vLLM Performance · Engineering Notes —종합편 K-Exaone 4.7배 빠르게 하기 이번 편은 앞선 1~4편에서 검증한 방법을 종합한다. 기본 vLLM 대비 누적 처리량, 내 모델에 적용하는 절차, 그리고 시리즈 전체의 결론을
글쓰기, 여행, 프로그래밍, 리뷰
vLLM Performance · Engineering Notes —종합편 K-Exaone 4.7배 빠르게 하기 이번 편은 앞선 1~4편에서 검증한 방법을 종합한다. 기본 vLLM 대비 누적 처리량, 내 모델에 적용하는 절차, 그리고 시리즈 전체의 결론을
vLLM Performance · Engineering Notes — 4편 bestKpad 위의 두 방법 — W4A4와 동적-K 3편에서 확립한 bestKpad를 기준선으로 두고, 양자화(W4A4)와 런타임 동적-K가 그 처리량을 넘어서는지 측정했다. W4A4는 11개 모델 중