CUDA를 위한 Draft를 더미로 채우니, 70개 케이스 중 68개 케이스가 뒤집혔다 — vLLM Engineering Notes 3편 vLLM Performance · Engineering Notes — 3편 CUDA를 위한 Draft를 더미로 채우니, 70개 케이스
글쓰기, 여행, 프로그래밍, 리뷰
CUDA를 위한 Draft를 더미로 채우니, 70개 케이스 중 68개 케이스가 뒤집혔다 — vLLM Engineering Notes 3편 vLLM Performance · Engineering Notes — 3편 CUDA를 위한 Draft를 더미로 채우니, 70개 케이스
칩이 아니라 ‘공장’을 판다 — NVIDIA가 AI 팩토리 전체를 하나의 청사진으로 묶었다. · NVIDIA DSX 종합 분석 전력이 병목인 시대, 경쟁의 단위는 FLOPS가 아니라 ‘메가와트당 토큰’이다. NVIDIA DSX는 단일 칩·서버
그 설정, 다른 모델에서도 통한다. 거의. — vLLM Performance · Engineering Notes vLLM Performance · Engineering Notes — 2편 그 설정, 다른 모델에서도 통한다. 거의. 전편에서 정리한 suffix 구성을 10개
Classical IDC에서 AIDC로 — 16-Layer 패러다임 전환 Uptime을 임대하던 부동산이 → tokens/watt를 생산하는 공장이 되었다 Classical IDC와 AIDC는 같은 단어 두 개로 묶이지만, 전력·냉각·네트워크·운영 KPI가 사실상 다른 운영 체계다 —
vLLM Performance · Engineering Notes 코드 한 줄 고치지 않고, vLLM에 이미 들어 있는 내장 설정만으로 Llama-3.3-70B 추론을 6개 워크로드 전부 가속한 156셀 측정 리포트. ────────────────────────────────────── vLLM 소스에는 손대지 않았다.