LLM INFERENCE · CPU–GPU HYBRID CPU MoE Offloading:GPU 메모리의 한계를 넘으면 무엇이 달라질까 Hot expert는 GPU에, Cold expert는 Host Memory에: 실행 구조와 기본 성능, 최적화의 출발점 그림 움직임 멈춤 큰
글쓰기, 여행, 프로그래밍, 리뷰
LLM INFERENCE · CPU–GPU HYBRID CPU MoE Offloading:GPU 메모리의 한계를 넘으면 무엇이 달라질까 Hot expert는 GPU에, Cold expert는 Host Memory에: 실행 구조와 기본 성능, 최적화의 출발점 그림 움직임 멈춤 큰
2025년 기준으로 GPU의 인기가 예전만 못해진 걸까? 아니면 오히려 더 뜨거워졌을까? 미시적·거시적으로 살펴보면, 데이터 센터(DC)나 리테일(RTX) 분야에서는 여전히 높은 수요를 보이고 있는 듯하다. 다만, 이전 세대인 ‘Hopper’ 시리즈에 대한 관심은
기술서적 집필 두 번째로 집필한 ‘Do It! C++ 완전 정복’이 3년이 넘는 집필 기간을 거처 드디어 ’24년 3월 25일부터 판매가 되었다. 25살(고전 한국 나이) 직장 생활을 한 후 총 3개의
1 프롤로그(Prologue) Code Review가 좋다는 것은 많은 사람들이 동의 하는 명제입니다. 막연하게 Code Review는 해야 할 것 같다는 생각이 들기도 합니다. 그렇지만 때로는 바쁜 개발 일정때문에 Code Review가 걸림돌처럼 느껴지기도
1 Code Review는 왜 필요한가? Code Review에 대한 사람들의 의견이나 진행 방법은 천차만별입니다. 많은 경우 개발자가 짬을 내서 한다는 인식이 많았습니다(적어도 한국에서는). 이번 포스팅은 Code Review에 대한 최근의 동향을 정리해서