
오픈소스 AI 모델 확산에 따른 메모리 수요 확대 (BofA)
1. 오픈소스/오픈웨이트 모델 확산과 메모리 엔드포인트 증대
• 중국 오픈소스 모델의 파격적인 API 가격은 하드웨어 비용 절감이 아닌 비즈니스 모델 차원의 전략 및 보조금에 기인
• 폐쇄형 모델은 중앙 서버의 메모리를 수백만 사용자가 공유하지만, 오픈웨이트 모델은 다운로드받아 자체 호스팅하는 모든 기업/고객사마다 독립적인 HBM 및 DRAM 소켓을 신설
• 글로벌 고객사의 오픈웨이트 다운로드 증대는 단일 API 공유 대비 엔드포인트 수를 폭발적으로 늘려 기술적 압축 효과를 압도하며 AI 메모리 TAM을 구조적으로 확장시킴
2. 모델 대형화 및 연산 아키텍처에 따른 반도체 수요 확대
• MoE(Mixture of Experts) 구조는 추론 시 일부 활성화 파라미터만 사용하여 연산량을 줄이지만, 전체 전문가 가중치는 고속 메모리에 상주해야 하므로 HBM 필요 용량은 총 파라미터 비례로 유지됨
• 최신 Kimi K3는 2.8조 파라미터 크기로 4비트 양자화를 적용해도 인스턴스당 ~1.4TB의 HBM과 64개 이상의 가속기가 필수적
• 양자화 기술(FP8→MXFP4)을 통한 2배의 메모리 절감보다 모델 크기의 4배 이상 성장 속도가 더 빨라 메모리 상쇄 효과를 초과함
• 모델 대형화에 따라 계층형 메모리 구조(HBM, CPU LPDDR5X/DDR5, 기업용 NAND) 필요성이 증대되며, 멀티 에이전트 워크로드 증가에 따른 KV 캐시 확장으로 다중 메모리 채택이 가속화됨
3. CXMT 리스크 제한적
• CXMT의 생산 능력 확대는 레거시/소비자용 DRAM에 국한되어 있으며, 고성능 AI 메모리 진입은 매우 제한적
• 미국 OEM이 CXMT 제품을 조달하기 위한 정부 승인 여부도 불투명
• 중국 LLM의 가격 우위는 하드웨어 단가 하락이 아닌 아키텍처 효율성, 낮은 인프라 비용(전기료 $0.05-0.08/kWh vs 미국 $0.10-0.15/kWh, 엔지니어 인건비 40-60% 저렴) 및 정부 보조금에 의한 것
잡담 오픈소스 AI 모델 확산에 따른 메모리 수요 확대 (BofA)
325 4
댓글 더 보기
새 댓글 확인하기