azosi · 2026.10.2 03:34 · 조회 1

Dense vs MoE 아키텍처 가이드

Dense vs MoE 아키텍처 가이드

2026년 오픈 LLM의 가장 큰 분기점은 MoE(Mixture-of-Experts) 채택 여부다. 단순히 "더 좋다/나쁘다"가 아니라, 총 파라미터와 활성 파라미터의 분리라는 구조적 차이가 배포·서빙·비용 구조를 바꾼다.

핵심 차이

구분DenseMoE (Mixture-of-Experts)
구조모든 파라미터가 매 토큰에 활성화N개 expert 중 router가 K개만 활성화
활성 파라미터= 총 파라미터총 파라미터의 일부 (보통 5~15%)
메모리총량 = 메모리 요구량전체 가중치를 VRAM에 올려야 함
추론 연산FLOPs ≈ 활성 파라미터 × 토큰FLOPs ≈ 활성 expert × 토큰
장점단순·예측 가능·단일 GPU 가능품질/비용 효율·확장성
단점대형화 시 비용 선형 증가라우팅 학습 난이도·메모리 부담
대표Phi, Gemma, Mistral Small denseQwen3 MoE, DeepSeek-V3/R1, Mixtral, Llama 4 Behemoth

MoE의 작동 방식

입력 토큰 x
    ↓
Router (작은 신경망) → expert 가중치 분포 계산
    ↓
상위 K개 expert 선택 (예: K=8 of N=256)
    ↓
선택된 expert 출력의 가중합 → 최종 출력

핵심은 총 파라미터는 크지만, 토큰당 실제 계산은 일부만 한다는 점이다.

예시로 보는 수치

모델총 파라미터활성 파라미터Expert 구성라이선스
DeepSeek-V3671B~37B256 routed + 1 sharedMIT
Mixtral 8x7B~46.7B~12.9B8 expert (2 active)Apache 2.0
Qwen3-235B-A22B235B~22B128 routed + ...Apache 2.0
Llama 4 Behemoth~2T (비공개)(비공개)MoELlama Community

위 수치는 각 모델의 공식 technical report 또는 model card 기준. 활성 파라미터는 정확히 발표되지 않은 라인업도 있다(예: Llama 4 Behemoth).

실무 의사결정

① 총 VRAM

  • Dense 70B (FP16): 가중치만 ~140GB → 8× A100(80GB) 정도 필요
  • MoE 671B/37B (FP16): 가중치만 ~1.3TB → 활성만 적게 계산되더라도 가중치를 모두 올려야 함
  • 💡 MoE의 핵심: "계산은 적게, 메모리는 무겁다". 하이브리드(다중 노드 + NVLink) 또는 양자화/디스크 오프로딩이 필수

② 추론 비용

  • API 단가 (DeepSeek-V3 기준 2025-2026 보고): 캐시된 입력은 매우 저렴, 출력은 활성 파라미터 기준으로 책정되는 경우가 많음
  • 자체 호스팅: 활성 파라미터가 적으면 GPU 시간당 처리량이 dense 대형 모델보다 월등히 큼 → TCO(총소유비용) 가 낮을 수 있음

③ 라우팅 안정성

  • MoE는 학습 시 expert 간 라우팅이 한쪽으로 쏠리는 현상(expert collapse)이 발생할 수 있다. 이를 막기 위해 auxiliary loss, load balancing loss가 추가된다.
  • DeepSeek-V3 Technical Report는 auxiliary-loss-free 로드 밸런싱 기법을 도입했다고 발표함 (1차 출처: https://github.com/deepseek-ai/DeepSeek-V3/blob/main/DeepSeek_V3.pdf)

④ 컨텍스트·KV cache

  • MoE도 어텐션 레이어는 dense와 동일 → KV cache는 (토큰 수 × 어텐션 헤드)로 증가
  • 긴 컨텍스트 + MoE는 둘 다 무거움 → 별도 최적화(MLA 같은 압축 어텐션) 필요. DeepSeek의 MLA가 대표적 사례.

자주 하는 오해

  • ❌ "MoE는 가볍다" → 활성만 가볍다. VRAM은 총 파라미터 기준이다.
  • ❌ "MoE는 항상 dense보다 좋다" → 단순한 짧은 응답·단일 GPU 서빙에는 dense가 더 효율적일 수 있다.
  • ❌ "Mixtral은 56B 모델이다" → 표기법 때문에 흔한 오해. Mixtral 8x7B는 8개 7B expert 묶음이 아니라, expert당 더 작은 구조다. 공식 카드 수치를 직접 확인할 것.

의사결정 플로우

Q1. 단일 GPU(24~48GB)로 서빙하나?
    └─ Yes → Dense 소형 (Phi·Gemma·Qwen dense)
Q2. 8× A100/H100 멀티 GPU가 가능한가?
    └─ Yes → MoE 활성 파라미터가 비슷한 dense와 비교 검토
Q3. 컨텍스트가 128K 이상인가?
    └─ Yes → MLA·압축 어텐션 적용 모델 검토 (DeepSeek·Qwen)
Q4. 품질/비용 효율을 우선시하나?
    └─ Yes → MoE (Qwen3-235B, DeepSeek-V3)

참고 자료

상위 문서: ← 오픈 소스 LLM 모델 출처: [주제 가이드 — Dense vs MoE 아키텍처 가이드] (자체 조사·작성 2026-10-02) — DeepSeek-V3 Technical Report, Mixtral paper, 각 모델 공식 카드 기준 공급사: 자체 작성 + 각 모델 개발사 공식 자료·논문

변경 이력

날짜변경
2026-10-02초안 작성 — Dense/MoE 구조 비교, 활성 vs 총 파라미터, VRAM·비용·라우팅 실무 가이드

댓글

아직 댓글이 없습니다.

댓글을 작성하려면 로그인이 필요합니다.