azosi · 2026.10.2 03:34 · 조회 1
Dense vs MoE 아키텍처 가이드
Dense vs MoE 아키텍처 가이드
2026년 오픈 LLM의 가장 큰 분기점은 MoE(Mixture-of-Experts) 채택 여부다. 단순히 "더 좋다/나쁘다"가 아니라, 총 파라미터와 활성 파라미터의 분리라는 구조적 차이가 배포·서빙·비용 구조를 바꾼다.
핵심 차이
| 구분 | Dense | MoE (Mixture-of-Experts) |
|---|---|---|
| 구조 | 모든 파라미터가 매 토큰에 활성화 | N개 expert 중 router가 K개만 활성화 |
| 활성 파라미터 | = 총 파라미터 | 총 파라미터의 일부 (보통 5~15%) |
| 메모리 | 총량 = 메모리 요구량 | 전체 가중치를 VRAM에 올려야 함 |
| 추론 연산 | FLOPs ≈ 활성 파라미터 × 토큰 | FLOPs ≈ 활성 expert × 토큰 |
| 장점 | 단순·예측 가능·단일 GPU 가능 | 품질/비용 효율·확장성 |
| 단점 | 대형화 시 비용 선형 증가 | 라우팅 학습 난이도·메모리 부담 |
| 대표 | Phi, Gemma, Mistral Small dense | Qwen3 MoE, DeepSeek-V3/R1, Mixtral, Llama 4 Behemoth |
MoE의 작동 방식
입력 토큰 x
↓
Router (작은 신경망) → expert 가중치 분포 계산
↓
상위 K개 expert 선택 (예: K=8 of N=256)
↓
선택된 expert 출력의 가중합 → 최종 출력
핵심은 총 파라미터는 크지만, 토큰당 실제 계산은 일부만 한다는 점이다.
예시로 보는 수치
| 모델 | 총 파라미터 | 활성 파라미터 | Expert 구성 | 라이선스 |
|---|---|---|---|---|
| DeepSeek-V3 | 671B | ~37B | 256 routed + 1 shared | MIT |
| Mixtral 8x7B | ~46.7B | ~12.9B | 8 expert (2 active) | Apache 2.0 |
| Qwen3-235B-A22B | 235B | ~22B | 128 routed + ... | Apache 2.0 |
| Llama 4 Behemoth | ~2T (비공개) | (비공개) | MoE | Llama Community |
위 수치는 각 모델의 공식 technical report 또는 model card 기준. 활성 파라미터는 정확히 발표되지 않은 라인업도 있다(예: Llama 4 Behemoth).
실무 의사결정
① 총 VRAM
- Dense 70B (FP16): 가중치만 ~140GB → 8× A100(80GB) 정도 필요
- MoE 671B/37B (FP16): 가중치만 ~1.3TB → 활성만 적게 계산되더라도 가중치를 모두 올려야 함
- 💡 MoE의 핵심: "계산은 적게, 메모리는 무겁다". 하이브리드(다중 노드 + NVLink) 또는 양자화/디스크 오프로딩이 필수
② 추론 비용
- API 단가 (DeepSeek-V3 기준 2025-2026 보고): 캐시된 입력은 매우 저렴, 출력은 활성 파라미터 기준으로 책정되는 경우가 많음
- 자체 호스팅: 활성 파라미터가 적으면 GPU 시간당 처리량이 dense 대형 모델보다 월등히 큼 → TCO(총소유비용) 가 낮을 수 있음
③ 라우팅 안정성
- MoE는 학습 시 expert 간 라우팅이 한쪽으로 쏠리는 현상(expert collapse)이 발생할 수 있다. 이를 막기 위해 auxiliary loss, load balancing loss가 추가된다.
- DeepSeek-V3 Technical Report는 auxiliary-loss-free 로드 밸런싱 기법을 도입했다고 발표함 (1차 출처: https://github.com/deepseek-ai/DeepSeek-V3/blob/main/DeepSeek_V3.pdf)
④ 컨텍스트·KV cache
- MoE도 어텐션 레이어는 dense와 동일 → KV cache는 (토큰 수 × 어텐션 헤드)로 증가
- 긴 컨텍스트 + MoE는 둘 다 무거움 → 별도 최적화(MLA 같은 압축 어텐션) 필요. DeepSeek의 MLA가 대표적 사례.
자주 하는 오해
- ❌ "MoE는 가볍다" → 활성만 가볍다. VRAM은 총 파라미터 기준이다.
- ❌ "MoE는 항상 dense보다 좋다" → 단순한 짧은 응답·단일 GPU 서빙에는 dense가 더 효율적일 수 있다.
- ❌ "Mixtral은 56B 모델이다" → 표기법 때문에 흔한 오해. Mixtral 8x7B는 8개 7B expert 묶음이 아니라, expert당 더 작은 구조다. 공식 카드 수치를 직접 확인할 것.
의사결정 플로우
Q1. 단일 GPU(24~48GB)로 서빙하나?
└─ Yes → Dense 소형 (Phi·Gemma·Qwen dense)
Q2. 8× A100/H100 멀티 GPU가 가능한가?
└─ Yes → MoE 활성 파라미터가 비슷한 dense와 비교 검토
Q3. 컨텍스트가 128K 이상인가?
└─ Yes → MLA·압축 어텐션 적용 모델 검토 (DeepSeek·Qwen)
Q4. 품질/비용 효율을 우선시하나?
└─ Yes → MoE (Qwen3-235B, DeepSeek-V3)
참고 자료
- DeepSeek-V3 Technical Report (PDF): https://github.com/deepseek-ai/DeepSeek-V3/blob/main/DeepSeek_V3.pdf
- Mixtral 8x7B paper (arXiv): https://arxiv.org/abs/2401.04088
- Qwen3 GitHub (MoE 라인업): https://github.com/QwenLM/Qwen3
- Llama 4 공식 페이지: https://github.com/meta-llama
상위 문서: ← 오픈 소스 LLM 모델 출처: [주제 가이드 — Dense vs MoE 아키텍처 가이드] (자체 조사·작성 2026-10-02) — DeepSeek-V3 Technical Report, Mixtral paper, 각 모델 공식 카드 기준 공급사: 자체 작성 + 각 모델 개발사 공식 자료·논문
변경 이력
| 날짜 | 변경 |
|---|---|
| 2026-10-02 | 초안 작성 — Dense/MoE 구조 비교, 활성 vs 총 파라미터, VRAM·비용·라우팅 실무 가이드 |
댓글
아직 댓글이 없습니다.
댓글을 작성하려면 로그인이 필요합니다.