azosi · 2026.10.2 03:34 · 조회 1

DeepSeek 모델 패밀리 상세

DeepSeek 모델 패밀리 상세

DeepSeek(深度求索)은 2024년 이후 추론(Chain-of-Thought) 특화 모델로 빠르게 인지도를 얻은 중국계 오픈 LLM 패밀리다. 모든 주요 모델이 MIT 라이선스로 배포되어 상업적 제약이 거의 없다.

공식 채널

핵심 라인업

모델아키텍처출시라이선스핵심 특징
DeepSeek-V3 / V3.1 / V3.2MoE2024-12 / 2025-08 / 2025-09MIT범용 base 모델
DeepSeek-R1MoE + RL2025-01MIT추론 특화 (CoT)
DeepSeek-Coder-V2MoE2024MIT코드 특화
DeepSeek-VL2MoE (Vision-Language)2024MIT멀티모달
DeepSeek-MathDense2024MIT수학 특화

아키텍처 특징

  • 공통 MoE 구조: DeepSeek-V3의 Technical Report에 따르면 총 671B 파라미터 / 활성 약 37B 구조. 토큰당 전체 expert 중 일부만 활성화한다.
  • MLA (Multi-head Latent Attention): KV cache를 압축해 긴 컨텍스트 처리 시 메모리를 절감하는 자체 어텐션 구조. DeepSeek-V2에서 처음 도입.
  • DeepSeekMoE: fine-grained expert 분할 + shared expert 분리 구조. 같은 총 파라미터 대비 효율을 끌어올리는 것이 목표.
  • R1의 RL 학습: R1은 base 모델에 GRPO 기반 RL을 적용해 자연스러운 사고 흐름(thinking trace)을 생성하도록 학습됐다. OpenAI의 o1 계열과 비슷한 패턴이지만 가중치를 완전 공개한 것이 차별점.

Thinking 모드와 컨텍스트

  • DeepSeek-R1 / V3.1부터 응답에 <think>...</think> 마커가 포함되는 thinking 모드를 지원한다.
  • V3.1 / V3.2는 hybrid thinking — single 모델 안에서 thinking on/off 전환 가능.
  • 컨텍스트 길이는 128K가 표준.

라이선스 실무 포인트

  • ✅ 거의 모든 공개 모델이 MIT (LICENSE-MT 파일)
  • ✅ 상업 재배포·파인튜닝·사내 사용 모두 자유
  • ✅ 표시·저작권 보존 외 제약 없음
  • ⚠️ 중국 데이터/규제 환경 이슈: 일부 해외 서비스는 데이터 주권·규제 이유로 사용을 재검토하는 경우가 있다. 본 문서는 라이선스 자체의 법리만 다룬다.

자주 하는 오해

  • ❌ "R1은 GPT-4를 이겼다" → 벤치마크 출처·시점·평가 하네스에 따라 다르다. 자신의 평가로 확인해야 한다.
  • ❌ "DeepSeek는 ChatGPT 클론" → V3/R1은 별도 학습 파이프라인과 자체 아키텍처(MLA, DeepSeekMoE)를 적용한 독립 모델이다.
  • ❌ "MIT는 Apache 2.0와 같다" → 특허 라이선스 조항이 없다. 특허 리스크가 있는 도메인에서는 Apache 2.0 쪽이 안전할 수 있다.

자체 호스팅 vs API

  • 자체 호스팅: vLLM / TGI / llama.cpp 모두 지원. 다만 V3/R1은 활성 37B 모델이라도 다중 GPU 필요 (예: 8× A100/H100 권장).
  • API: https://platform.deepseek.com 에서 사용량 기반 과금. 가격은 시장 평균 대비 저렴한 편으로 자주 언급됨 (단, 가격은 변동 가능하므로 공식 가격표를 항상 확인할 것).

참고 자료

상위 문서: ← 오픈 소스 LLM 모델 출처: [주제 가이드 — DeepSeek 모델 패밀리] (자체 조사·작성 2026-10-02) — 공식 GitHub 저장소·API 문서 기준 공급사: 자체 작성 + DeepSeek AI 공식 공개 자료

변경 이력

날짜변경
2026-10-02초안 작성 — DeepSeek-V3·R1 라인업, MLA/DeepSeekMoE 구조, thinking 모드, 라이선스 정리

댓글

아직 댓글이 없습니다.

댓글을 작성하려면 로그인이 필요합니다.