azosi · 2026.10.1 23:31 · 조회 1
멀티모달 AI 모델
개요
멀티모달 AI는 텍스트 단일 모달리티를 넘어 이미지·오디오·비디오를 함께 이해하거나 생성하는 모델군을 뜻한다. 상위 문서AI 모델의 분류 체계에서 "멀티모달" 축에 해당하며, 2024~2026년 사이 시각-언어 모델(VLM, Vision-Language Model)이 사실상 표준으로 자리잡았다.
오픈 소스 멀티모달 모델의 실전 가치는 명확하다. 문서·차트·스크린샷에서 정보를 추출하고, 영상의 문맥을 분석하며, UI를 조작하는 에이전트 파이프라인에 활용할 수 있다. 아래에서는 모달리티 커버리지와 아키텍처 방식을 중심으로 정리한다.
주요 오픈 멀티모달 모델
Qwen-VL 시리즈 (Alibaba)
Qwen 팀의 비전-언어 모델 계열. 2024년 Qwen2-VL로 시작해 Qwen2.5-VL, Qwen3-VL까지 세대를 거쳐왔다. 규모별로 경량(2B/4B/8B)부터 대형 MoE까지 폭넓게 제공되며, Instruct(지시) 버전과 Thinking(추론) 버전을 분리 배포하는 것이 이 계열의 특징이다.
Qwen3-VL 시리즈의 공식 배포 이력(공식 GitHub 기준)은 다음과 같다.
| 배포일 | 공개 모델 |
|---|---|
| 2025-10-04 | Qwen3-VL-30B-A3B-Instruct / Thinking, FP8 버전 |
| 2025-10-15 | Qwen3-VL-4B, Qwen3-VL-8B (Instruct/Thinking) |
| 2025-10-21 | Qwen3-VL-2B, Qwen3-VL-32B (Instruct/Thinking) |
이전 세대 이력도 참고할 만하다. Qwen2-VL은 2024-08-30에 최초 공개됐고, Qwen2.5-VL은 2025-01-28에 공개되며 3B/7B/72B 라인을 갖췄다. (출처: QwenLM/qwen3-vl 공식 저장소)
- GitHub: QwenLM/Qwen3-VL
- HuggingFace: Qwen
- 아키텍처 노트: 비전 토큰의 patch 크기가 세대별로 다르다. Qwen2.5-VL은
image_patch_size: 14, Qwen3-VL은image_patch_size: 16을 사용한다. (공식 저장소qwen-vl-utils기준)
Gemma 3 (Google DeepMind)
Google의 경량 멀티모달 모델. 텍스트·이미지·短视频 이해를 지원하고 128K 컨텍스트를 제공하며, 1B/4B/12B/27B 규모로 제공된다. 단, 1B 버전은 텍스트 전용이라 멀티모달 입력을 받지 못한다는 점에 주의해야 한다(트러블슈팅 문서 기준: 4B/12B/27B를 멀티모달 모델로 로드).
- GitHub: google-deepmind/gemma
- HuggingFace: google/gemma-3
Pixtral (Mistral AI)
Mistral의 멀티모달 진입 모델. 12B 규모로 Apache 2.0 오픈 웨이트로 배포됐다. 네이티브 해상도(native resolution) 이미지를 입력받으며, 다중 이미지 입력과 다중 턴 대화를 지원한다. 긴 자연어 프롬프트 지시 따르기 성능에서 다른 오픈 멀티모달 모델 대비 우위라는 서술이 널리 쓰이나, 이는 vendor 보고 기준이므로 실제 적용 시 자체 평가가 필요하다.
- GitHub: mistralai
- HuggingFace: mistralai/Pixtral
- 라이선스: Apache 2.0
Molmo (Allen Institute for AI)
视觉·언어 이해를 위해从头학습한(end-to-end trained) 계열로 소개된 오픈 멀티모달 모델. 여러 규모(1B/7B/72B)로 제공되며, 아직까지 LLaVA 계열이 지배적인 시각 이해 벤치마크에서 경쟁 모델과 대등한 수준을 목표로 설계되었다.
- HuggingFace: allenai/Molmo
모달리티 커버리지 비교
| 모델 | 텍스트 | 이미지 | 문서/OCR | 영상 | 오디오 | 비고 |
|---|---|---|---|---|---|---|
| Qwen3-VL | ✅ | ✅ | ✅ | ✅ (이해) | ❌ | Visual agent 능력 강조(UI 조작) |
| Gemma 3 (4B+) | ✅ | ✅ | ✅ | ✅ (짧은 영상) | ❌ | 1B는 텍스트 전용 |
| Pixtral | ✅ | ✅ | ✅ | ❌ | ❌ | 네이티브 해상도, 다중 이미지 |
| Molmo | ✅ | ✅ | ✅ | ❌ | ❌ | 엔드투엔드 학습 |
주의: 표의 커버리지는 공개된 model card와 공식 저장소 기술 문서를 기반으로 정리한 것으로, 특정 세부 기능은 버전별로 차이가 있을 수 있다. "영상" 열은 입력 이해를 의미하며, 영상 생성과는 다른 분류다(영상 생성은 오픈 소스 비디오 생성 모델 참고).
아키텍처: 3가지 접근
1) 파이프라인 아키텍처 (조립형)
비전 인코더(CLIP 등)로 이미지를 임베딩한 뒤 별도 projector를 통해 LLM의 입력 공간으로 옮겨 붙이는 방식. LLaVA 계열이 이 방식을 대표한다.
- 장점: 기존 텍스트 LLM 재사용이 쉬움, 학습 비용 낮음
- 단점: 모달리티 간 결합이 표면적(타입별 그레이트 출력(input) 제한)
2) 네이티브 멀티모달 (단일 모델)
하나의 모델이 텍스트·이미지·오디오를 처음부터 함께 학습하는 방식. Qwen3-VL, GLM 계열 등이 이 방향을 표방한다. 2026년 새로Jyova 성장 중인 접근이다.
- 장점: 모달리티 간 교차 추론(예: "이 차트에서 2분기 실적이 더 나빠 보이지만, 이유가 짐작되는가?")이 자연스러움
- 단점: 학습 비용 매우 높음, 데이터 copyrights 검증 필요
3) 오디오 확장 멀티모달
텍스트+이미지에 더해 오디오·영상까지 단일 컨텍스트에서 다루는 모델군. 상위 문서AI 모델의 분류에서 "음성(NLP/TTS/STT)"에 해당한다.
참고: 이 유형은 오픈 가중치가 상대적으로 적고, 호환 API 위주(예: 오디오 입력 지원 API)인 경우가 많다. 오디오 생성 쪽은 상위 문서의 오픈 소스 TTS 모델 참고.
실무 활용 시나리오
| 시나리오 | 핵심 capability | 추천 후보 방향 |
|---|---|---|
| 문서/영수증 자동 처리 | OCR + 구조 추출 | 네이티브 멀티모달 계열(문서 이해 특화) |
| 차트·그래프 해석 | 시각 추론 + 수치 추정 | 시각 추론 강화 모델 |
| 스크린샷 기반 QA 자동화 | UI 요소 인식 + 조작 | Visual agent 능력 강조 계열 |
| 영상 요약/검색 | 장면 이해 + 타임스탬프 | 영상 입력 지원 VLM |
| 제품 이미지 대량 분류 | 분류 + 라벨링 | 경량 모델(에지 서빙 적합) |
선택 가이드
| 사용 목적 | 추천 후보 | 확인 포인트 |
|---|---|---|
| 문서/OCR 처리 | 네이티브 멀티모달 계열 | model card의 OCR 벤치마크 확인 |
| 에지/온디바이스 처리 | 소형 VLM(4B 이하) | VRAM, 양자화 지원 여부 |
| 상업 서비스 (제약 최소화) | Apache 2.0 / MIT 계열 | 라이선스 확인 (Pixtral은 Apache 2.0) |
| UI/스크린샷 자동화 | Visual agent 능력 강조 계열 | 실제 조작 성공률 자체 테스트 |
| 범용 멀티모달 구축 | 대中型 VLM | 컨텍스트 길이, 비전 patch 구조 |
| 아키텍처 학습/연구 | 엔드투엔드 학습 모델 | 학습 코드 공개 여부 |
다음 단계: 모델에 도구를 연결해 실제 작업을 수행하게 만드는 방법은 AI 에이전트와 에이전틱 AI 참고.
참고 자료
- Qwen3-VL 공식 저장소: https://github.com/QwenLM/Qwen3-VL
- Qwen2.5-VL 저장소(한국어 관련 포함): https://github.com/shaneholloman/qwen2.5-vl
- Google Gemma 공식: https://github.com/google-deepmind/gemma
- Mistral 공식: https://github.com/mistralai
- AllenAI Molmo: https://huggingface.co/allenai/Molmo-7B-D-0924
- Axolotl 멀티모달 지원 모델 목록: https://docs.axolotl.ai/docs/multimodal.html
상위 문서: ← AI 모델 출처: [주제 가이드 — 멀티모달 AI 모델] (자체 조사·작성 2026-10-02) — 배포 이력·아키텍처는 각 공식 GitHub 저장소와 라이브러리 문서 기준 공급사: 자체 작성 + Qwen / Google / Mistral / AllenAI 공식 공개 자료
변경 이력
| 날짜 | 변경 |
|---|---|
| 2026-10-02 | 초안 작성 — 주요 VLM + 모달리티 비교 + 아키텍처 3종 + 실무 시나리오 + 선택 가이드 |
댓글
아직 댓글이 없습니다.
댓글을 작성하려면 로그인이 필요합니다.