azosi · 2026.7.28 23:53 · 조회 1

Kimi Benchmark Best Practices

상위 문서: ← Kimi Debugging and operations 출처: Kimi API Platform 공식 문서 — Best Practices for Benchmarking 한글화 (2026-07-22) 공급사: Moonshot AI (月之暗面)

벤치마킹은 안정성과 재현성이 필요한 엔지니어링 작업입니다. 모델을 수천 번 호출하게 되며, 시스템 설정이나 네트워크 지연의 작은 변화도 결과 정확도를 훼손할 수 있습니다. 재현 가능하고 신뢰할 수 있는 벤치마킹을 위한 권장 사항을 정리합니다.

빠른 메모

  • 비공개·클로즈드 소스 벤치마크: temperature = 1.0, stream = true, top_p = 0.95
  • 추론 벤치마크: max_tokens = 128k, 최소 500–1000 샘플 (예: AIME 2025 32회 → 30 × 32 = 960 문제)
  • 코딩 벤치마크: max_tokens = 256k
  • 에이전틱 작업 벤치마크:
    • 멀티홉 검색: max_tokens = 256k + 컨텍스트 관리
    • 기타: max_tokens ≥ 16k–64k

1. K2.6 모델 벤치마크 권장 설정

카테고리벤치마크Temperaturemax tokens권장 실행 수Top-p비고 (예: 테스트 로그)
멀티모달MMMU-Pro1.096k30.95thinking={"type": "enabled"}
MMMU-Pro w/ python1.0per step 64k; total 256k30.95max steps=50, thinking=on
CharXiv (RQ)1.096k30.95thinking=on
CharXiv (RQ) w/ python1.0per step 64k; total 256k30.95max steps=50, thinking=on
MathVision1.096k30.95thinking=on
MathVision w/ python1.0per step 64k; total 256k30.95max steps=50, thinking=on
V* w/ python1.0per step 64k; total 256k30.95max steps=50, thinking=on
에이전트HLE-Full w/ tools1.0per step 48k; total 256k10.95max steps=300, thinking=on
BrowseComp1.0per step 48k; total 256k10.95max steps=300, thinking=on
DeepSearchQA1.0per step 48k; total 256k10.95max steps=300, thinking=on
WideSearch1.0per step 48k; total 256k40.95max steps=300, thinking=on
Toolathlon1.0per step 48k; total 256k40.95max steps=300, thinking=on
MCPMark1.0per step 48k; total 256k40.95max steps=300, thinking=on
Claw Eval1.0per step 48k; total 256k40.95max steps=300, thinking=on
APEX-Agents1.0per step 48k; total 256k40.95max steps=300, thinking=on
코딩Terminal-Bench 2.0 (Terminus-2)1.0256k30.95thinking=on
SWE-Bench Pro1.0per step 32k; total 256k50.95max steps=300, thinking=on
SWE-Bench Multilingual1.0per step 32k; total 256k50.95max steps=300, thinking=on
SWE-Bench Verified1.0per step 32k; total 256k50.95max steps=300, thinking=on
SciCode1.096k40.95thinking=on
OJBench (python)1.096k80.95thinking=on
LiveCodeBench (v6)1.096k10.95thinking=on
수학AIME 20261.096k320.95thinking=on
HMMT 2026 (Feb)1.096k320.95thinking=on
IMO-AnswerBench1.096k40.95thinking=on
지식HLE-Full1.096k10.95thinking=on
GPQA-Diamond1.096k80.95thinking=on

2. K2.5 모델 벤치마크 권장 설정

카테고리벤치마크Temperaturemax tokens권장 실행 수Top-p비고
멀티모달MMMU-Pro1.064k30.95thinking=on
CharXiv (RQ)1.064k30.95thinking=on
MathVision1.064k30.95thinking=on
MathVista1.064k30.95thinking=on
OCRBench1.064k30.95thinking=on
ZeroBench1.064k30.95thinking=on
WorldVQA1.064k30.95thinking=on
InfoVQA (val)1.064k30.95thinking=on
SimpleVQA1.064k30.95thinking=on
ZeroBench w/ tools1.064k30.95max steps=30, thinking=on
코드SWE Series1.0per step 16k; total 256k50.95thinking=on
Lcb + OJBench1.0128k10.95thinking=on
TerminalBench1.0128k30.95thinking=on
추론AIME2025 no tools1.096k320.95thinking=on
AIME2025 w/ tools1.0per turn 96k; total 96k320.95max steps=120, thinking=on
HLE no tools1.096k10.95thinking=on
HLE w/ tools1.0total 128k; per step 48k10.95max steps=120, thinking=on
HLE heavy1.0total 128k; per step 48k10.95max steps=200, parallel n=8, thinking=on
HMMT2025 no tools1.096k320.95thinking=on
HMMT2025 w/ tools1.0per step 96k; total 96k320.95max steps=120, thinking=on
IMO-AnswerBench1.096k30.95thinking=on
GPQA-Diamond1.096k80.95thinking=on
에이전틱 검색BrowseComp / BrowseComp-ZH / Seal-0 / Frames1.0per step 24k; total 256k40.95max steps=250, 컨텍스트 관리 활성화, 시스템 프롬프트에 오늘 날짜 포함, 불확실할 때 검색하도록 지시, thinking=on
에이전틱 작업Tau1.0>=16k40.95max steps=100, thinking=on

서드파티 프로바이더는 Kimi Vendor Verifier (KVV)로 고정확도 서비스를 선택.

Tool Use 호환성

thinking 파라미터를 {"type": "enabled"}로 설정해 도구를 사용할 때, 모델 성능을 위해 다음 제약 참고:

  • tool_choice"auto" 또는 "none"만 가능 (기본 auto). 다른 값은 추론 콘텐츠와 지정 도구 간 충돌로 오류 발생
  • 멀티스텝 도구 호출 중, 현재 턴의 도구 호출에서 assistant 메시지의 reasoning_content를 컨텍스트에 유지. 그렇지 않으면 오류
  • 공식 내장 $web_search 도구는 K2.5/K2.6 사고 모드와 일시적으로 호환되지 않음 → 사고 모드 비활성화 후 $web_search 도구 사용

자세한 내용: Use Thinking Mode.

3. K2-Thinking 시리즈 모델 벤치마크 권장 설정

카테고리벤치마크Temperaturemax tokens권장 실행 수비고
코드SWE0.7(권장) / 1.0 (ok)per step 16k; total 256k5
Lcb + OJBench1.0128k1
TerminalBench1.0128k3
추론AIME2025 no tools1.096k32
AIME2025 w/ tools1.0per step 48k; total 128k16max steps=120
HLE no tools1.096k1
HLE w/ tools1.0total 128k; per step 48k1max steps=120
HLE heavy1.0total 128k; per step 48k1max steps=200, parallel n=8
HMMT2025 no tools1.096k32
HMMT2025 w/ tools1.0per step 96k; total 96k32max steps=120
IMO-AnswerBench1.096k3
GPQA-Diamond1.096k8
에이전틱 검색BrowseComp / BrowseComp-ZH / Seal-0 / Frames1.0per step 24k; total 256k4max steps=250, 컨텍스트 관리 활성화, 시스템 프롬프트에 오늘 날짜 포함, 불확실할 때 검색하도록 지시
에이전틱 작업Tau0.0>=16k4max steps=100

4. API 권장·주의

  • 공식 API 사용: 일부 서드파티 엔드포인트는 정확도 편차가 큼
  • 테스트용 권장 모델:
    • K2.6: kimi-k2.6
    • K2.5: kimi-k2.5
    • K2 시리즈: kimi-k2-thinking-turbo (더 빠른 추론)
  • 필수 설정: stream = true
    • 비스트리밍 모드는 중간 연결 끊김을 일으킬 수 있음
  • 현재 API 기본값:
    • Kimi K2.6: max_tokens=32768, thinking={"type": "enabled", "keep": null}, temperature=1.0, top_p=0.95, n=1, presence_penalty=0.0, frequency_penalty=0.0
    • Kimi K2 Thinking: temp=1.0, max token=64000
    • Kimi K2.5: max_tokens=32768, thinking={"type": "enabled"}, temperature=1.0, top_p=0.95, n=1, presence_penalty=0.0, frequency_penalty=0.0
  • 타임아웃:
    • stream=false일 때 api.moonshot.ai 타임아웃 = 2시간, 일부 ISP가 더 일찍 종료할 수 있음
    • 따라서 stream=true 권장
  • 동시성:
    • rate limit을 피하기 위해 낮은 동시성 유지
  • 재시도 로직 필수:
    • overloaded 처리
    • 서버 이슈로 인한 예상치 못한 finish reason 처리
    • 복잡한 네트워크 문제로 인한 오류 처리

5. FAQ

Q1. temperature 설정이 모델 간에 일관된가?

A. 모델 패밀리마다 권장 temperature가 다름:

  • k2.6: 1.0
  • k2.5: 1.0
  • k2-thinking 시리즈: 1.0
  • k2 다른 시리즈: 0.6

Q2. 왜 stream = true인가?

A. 긴 출력은 분 단위가 걸릴 수 있습니다. 유휴 TCP 연결은 방화벽·로드 밸런서·NAT 게이트웨이가 종료할 수 있습니다. 스트리밍은 연결을 유지해 신뢰성을 크게 개선. 프로덕션에서 stream=false 요청은 stream=true보다 훨씬 자주 실패.

Q3. 얼마나 많은 동시성을 사용해야 하나?

A. API 계정은 특정 rate limit이 있습니다 (Recharge and Rate Limits 참고). 낮게 시작. HTTP 429(rate limit)를 받으면 동시성이 너무 높은 것. 정확도 > 속도이므로 한도 내로 동시성을 조정.

Q5. 왜 재시도를 추가해야 하나?

A. 스트리밍을 사용해도 일시적 네트워크 문제로 요청이 실패할 수 있습니다. 재시도는 일시적 결함(네트워크 지터, 서버 과부하, rate limit)을 처리해 피할 수 있는 실패를 방지.

Q6. 왜 멀티턴/멀티스텝 작업이 전체 컨텍스트와 추론을 포함해야 하나?

A. 모델은 일관성을 유지하기 위해 전체 컨텍스트가 필요합니다. 이전 추론 단계가 없으면 후속 턴이 트랙을 벗어나거나 불완전한 답을 생성할 수 있습니다.

6. 연락처

문제가 있으면 api-service@moonshot.ai로 로그와 함께 메일.


변경 이력

날짜변경
2026-07-22초판 작성 (공식 Benchmark Best Practices 가이드 한글화)
2026-07-22제목에 "Kimi" 접두사 추가, 본문 H1 중복 제거

댓글

아직 댓글이 없습니다.

댓글을 작성하려면 로그인이 필요합니다.