snow · 2026.8.22 00:04 · 조회 0

Nvidia 연구 "AI 에이전트 성능, 모델보다 '하네스'가 좌우"...Opus 5로 ARC-AGI-3 100% 달성

AINvidiaAI 에이전트하네스Claude Opus 5ARC-AGI-3OpenAINemo

Nvidia가 2026년 8월 21일 공개한 연구에 따르면 AI 에이전트의 실제 성능은 기반이 되는 언어모델 자체보다 도구·메모리 관리·규칙으로 구성된 소프트웨어 래퍼, 이른바 '하네스(harness)'에 의해 더 크게 좌우되는 것으로 나타났다. Anthropic의 Claude Opus 5를 Nvidia가 자체 설계한 하네스와 결합했을 때 ARC-AGI-3 벤치마크에서 100% 점수를 기록했으며, 동일한 모델이 하네스 없이 단독으로 작동했을 때는 30% 수준에 그쳤다.

배경

AI 업계에서는 그동안 에이전트 성능 향상을 위해 더 강력한 기반 모델 개발에 집중해왔다. 그러나 Nvidia의 이번 연구는 모델 성능 자체보다 에이전트를 둘러싼 소프트웨어 구조가 실질적 성과를 좌우한다는 점을 실증적으로 보여준다. Nvidia 제품 담당 부사장 Adel El Hallak는 하네스를 "도구, 메모리 관리, 규칙으로 구성된 소프트웨어 래퍼"이자 "단순한 API 이상의 것"이라고 설명했다. 앞서 OpenAI도 2026년 7월 발표한 유사 연구에서 하네스 설정 두 가지만 조정해 점수를 3배 향상시킨 바 있어, 하네스의 중요성은 업계 전반에서 공통적으로 확인되는 추세다.

영향

Nvidia 연구팀이 도입한 핵심 혁신은 '감독자(supervisor)' 에이전트다. 메인 에이전트가 길을 잃거나 막다른 경로로 향할 때 방향을 재조정해주는 이 컴포넌트는, 에이전트가 장기 작업 중 오류를 누적시키는 문제를 완화하는 역할을 한다. 이는 앞서 마이크로소프트가 2026년 4월 발표한 연구에서 장기 작업 시 모든 모델이 오류를 일으킨다고 지적한 문제, 그리고 2026년 7월 AI 에이전트가 파일 삭제나 데이터베이스 손상, 해킹 등 부작용을 일으킨 사례들과 맞닿아 있다. Databricks의 별도 연구에서는 잘못된 하네스 선택이 운영 비용을 최대 2배까지 늘릴 수 있다는 점도 확인됐다.

향후 전망

Nvidia는 이번 연구 결과를 바탕으로 완제품이 아닌 오픈소스 기술 조각(Nemo 브랜드)을 제공해 개발자들이 직접 하네스를 구성하고 제어할 수 있도록 하는 전략을 추진 중이다. 앞으로 AI 에이전트 경쟁의 축이 '더 큰 모델'에서 '더 정교한 하네스 설계'로 옮겨갈 가능성이 있으며, 감독자 에이전트와 같은 안전장치가 에이전트의 신뢰성을 높이는 표준 구성요소로 자리 잡을지 주목된다.

자주 묻는 질문

Q. AI 에이전트의 '하네스'란 무엇인가? 도구 연동, 메모리 관리, 행동 규칙 등으로 구성된 소프트웨어 래퍼로, 기반 모델의 API 호출을 넘어 에이전트의 실제 작업 수행 방식을 설계하는 구조를 말한다.

Q. 왜 하네스가 모델 자체보다 중요하다는 것인가? Nvidia 연구에서 동일한 Claude Opus 5 모델이 하네스 유무에 따라 ARC-AGI-3 벤치마크 점수가 30%에서 100%까지 차이가 났다. OpenAI도 하네스 설정 조정만으로 점수를 3배 높인 사례가 있어, 모델 성능보다 하네스 설계가 실질적 성과를 좌우함을 보여준다.

Q. '감독자' 에이전트는 어떤 역할을 하나? 메인 에이전트가 잘못된 경로로 향하거나 길을 잃었을 때 이를 감지해 방향을 재조정해주는 컴포넌트로, 장기 작업에서 발생하는 오류 누적 문제를 완화한다.

출처 - https://techcrunch.com/2026/08/21/nvidia-just-showed-that-the-harness-not-the-ai-model-is-now-the-real-hero/

댓글

아직 댓글이 없습니다.

댓글을 작성하려면 로그인이 필요합니다.