Nvidia 연구, AI 에이전트 성능은 모델이 아니라 '하니스'가 좌우한다는 결과 공개
Nvidia가 공개한 연구에서 동일한 Claude Opus 5 모델이 자체 개발한 하니스와 감독 컴포넌트를 붙였을 때 ARC-AGI-3 벤치마크에서 100% 점수를 기록했지만, 하니스 없이는 30%에 그쳤다. 모델 자체의 성능 향상보다 메모리 관리·도구 접근·감독 구조 같은 소프트웨어 하니스 설계가 장기 과제 수행 능력을 더 크게 좌우한다는 뜻으로, AI 에이전트를 도입하는 기업의 투자 우선순위에 시사점을 준다.
무엇이 바뀌었나
Nvidia 연구진이 장기 과제를 수행하는 AI 에이전트에서 모델 자체보다 그 주변을 감싸는 소프트웨어 하니스(harness)가 성능을 더 크게 결정한다는 연구 결과를 공개했다. 하니스는 메모리 관리, 도구 접근 권한, 그리고 작업을 감독하는 컴포넌트로 구성되는데, 연구진은 감독 컴포넌트를 포함한 자체 제작 하니스를 Claude Opus 5에 씌워 인터랙티브 추론 벤치마크 ARC-AGI-3에서 100% 점수를 기록했다[1]. 같은 모델이 하니스 없이 받은 점수는 30%로, 이는 하니스를 적용하지 않은 상태에서 테스트된 모든 모델 중 가장 높은 점수였다[1]. 참고로 OpenAI 모델들은 원래 이 벤치마크에서 10% 미만의 점수를 받았다고 알려졌다[1].
이 발표는 Nvidia AI 사업부 제품 담당 부사장 Adel El Hallak을 통해 나왔으며, 연구는 Agentic Variation Operators(AVO), Nvidia Nemo, 그리고 Claude Code·Codex·Hermes 같은 코딩 에이전트를 하니스 구성 요소나 비교 대상의 예시로 함께 언급했다[1]. 별도로 Microsoft 연구팀도 19개 LLM을 대상으로 장기 문서 편집 과제를 시험했다는 사실이 같은 맥락에서 소개됐다[1].
왜 중요한가
지금까지 AI 에이전트 성능 경쟁은 대체로 더 뛰어난 파운데이션 모델을 확보하는 문제로 다뤄졌다. 이번 결과는 동일한 모델이라도 하니스 설계에 따라 벤치마크 점수가 3배 이상 벌어질 수 있음을 보여주면서, 성능 격차의 상당 부분이 모델이 아니라 그 모델을 운영하는 소프트웨어 구조에서 발생한다는 점을 뒷받침한다. Databricks CEO Ali Ghodsi는 잘못된 하니스를 쓰면 비용이 최대 2배까지 늘어날 수 있다고 언급했는데[1], 이는 하니스 설계가 성능뿐 아니라 운영 비용에도 직접 영향을 미친다는 뜻으로 해석할 수 있다.
이런 흐름은 AI 코드 리뷰 기업 Ito가 최근 밝힌 "다음 LLM보다 인프라 투자가 더 중요하다"는 주장과도 맞닿아 있다. 모델 간 벤치마크 순위 차이가 좁아지는 국면에서, 라우팅·캐싱·감독 구조 같은 하니스 엔지니어링이 실제 프로덕션 성능을 가르는 요소로 부각되고 있다는 관측이 여러 곳에서 동시에 나오는 셈이다.
기업 실무에 미치는 영향
AI 에이전트를 도입하려는 개발팀이나 AI 인프라 조직이라면, 어떤 모델을 쓸지보다 그 모델을 감싸는 메모리 관리 구조와 도구 접근 정책, 감독 컴포넌트를 어떻게 설계할지에 더 많은 검토 시간을 배분해야 할 필요가 생긴다. 특히 장기간 여러 단계를 거쳐야 하는 업무—예를 들어 문서 편집, 코드베이스 유지보수, 복잡한 워크플로 자동화—에서는 모델 교체보다 하니스 재설계가 더 큰 성능 개선을 가져올 가능성이 있다.
다만 하니스 설계와 보안 통제를 같은 층에서 다뤄서는 안 된다는 지적도 있다. Nvidia AI 안전 및 보안팀은 별도 블로그에서 보안 통제는 개발자가 수정 가능한 하니스 로직이 아니라 런타임과 인프라 계층에 둬야 한다고 강조했다. 즉 하니스는 성능을 끌어올리는 지렛대이지만, 최소 권한이나 격리 같은 보안 요건까지 하니스 로직에 맡기는 것은 위험하다는 의미로, 에이전트형 AI를 실제 업무에 투입하는 보안·인프라 팀은 성능 최적화와 보안 통제를 서로 다른 계층에서 설계해야 할 것으로 보인다.
확인이 필요한 부분
이번 연구가 정확히 언제 공개됐는지는 기사 원문에 '금요일'로만 표기돼 있어 정확한 날짜는 확인되지 않는다[1]. 또한 OpenAI 모델들이 하니스 설정을 바꾼 뒤 점수가 '3배로 뛰었다'는 표현도 정성적으로만 서술돼 있어, 정확히 몇 퍼센트에서 몇 퍼센트로 올랐는지 구체적 수치는 공개되지 않았다[1]. 하니스 설계가 실제로 어느 정도의 비용·시간 투입을 요구하는지, 그리고 이번 실험 결과가 ARC-AGI-3 외 다른 실무 과제에서도 동일하게 재현되는지는 추가 확인이 필요한 대목이다.

