본문으로 건너뛰기
NvidiaAI 에이전트ARC-AGI-3Claude Opus 5

Nvidia 연구, AI 에이전트 성능은 모델이 아니라 '하니스'가 좌우한다는 결과 공개

Nvidia가 공개한 연구에서 동일한 Claude Opus 5 모델이 자체 개발한 하니스와 감독 컴포넌트를 붙였을 때 ARC-AGI-3 벤치마크에서 100% 점수를 기록했지만, 하니스 없이는 30%에 그쳤다. 모델 자체의 성능 향상보다 메모리 관리·도구 접근·감독 구조 같은 소프트웨어 하니스 설계가 장기 과제 수행 능력을 더 크게 좌우한다는 뜻으로, AI 에이전트를 도입하는 기업의 투자 우선순위에 시사점을 준다.

확인 출처 1발행 주체 빅시프트

무엇이 바뀌었나

Nvidia 연구진이 장기 과제를 수행하는 AI 에이전트에서 모델 자체보다 그 주변을 감싸는 소프트웨어 하니스(harness)가 성능을 더 크게 결정한다는 연구 결과를 공개했다. 하니스는 메모리 관리, 도구 접근 권한, 그리고 작업을 감독하는 컴포넌트로 구성되는데, 연구진은 감독 컴포넌트를 포함한 자체 제작 하니스를 Claude Opus 5에 씌워 인터랙티브 추론 벤치마크 ARC-AGI-3에서 100% 점수를 기록했다[1]. 같은 모델이 하니스 없이 받은 점수는 30%로, 이는 하니스를 적용하지 않은 상태에서 테스트된 모든 모델 중 가장 높은 점수였다[1]. 참고로 OpenAI 모델들은 원래 이 벤치마크에서 10% 미만의 점수를 받았다고 알려졌다[1].

이 발표는 Nvidia AI 사업부 제품 담당 부사장 Adel El Hallak을 통해 나왔으며, 연구는 Agentic Variation Operators(AVO), Nvidia Nemo, 그리고 Claude Code·Codex·Hermes 같은 코딩 에이전트를 하니스 구성 요소나 비교 대상의 예시로 함께 언급했다[1]. 별도로 Microsoft 연구팀도 19개 LLM을 대상으로 장기 문서 편집 과제를 시험했다는 사실이 같은 맥락에서 소개됐다[1].

왜 중요한가

지금까지 AI 에이전트 성능 경쟁은 대체로 더 뛰어난 파운데이션 모델을 확보하는 문제로 다뤄졌다. 이번 결과는 동일한 모델이라도 하니스 설계에 따라 벤치마크 점수가 3배 이상 벌어질 수 있음을 보여주면서, 성능 격차의 상당 부분이 모델이 아니라 그 모델을 운영하는 소프트웨어 구조에서 발생한다는 점을 뒷받침한다. Databricks CEO Ali Ghodsi는 잘못된 하니스를 쓰면 비용이 최대 2배까지 늘어날 수 있다고 언급했는데[1], 이는 하니스 설계가 성능뿐 아니라 운영 비용에도 직접 영향을 미친다는 뜻으로 해석할 수 있다.

이런 흐름은 AI 코드 리뷰 기업 Ito가 최근 밝힌 "다음 LLM보다 인프라 투자가 더 중요하다"는 주장과도 맞닿아 있다. 모델 간 벤치마크 순위 차이가 좁아지는 국면에서, 라우팅·캐싱·감독 구조 같은 하니스 엔지니어링이 실제 프로덕션 성능을 가르는 요소로 부각되고 있다는 관측이 여러 곳에서 동시에 나오는 셈이다.

기업 실무에 미치는 영향

AI 에이전트를 도입하려는 개발팀이나 AI 인프라 조직이라면, 어떤 모델을 쓸지보다 그 모델을 감싸는 메모리 관리 구조와 도구 접근 정책, 감독 컴포넌트를 어떻게 설계할지에 더 많은 검토 시간을 배분해야 할 필요가 생긴다. 특히 장기간 여러 단계를 거쳐야 하는 업무—예를 들어 문서 편집, 코드베이스 유지보수, 복잡한 워크플로 자동화—에서는 모델 교체보다 하니스 재설계가 더 큰 성능 개선을 가져올 가능성이 있다.

다만 하니스 설계와 보안 통제를 같은 층에서 다뤄서는 안 된다는 지적도 있다. Nvidia AI 안전 및 보안팀은 별도 블로그에서 보안 통제는 개발자가 수정 가능한 하니스 로직이 아니라 런타임과 인프라 계층에 둬야 한다고 강조했다. 즉 하니스는 성능을 끌어올리는 지렛대이지만, 최소 권한이나 격리 같은 보안 요건까지 하니스 로직에 맡기는 것은 위험하다는 의미로, 에이전트형 AI를 실제 업무에 투입하는 보안·인프라 팀은 성능 최적화와 보안 통제를 서로 다른 계층에서 설계해야 할 것으로 보인다.

확인이 필요한 부분

이번 연구가 정확히 언제 공개됐는지는 기사 원문에 '금요일'로만 표기돼 있어 정확한 날짜는 확인되지 않는다[1]. 또한 OpenAI 모델들이 하니스 설정을 바꾼 뒤 점수가 '3배로 뛰었다'는 표현도 정성적으로만 서술돼 있어, 정확히 몇 퍼센트에서 몇 퍼센트로 올랐는지 구체적 수치는 공개되지 않았다[1]. 하니스 설계가 실제로 어느 정도의 비용·시간 투입을 요구하는지, 그리고 이번 실험 결과가 ARC-AGI-3 외 다른 실무 과제에서도 동일하게 재현되는지는 추가 확인이 필요한 대목이다.

확인한 출처

관련 AI 뉴스

AI BRIEFING/

AI 에이전트용 범용 샌드박스 'OpenSandbox' 오픈소스로 공개

코딩 에이전트, GUI 에이전트, 에이전트 평가, AI 코드 실행, RL 트레이닝 등 다양한 AI 에이전트 워크로드를 위한 통합 샌드박스 플랫폼 'OpenSandbox'가 GitHub에 Apache-2.0 라이선스로 공개됐다. 다중 언어 SDK와 통합 API, Docker·Kubernetes 런타임을 함께 제공해 그동안 목적별로 흩어져 있던 에이전트 실행 환경을 하나의 인터페이스로 묶으려는 시도로 보인다.

OpenSandboxAI 에이전트샌드박스
읽기
AI BRIEFING/

Patronus AI, 'GLM-5.2 NVFP4 사후학습' 제목의 블로그 글만 게시...본문 내용은 확인 안 돼

AI 평가 스타트업 Patronus AI가 'Getting GLM-5.2 NVFP4 Post-Training off the ground'라는 제목의 블로그 글을 게시했다. 그러나 본문에는 제목과 동일한 문구 외에 구체적인 작업 방식이나 결과가 공개되지 않아, 실제로 어떤 작업이 진행 중인지는 확인되지 않는다.

Patronus AIGLM-5.2NVFP4
읽기
AI BRIEFING/

클라우드플레어, AI 에이전트 전용 접근제어 모델 'AAM' 제안

클라우드플레어가 인간 사용자를 전제로 설계된 BeyondCorp·Zero Trust 모델이 AI 에이전트에는 맞지 않는다는 문제의식에서 'Agent Access Model(AAM)'이라는 새 보안 프레임워크 논문을 발표했다. 에이전트 권한을 작업 단위로 최소화하고 실시간으로 강제하는 5원칙과 6개 아키텍처 구성요소를 제시하면서도, 여러 사용자가 공유하는 에이전트의 권한 분리 문제는 업계 전체가 아직 풀지 못했다고 스스로 밝혔다.

CloudflareAI 에이전트 보안Agent Access Model
읽기