# 엔비디아 논문, 에이전트 하네스와 모델을 동시 진화시키는 VERA 프레임워크 공개

엔비디아 연구진이 벤치마크 궤적을 루브릭 평가가 가능한 9,000개 이상의 재시작 가능한 샌드박스로 변환하고, 모델 가중치와 함께 에이전트 하네스를 동시 진화시키는 VERA 시스템을 논문으로 공개했다. 연구팀은 해당 환경 말뭉치를 오픈소스로 공개했으며, 27B 에이전트가 AutoCoWorkBench에서 71.6점을 기록해 Claude Opus 4.8을 넘어섰다고 밝혔다.

Language: ko
Time zone: Asia/Seoul

HTML: https://didcodexreset.com/ko/news/10433a5ea5fa405a9d584306.html

Content language: ko
Localization state: translated

출처: elvis · 2026. 10. 8. 00:30:48 게시

VERA는 벤치마크 궤적을 루브릭 평가가 지원되는 9,000개 이상의 재시작 가능한 샌드박스로 변환하며, 실제로 실행되고 관찰 가능한 증거로 평가할 수 있는 환경만 선별해 유지한다. 학습 과정에서 이 프레임워크는 에이전트 하네스와 모델 가중치를 동시에 진화시킨다. 하네스 수정 사항은 자체 테스트를 통과하고 개발 셋에서 최소 5점 이상의 향상을 보일 때만 유지되며, 모델 체크포인트는 성능이 20% 이상 하락할 경우 폐기된다.

[연구 논문](https://arxiv.org/abs/2610.05923)에 따르면, 동시 진화된 9B 에이전트는 가장 강력한 단일 축 기준선 대비 AutoCoWorkBench에서 10.3점, AutoMedBench에서 13.0점 높은 성능을 보였다. 27B 모델의 경우 AutoCoWorkBench에서 71.6점을 기록하며 Claude Opus 4.8을 앞섰다. 엔비디아는 이 환경 말뭉치를 오픈소스로 공개했다.

Tags: NVIDIA, AI 에이전트, 벤치마크, 오픈소스

[원문 게시물 보기](https://x.com/omarsar0/status/2107849444897243141)
