PrimeScientist, AutoResearch보다 보상 10.3% 높고 연구 시도 50.6% 적어
DAIR.AI는 연구 에이전트가 예산을 어디에 쓸지 적응형 MCTS 정책으로 정하는 PrimeScientist를 소개한다. 같은 예산의 AI 연구 과제 12개에서 AutoResearch보다 보상은 10.3% 높고 연구 시도는 50.6% 적었다고 보고한다.
DAIR.AI는 연구 에이전트가 예산을 어디에 쓸지 적응형 MCTS 정책으로 정하는 PrimeScientist를 소개한다. 같은 예산의 AI 연구 과제 12개에서 AutoResearch보다 보상은 10.3% 높고 연구 시도는 50.6% 적었다고 보고한다.
그는 SliceAttention 커널과 BatchedMuon 덕분이라고 밝혔으며, 현재 Transolver를 쓰고 있다고 전했다. 전체 학습 실행은 26시간에서 22시간으로 줄었고, 오차나 품질에는 유의미한 변화가 없었다고 한다.