Prime Intellect, Prime Inference 출시 PPrime Intellect1시간 2분 전 Prime Intellect가 Prime Inference를 출시했다. 회사 측은 강화학습 및 고객 전용 배포 환경을 대상으로 수조 개의 토큰을 처리했다고 밝혔다。 #prime-intellect#prime-inference#추론#강화학습
허깅페이스 허브, 강화학습 환경 호스팅 지원강화학습 환경을 허깅페이스 허브에서 직접 호스팅할 수 있게 되었으며, 기존 데이터셋 인프라를 활용해 프레임워크 전반의 저장, 버전 관리, 접근 제어, 미리보기 기능을 지원한다.
CMU 논문, 솔버를 바꾸지 않고 에이전트 하네스를 편집하는 4B 제안 모델 훈련이 하네스 학습 논문은 강화 학습으로 제안 모델이 과제, 현재 하네스, 실행 보고서를 바탕으로 하네스 코드를 수정하도록 한다. 훈련된 4B 제안 모델은 Reasoning Gym 단일 단계 수정에서 35B 교사 모델을 능가하며, HotpotQA 훈련은 MuSiQue와 2WikiMultihopQA로 전이된다.
Amazon AGI 논문, 에이전트 강화학습 환경을 위한 AutoGym 제안Amazon AGI의 논문은 AutoGym을 제안한다. AutoGym은 작은 도메인 시드 또는 과거 모델 궤적으로부터 에이전트 과제, 실행 가능한 환경, 검증기를 함께 작성한다.
Critical-State RL은 결과를 바꾸는 도구 호출만 학습한다DAIR.AI는 이후 보상을 바꾸는 행동에 해당하는 다중 턴 도구 호출을 가려내고 그 호출만 업데이트하는 Salesforce AI Research의 방법을 설명한다. BFCL v4 missing-function 과제에서 선택한 턴을 학습하면 약 14점이 오른다.