Surya가 RL 학습 실행을 스트리밍
Surya는 자신의 강화학습 학습 실행을 brusharena.art/live에서 스트리밍하고 있다고 밝혔다. 이 스트리밍은 LuoFuli에게서 영감을 받았다.
Surya는 자신의 강화학습 학습 실행을 brusharena.art/live에서 스트리밍하고 있다고 밝혔다. 이 스트리밍은 LuoFuli에게서 영감을 받았다.
OpenAI가 프론티어 강화학습 학습 실행의 보안을 어떻게 보는지에 대한 페이지를 공개했다. URL은 프론티어 AI 학습의 안전 사례에 관한 것이다.
Amazon AGI의 논문은 AutoGym을 제안한다. AutoGym은 작은 도메인 시드 또는 과거 모델 궤적으로부터 에이전트 과제, 실행 가능한 환경, 검증기를 함께 작성한다.
DAIR.AI는 이후 보상을 바꾸는 행동에 해당하는 다중 턴 도구 호출을 가려내고 그 호출만 업데이트하는 Salesforce AI Research의 방법을 설명한다. BFCL v4 missing-function 과제에서 선택한 턴을 학습하면 약 14점이 오른다.
SmolDataEnvs는 코드와 데이터 과학 분야에서 소형 모델을 점진적으로 개선하기 위한, 검증 가능한 강화학습 환경 과제 5,000개 이상을 모은 오픈소스 자료다. 이번 공개에는 환경, 평가, 학습 자료가 포함된다.
Salesforce AI Research는 양방향 보상 오류를 확인한 뒤 해당 컬렉션의 깨끗한 비율을 35.8%, 다른 두 컬렉션은 10.1%와 3.3%로 제시했다. 저자들은 결함 환경을 걸러내는 RIVER가 TMax 환경의 30% 미만을 쓰면서도 Terminal-Bench-Lite에서 RL 이득을 106%, Terminal-Bench v2.1에서 30% 늘린다고 말한다.