Did Codex Reset
GitHub

Critical-State RL은 결과를 바꾸는 도구 호출만 학습한다

DAIR.AI

Critical-State RL은 보상을 전체 궤적에 나누는 대신, 행동이 결과를 바꾸는 단일 호출만 학습해 다중 턴 도구 사용을 다룬다. 보상이 이후 턴에 달려 있으면 변동의 상당 부분은 하류에서 일어나는 일에서 나온다.

이 방법은 중첩 샘플링으로 현재 행동이 만든 보상 변동과 하류 잡음을 가른 뒤, 선택한 호출만 컨텍스트 밴딧 업데이트로 학습한다. BFCL v4 missing-function 과제에서 선택한 턴을 학습하면 약 14점이 오르지만, 다른 후보 턴을 학습하면 정확도는 그대로이거나 낮아진다.

DAIR.AI는 Critical-State RL 논문을 가리킨다.