Critical-State RL은 결과를 바꾸는 도구 호출만 학습한다
DAIR.AI는 이후 보상을 바꾸는 행동에 해당하는 다중 턴 도구 호출을 가려내고 그 호출만 업데이트하는 Salesforce AI Research의 방법을 설명한다. BFCL v4 missing-function 과제에서 선택한 턴을 학습하면 약 14점이 오른다.
DAIR.AI는 이후 보상을 바꾸는 행동에 해당하는 다중 턴 도구 호출을 가려내고 그 호출만 업데이트하는 Salesforce AI Research의 방법을 설명한다. BFCL v4 missing-function 과제에서 선택한 턴을 학습하면 약 14점이 오른다.