Critical-State RLは結果を変えるツール呼び出しだけを学習する
Critical-State RLは、報酬を軌跡全体に配分するのではなく、行動が結果を変える単一の呼び出しだけを学習することで、マルチターンのツール使用を対象にする。報酬が後続ターンに依存する場合、その変動の多くは下流で起きることによる。
この手法はネストサンプリングで、現在の行動による報酬の変動と下流のノイズを分け、選んだ呼び出しだけをコンテキストバンディット更新で学習する。BFCL v4のmissing-functionタスクでは、選んだターンを学習すると約14ポイント上がる一方、もう一方の候補ターンを学習すると精度は横ばいか低下する。
DAIR.AIはCritical-State RLの論文を示している。