Critical-State RLは結果を変えるツール呼び出しだけを学習する
DAIR.AIは、後の報酬を変える行動にあたるマルチターンのツール呼び出しを切り分け、その呼び出しだけを更新するSalesforce AI Researchの手法を説明している。BFCL v4のmissing-functionタスクでは、選んだターンを学習すると約14ポイント上がる。
DAIR.AIは、後の報酬を変える行動にあたるマルチターンのツール呼び出しを切り分け、その呼び出しだけを更新するSalesforce AI Researchの手法を説明している。BFCL v4のmissing-functionタスクでは、選んだターンを学習すると約14ポイント上がる。