Perplexityによると、ライブA/Bテストで後のComputerチェックポイントがツール呼び出し失敗を21.2%減らした
Perplexityは、ヒント誘導型の自己蒸留を使い、自らの誤りから学ぶようComputerモデルをポストトレーニングした。ライブA/Bテストでは、後に学習したチェックポイントが、より前のチェックポイントと比べてツール呼び出しの失敗を21.2%減らしたとPerplexityは述べた。
Perplexityは、ヒント誘導型の自己蒸留を使い、自らの誤りから学ぶようComputerモデルをポストトレーニングした。ライブA/Bテストでは、後に学習したチェックポイントが、より前のチェックポイントと比べてツール呼び出しの失敗を21.2%減らしたとPerplexityは述べた。