Perplexityによると、ライブA/Bテストで後のComputerチェックポイントがツール呼び出し失敗を21.2%減らした
Perplexityは、ヒント誘導型の自己蒸留を使い、自らの誤りから学ぶようComputerモデルをポストトレーニングした。21.2%の減少は、より前のチェックポイントとの比較だと述べた。
Perplexityは、ヒント誘導型の自己蒸留を使い、自らの誤りから学ぶようComputerモデルをポストトレーニングした。21.2%の減少は、より前のチェックポイントとの比較だと述べた。