Did Codex Reset
GitHub

Perplexityによると、ライブA/Bテストで後のComputerチェックポイントがツール呼び出し失敗を21.2%減らした

Perplexity

Perplexityは、ヒント誘導型の自己蒸留を使い、自らの誤りから学ぶようComputerモデルをポストトレーニングした。ライブA/Bテストでは、後に学習したチェックポイントが、より前のチェックポイントと比べてツール呼び出しの失敗を21.2%減らしたとPerplexityは述べた。