Arena.aiによると、GPT-6 SolとGPT-6 Lunaのスコアは近日公開
OpenAIの2モデルはArenaで試すことができ、実世界のエージェント型タスクへの投票がリーダーボードに反映される。Arena.aiによると、petergostevは同一のプロンプトと最大推論設定でGPT-6 SolとGPT-5.6 Solも比較している。
OpenAIの2モデルはArenaで試すことができ、実世界のエージェント型タスクへの投票がリーダーボードに反映される。Arena.aiによると、petergostevは同一のプロンプトと最大推論設定でGPT-6 SolとGPT-5.6 Solも比較している。
OpenAIによると、両モデルはそれぞれのGPT-5.6対応モデルを上回る改善を示している。
LangChainは、エージェント評価の審査役としてJevをGPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6と比較検証し、すべての呼び出しで人間のレビュアーと一致、最大913倍低い分散、呼び出しあたり0.44秒、フル実行コスト0.34ドル(Claude Sonnet 4.6では28.17ドル)と報告した。