Did Codex Reset
GitHub

#claude-sonnet

すべてのAIニュースを見る

LangChain、エージェント評価の審査役としてJevが人間のレビュアーと一致したと報告、GPT-5.6およびClaude Sonnet 4.6と比較

LangChainは、エージェント評価の審査役としてJevをGPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6と比較検証し、すべての呼び出しで人間のレビュアーと一致、最大913倍低い分散、呼び出しあたり0.44秒、フル実行コスト0.34ドル(Claude Sonnet 4.6では28.17ドル)と報告した。