Did Codex Reset
GitHub

#evaluation

すべてのAIニュースを見る

LangChain、エージェント評価の審査役としてJevが人間のレビュアーと一致したと報告、GPT-5.6およびClaude Sonnet 4.6と比較

LangChainは、エージェント評価の審査役としてJevをGPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6と比較検証し、すべての呼び出しで人間のレビュアーと一致、最大913倍低い分散、呼び出しあたり0.44秒、フル実行コスト0.34ドル(Claude Sonnet 4.6では28.17ドル)と報告した。

Jev-as-a-judgeがLangSmithで利用可能に

LangChainは、Jev-as-a-judgeがLangSmithで利用可能になったと述べている。同社は、すべての本番トレースをスコアリングでき、コストを上昇させずにトレースあたりより多くの基準をチェックでき、自動化された対応をトリガーできるほど迅速に安全性またはセキュリティの問題を捕捉できると主張している。

Elvis、Jevを使って約2.3K件のAI論文を83秒で0.14ドルで再タグ付けしたと報告

Elvis(@omarsar0)は、Jevを使って約2.3K件のAI研究論文を総費用0.14ドル、約83秒で整理したと述べた。Jevは以前のDeepSeek V4 Flashのタグの75%に同意し、約579件の高信頼度のトピック変更を見つけ、不一致30件の手動チェックはすべて受け入れられた後、変更が本番環境で適用されたと述べた。