Did Codex Reset
GitHub

QQ·微信群

LangChain 報告 Jev 作為代理評估評判與人類審核者一致,對比 GPT-5.6 及 Claude Sonnet 4.6

LangChain

LangChain 表示已測試 Jev 對比 GPT-5.6 Luna、GPT-5.6 Terra 及 Claude Sonnet 4.6 作為代理評估評判。

據 LangChain 表示,Jev 每次呼叫均與人類審核者一致,方差最多低 913x,以 每次呼叫 0.44s 對比大型語言模型的 2.16-2.83s。其報告完整運行成本使用 Jev 為 $0.34,使用 Claude Sonnet 4.6 則為 $28.17。