Did Codex Reset
GitHub

QQ·微信群

LangChain 报告称作为智能体评估评判,Jev 与人类评审员匹配,对比 GPT-5.6 和 Claude Sonnet 4.6

LangChain

LangChain 表示,其将 Jev 与 GPT-5.6 Luna、GPT-5.6 Terra 和 Claude Sonnet 4.6 作为智能体评估评判进行了对比测试。

据 LangChain 称,Jev 每次调用均与人类评审员匹配,方差最高降低 913 倍,每次调用耗时 0.44 秒,而这些大语言模型为 2.16-2.83 秒。其报告完整运行成本为:Jev 0.34 美元,Claude Sonnet 4.6 为 28.17 美元。