Arena.ai 称 GPT-6 Sol 与 GPT-6 Luna 的评分即将公布
OpenAI 的两款模型已可在 Arena 上测试,针对真实世界智能体任务的投票会计入排行榜。Arena.ai 称,petergostev 还用相同提示词、在最高推理设置下比较了 GPT-6 Sol 与 GPT-5.6 Sol。
OpenAI 的两款模型已可在 Arena 上测试,针对真实世界智能体任务的投票会计入排行榜。Arena.ai 称,petergostev 还用相同提示词、在最高推理设置下比较了 GPT-6 Sol 与 GPT-5.6 Sol。
OpenAI 表示,这两款模型均优于各自对应的 GPT-5.6 版本。
LangChain 表示,其将 Jev 与 GPT-5.6 Luna、GPT-5.6 Terra 和 Claude Sonnet 4.6 作为智能体评估评判进行了对比测试,报告称每次调用均与人类评审员匹配,方差最高降低 913 倍,每次调用耗时 0.44 秒,完整运行成本为 0.34 美元,而使用 Claude Sonnet 4.6 为 28.17 美元。