Did Codex Reset
GitHub

QQ·微信群

#benchmarks

查看全部AI快讯
TGRSS 订阅共 15 条

Taste-Bench 最佳模型选出更优方向的比例为 59.7%

微软及合作者的一篇论文报告,在长周期工程与研究任务中选择更优开放方向时,最佳模型正确回答 59.7% 的 Taste-Bench 问题。由后续证据决定的分叉难度高得多,增加推理预算并不能提高准确率,而将教师模型对结果的判断蒸馏到学生模型后,可提高留出集 SWE-bench Pro 任务的成功率。

Artificial Analysis 报告其 Intelligence Index 成本前沿新增 11 个点

MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna 和 GPT-6 Sol 在不同推理强度下,为 Artificial Analysis 的 Intelligence Index 与单任务成本帕累托前沿贡献了 11 个新点。Claude Opus 5.5(max with fallback)得分为 58,单任务成本 5.98 美元,是该指数上的最高结果。

EvoOntology 论文称自演化本体层提升数据智能体在 DDR-Bench 和 BIRD 上的得分

elvis (@omarsar0) 分享了一篇关于 EvoOntology 的论文,这是一种以 MCP 服务器形式提供的、面向数据智能体的自演化本体层。帖文称,在六个骨干模型上,DDR-Bench 准确率平均提升 17.8 个百分点,其中 GPT-5.5 提升 26.7 个百分点,BIRD 执行准确率提升 7.4 个百分点。