相关AI快讯
EvoOntology 论文称自演化本体层提升数据智能体在 DDR-Bench 和 BIRD 上的得分
elvis (@omarsar0) 分享了一篇关于 EvoOntology 的论文,这是一种以 MCP 服务器形式提供的、面向数据智能体的自演化本体层。帖文称,在六个骨干模型上,DDR-Bench 准确率平均提升 17.8 个百分点,其中 GPT-5.5 提升 26.7 个百分点,BIRD 执行准确率提升 7.4 个百分点。
BRIDGE ASR 2.0 测试 23 个语音识别模型在长篇多语言对话中的表现
elvis 表示,humynlabs 构建了 BRIDGE ASR 2.0,用于评估语音识别在真实双人对话中的表现。这些对话时长为 10 至 15 分钟,涵盖 18 种印度语言,以及西班牙语、葡萄牙语和越南语。
Taste-Bench 最佳模型选出更优方向的比例为 59.7%
微软及合作者的一篇论文报告,在长周期工程与研究任务中选择更优开放方向时,最佳模型正确回答 59.7% 的 Taste-Bench 问题。由后续证据决定的分叉难度高得多,增加推理预算并不能提高准确率,而将教师模型对结果的判断蒸馏到学生模型后,可提高留出集 SWE-bench Pro 任务的成功率。
elvis 称 Agora-2 可让最多 20 名人类与智能体共享同一个实时模拟世界
elvis 称,世界模型 Agora-2 现可将最多 20 名人类和智能体同时放入同一个模拟世界。elvis 将其描述为可共同训练机器人、自动驾驶汽车和网络防御智能体的场所,也可在投入真实世界使用前研究智能体共谋。
Harness-Zero 在去掉专用 harness 后将宏观任务成功率提高到 44.3%
Google 与合作者的一篇论文介绍了 Harness-Zero:优化后的 agent harness 只在训练阶段使用。去掉该 harness 后,宏观任务成功率从 23.3% 升至 44.3%,高于基座模型挂上该 harness 时达到的 41.7%。