相關AI快訊
EvoOntology 論文報告自我演化本體層提升數據代理在 DDR-Bench 與 BIRD 的分數
elvis(@omarsar0)分享一篇關於 EvoOntology 的論文,此為面向數據代理、以 MCP 伺服器形式提供的自我演化本體層。帖文指 DDR-Bench 準確率在六個骨幹模型上平均上升 17.8 分,當中 GPT-5.5 上升 26.7 分,而 BIRD 執行準確率上升 7.4 分。
BRIDGE ASR 2.0 測試 23 個語音識別模型處理長篇多語對話
elvis 表示,humynlabs 建立 BRIDGE ASR 2.0,用以評估語音識別在真實雙人對話上的表現。對話長 10 至 15 分鐘,涵蓋 18 種印度語系語言,以及西班牙語、葡萄牙語和越南語。
最佳 Taste-Bench 模型有 59.7% 時間選出較佳方向
微軟與合作者的論文指出,在長程工程與研究任務中選擇較佳的開放方向時,最佳模型答對 59.7% 的 Taste-Bench 問題。由較後證據決定的分岔難度高得多,加大推理預算不會提高準確率;把教師對結果的判斷蒸餾到學生模型,則能提升在留出的 SWE-bench Pro 上的成功率。
elvis 表示,Agora-2 可讓最多 20 名人類與智能體共用同一個即時模擬世界
elvis 表示,世界模型 Agora-2 現可讓最多 20 名人類與智能體同時置身同一個模擬世界。elvis 形容,它可用來一同訓練機械人、自動駕駛汽車與網絡防禦智能體,並在投入現實應用前研究智能體串謀。
Harness-Zero 在移除專用 harness 後,將宏觀任務成功率提升至 44.3%
Google 與合作者的論文介紹 Harness-Zero:優化後的 agent harness 只在訓練期間使用。移除該 harness 後,宏觀任務成功率由 23.3% 升至 44.3%,高於基礎模型在掛上 harness 時達到的 41.7%。