BRIDGE ASR 2.0 測試 23 個語音識別模型處理長篇多語對話
elvis 表示,humynlabs 建立 BRIDGE ASR 2.0,用以評估語音識別在真實雙人對話上的表現。對話長 10 至 15 分鐘,涵蓋 18 種印度語系語言,以及西班牙語、葡萄牙語和越南語。
elvis 表示,humynlabs 建立 BRIDGE ASR 2.0,用以評估語音識別在真實雙人對話上的表現。對話長 10 至 15 分鐘,涵蓋 18 種印度語系語言,以及西班牙語、葡萄牙語和越南語。
CASD 讓現成的編程智能體分析完整的智能體日誌,並把發現寫成單一提示詞中的規則,無需環境存取或驗證數據。DAIR.AI 表示,在所報告的基準測試中,一次處理的表現優於 GEPA 與 SkillOpt,每個優化後的提示詞成本約 1.60 美元。
微軟與合作者的論文指出,在長程工程與研究任務中選擇較佳的開放方向時,最佳模型答對 59.7% 的 Taste-Bench 問題。由較後證據決定的分岔難度高得多,加大推理預算不會提高準確率;把教師對結果的判斷蒸餾到學生模型,則能提升在留出的 SWE-bench Pro 上的成功率。
Gemini 3.8 Flash 在 Cline 可免費使用。Cline 表示,該模型在 Artificial Analysis Intelligence Index 得分 41,運行速度為每秒 291 個 token,上下文視窗為 100 萬個 token。
在 Claude Code 以 max effort 運行時,Artificial Analysis 測得 Opus 5.5 為 66 分,高於 Opus 5 的 60 分及 Claude Fable 5.1 的 62 分。其每項任務成本為 13.04 美元,儘管 token 價格較低,仍高於 Opus 5 的 10.79 美元。
MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna 與 GPT-6 Sol,在不同推理力度下,合共為 Artificial Analysis 的 Intelligence Index 對每項任務成本 Pareto 前沿貢獻 11 個新點。Claude Opus 5.5(max with fallback)得分 58,每項任務成本 5.98 美元,是該指數的最高結果。
Microsoft AI 把這個速度定為每年 377 分,即榜上第二快升幅的 1.6 倍。
Artificial Analysis 表示,Google 已發布 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS,兩者為 Google DeepMind 文字轉語音模型,支援預設聲線及聲音複製。按其測試,Gemini 3.8 Flash TTS 在發音穩健度得 89.5%,並在 Provider Voice Arena 取得 1,263 Elo。
Google 報告,Gemini 3.8 Flash TTS 在 Hume AI Voice Design 的總分為 71.4,口音建模分數為 60.8。Google 亦把 Flash TTS 排在 Hume AI Overall Quality 第一,Gemini 3.8 Flash-Lite TTS 排第二。
DAIR.AI 報告指,史丹福與 Together AI 的一篇論文發現,o3-mini、Claude Sonnet 4 與 DeepSeek-V3 組成自組織團隊,在五項數學與物理基準測試中平均得分 66.7%,高於最強成員單獨作答的 48.8%,以及完美路由器的 59.0%。
Artificial Analysis 發現,沒有單一開源權重文字轉語音模型在全部九個新語言排行榜領先。領先位置分屬 Higgs Audio V3 TTS、OpenAudio S1 Mini、Voxtral TTS 和 Breeze TTS 2。
Artificial Analysis 報告,StepAudio 3 ASR 的轉錄速度為即時的 88 倍,落後三個更快的系統,接近 ElevenLabs Scribe v2 與 Gemini 3.5 Transcribe,並領先 Fun-Realtime-ASR-preview。
OpenAI 報告,GPT-6 Luna 在 DeepSWE v1.1 得分 66.6%,與中等努力程度下的 Claude Opus 5 及 Fable 5 相當,每項任務成本低 93% 至 96%;在較高努力程度下,事實準確度與 GPT-5.6 Sol 相當,成本約為其百分之一。
2026年9月22日,Scale AI 發布 SWE-Bench Pro V2,作為 SWE-Bench Pro 更新後的公開分組。
elvis(@omarsar0)分享一篇關於 EvoOntology 的論文,此為面向數據代理、以 MCP 伺服器形式提供的自我演化本體層。帖文指 DDR-Bench 準確率在六個骨幹模型上平均上升 17.8 分,當中 GPT-5.5 上升 26.7 分,而 BIRD 執行準確率上升 7.4 分。