Scale AI 發布 SWE-Bench Pro V2
Scale AI 於2026年9月22日發布 SWE-Bench Pro V2,這是 SWE-Bench Pro 更新後的公開分組。
Scale AI 於2026年9月22日發布 SWE-Bench Pro V2,這是 SWE-Bench Pro 更新後的公開分組。
這份聯合藍圖將 Scale GenAI Portfolio 帶到 Google Cloud,並包括 Gemini Enterprise 整合。Scale AI 表示,它旨在為開發者提供經過驗證的基礎,以便更快將 AI 投入應用。
elvis 表示,humynlabs 建立 BRIDGE ASR 2.0,用以評估語音識別在真實雙人對話上的表現。對話長 10 至 15 分鐘,涵蓋 18 種印度語系語言,以及西班牙語、葡萄牙語和越南語。
CASD 讓現成的編程智能體分析完整的智能體日誌,並把發現寫成單一提示詞中的規則,無需環境存取或驗證數據。DAIR.AI 表示,在所報告的基準測試中,一次處理的表現優於 GEPA 與 SkillOpt,每個優化後的提示詞成本約 1.60 美元。
微軟與合作者的論文指出,在長程工程與研究任務中選擇較佳的開放方向時,最佳模型答對 59.7% 的 Taste-Bench 問題。由較後證據決定的分岔難度高得多,加大推理預算不會提高準確率;把教師對結果的判斷蒸餾到學生模型,則能提升在留出的 SWE-bench Pro 上的成功率。
Gemini 3.8 Flash 在 Cline 可免費使用。Cline 表示,該模型在 Artificial Analysis Intelligence Index 得分 41,運行速度為每秒 291 個 token,上下文視窗為 100 萬個 token。