Scale AI 發布 SWE-Bench Pro V2
2026年9月22日,Scale AI 發布 SWE-Bench Pro V2,作為 SWE-Bench Pro 更新後的公開分組。
2026年9月22日,Scale AI 發布 SWE-Bench Pro V2,作為 SWE-Bench Pro 更新後的公開分組。
Cursor 表示,該模型以 57.8%(Max)成為 CursorBench 的新榜首,每項任務成本較 Opus 5 低 40%。
OpenAI 表示,將支持獨立評估,並在訓練、評估和部署各階段提供深入存取權;同時概述四個優先領域,以及嚴謹、安全且獨立工作的原則。
theopenfrontier.com 比較開放模型在程式編寫、代理、長上下文、視覺、金融及其他任務上的表現,並同時顯示成本與質素,包括轉用開放模型可能節省的費用。
IBM、Meta 與 Hugging Face 的貢獻者提出硬件無關層,旨在為於不同硬件上運行不同模型的用戶,在前沿效能與可移植性之間取得平衡。
LangChain 表示,Managed Deep Agents 只需幾行程式碼即可建立這類代理。其示例 Patch 在 Slack 討論串中被標註並收到功能說明後,會開啟包含 diff 的 pull request。
用戶可建立交易策略、進行回測,並在投入真實資金前,以 Hyperliquid 的實時市場作前向測試。
這些額度可用於研究、策略生成、回測和 Paper Trading。自動化執行只列為日後用途。
Paper Trading 現已在 Sorin 提供,屬於 HeySorinAI 的交易工具組合。用戶可以用 AI 建立交易策略、進行回測,再部署到 HyperliquidX 實時市場,並由 Sorin 在背景持續運行。
Claude 表示,Opus 5.5 在大部分任務上的表現達到 Claude Fable 5.1 的水平,運行成本較 Opus 5 低 40%。Pi 表示,想在 Pi 使用該模型的用戶可以等待,或執行 pi update --models。
Perplexity 已將 Claude Opus 5.5 作為 Perplexity Computer 的 Standard 力度級別開放。在 Perplexity 的 WANDR 基準測試中,它以每項任務 4.13 美元取得 0.610 分,略勝 Claude Fable 5.1,同時每項任務成本低 67.6%。
v0 現已支援 Claude Opus 5.5。Claude 表示,這是 Claude 5.5 系列的首個模型,在大多數任務上表現與 Claude Fable 5.1 相當,運行成本較 Opus 5 低 40%。
Polymarket 稱,司機可用語音指令訂購產品,並管理電郵、日曆、財務及其他事務。
OpenRouter 列出開發者從 Opus 5 遷出時的三項差異,其遷移指南說明有何改動,以及如何更新提示詞。
OpenRouter 提供 AnthropicAI 的 Claude Opus 5.5,上下文視窗為 100 萬 token,輸入每百萬 token 收費 4 美元,輸出每百萬 token 收費 20 美元。OpenRouter 表示,此價格按 token 計算較 Opus 5 低 20%。
ClaudeDevs 表示,Opus 5.5 現已在 Claude Code 和 Claude Platform 提供,並將其用作編碼與代理工作的新日常主力,理由是其智能、較低價格和速度。
相關防護措施涵蓋網絡安全、生物及前沿 LLM 開發。被標記的請求會回退至另一模型,ClaudeDevs 表示正致力減少錯誤標記。
Opus 5.5 是 Claude 5.5 系列的首個模型。Claude 表示,它在大多數任務上與 Claude Fable 5.1 相當;ClaudeDevs 則表示,按每項任務計算,它較 Opus 5 快約 30%、便宜約 40%,同時 Claude Code 的時段上限也有所提高。
Anthropic 於 2026 年 9 月 22 日表示,Claude Opus 5.5 現已推出。Claude 稱,該模型在大多數任務上的表現達到 Claude Fable 5.1 的水平,運行成本較 Opus 5 低 40%。
Pro、Max 及 Team 方案的五小時用量上限提高,訂閱用戶會獲發一次可儲存並隨時使用的速率限制重設。