Scale AI 发布 SWE-Bench Pro V2
2026年9月22日,Scale AI 发布 SWE-Bench Pro V2,作为 SWE-Bench Pro 更新后的公开划分。
2026年9月22日,Scale AI 发布 SWE-Bench Pro V2,作为 SWE-Bench Pro 更新后的公开划分。
Cursor 表示,该模型以 57.8%(Max)成为 CursorBench 的新榜首,且每项任务成本比 Opus 5 低 40%。
OpenAI 表示将支持独立评估,并在训练、评估和部署环节提供深入访问,同时概述四个优先领域以及严谨、安全、独立开展工作的原则。
theopenfrontier.com 从编程、智能体、长上下文、视觉、金融及其他任务比较开源模型,并同时展示成本与质量,包括改用开源模型可能节省的费用。
来自 IBM、Meta 和 Hugging Face 的贡献者提出硬件无关层,旨在为在不同硬件上运行多种模型的用户兼顾前沿性能与可移植性。
LangChain 表示,Managed Deep Agents 只需几行代码即可构建这类智能体。其示例 Patch 在 Slack 讨论串中被提及并收到功能描述后,会发起包含 diff 的 pull request。
用户可以构建交易策略、进行回测,并在投入真实资金之前,对照 Hyperliquid 实时市场做前向测试。
这些积分可用于研究、策略生成、回测和模拟交易。自动化执行仅被列为后续用途。
Paper Trading 现已在 Sorin 上线,属于 HeySorinAI 交易体系的一部分。用户可以用 AI 构建交易策略并回测,再部署到 HyperliquidX 实盘市场,由 Sorin 在后台持续运行。
Claude 表示,Opus 5.5 在大多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。Pi 表示,希望在 Pi 中使用该模型的用户可以等待,或运行 pi update --models。
Perplexity 已将 Claude Opus 5.5 作为 Perplexity Computer 的 Standard 努力级别开放使用。在 Perplexity 的 WANDR 基准测试中,其得分为 0.610,每项任务成本 4.13 美元,略优于 Claude Fable 5.1,同时每项任务成本低 67.6%。
v0 现已支持 Claude Opus 5.5。Claude 表示,它是 Claude 5.5 系列的首个模型,在多数任务上的表现达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。
Polymarket 称,驾驶者可通过语音指令下单商品,并管理邮件、日历、财务及其他事务。
OpenRouter 为从 Opus 5 迁移的开发者列出这三项差异,其迁移指南说明了变更内容以及如何更新提示词。
OpenRouter 现提供 AnthropicAI 的 Claude Opus 5.5,上下文窗口为 100 万 token,输入价格为每百万 token 4 美元,输出价格为每百万 token 20 美元。OpenRouter 称,该价格较 Opus 5 每 token 低 20%。
ClaudeDevs 表示,Opus 5.5 现已登陆 Claude Code 和 Claude Platform,并将其作为编程与智能体工作的新日常主力,理由是它的智能水平、更低价格和速度。
这些防护覆盖网络安全、生物安全以及前沿大语言模型开发。被标记的请求会回退到另一个模型,ClaudeDevs 称其正在减少错误标记。
Opus 5.5 是 Claude 5.5 系列的首个模型。Claude 称其在大多数任务上与 Claude Fable 5.1 持平,ClaudeDevs 则称其每项任务比 Opus 5 约快 30%、约便宜 40%,同时 Claude Code 的会话限额也有所提高。
Anthropic 于 2026 年 9 月 22 日表示,Claude Opus 5.5 现已推出。Claude 称,该模型在大多数任务上的表现与 Claude Fable 5.1 相当,运行成本比 Opus 5 低 40%。
Pro、Max 和 Team 计划的五小时用量上限提高,订阅用户还将获得一次可保存并随时使用的速率限制重置。