Scale AI, SWE-Bench Pro V2 공개
2026년 9월 22일 Scale AI가 SWE-Bench Pro의 갱신된 공개 스플릿인 SWE-Bench Pro V2를 공개했다.
2026년 9월 22일 Scale AI가 SWE-Bench Pro의 갱신된 공개 스플릿인 SWE-Bench Pro V2를 공개했다.
Cursor는 이 모델이 CursorBench에서 57.8%(Max)로 새 최고 성적을 기록했으며, 작업당 비용이 Opus 5보다 40% 낮다고 밝혔다.
OpenAI는 학습, 평가, 배포 전반에 대한 심층 접근을 통해 독립 평가를 지원하겠다고 밝혔으며, 엄밀하고 안전하며 독립적인 작업을 위한 4가지 우선 영역과 원칙을 제시하고 있다.
theopenfrontier.com은 코딩, 에이전트, 긴 맥락, 비전, 금융 등 작업에서 오픈 모델을 비교하고, 품질과 함께 비용, 오픈 모델로 전환할 경우 절감할 수 있는 금액도 보여 준다.
IBM, Meta, Hugging Face의 기여자들이 다양한 하드웨어에서 다양한 모델을 실행하는 사용자를 위해 최첨단 성능과 이식성의 균형을 맞추려는 하드웨어 독립 레이어를 소개한다.
LangChain은 Managed Deep Agents로 몇 줄의 코드만으로 이런 에이전트를 만들 수 있다고 밝혔다. 예시 에이전트 Patch는 Slack 스레드에서 태그되고 기능 설명을 받으면 diff가 포함된 pull request를 연다.
사용자는 거래 전략을 만들고 백테스트한 뒤, 실제 자금을 투입하기 전에 실시간 Hyperliquid 시장에서 포워드 테스트할 수 있다.
크레딧은 리서치, 전략 생성, 백테스트, Paper Trading에 사용할 수 있다. 자동 실행은 향후 용도로만 적혀 있다.
HeySorinAI 트레이딩 스택에 속한 Sorin에서 Paper Trading을 이제 이용할 수 있다. 사용자는 AI로 트레이딩 전략을 만들고 백테스트한 뒤, 실제 HyperliquidX 시장에 배포하고 Sorin이 백그라운드에서 계속 실행하게 할 수 있다.
Claude는 Opus 5.5가 대부분의 작업에서 Claude Fable 5.1 수준으로 동작하며 Opus 5보다 실행 비용이 40% 낮다고 밝혔다. Pi는 Pi에서 이 모델을 쓰려는 사용자는 기다리거나 pi update --models를 실행할 수 있다고 밝혔다.
Perplexity가 Claude Opus 5.5를 Perplexity Computer의 Standard 작업 수준으로 제공하기 시작했다. Perplexity의 WANDR 벤치마크에서 작업당 4.13달러로 0.610점을 기록했으며, Claude Fable 5.1보다 소폭 높은 점수에 작업당 비용은 67.6% 낮았다.
v0가 이제 Claude Opus 5.5를 지원한다. Claude는 이 모델이 Claude 5.5 제품군의 첫 모델이며, 대부분의 작업에서 Claude Fable 5.1 수준의 성능을 내고, 운영 비용이 Opus 5보다 40% 낮다고 밝혔다.
Polymarket에 따르면, 운전자는 음성 명령으로 상품을 주문하고 이메일, 일정, 재정 및 기타 업무를 관리할 수 있다.
OpenRouter는 Opus 5를 떠나는 개발자를 위해 이 세 가지 차이를 정리했으며, 마이그레이션 가이드에서 무엇이 바뀌었는지와 프롬프트를 어떻게 업데이트하는지를 다룬다.
OpenRouter가 AnthropicAI의 Claude Opus 5.5를 100만 토큰 컨텍스트 창과 함께 제공하며, 요금은 입력 토큰 100만 개당 4달러, 출력 토큰 100만 개당 20달러다. OpenRouter는 이 요금이 Opus 5보다 토큰당 20% 낮다고 밝혔다.
ClaudeDevs는 Opus 5.5가 Claude Code와 Claude Platform에서 이용 가능하며, 지능과 더 낮은 가격, 속도를 이유로 코딩과 에이전트 작업의 새로운 주력 도구로 쓰고 있다고 밝혔다.
안전장치는 사이버, 바이오, 프론티어 LLM 개발을 대상으로 한다. 플래그된 요청은 다른 모델로 폴백되며, ClaudeDevs는 잘못된 플래그를 줄이기 위해 작업 중이라고 밝혔다.
Opus 5.5는 Claude 5.5 제품군의 첫 모델이다. Claude는 대부분 작업에서 Claude Fable 5.1과 맞먹는다고 밝혔고, ClaudeDevs는 Opus 5보다 작업당 약 30% 빠르고 약 40% 저렴하며 Claude Code 세션 한도도 높아진다고 전했다.
Anthropic은 2026년 9월 22일 Claude Opus 5.5가 이용 가능하다고 밝혔다. Claude는 이 모델이 대부분의 작업에서 Claude Fable 5.1 수준의 성능을 내며, 실행 비용은 Opus 5보다 40% 낮다고 말한다.
Pro, Max, Team 요금제의 5시간 사용 한도가 높아지고, 구독 사용자는 저장해 두었다가 원하는 때에 쓸 수 있는 속도 제한 초기화를 받는다.