Scale AI, SWE-Bench Pro V2 공개
Scale AI가 2026년 9월 22일 SWE-Bench Pro V2를 공개했다. 이는 SWE-Bench Pro의 갱신된 공개 스플릿이다.
Scale AI가 2026년 9월 22일 SWE-Bench Pro V2를 공개했다. 이는 SWE-Bench Pro의 갱신된 공개 스플릿이다.
공동 청사진은 Scale GenAI Portfolio를 Google Cloud로 가져오며 Gemini Enterprise 통합을 포함한다. Scale AI는 빌더가 AI를 더 빨리 실무에 적용할 수 있도록 검증된 기반을 제공하기 위한 것이라고 밝혔다.
elvis는 humynlabs가 BRIDGE ASR 2.0을 만들어, 10~15분 길이의 실제 2인 대화에서 음성 인식을 평가한다고 밝혔다. 대상은 인도계 언어 18개와 스페인어, 포르투갈어, 베트남어다.
CASD는 기성 코딩 에이전트가 에이전트 로그 전체를 분석하고 그 결과를 하나의 프롬프트에 규칙으로 쓰게 하며, 환경 접근이나 검증 데이터는 쓰지 않는다. DAIR.AI는 한 번의 실행이 보고된 벤치마크에서 GEPA와 SkillOpt를 앞섰고, 최적화된 프롬프트당 비용은 약 1.60달러라고 밝혔다.
Microsoft와 동료들의 논문에 따르면, 최고 모델은 긴 엔지니어링·연구 과제에서 열려 있는 더 나은 방향을 고르는 Taste-Bench 문항의 59.7%를 맞힌다. 나중에 나오는 근거로 판가름나는 분기점은 훨씬 어렵고, 추론 예산을 늘려도 정확도는 오르지 않으며, 교사의 결과 판단을 증류하면 홀드아웃 SWE-bench Pro 성공률이 개선된다.
Cline에서 Gemini 3.8 Flash를 무료로 이용할 수 있다. Cline은 이 모델이 Artificial Analysis Intelligence Index에서 41점을 기록하고, 초당 291토큰으로 실행되며, 컨텍스트 창이 100만 토큰이라고 밝혔다.