BRIDGE ASR 2.0, 긴 다국어 대화에서 음성 인식 모델 23종 평가
elvis는 humynlabs가 BRIDGE ASR 2.0을 만들어, 10~15분 길이의 실제 2인 대화에서 음성 인식을 평가한다고 밝혔다. 대상은 인도계 언어 18개와 스페인어, 포르투갈어, 베트남어다.
elvis는 humynlabs가 BRIDGE ASR 2.0을 만들어, 10~15분 길이의 실제 2인 대화에서 음성 인식을 평가한다고 밝혔다. 대상은 인도계 언어 18개와 스페인어, 포르투갈어, 베트남어다.
CASD는 기성 코딩 에이전트가 에이전트 로그 전체를 분석하고 그 결과를 하나의 프롬프트에 규칙으로 쓰게 하며, 환경 접근이나 검증 데이터는 쓰지 않는다. DAIR.AI는 한 번의 실행이 보고된 벤치마크에서 GEPA와 SkillOpt를 앞섰고, 최적화된 프롬프트당 비용은 약 1.60달러라고 밝혔다.
Microsoft와 동료들의 논문에 따르면, 최고 모델은 긴 엔지니어링·연구 과제에서 열려 있는 더 나은 방향을 고르는 Taste-Bench 문항의 59.7%를 맞힌다. 나중에 나오는 근거로 판가름나는 분기점은 훨씬 어렵고, 추론 예산을 늘려도 정확도는 오르지 않으며, 교사의 결과 판단을 증류하면 홀드아웃 SWE-bench Pro 성공률이 개선된다.
Cline에서 Gemini 3.8 Flash를 무료로 이용할 수 있다. Cline은 이 모델이 Artificial Analysis Intelligence Index에서 41점을 기록하고, 초당 291토큰으로 실행되며, 컨텍스트 창이 100만 토큰이라고 밝혔다.
Claude Code에서 max effort로 실행했을 때 Artificial Analysis가 측정한 Opus 5.5 점수는 66점으로, Opus 5의 60점과 Claude Fable 5.1의 62점을 웃돈다. 작업당 비용은 13.04달러로, 토큰 가격이 낮아졌음에도 Opus 5의 10.79달러보다 높다.
MiMo-V2.6-Pro, Claude Opus 5.5, GPT-6 Luna, GPT-6 Sol이 서로 다른 reasoning effort에서 Artificial Analysis의 Intelligence Index 대 작업당 비용 파레토 프론티어에 새 지점 11개를 차지했다. Claude Opus 5.5(max with fallback)는 작업당 5.98달러에 58점을 기록해 이 지수에서 가장 높은 결과다.
Microsoft AI는 이 속도를 연간 377점, 보드에서 그다음으로 빠른 상승의 1.6배로 제시한다.
Artificial Analysis는 Google이 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 출시했다고 밝혔다. 두 모델은 사전 설정 음성과 음성 복제를 지원하는 Google DeepMind 텍스트 음성 변환 모델이다. 테스트에서 Gemini 3.8 Flash TTS는 발음 강건성 89.5%, Provider Voice Arena Elo 1,263을 기록했다.
Google는 Hume AI Voice Design에서 Gemini 3.8 Flash TTS의 종합 점수가 71.4, 억양 모델링 점수가 60.8이라고 밝혔습니다. Hume AI Overall Quality에서는 Flash TTS를 1위, Gemini 3.8 Flash-Lite TTS를 2위로 평가했습니다.
DAIR.AI는 스탠퍼드와 Together AI 논문에서 o3-mini, Claude Sonnet 4, DeepSeek-V3가 자기조직화 팀으로 수학·물리 벤치마크 다섯 개에서 평균 66.7%를 기록했다고 전했다. 이는 가장 강한 구성원 단독의 48.8%와 완벽한 라우터의 59.0%보다 높다.
Artificial Analysis는 신규 9개 언어 리더보드 전체에서 단일 오픈 웨이트 음성 합성 모델이 모두 앞서지는 않는다고 밝혔다. 선두는 Higgs Audio V3 TTS, OpenAudio S1 Mini, Voxtral TTS, Breeze TTS 2로 나뉜다.
Artificial Analysis는 StepAudio 3 ASR의 전사 속도가 실시간의 88배라고 보고했다. 더 빠른 시스템 세 개보다는 뒤지고, ElevenLabs Scribe v2와 Gemini 3.5 Transcribe와는 비슷한 수준이며, Fun-Realtime-ASR-preview보다는 앞선다.
OpenAI는 GPT-6 Luna가 DeepSWE v1.1에서 66.6%를 기록했으며, 중간 노력 수준에서 Claude Opus 5·Fable 5와 비슷한 수준이면서 작업당 비용은 93–96% 낮고, 더 높은 노력 수준에서는 사실성에서 GPT-5.6 Sol과 맞먹으면서 비용은 약 100분의 1이라고 밝혔다.
2026년 9월 22일 Scale AI가 SWE-Bench Pro의 갱신된 공개 스플릿인 SWE-Bench Pro V2를 공개했다.
elvis (@omarsar0)가 데이터 에이전트를 위한 자기진화 온톨로지 계층으로 MCP 서버로 제공되는 EvoOntology에 관한 논문을 공유했다. 게시물에 따르면 DDR-Bench 정확도가 6개 백본에서 평균 17.8포인트 상승하며 GPT-5.5의 26.7포인트를 포함하고, BIRD 실행 정확도는 7.4포인트 상승한다.