BRIDGE ASR 2.0、10〜15分の多言語会話で23の音声認識モデルを検証
elvisによると、humynlabsは、10〜15分の実際の二者会話における音声認識を評価するためBRIDGE ASR 2.0を構築した。対象はインド系18言語にスペイン語、ポルトガル語、ベトナム語を加えた言語だ。
elvisによると、humynlabsは、10〜15分の実際の二者会話における音声認識を評価するためBRIDGE ASR 2.0を構築した。対象はインド系18言語にスペイン語、ポルトガル語、ベトナム語を加えた言語だ。
CASDは、既製のコーディングエージェントにエージェントログ一式を分析させ、知見を1つのプロンプト内のルールとして記述させる。環境へのアクセスも検証データも不要だ。DAIR.AIによると、1回の実行は報告されたベンチマークでGEPAとSkillOptを上回り、最適化済みプロンプト1件あたりの費用は約1.60ドルだった。
Microsoftらの論文によると、長期のエンジニアリングと研究タスクで、開いている方向のうちより良いものを選ぶTaste-Benchの設問に、最高のモデルは59.7%正解した。後から現れる証拠で決まる分岐ははるかに難しく、推論予算を増やしても精度は上がらない。教師の結果判断を蒸留すると、未使用のSWE-bench Proでの成功率は向上した。
Gemini 3.8 FlashがClineで無料になる。Clineによると、Artificial Analysis Intelligence Indexのスコアは41、処理速度は毎秒291トークン、コンテキストウィンドウは100万トークン。
Claude Codeの最大努力設定で、Artificial AnalysisはOpus 5.5を66と測定した。Opus 5の60、Claude Fable 5.1の62を上回る。タスクあたりの費用は13.04ドルで、トークン単価は下がったものの、Opus 5の10.79ドルより高い。
MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna、GPT-6 Solは、異なる推論エフォートにわたって、Artificial AnalysisのIntelligence Indexとタスクあたりコストのパレートフロンティア上に新たに11点を占めている。Claude Opus 5.5(max with fallback)はタスクあたり5.98ドルで58点を記録し、同指数で最高の結果となった。
Microsoft AIはこのペースを年377ポイント、ボード上で次に速い上昇の1.6倍としている。
Artificial Analysisによると、Googleはプリセット音声と音声複製に対応するGoogle DeepMindのテキスト読み上げモデル、Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSを公開した。同社のテストでは、Gemini 3.8 Flash TTSの発音ロバスト性は89.5%、Provider Voice ArenaのEloは1,263だった。
Googleによると、Hume AI Voice DesignにおけるGemini 3.8 Flash TTSの総合スコアは71.4、アクセントモデリングのスコアは60.8。Hume AI Overall QualityでもFlash TTSを1位、Gemini 3.8 Flash-Lite TTSを2位としている。
DAIR.AIによると、スタンフォードとTogether AIの論文では、o3-mini、Claude Sonnet 4、DeepSeek-V3が自己組織化するチームとして数学と物理の5つのベンチマークで平均66.7%となり、最も強いメンバー単体の48.8%、完全なルーターの59.0%を上回った。
Artificial Analysisは、新たな9言語のリーダーボードすべてで首位に立つオープンウェイトの音声合成モデルは1つもないとしている。首位はHiggs Audio V3 TTS、OpenAudio S1 Mini、Voxtral TTS、Breeze TTS 2に分かれている。
Artificial Analysisは、StepAudio 3 ASRの文字起こし速度係数を実時間の88倍と報告している。3つのより速いシステムより遅く、ElevenLabs Scribe v2およびGemini 3.5 Transcribeに近く、Fun-Realtime-ASR-previewより速い。
OpenAIは、GPT-6 LunaがDeepSWE v1.1で66.6%を記録し、medium effortでClaude Opus 5およびFable 5に匹敵しつつ1タスクあたり93〜96%低いコストだと報告している。また、より高いeffortでは事実性でGPT-5.6 Solに匹敵し、コストは約100分の1だとしている。
2026年9月22日、Scale AIはSWE-Bench Proの公開スプリットを更新したSWE-Bench Pro V2を公開した。
elvis(@omarsar0)が、MCPサーバーとして提供されるデータエージェント向け自己進化オントロジー層EvoOntologyに関する論文を共有した。投稿によると、DDR-Benchの精度は6つのバックボーンで平均17.8ポイント上昇し、GPT-5.5では26.7ポイント、BIRDの実行精度は7.4ポイント上昇するという。