BRIDGE ASR 2.0 测试 23 个语音识别模型在长篇多语言对话中的表现
elvis 表示,humynlabs 构建了 BRIDGE ASR 2.0,用于评估语音识别在真实双人对话中的表现。这些对话时长为 10 至 15 分钟,涵盖 18 种印度语言,以及西班牙语、葡萄牙语和越南语。
elvis 表示,humynlabs 构建了 BRIDGE ASR 2.0,用于评估语音识别在真实双人对话中的表现。这些对话时长为 10 至 15 分钟,涵盖 18 种印度语言,以及西班牙语、葡萄牙语和越南语。
CASD 让现成的编程智能体分析完整的智能体日志集,并把发现写成一条提示中的规则,无需环境访问或验证数据。DAIR.AI 称,单次运行在所报告的基准上超过 GEPA 和 SkillOpt,每条优化后的提示成本约 1.60 美元。
微软及合作者的一篇论文报告,在长周期工程与研究任务中选择更优开放方向时,最佳模型正确回答 59.7% 的 Taste-Bench 问题。由后续证据决定的分叉难度高得多,增加推理预算并不能提高准确率,而将教师模型对结果的判断蒸馏到学生模型后,可提高留出集 SWE-bench Pro 任务的成功率。
Gemini 3.8 Flash 在 Cline 中免费使用。Cline 称其在 Artificial Analysis Intelligence Index 上得分为 41,运行速度为每秒 291 token,上下文窗口为 100 万 token。
在 Claude Code 的最高努力档,Artificial Analysis 测得 Opus 5.5 为 66 分,高于 Opus 5 的 60 分和 Claude Fable 5.1 的 62 分。其单任务成本为 13.04 美元,尽管 token 价格更低,仍高于 Opus 5 的 10.79 美元。
MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna 和 GPT-6 Sol 在不同推理强度下,为 Artificial Analysis 的 Intelligence Index 与单任务成本帕累托前沿贡献了 11 个新点。Claude Opus 5.5(max with fallback)得分为 58,单任务成本 5.98 美元,是该指数上的最高结果。
Microsoft AI 称这一速度为每年 377 分,相当于榜上第二快升幅的 1.6 倍。
Artificial Analysis 表示,Google 已发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,这两款 Google DeepMind 文本转语音模型支持预设音色和声音复刻。在其测试中,Gemini 3.8 Flash TTS 的发音稳健性得分为 89.5%,在 Provider Voice Arena 上的 Elo 为 1,263。
Google 报告称,Gemini 3.8 Flash TTS 在 Hume AI Voice Design 上的综合得分为 71.4,口音建模得分为 60.8。Google 还将 Flash TTS 排在 Hume AI Overall Quality 第一,将 Gemini 3.8 Flash-Lite TTS 排在第二。
DAIR.AI 报道,斯坦福与 Together AI 的一篇论文发现,o3-mini、Claude Sonnet 4 与 DeepSeek-V3 组成自组织团队,在五项数学与物理基准测试中平均得分为 66.7%,高于最强单模型单独作答的 48.8%,也高于完美路由器的 59.0%。
Artificial Analysis发现,没有单一开放权重文本转语音模型在全部九个新语言排行榜上领先。领先位置由Higgs Audio V3 TTS、OpenAudio S1 Mini、Voxtral TTS和Breeze TTS 2分占。
Artificial Analysis 报告,StepAudio 3 ASR 的转写速度为实时的 88 倍,落后于三个更快的系统,接近 ElevenLabs Scribe v2 与 Gemini 3.5 Transcribe,并领先于 Fun-Realtime-ASR-preview。
OpenAI 报告,GPT-6 Luna 在 DeepSWE v1.1 上得分为 66.6%,与中等 effort 下的 Claude Opus 5 和 Fable 5 相当,且每项任务成本低 93%–96%;在更高 effort 下,其事实性与 GPT-5.6 Sol 相当,成本约为后者的百分之一。
2026年9月22日,Scale AI 发布 SWE-Bench Pro V2,作为 SWE-Bench Pro 更新后的公开划分。
elvis (@omarsar0) 分享了一篇关于 EvoOntology 的论文,这是一种以 MCP 服务器形式提供的、面向数据智能体的自演化本体层。帖文称,在六个骨干模型上,DDR-Bench 准确率平均提升 17.8 个百分点,其中 GPT-5.5 提升 26.7 个百分点,BIRD 执行准确率提升 7.4 个百分点。