Jiantao Jiao 发布 SWE-Serve,一项包含 53 项任务的 NVIDIA 基准
Jiantao Jiao 表示,NVIDIA 团队构建了 SWE-Serve,用以测试 AI 智能体能否开发推理引擎并服务真实模型。该基准包含 53 项任务,取自 sgl_project 的真实工程工作。
Jiantao Jiao 表示,NVIDIA 团队构建了 SWE-Serve,用以测试 AI 智能体能否开发推理引擎并服务真实模型。该基准包含 53 项任务,取自 sgl_project 的真实工程工作。
WebCraftBench 让智能体使用正在运行的应用,再对美观度、可用性以及是否满足原始请求进行评分。Tencent Hy 称,在 197 组经人工验证的配对上,其结果与人类偏好的一致率为 85.3%。
OpenAI 表示,MentalHealthBench 面向人们向 AI 提出的各类心理健康对话,从日常支持到更急性的危机场景,而不只是紧急情况。
OpenAI 已公开发布 MentalHealthBench。这项新基准由 80 多名心理健康临床人员参与构建。OpenAI 表示,它显示前沿模型在真实心理健康对话中持续改进。
在 Artificial Analysis 的 Pronunciation Robustness 基准测试中,Gemini 3.8 Flash TTS 得分为 89.5%,领先于 Gemini 3.1 Flash TTS、SpaceXAI TTS 和 Gemini 3.8 Flash-Lite TTS。各单项发音类别的领先位置由多个模型分占。
Polymarket 称,在 DrivingBench 测试的 AI 中,只有 GPT-6 Astra 完成了该赛道。
NVIDIA AI 称,Nemotron 3 Diarization 在 voicearena_ai 首期 Diarization-Bench 上的错误率为 14.72%,比第二名低约 24%。
Tarush Agarwal 报告了一项语音转文字基准测试,15 个模型使用相同音频和流程。在 Pipecat FLEURS 的 1,000 段朗读片段上,AssemblyAI Universal 3.5 Pro 的词错误率为 1.93%,首次出字中位时间为 489 毫秒,两项均为该测试中的最佳结果。
Lovable 称,在其 0 到 1 构建基准测试中,GPT-6 Sol 在各个 effort 级别上的得分均比 GPT-5.6 Sol 高 6% 至 12%,意图对齐和设计基础的提升更大。
ModelScope 表示,Qwen 已推出 RecreationBench,这是一个包含 250 项任务的基准测试,面向 Ubuntu、macOS、Windows、Android 和 Web 上的混合计算机使用智能体。智能体必须探索正在运行的应用,用代码复现该应用,并通过程序化测试以及基于 VLM 的视觉评估。
在一次快速演示中,TypeSafe AI 的 Jev 精确匹配率为 80.5%,每个职位约 200 毫秒、每 100 万次成本 122 美元;Luna 精确匹配率为 84.9%,每个职位约 2 秒、每 100 万次成本 482 美元。