Jiantao Jiao 公布 SWE-Serve,一項含 53 項任務的 NVIDIA 基準測試
Jiantao Jiao 表示,NVIDIA 團隊建立了 SWE-Serve,用以測試 AI 代理能否開發推理引擎,並讓其服務真實模型。該基準測試包含 53 項任務,取材自 sgl_project 的實際工程工作。
Jiantao Jiao 表示,NVIDIA 團隊建立了 SWE-Serve,用以測試 AI 代理能否開發推理引擎,並讓其服務真實模型。該基準測試包含 53 項任務,取材自 sgl_project 的實際工程工作。
WebCraftBench 讓代理實際使用線上應用,再就美感、可用性,以及是否滿足原始要求評分。Tencent Hy 表示,在 197 組經驗證的配對中,與人類偏好的吻合率為 85.3%。
OpenAI 表示,MentalHealthBench 旨在涵蓋人們向 AI 提出的各類精神健康對話,範圍由日常支援延伸至較急性的危機情境,而不僅限於緊急情況。
OpenAI 已公開發布 MentalHealthBench。這項新基準由超過 80 名心理健康臨床人員參與制定。OpenAI 表示,基準顯示前沿模型在真實心理健康對話中持續改善。
在 Artificial Analysis 的 Pronunciation Robustness 基準測試中,Gemini 3.8 Flash TTS 得分 89.5%,領先 Gemini 3.1 Flash TTS、SpaceXAI TTS 及 Gemini 3.8 Flash-Lite TTS。個別發音類別的領先位置由多個模型分別取得。
Polymarket 表示,GPT-6 Astra 是 DrivingBench 測試中唯一完成該賽道的人工智能。
NVIDIA AI 報告,Nemotron 3 Diarization 在 voicearena_ai 首期 Diarization-Bench 的錯誤率為 14.72%,較第二名低約 24%。
Tarush Agarwal 報告一項語音轉文字基準測試,以相同音訊與流程測試 15 款模型。在 Pipecat FLEURS 的 1,000 段朗讀片段中,AssemblyAI Universal 3.5 Pro 的詞錯誤率為 1.93%,首次輸出文字的中位數時間為 489 毫秒,兩項均為該測試最佳結果。
Lovable 表示,在其 0 到 1 建構基準測試中,GPT-6 Sol 於每個努力程度的得分都比 GPT-5.6 Sol 高 6% 至 12%,其中意圖對齊與設計基礎的提升較大。
ModelScope 表示,Qwen 已推出 RecreationBench,這是一個包含 250 項任務的基準測試,適用於 Ubuntu、macOS、Windows、Android 及 Web 上的混合電腦使用代理。代理必須探索正在運行的應用程式,以程式碼重現該應用,並通過程式化測試以及基於 VLM 的視覺評估。
在一次簡短示範中,TypeSafe AI 的 Jev 精確匹配率為 80.5%,每項職位約 200 毫秒、每 100 萬次 122 美元;Luna 精確匹配率為 84.9%,每項職位約 2 秒、每 100 萬次 482 美元。