Jiantao Jiao、53タスクのNVIDIAベンチマークSWE-Serveを発表
Jiantao Jiaoは、NVIDIAのチームが、AIエージェントが推論エンジンを開発し、実際のモデルをサーブできるかを確かめるためSWE-Serveを構築したと述べている。このベンチマークは、sgl_projectの実際のエンジニアリング作業から取られた53のタスクで構成される。
Jiantao Jiaoは、NVIDIAのチームが、AIエージェントが推論エンジンを開発し、実際のモデルをサーブできるかを確かめるためSWE-Serveを構築したと述べている。このベンチマークは、sgl_projectの実際のエンジニアリング作業から取られた53のタスクで構成される。
WebCraftBenchは、エージェントに稼働中のアプリを使わせたうえで、見た目、使いやすさ、元の依頼を満たしたかを採点する。Tencent Hyは、検証済み197組で人間の好みとの一致が85.3%だったと報告している。
OpenAIによると、MentalHealthBenchは緊急時だけでなく、人々がAIに持ちかけるメンタルヘルスに関する会話の全範囲、日常的な支援からより急性の危機的状況までを対象に設計されている。
OpenAIは、80人超のメンタルヘルス臨床家の意見を取り入れて作った新しいベンチマークMentalHealthBenchを公開した。OpenAIによると、フロンティアモデルは現実的なメンタルヘルス会話で改善を続けているという。
Artificial AnalysisのPronunciation Robustnessベンチマークで、Gemini 3.8 Flash TTSは89.5%を記録し、Gemini 3.1 Flash TTS、SpaceXAI TTS、Gemini 3.8 Flash-Lite TTSを上回った。個別の発音カテゴリーの首位は、複数のモデルに分かれている。
Polymarketによると、GPT-6 AstraはDrivingBenchがテストしたAIのうち、コースを完走した唯一のAIだった。
NVIDIA AIは、voicearena_aiの初期Diarization-BenchでNemotron 3 Diarizationのエラー率が14.72%となり、2位より約24%低かったと報告している。
Tarush Agarwalは、同一の音声とパイプラインで15モデルを比較した音声テキスト変換ベンチマークを報告した。Pipecat FLEURSの読み上げ音声1,000件で、AssemblyAI Universal 3.5 Proの単語誤り率は1.93%、最初のテキストまでの中央値は489ミリ秒で、いずれもこのテストで最良の結果だった。
Lovableによると、0から1の構築ベンチマークでは、どのeffortレベルでもGPT-6 SolのスコアがGPT-5.6 Solより6〜12%高く、意図の一致とデザインの基本でより大きな向上が見られた。
ModelScopeは、QwenがUbuntu、macOS、Windows、Android、Webにわたるハイブリッドコンピュータ使用エージェント向けの250タスクのベンチマークであるRecreationBenchを導入したと述べた。エージェントは実行中のアプリを探索し、コードで再現し、プログラムテストとVLMベースの視覚評価に合格する必要がある。
短いデモでは、TypeSafe AIのJevが完全一致率80.5%、1件あたり約200ミリ秒、100万件あたり122ドルだった。対するLunaは完全一致率84.9%、1件あたり約2秒、100万件あたり482ドルだった。