Did Codex Reset
GitHub

#benchmark

すべてのAIニュースを見る

Jiantao Jiao、53タスクのNVIDIAベンチマークSWE-Serveを発表

Jiantao Jiaoは、NVIDIAのチームが、AIエージェントが推論エンジンを開発し、実際のモデルをサーブできるかを確かめるためSWE-Serveを構築したと述べている。このベンチマークは、sgl_projectの実際のエンジニアリング作業から取られた53のタスクで構成される。

AssemblyAI Universal 3.5 Pro、15モデルのテストで単語誤り率1.93%

Tarush Agarwalは、同一の音声とパイプラインで15モデルを比較した音声テキスト変換ベンチマークを報告した。Pipecat FLEURSの読み上げ音声1,000件で、AssemblyAI Universal 3.5 Proの単語誤り率は1.93%、最初のテキストまでの中央値は489ミリ秒で、いずれもこのテストで最良の結果だった。

Qwenがハイブリッドコンピュータ使用エージェント向けにRecreationBenchを導入

ModelScopeは、QwenがUbuntu、macOS、Windows、Android、Webにわたるハイブリッドコンピュータ使用エージェント向けの250タスクのベンチマークであるRecreationBenchを導入したと述べた。エージェントは実行中のアプリを探索し、コードで再現し、プログラムテストとVLMベースの視覚評価に合格する必要がある。