Did Codex Reset
GitHub

#benchmarks

すべてのAIニュースを見る

Microsoftの論文、CASDのプロンプト最適化で平均16.6ポイント向上を報告

CASDは、既製のコーディングエージェントにエージェントログ一式を分析させ、知見を1つのプロンプト内のルールとして記述させる。環境へのアクセスも検証データも不要だ。DAIR.AIによると、1回の実行は報告されたベンチマークでGEPAとSkillOptを上回り、最適化済みプロンプト1件あたりの費用は約1.60ドルだった。

Taste-Benchで最高のモデルは、より良い方向を59.7%の割合で選ぶ

Microsoftらの論文によると、長期のエンジニアリングと研究タスクで、開いている方向のうちより良いものを選ぶTaste-Benchの設問に、最高のモデルは59.7%正解した。後から現れる証拠で決まる分岐ははるかに難しく、推論予算を増やしても精度は上がらない。教師の結果判断を蒸留すると、未使用のSWE-bench Proでの成功率は向上した。

Artificial Analysis、Intelligence Indexのコストフロンティアに新たに11点を報告

MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna、GPT-6 Solは、異なる推論エフォートにわたって、Artificial AnalysisのIntelligence Indexとタスクあたりコストのパレートフロンティア上に新たに11点を占めている。Claude Opus 5.5(max with fallback)はタスクあたり5.98ドルで58点を記録し、同指数で最高の結果となった。

Gemini 3.8 Flash TTSがArtificial Analysisの発音ロバスト性ベンチマークで首位

Artificial Analysisによると、Googleはプリセット音声と音声複製に対応するGoogle DeepMindのテキスト読み上げモデル、Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSを公開した。同社のテストでは、Gemini 3.8 Flash TTSの発音ロバスト性は89.5%、Provider Voice ArenaのEloは1,263だった。

スタンフォードとTogether AIの論文で、自己組織化する3モデルのチームが平均66.7%

DAIR.AIによると、スタンフォードとTogether AIの論文では、o3-mini、Claude Sonnet 4、DeepSeek-V3が自己組織化するチームとして数学と物理の5つのベンチマークで平均66.7%となり、最も強いメンバー単体の48.8%、完全なルーターの59.0%を上回った。

EvoOntology論文、自己進化するオントロジー層がDDR-BenchとBIRDでデータエージェントのスコアを向上と報告

elvis(@omarsar0)が、MCPサーバーとして提供されるデータエージェント向け自己進化オントロジー層EvoOntologyに関する論文を共有した。投稿によると、DDR-Benchの精度は6つのバックボーンで平均17.8ポイント上昇し、GPT-5.5では26.7ポイント、BIRDの実行精度は7.4ポイント上昇するという。