Artificial Analysis、ノートPCとワークステーション向け推論テスト AA-AgentPerf-Local をオープンソース化
Artificial Analysis は、ノートPCとワークステーション上のローカル AI モデル向け推論テストである AA-AgentPerf-Local のコードとデータをオープンソース化し、モデルとハードウェアの組み合わせのリーダーボードも公開する。既定のワークロードは、記録済みのエージェントタスク 8 件を、モデルのターン計 168 回にわたって再生する。各リクエストにはそれまでの会話全文が含まれ、コンテキストは約 56K トークンまで増え、すべてのシステムが記録されたトークン数を生成する。推論速度だけを切り分けるため、ツール実行は既定で省略する。ユーザーは代わりに、記録されたツール遅延を再生するか、ツール呼び出しをライブで実行できる。今回の公開では、1 つのエージェントがシステム全体を使う場合を測定し、マルチエージェントと共有ワークロードの対象範囲は後日追加する予定だ。
初期のハードウェアは NVIDIA DGX Spark(128 GB)、AMD Ryzen AI Halo(128 GB)、MacBook Pro M5 Pro(64 GB)、NVIDIA GeForce RTX 5090(32 GB)で、CUDA、ROCm、Vulkan、Metal をカバーする。取り上げたモデルはいずれも 4-bit で、Qwen3.5-9B、Qwen3.8-27B、Qwen3.6-35B-A3B、Ling 3.0 Flash(総パラメータ 124B、アクティブ 5B)だ。このツールは、OpenAI 互換の推論サーバーで提供される任意のモデルもテストできる。公開された 14 のサービング構成はすべて、MTP、DFlash、または DSpark による投機的デコーディングを使い、公式構成がある場合はそれを採用している。
Artificial Analysis によると、アクティブパラメータが 3B の Qwen3.6-35B-A3B はすべてのシステムで最速のモデルとなり、dense な Qwen3.8-27B より 2.5~3.3 倍速かった。一方、Ling 3.0 Flash は、実行できたハードウェアでも Qwen3.5-9B に及ばなかった。32 GB に収まった各モデルでは RTX 5090 が最速で、完了時間は他のシステムより 3.5 倍超短かった。メモリ帯域は 1,792 GB/s で、ユニファイドメモリ搭載システムの 256~307 GB/s と比較される。DGX Spark と Ryzen AI Halo はいずれも 128 GB のユニファイドメモリを備え、発売価格は 4,000 ドルだ。Spark は 4 モデル中 3 つで 1.4~1.7 倍速く、Qwen3.5-9B では同点だった。Artificial Analysis は、この差が両者の帯域差 7% を上回ると述べている。テストされた唯一のノートPCである M5 Pro MacBook の帯域は 307 GB/s、現在の価格は 3,700 ドルだ。Qwen3.6-35B-A3B と Qwen3.8-27B では Ryzen AI Halo との差が 2~9% 以内だったが、Qwen3.5-9B では 21% 遅かった。