Artificial Analysis 開源面向手提電腦與工作站推理的 AA-AgentPerf-Local
Artificial Analysis 正在開源 AA-AgentPerf-Local 的程式碼與數據。這是一項面向手提電腦和工作站上本地 AI 模型的推理測試,同時發布模型與硬件組合排行榜。預設工作負載重放 8 項已記錄的智能體任務,共 168 次模型輪次。每次請求都包含截至當時的完整對話,上下文增長到約 56K token,每套系統都生成所記錄的 token 數量。預設跳過工具執行,以單獨量度推理速度;用戶也可以改為重放已記錄的工具延遲,或即時運行工具調用。此次發布量度的是單個智能體佔用整套系統的情況,多智能體與共享工作負載的覆蓋計劃稍後推出。
首批硬件為 NVIDIA DGX Spark(128 GB)、AMD Ryzen AI Halo(128 GB)、MacBook Pro M5 Pro(64 GB)和 NVIDIA GeForce RTX 5090(32 GB),涵蓋 CUDA、ROCm、Vulkan 和 Metal。重點模型均為 4-bit:Qwen3.5-9B、Qwen3.8-27B、Qwen3.6-35B-A3B 和 Ling 3.0 Flash(總參數 124B,啟用 5B)。該工具也可測試由兼容 OpenAI 的推理伺服器提供的任意模型。已公布的全部 14 種服務配置都透過 MTP、DFlash 或 DSpark 使用推測解碼;若存在官方配置,則採用官方配置。
Artificial Analysis 表示,啟用參數為 3B 的 Qwen3.6-35B-A3B 在每套系統上都是最快的模型,比稠密模型 Qwen3.8-27B 快 2.5 至 3.3 倍;而在能夠運行 Ling 3.0 Flash 的硬件上,它仍慢於 Qwen3.5-9B。對於每個能裝入 32 GB 的模型,RTX 5090 都最快,完成時間比其他系統短 3.5 倍以上;其 1,792 GB/s 記憶體頻寬,對比統一記憶體系統的 256–307 GB/s。DGX Spark 與 Ryzen AI Halo 都配備 128 GB 統一記憶體,發售價同為 4,000 美元。Spark 在四個模型中的三個上快 1.4 至 1.7 倍,在 Qwen3.5-9B 上打平;Artificial Analysis 表示,這一差距超過兩者 7% 的頻寬差異。M5 Pro MacBook 是唯一受測的手提電腦,頻寬為 307 GB/s,目前售價 3,700 美元。它在 Qwen3.6-35B-A3B 和 Qwen3.8-27B 上與 Ryzen AI Halo 的差距在 2%–9% 以內,但在 Qwen3.5-9B 上慢 21%。