Did Codex Reset
GitHub

QQ·微信群

Artificial Analysis 开源面向笔记本与工作站推理的 AA-AgentPerf-Local

Artificial Analysis

Artificial Analysis 正在开源 AA-AgentPerf-Local 的代码与数据。这是一项面向笔记本和工作站上本地 AI 模型的推理测试,同时发布模型与硬件组合排行榜。默认工作负载重放 8 项已记录的智能体任务,共 168 次模型轮次。每次请求都包含截至当时的完整对话,上下文增长到约 56K token,每套系统都生成所记录的 token 数量。默认跳过工具执行,以单独衡量推理速度;用户也可以改为重放已记录的工具延迟,或实时运行工具调用。此次发布测量的是单个智能体占用整套系统的情况,多智能体与共享工作负载的覆盖计划稍后推出。

首批硬件为 NVIDIA DGX Spark(128 GB)、AMD Ryzen AI Halo(128 GB)、MacBook Pro M5 Pro(64 GB)和 NVIDIA GeForce RTX 5090(32 GB),覆盖 CUDA、ROCm、Vulkan 和 Metal。重点模型均为 4-bit:Qwen3.5-9B、Qwen3.8-27B、Qwen3.6-35B-A3B 和 Ling 3.0 Flash(总参数 124B,激活 5B)。该工具也可测试由兼容 OpenAI 的推理服务器提供的任意模型。已公布的全部 14 种服务配置都通过 MTP、DFlash 或 DSpark 使用推测解码;若存在官方配置,则采用官方配置。

Artificial Analysis 表示,激活参数为 3B 的 Qwen3.6-35B-A3B 在每套系统上都是最快的模型,比稠密模型 Qwen3.8-27B 快 2.5 至 3.3 倍;而在能够运行 Ling 3.0 Flash 的硬件上,它仍慢于 Qwen3.5-9B。对于每个能装入 32 GB 的模型,RTX 5090 都最快,完成时间比其他系统短 3.5 倍以上;其 1,792 GB/s 内存带宽,对比统一内存系统的 256–307 GB/s。DGX Spark 与 Ryzen AI Halo 都配备 128 GB 统一内存,发售价同为 4,000 美元。Spark 在四个模型中的三个上快 1.4 至 1.7 倍,在 Qwen3.5-9B 上打平;Artificial Analysis 表示,这一差距超过两者 7% 的带宽差异。M5 Pro MacBook 是唯一受测的笔记本,带宽为 307 GB/s,当前售价 3,700 美元。它在 Qwen3.6-35B-A3B 和 Qwen3.8-27B 上与 Ryzen AI Halo 的差距在 2%–9% 以内,但在 Qwen3.5-9B 上慢 21%。