Artificial Analysis, 노트북과 워크스테이션 추론용 AA-AgentPerf-Local 오픈소스 공개
Artificial Analysis는 노트북과 워크스테이션의 로컬 AI 모델용 추론 테스트인 AA-AgentPerf-Local의 코드와 데이터를 오픈소스로 공개하며, 모델과 하드웨어 조합의 리더보드도 함께 내놓는다. 기본 워크로드는 기록된 에이전트 작업 8개를 모델 턴 168회에 걸쳐 재생한다. 각 요청에는 그때까지의 전체 대화가 포함되어 컨텍스트가 약 56K 토큰까지 늘어나며, 모든 시스템은 기록된 토큰 수만큼 생성한다. 추론 속도만 분리해 측정하기 위해 도구 실행은 기본적으로 건너뛴다. 사용자는 대신 기록된 도구 지연을 재생하거나 도구 호출을 실시간으로 실행할 수 있다. 이번 공개는 에이전트 하나가 시스템 전체를 사용하는 경우를 측정하며, 멀티 에이전트와 공유 워크로드 범위는 나중에 추가할 예정이다.
초기 하드웨어는 NVIDIA DGX Spark(128GB), AMD Ryzen AI Halo(128GB), MacBook Pro M5 Pro(64GB), NVIDIA GeForce RTX 5090(32GB)이며 CUDA, ROCm, Vulkan, Metal을 다룬다. 소개된 모델은 모두 4-bit로, Qwen3.5-9B, Qwen3.8-27B, Qwen3.6-35B-A3B, Ling 3.0 Flash(총 124B, 활성 5B)다. 이 도구는 OpenAI 호환 추론 서버가 제공하는 어떤 모델도 테스트할 수 있다. 공개된 서빙 구성 14개 모두 MTP, DFlash 또는 DSpark를 통한 추측 디코딩을 사용하며, 공식 구성이 있으면 그것을 쓴다.
Artificial Analysis는 활성 파라미터가 3B인 Qwen3.6-35B-A3B가 모든 시스템에서 가장 빠른 모델이었으며, 밀집 모델 Qwen3.8-27B보다 2.5~3.3배 빨랐다고 밝혔다. Ling 3.0 Flash는 실행할 수 있는 하드웨어에서도 Qwen3.5-9B보다 느렸다. 32GB에 들어간 모든 모델에서 RTX 5090이 가장 빨랐고, 완료 시간은 다른 시스템보다 3.5배 넘게 짧았다. 메모리 대역폭은 1,792GB/s로, 통합 메모리 시스템의 256~307GB/s와 비교된다. DGX Spark와 Ryzen AI Halo는 모두 128GB 통합 메모리를 갖췄고 출시 가격은 4,000달러다. Spark는 네 개 모델 중 세 개에서 1.4~1.7배 빨랐고 Qwen3.5-9B에서는 동률이었다. Artificial Analysis는 이 차이가 두 시스템의 대역폭 차이 7%를 넘는다고 밝혔다. 테스트된 유일한 노트북인 M5 Pro MacBook의 대역폭은 307GB/s이고 현재 가격은 3,700달러다. Qwen3.6-35B-A3B와 Qwen3.8-27B에서는 Ryzen AI Halo와 차이가 2~9% 이내였지만, Qwen3.5-9B에서는 21% 느렸다.