Arena.ai 公布 Agent Arena 榜單,涵蓋代碼、工作與對話三大領域
Arena.ai 發布了截至 2026 年 10 月 5 日的 Agent Arena 領域排行榜,評估智能體在代碼(Code)、工作(Work)及對話(Chat)中的問題解決能力。該榜單透過真實任務中收集的實時執行軌跡,衡量模型相較當前前端水平的淨提升。
Anthropic 模型在各分類中均佔據榜首。Claude Fable 5.1 (Max) 在代碼與工作領域排名第一,對話領域位列第二。Claude Sonnet 5.5 (Max) 則領跑對話分類,在代碼領域排第四,工作領域排第五。
OpenAI 的 GPT 6 Astra (Max) 在全部三個分類中均位列前四,取得代碼第二,以及工作與對話第四。Arena.ai 指出,代碼與工作的排名一致性高於對話;例如,Gemini 4 Argon (High) 在代碼中排第 14 位,工作中排第 12 位,但在對話中排第五。