# Arena.ai 於 Agent Arena 透過逾 4,700 場 Agent 會話評估 Jev Router

Arena.ai 於 Agent Arena 針對 typesafeai 開發的 Jev Router 進行了逾 4,700 場 Agent 會話評估，發現雖然該路由器未有突破現有的柏拉圖前沿，但在響應使用者反饋方面展現出出色的可引導性。

Language: zh-HK
Time zone: Asia/Hong_Kong

HTML: https://didcodexreset.com/zh-hk/news/d2efd8a2a7364c27949b00b4.html

Content language: zh-HK
Localization state: translated

來源：Arena.ai · 發布於 8/10/2026 06:33:08

Arena.ai 在 Agent Arena 上基於 4,700 多場真實環境的 Agent 會話，評估了 typesafeai 的 Jev Router。測試顯示 Jev Router 並未改善現有的柏拉圖前沿：要達到與 DeepSeek V4.1 Flash (Max) 相同的效能，成本高出 38%，且模型請求的中位數延遲亦高出 1.7 倍。

評估指出，該路由器大部分時間會將查詢導向符合柏拉圖效益的模型，其中最常選用 DeepSeek V4.1 Flash，亦會常規選用 GPT-6.1 Sol 和 GPT-6 Luna。Jev Router 的主要優勢在於可引導性，得分為 +10%，能依據使用者反饋將查詢導向能力更強的模型，表現接近 Claude Opus 5.5 (High) 的 +10.48。

Tags: Arena.ai, Jev Router, typesafeai, 基準測試

[查看主帖原文](https://x.com/arena/status/2107961555363213482)
