Arena.ai 於 Agent Arena 透過逾 4,700 場 Agent 會話評估 Jev Router
Arena.ai 在 Agent Arena 上基於 4,700 多場真實環境的 Agent 會話,評估了 typesafeai 的 Jev Router。測試顯示 Jev Router 並未改善現有的柏拉圖前沿:要達到與 DeepSeek V4.1 Flash (Max) 相同的效能,成本高出 38%,且模型請求的中位數延遲亦高出 1.7 倍。
評估指出,該路由器大部分時間會將查詢導向符合柏拉圖效益的模型,其中最常選用 DeepSeek V4.1 Flash,亦會常規選用 GPT-6.1 Sol 和 GPT-6 Luna。Jev Router 的主要優勢在於可引導性,得分為 +10%,能依據使用者反饋將查詢導向能力更強的模型,表現接近 Claude Opus 5.5 (High) 的 +10.48。