Did Codex Reset
GitHub

QQ·微信群

Hassan 發布 GeoGuess Bench,用於評估 AI 模型的 GeoGuessr 定位表現

Hassan

Hassan 發布了基準測試 GeoGuess Bench,用於評估 AI 模型在地理定位遊戲 GeoGuessr 中的表現。該測試向各模型提供 210 張來自全球各地的照片,要求其預測拍攝地點,並根據預測位置與真實地點的距離計分。

測試結果顯示,Claude Opus 5.5 成績高於 Fable 5.1,位列榜首。開源模型亦展現出顯著的成本效益:Muse Glimmer 30B 以低約 45 倍的成本超越了 GPT 6 Astra,GLM 5.3 Flash 則以約五分之一的成本達到與 GPT 6.1 Sol 相當的成績。完整排行榜與預測紀錄已在 GeoGuess Bench 發布,程式碼託管於 GitHub。