# Hassan 發布 GeoGuess Bench，用於評估 AI 模型的 GeoGuessr 定位表現

GeoGuess Bench 透過 210 項全球照片定位任務評估 AI 模型。Claude Opus 5.5 總排名第一，開源模型則以更低的推論成本展現出具競爭力的準確率。

Language: zh-HK
Time zone: Asia/Hong_Kong

HTML: https://didcodexreset.com/zh-hk/news/66e118cb2507476e89779c33.html

Content language: zh-HK
Localization state: translated

來源：Hassan · 發布於 7/10/2026 00:27:53

Hassan 發布了基準測試 GeoGuess Bench，用於評估 AI 模型在地理定位遊戲 GeoGuessr 中的表現。該測試向各模型提供 210 張來自全球各地的照片，要求其預測拍攝地點，並根據預測位置與真實地點的距離計分。

測試結果顯示，Claude Opus 5.5 成績高於 Fable 5.1，位列榜首。開源模型亦展現出顯著的成本效益：Muse Glimmer 30B 以低約 45 倍的成本超越了 GPT 6 Astra，GLM 5.3 Flash 則以約五分之一的成本達到與 GPT 6.1 Sol 相當的成績。完整排行榜與預測紀錄已在 [GeoGuess Bench](http://geoguessbench.com) 發布，程式碼託管於 [GitHub](http://github.com/Nutlope/geoguessbench)。

Tags: 基準測試, GeoGuessr, 多模態 AI, 開源

[查看主帖原文](https://x.com/nutlope/status/2107502264101331150)
