# Hassan 发布 GeoGuess Bench，用于评估 AI 模型的 GeoGuessr 定位表现

GeoGuess Bench 通过 210 项全球照片定位任务评估 AI 模型。Claude Opus 5.5 综合排名第一，开源模型则以更低的推理成本展现出具备竞争力的准确率。

Language: zh-CN
Time zone: Asia/Shanghai

HTML: https://didcodexreset.com/zh/news/66e118cb2507476e89779c33.html

Content language: zh-CN
Localization state: translated

来源：Hassan · 发布于 2026/10/7 00:27:53

Hassan 发布了基准测试 GeoGuess Bench，用于评估 AI 模型在地理定位游戏 GeoGuessr 中的表现。该测试向各模型提供 210 张全球各地的照片，要求其预测拍摄地点，并根据预测位置与实际位置的距离进行评分。

测试结果显示，Claude Opus 5.5 成绩高于 Fable 5.1，位列榜首。开源模型也表现出较高的成本效益：Muse Glimmer 30B 以低约 45 倍的成本超越了 GPT 6 Astra，GLM 5.3 Flash 则以约五分之一的成本达到了与 GPT 6.1 Sol 相当的表现。完整排行榜与预测记录已在 [GeoGuess Bench](http://geoguessbench.com) 公布，代码托管于 [GitHub](http://github.com/Nutlope/geoguessbench)。

Tags: 基准测试, GeoGuessr, 多模态 AI, 开源

[查看主帖原文](https://x.com/nutlope/status/2107502264101331150)
