# Hassan、AIモデルのGeoGuessr能力を評価する「GeoGuess Bench」を公開

GeoGuess Benchは、世界各地の写真を用いた210問の位置特定タスクでAIモデルを評価する。総合1位はClaude Opus 5.5で、オープンモデルも低い推論コストで競争力のある精度を示した。

Language: ja
Time zone: Asia/Tokyo

HTML: https://didcodexreset.com/ja/news/66e118cb2507476e89779c33.html

Content language: ja
Localization state: translated

出典：Hassan · 2026/10/7 01:27:53 公開

Hassanは、地理推測ゲーム「GeoGuessr」におけるAIモデルのプレイ精度を評価するベンチマーク「GeoGuess Bench」を公開した。このテストでは世界各地の写真を210枚提示して撮影場所を予測させ、実際の位置との距離に基づいてスコアを算出する。

結果では、Claude Opus 5.5がFable 5.1を上回り首位を獲得した。オープンモデルも高いコスト効率を示し、Muse Glimmer 30Bは約45分の1のコストでGPT 6 Astraを上回り、GLM 5.3 Flashは約5分の1のコストでGPT 6.1 Solと同等の性能を記録した。全順位表と推測データは[GeoGuess Bench](http://geoguessbench.com)で確認でき、コードは[GitHub](http://github.com/Nutlope/geoguessbench)で公開されている。

Tags: ベンチマーク, GeoGuessr, マルチモーダルAI, オープンソース

[元の投稿を見る](https://x.com/nutlope/status/2107502264101331150)
