Hassan, AI 모델의 GeoGuessr 실력을 평가하는 GeoGuess Bench 공개
Hassan이 위치 추정 게임 GeoGuessr에서 AI 모델의 성능을 평가하는 벤치마크인 GeoGuess Bench를 공개했다. 각 모델에 전 세계에서 수집한 사진 210장을 제시해 촬영 위치를 예측하게 한 뒤, 실제 위치와의 거리를 기준으로 점수를 매긴다.
벤치마크 결과에서는 Claude Opus 5.5가 Fable 5.1을 제치고 1위에 올랐다. 오픈 모델 역시 높은 비용 효율을 증명했다. Muse Glimmer 30B는 약 45배 저렴한 비용으로 GPT 6 Astra를 앞섰고, GLM 5.3 Flash는 약 5분의 1 비용으로 GPT 6.1 Sol과 대등한 점수를 기록했다. 전체 리더보드와 예측 결과는 GeoGuess Bench에서 볼 수 있으며, 소스 코드는 GitHub에 공개되어 있다.