# Artificial Analysis, 지능 지수에서 Claude Haiku 5.5에 43점 부여

Artificial Analysis는 Claude Haiku 5.5에 이전 Haiku보다 26점 상승한 43점을 부여하고, 100만 토큰의 컨텍스트 창을 지원한다고 밝혔다. 이번 결과에는 토큰 사용량, 터미널 작업, 사실 정확도 및 해당 기관이 과소평가되었을 가능성이 높다고 밝힌 AutomationBench 점수도 포함된다.

Language: ko
Time zone: Asia/Seoul

HTML: https://didcodexreset.com/ko/news/8ea1e06cf2394d288f5b2a05.html

Content language: ko
Localization state: translated

출처: Artificial Analysis · 2026. 10. 8. 04:33:25 게시

Artificial Analysis는 자체 지능 지수(Intelligence Index)에서 Claude Haiku 5.5에 43점을 부여했다. 이는 1년 전의 이전 Haiku보다 26점 높은 점수다. 컨텍스트 창은 Claude 4.5 Haiku의 20만 토큰에서 100만 토큰으로 늘어났다. 이 모델은 텍스트와 이미지 입력을 지원하며 텍스트를 출력한다.

최대 노력(maximum effort) 기준 점수는 GLM-5.3 Flash(42점), Gemini 3.8 Flash(41점), GPT-6 Luna(38점)를 소폭 앞서며 Kimi K3(44점)와 비슷한 수준이고, 최대 노력 기준 Claude Sonnet 5.5(56점)보다는 13점 낮다. 동일 지수에서 최대 노력 설정 시 작업당 약 162,000개의 출력 토큰을 사용해 최대 노력 기준 GPT-6 Luna(약 50,000개)의 약 3배에 달한다. xhigh에서 max로 올리면 점수는 2점 상승하지만 토큰은 약 1.8배 더 소모된다. 동일한 38점 기준으로 high 노력 설정 시 작업당 약 55,000개 토큰을 사용하며, 이는 최대 노력 기준 GPT-6 Luna의 약 50,000개와 비교된다.

실제 지식 업무 작업을 평가하는 Artificial Analysis의 자체 비공개 벤치마크인 AA-Briefcase에서 이 모델은 최대 노력 기준 1,578 Elo를 기록해 Kimi K3와 GLM-5.3을 앞섰으며, 최대 노력 기준 Muse Spark 1.3과 비슷한 수준을 보였다. Terminal-Bench 4.0에서는 Haiku 4.5의 0%에서 상승한 33%를 기록해 GLM-5.3 Flash와 동률을 이뤘고, Gemini 3.8 Flash(20%) 및 GPT-6 Luna(13%)를 앞섰다.

AA-Omniscience 정확도는 36%로, Gemini 3.8 Flash의 55% 및 GPT-6 Luna의 44%와 비교된다. Artificial Analysis는 이러한 격차의 일부가 모르는 것을 솔직하게 인정하는 태도에서 비롯되었다고 설명했다. 환각률은 40%로 다른 두 모델의 55% 및 77%보다 낮았다. AutomationBench-AA 점수는 35%로 세 모델의 53~60%에 미치지 못했다. Artificial Analysis는 출시 전 테스트에서 안전 거부 문제로 인한 과도한 거부가 발생했다고 설명했으며, Anthropic이 해결책을 마련 중이어서 재평가를 진행하면 점수가 오를 것으로 예상한다고 밝혔다.

5분 캐시 쓰기 비용은 10만 토큰 이하 프롬프트의 경우 100만 토큰당 0.125달러, 10만 토큰 초과 시 0.625달러다. Artificial Analysis는 자사 웹사이트에 아직 단계별 요금제가 반영되지 않아 Haiku 5.5의 잠정 비용 수치에는 10만 토큰 초과 구간의 높은 요율이 제외되어 있다고 설명했다.

Tags: Claude Haiku 5.5, Artificial Analysis, Anthropic, 벤치마크, 지능 지수

[원문 게시물 보기](https://x.com/ArtificialAnlys/status/2107911905822351609)
