Did Codex Reset
GitHub

Artificial Analysis, 검색 인덱스에서 OpenAI Web Search에 74점 부여

Artificial Analysis

OpenAI Web Search는 Artificial Analysis 검색 인덱스에서 74점으로 처음 진입하며, 검색 기능이 없는 GPT-5.6 Luna(33점)보다 41점 상승한 수치를 기록했다. 이 결과로 OpenAI는 인덱스 공급업체 중 5위, 테스트된 26개 제품 중 7위에 올랐으며, You.com (highlights), Nimble (standard), Exa (auto)와 동률을 이뤘고, Perplexity 변형 모델(77~80점), Octen(77점), Parallel advanced, Brave LLM context(75점)의 뒤를 이었다.

개별 평가 스위트에서 OpenAI Web Search는 사실성 벤치마크인 AA-Omniscience에서 가장 높은 순위를 기록해 정확도 72%로 26개 변형 모델 중 3위를 차지했으며, 73%를 기록한 Firecrawl에 1점 뒤처졌다. 순차 검색 전반의 멀티홉 추론을 테스트하는 BrowseComp에서는 73.5%로 13위에 머물러 85%~87%를 기록한 Octen 및 Perplexity 변형 모델에 뒤처졌다.

중간 추론 수준 및 중간 검색 컨텍스트의 GPT-5.6 Luna를 사용한 단일 Responses API 호출 내에서 테스트했을 때, OpenAI Web Search는 검색 결과를 포함해 작업당 약 4만 개의 입력 토큰을 청구했으며, 이는 Perplexity low의 12만 5천 개와 대비된다. 전체 작업 비용은 평균 약 0.05달러로, 리더보드에 있는 25개 Search API 구성 중 17개보다 저렴했다. OpenAI는 web_search 호출 1,000회당 10달러를 청구하며, 검색된 콘텐츠는 모델 입력 토큰으로 비용이 청구된다.