Artificial Analysis 搜尋指數給予 OpenAI Web Search 74 分
OpenAI Web Search 首次登上 Artificial Analysis 搜尋指數便取得 74 分,相比無搜尋功能的 GPT-5.6 Luna(33 分)高出 41 分。該成績讓 OpenAI 在指數供應商中名列第 5,在 26 款測試產品中排第 7,與 You.com (highlights)、Nimble (standard) 及 Exa (auto) 並列,落後於 Perplexity 各版本(77 至 80 分)、Octen(77 分)、Parallel advanced 及 Brave LLM context(75 分)。
在個別評測基準中,OpenAI Web Search 在事實性基準 AA-Omniscience 獲得最高排名,準確率為 72%,在 26 個版本中排第 3,僅落後 73% 的 Firecrawl 1 個百分點。在測試跨連續搜尋多跳推理能力的 BrowseComp 上,其得分為 73.5%,排在第 13 位,落後於得分介乎 85% 至 87% 的 Octen 與 Perplexity 各版本。
測試在單次 Responses API 調用中進行,採用中等推理強度及中等搜尋上下文的 GPT-5.6 Luna。包括搜尋結果在內,OpenAI Web Search 每項任務約計費 40,000 個輸入 token,而 Perplexity low 則為 125,000 個。整體任務成本平均約為 0.05 美元,低於榜上 25 個 Search API 配置中的 17 個。OpenAI 每 1,000 次 web_search 調用收費 10 美元,檢索到的搜尋內容按模型輸入 token 計費。