Artificial Analysis、検索インデックスでOpenAI Web Searchを74スコアと評価
OpenAI Web SearchはArtificial Analysisの検索インデックスにスコア74で初登場し、検索なしのGPT-5.6 Luna(33)から41ポイントの上昇を記録した。この結果により、OpenAIはインデックス上でプロバイダーとして5位、テスト対象26製品中7位となり、You.com (highlights)、Nimble (standard)、Exa (auto)と同率で並び、Perplexityの各バリアント(77〜80)、Octen(77)、Parallel advanced、Brave LLM context(75)に次ぐ順位となった。
個別の評価スイートにおいて、OpenAI Web Searchは事実性ベンチマークのAA-Omniscienceで最高順位を記録し、正解率72%で26バリアント中3位となり、73%のFirecrawlに1ポイント差で続いた。連続検索をまたぐマルチホップ推論をテストするBrowseCompでは73.5%で13位となり、85%〜87%を記録したOctenやPerplexityの各バリアントに遅れをとった。
中程度の推論と中程度の検索コンテキストを持つGPT-5.6 Lunaを使用し、単一のResponses API呼び出し内でテストされた結果、OpenAI Web Searchは検索結果を含めタスクあたり約4万入力トークンを消費し、Perplexity lowの12.5万トークンを下回った。タスク全体の平均コストは約0.05ドルで、リーダーボード上のSearch API構成25種のうち17種よりも低コストだった。OpenAIはweb_searchの呼び出し1,000回あたり10ドルを請求し、取得された検索コンテンツはモデルの入力トークンとして課金される。