Did Codex Reset
GitHub

Question's Gambit、ディープリサーチエージェントの最初の検索手順を変える

elvis

Question's Gambitは、ディープリサーチエージェントが検索を始める前に一度だけ実行される。質問を手がかりに分け、各手がかりを相補的な検索に変え、結果を集約して再ランク付けし、エージェントはその順位付き集合をすでに文脈へ入れた状態で開始する。論文はQuestion's Gambit (arXiv:2609.14412)である。

同じ検索器と同じエージェントループを用いた場合、この変更でBrowseComp-Plusの精度は、GPT-5.5が83.1%から90.5%、GPT-5.4-miniが68.1%から79.0%、DeepSeek-v4-proが71.4%から76.9%に上がる。GPT-5.5の較正誤差はおよそ半減し、1問あたりのツール呼び出しは2.3から5.3増える。elvisは、この向上は冒頭の文脈から来ると述べている。

残るGPT-5.5の誤りを分析すると、79件のうち、正解文書が一度も検索されなかったものは3件だけである。残る76件は、その後エージェントが証拠をプレビュー、開封、または利用する段階で起きている。