Did Codex Reset
GitHub

QQ·微信群

Question's Gambit 改變深度研究代理的第一步檢索

elvis

Question's Gambit 會在深度研究代理開始搜尋前執行一次。它把問題拆成線索,將每條線索轉成互補搜尋,彙集結果並重新排序,讓代理一開始就把這組已排序結果放在上下文中。論文為 Question's Gambit (arXiv:2609.14412)。

在相同檢索器與相同代理迴圈下,這項改動把 BrowseComp-Plus 準確率由 GPT-5.5 的 83.1% 提升至 90.5%,由 GPT-5.4-mini 的 68.1% 提升至 79.0%,並由 DeepSeek-v4-pro 的 71.4% 提升至 76.9%。它大致把 GPT-5.5 的校準誤差減半,並為每道問題增加 2.3 至 5.3 次工具呼叫。elvis 把這項增益描述為來自這段開場上下文。

在對其餘 GPT-5.5 錯誤的分析中,79 項裡只有 3 項是因為從未檢索到金標文件。另外 76 項發生在較後階段,即代理預覽、開啟或使用證據時。