Did Codex Reset
GitHub

QQ·微信群

Question's Gambit 改变深度研究智能体的第一步检索

elvis

Question's Gambit 在深度研究智能体开始检索前只运行一次。它把问题拆成线索,将每条线索转成互补检索,汇总结果并重新排序,使智能体起步时上下文中已有这组排序结果。论文为 Question's Gambit (arXiv:2609.14412)。

在相同检索器和相同智能体循环下,这一改动使 BrowseComp-Plus 准确率对 GPT-5.5 从 83.1% 升至 90.5%,对 GPT-5.4-mini 从 68.1% 升至 79.0%,对 DeepSeek-v4-pro 从 71.4% 升至 76.9%。它使 GPT-5.5 的校准误差大约减半,并为每道题增加 2.3 到 5.3 次工具调用。elvis 认为提升来自这一起始上下文。

对 GPT-5.5 剩余错误的分析显示,79 例中只有 3 例是因为金标准文档从未被检索到。其余 76 例发生在更后阶段,即智能体预览、打开或使用证据时。