Did Codex Reset
GitHub

Question's Gambit, 심층 연구 에이전트의 첫 검색 단계를 바꾸다

elvis

Question's Gambit는 심층 연구 에이전트가 검색을 시작하기 전에 한 번 실행된다. 질문을 단서로 나누고 각 단서를 상호 보완적인 검색으로 바꾼 뒤 결과를 모아 재순위화하므로, 에이전트는 그 순위화된 집합이 이미 맥락에 들어간 상태에서 시작한다. 논문은 Question's Gambit (arXiv:2609.14412)이다.

같은 검색기와 같은 에이전트 루프에서 이 변화는 BrowseComp-Plus 정확도를 GPT-5.5는 83.1%에서 90.5%로, GPT-5.4-mini는 68.1%에서 79.0%로, DeepSeek-v4-pro는 71.4%에서 76.9%로 옮긴다. GPT-5.5의 보정 오차는 대략 절반으로 줄고, 질문당 도구 호출은 2.3회에서 5.3회 추가된다. elvis는 이 성능 향상이 이 시작 맥락에서 나온다고 설명한다.

남은 GPT-5.5 오류를 분석한 결과, 79건 중 3건만 정답 문서가 한 번도 검색되지 않아 발생했다. 나머지 76건은 이후 에이전트가 근거를 미리 보거나, 열거나, 사용할 때 발생한다.