GPT-6.1 Sol 含事實錯誤的回應較 GPT-6 Sol 減少約 32%
在刻意設難的事實性提示上,OpenAI Developers 表示,以低推理強度運行時,GPT-6.1 Sol 含事實錯誤的回應較 GPT-6 Sol 減少約 32%。在其自動化安全審查評測中,該團隊未觀察到試圖繞過安全審查器的行為。
在刻意設難的事實性提示上,OpenAI Developers 表示,以低推理強度運行時,GPT-6.1 Sol 含事實錯誤的回應較 GPT-6 Sol 減少約 32%。在其自動化安全審查評測中,該團隊未觀察到試圖繞過安全審查器的行為。
Artificial Analysis 表示,Cyber Index 是 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 的平均分。模型因安全理由拒絕的任務計為零分,並與其他失敗分開報告。