GPT-6.1 Sol 含事实错误的回答较 GPT-6 Sol 减少约 32%
在刻意设难的事实性提示上,OpenAI Developers 表示,以低推理强度运行时,GPT-6.1 Sol 含事实错误的回答较 GPT-6 Sol 减少约 32%。在其自动化安全审查评测中,该团队未观察到试图绕过安全审查器的行为。
在刻意设难的事实性提示上,OpenAI Developers 表示,以低推理强度运行时,GPT-6.1 Sol 含事实错误的回答较 GPT-6 Sol 减少约 32%。在其自动化安全审查评测中,该团队未观察到试图绕过安全审查器的行为。
Artificial Analysis 表示,Cyber Index 是 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 的平均分。模型因安全原因拒绝的任务计为零分,并与其他失败分开报告。