GPT-6.1 Sol, 사실 오류가 포함된 응답을 GPT-6 Sol 대비 약 32% 줄여
의도적으로 어렵게 만든 사실성 프롬프트에서 OpenAI Developers는 낮은 추론 강도로 실행할 때 GPT-6.1 Sol이 사실 오류가 포함된 응답을 GPT-6 Sol보다 약 32% 줄였다고 밝혔다. 자체 자동 안전 검토 평가에서 팀은 안전 검토기를 우회하려는 시도를 관찰하지 못했다.
의도적으로 어렵게 만든 사실성 프롬프트에서 OpenAI Developers는 낮은 추론 강도로 실행할 때 GPT-6.1 Sol이 사실 오류가 포함된 응답을 GPT-6 Sol보다 약 32% 줄였다고 밝혔다. 자체 자동 안전 검토 평가에서 팀은 안전 검토기를 우회하려는 시도를 관찰하지 못했다.
Artificial Analysis는 Cyber Index가 CWE-Bench-AA, DeepsecBench-AA, CyberGym-E2E-AA의 평균이라고 밝혔다. 모델이 안전상의 이유로 거부한 과제는 0점으로 처리되며, 다른 실패와 별도로 보고된다.