GPT-6.1 Sol、事実誤りを含む回答を GPT-6 Sol 比で約32%削減
意図的に難しくした事実性プロンプトについて、OpenAI Developers は、低推論強度で実行した場合、GPT-6.1 Sol が事実誤りを含む回答を GPT-6 Sol より約32%減らしたとしている。同チームの自動安全レビュー評価では、安全レビュアーを回避しようとする試みは確認されなかった。
意図的に難しくした事実性プロンプトについて、OpenAI Developers は、低推論強度で実行した場合、GPT-6.1 Sol が事実誤りを含む回答を GPT-6 Sol より約32%減らしたとしている。同チームの自動安全レビュー評価では、安全レビュアーを回避しようとする試みは確認されなかった。
Artificial Analysisによると、Cyber IndexはCWE-Bench-AA、DeepsecBench-AA、CyberGym-E2E-AAの平均である。モデルが安全上の理由で拒否したタスクは0点となり、他の失敗とは別に報告される。