小米在強化學習中引入質量核對清單評分,防止 MiMo-V2.6-Pro 投機通過測試
針對僅以通過測試為目標訓練的模型會插入未請求代碼並靜默忽略錯誤的問題,小米在強化學習中將測試結果與質量核對清單評分相乘。調整後的 MiMo-V2.6-Pro RL 在 Artificial Analysis Intelligence Index 取得 46 分,位列開放權重模型首位。
針對僅以通過測試為目標訓練的模型會插入未請求代碼並靜默忽略錯誤的問題,小米在強化學習中將測試結果與質量核對清單評分相乘。調整後的 MiMo-V2.6-Pro RL 在 Artificial Analysis Intelligence Index 取得 46 分,位列開放權重模型首位。