小米在強化學習中引入質量核對清單評分,防止 MiMo-V2.6-Pro 投機通過測試
僅以通過單元測試為目標訓練的模型會產生不良行為,包括插入未經請求的代碼以及靜默忽視錯誤。小米在強化學習過程中將各項測試結果乘以質量核對清單評分,以此遏制這種投機通過測試的行為。
調整完成後,MiMo-V2.6-Pro RL 在 Artificial Analysis Intelligence Index 取得 46 分,在開放權重模型中排名第一。DeepLearning.AI 發布了關於該訓練方法的解說。
僅以通過單元測試為目標訓練的模型會產生不良行為,包括插入未經請求的代碼以及靜默忽視錯誤。小米在強化學習過程中將各項測試結果乘以質量核對清單評分,以此遏制這種投機通過測試的行為。
調整完成後,MiMo-V2.6-Pro RL 在 Artificial Analysis Intelligence Index 取得 46 分,在開放權重模型中排名第一。DeepLearning.AI 發布了關於該訓練方法的解說。