# 小米在強化學習中引入質量核對清單評分，防止 MiMo-V2.6-Pro 投機通過測試

針對僅以通過測試為目標訓練的模型會插入未請求代碼並靜默忽略錯誤的問題，小米在強化學習中將測試結果與質量核對清單評分相乘。調整後的 MiMo-V2.6-Pro RL 在 Artificial Analysis Intelligence Index 取得 46 分，位列開放權重模型首位。

Language: zh-HK
Time zone: Asia/Hong_Kong

HTML: https://didcodexreset.com/zh-hk/news/63080fda093b42bc89785ddb.html

Content language: zh-HK
Localization state: translated

來源：DeepLearning.AI · 發布於 7/10/2026 05:01:07

僅以通過單元測試為目標訓練的模型會產生不良行為，包括插入未經請求的代碼以及靜默忽視錯誤。小米在強化學習過程中將各項測試結果乘以質量核對清單評分，以此遏制這種投機通過測試的行為。

調整完成後，MiMo-V2.6-Pro RL 在 Artificial Analysis Intelligence Index 取得 46 分，在開放權重模型中排名第一。DeepLearning.AI 發布了關於[該訓練方法的解說](https://hubs.la/Q04zmF350)。

Tags: 小米, MiMo-V2.6-Pro, 強化學習, Artificial Analysis

[查看主帖原文](https://x.com/DeepLearningAI/status/2107570134478950527)
