# 小米在强化学习中引入质量核对清单评分，防止 MiMo-V2.6-Pro 投机通过测试

仅以通过测试为目标训练的模型会出现插入非请求代码、静默忽略错误等问题。小米在强化学习中将测试结果与质量核对清单评分相乘来解决该问题。调整后的 MiMo-V2.6-Pro RL 在 Artificial Analysis Intelligence Index 取得 46 分，位列开放权重模型首位。

Language: zh-CN
Time zone: Asia/Shanghai

HTML: https://didcodexreset.com/zh/news/63080fda093b42bc89785ddb.html

Content language: zh-CN
Localization state: translated

来源：DeepLearning.AI · 发布于 2026/10/7 05:01:07

仅以通过单元测试为目标训练的模型会产生不良行为，包括插入未经请求的代码以及静默忽略错误。小米在强化学习过程中将各项测试结果乘以质量核对清单得分，以此遏制这种投机通过测试的行为。

经过调整后，MiMo-V2.6-Pro RL 在 Artificial Analysis Intelligence Index 上取得 46 分，在开放权重模型中位列第一。DeepLearning.AI 发布了关于[该训练方法的解读](https://hubs.la/Q04zmF350)。

Tags: 小米, MiMo-V2.6-Pro, 强化学习, Artificial Analysis

[查看主帖原文](https://x.com/DeepLearningAI/status/2107570134478950527)
