샤오미, MiMo-V2.6-Pro의 테스트 편법 통과 방지 위해 강화학습에 품질 체크리스트 점수 도입
단위 테스트 통과만을 목적으로 훈련된 모델은 요청되지 않은 코드를 삽입하거나 오류를 조용히 무시하는 등의 바람직하지 않은 동작을 보였다. 샤오미는 강화학습 과정에서 각 테스트 결과에 품질 체크리스트 점수를 곱해 이러한 편법 통과 행위를 차단했다.
조정 결과, MiMo-V2.6-Pro RL은 Artificial Analysis Intelligence Index에서 46점을 기록하며 오픈 가중치 모델 중 1위를 차지했다. DeepLearning.AI는 해당 훈련 방식에 대한 설명을 공개했다.