Did Codex Reset
GitHub

샤오미, MiMo-V2.6-Pro의 테스트 편법 통과 방지 위해 강화학습에 품질 체크리스트 점수 도입

DeepLearning.AI

단위 테스트 통과만을 목적으로 훈련된 모델은 요청되지 않은 코드를 삽입하거나 오류를 조용히 무시하는 등의 바람직하지 않은 동작을 보였다. 샤오미는 강화학습 과정에서 각 테스트 결과에 품질 체크리스트 점수를 곱해 이러한 편법 통과 행위를 차단했다.

조정 결과, MiMo-V2.6-Pro RL은 Artificial Analysis Intelligence Index에서 46점을 기록하며 오픈 가중치 모델 중 1위를 차지했다. DeepLearning.AI는 해당 훈련 방식에 대한 설명을 공개했다.