# NVIDIA 研究人员推出 PivotOPD，训练 AI Agent 自我纠错

NVIDIA 研究人员开发了 PivotOPD 方法，旨在训练 AI Agent 避免在任务早期犯错，并在出错后能够纠正。该训练方法通过教师模型向 Agent 展示更优动作，并引导其在后续步骤重回正轨。

Language: zh-CN
Time zone: Asia/Shanghai

HTML: https://didcodexreset.com/zh/news/e72fc2c5cc734678a71448f0.html

Content language: zh-CN
Localization state: translated

来源：NVIDIA AI · 发布于 2026/10/8 04:34:02

NVIDIA 研究人员推出了 PivotOPD 方法，旨在训练 AI Agent 避免在执行任务时早期犯错，并在发生错误时能够及时纠正，而不是沿着错误方向继续进行。

在训练过程中，教师模型会向 Agent 展示更优动作，并演示如何在接下来的几步中重回正轨。NVIDIA 已在 [PivotOPD project page](https://research.nvidia.com/labs/lpr/pivotopd) 上发布了该研究论文和演示视频。

Tags: NVIDIA, AI Agent, PivotOPD

[查看主帖原文](https://x.com/NVIDIAAI/status/2107928667246715090)
