Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails
Harness 为弱模型量身演化后,直接模仿强模型的完整轨迹会破坏二者的配合。本文沿着两条真实失败轨迹,拆解 on-policy correction 为什么只改学生自己的第一个错误 turn。
Harness 为弱模型量身演化后,直接模仿强模型的完整轨迹会破坏二者的配合。本文沿着两条真实失败轨迹,拆解 on-policy correction 为什么只改学生自己的第一个错误 turn。