15,885
Retail successful traces
44.1
Travel Planner best
17/21
需要非零 RL reward
8.5/10
个人兴趣
π-Distill 把 successful tool-call trajectories 当训练期 privileged information。
Retail successful traces
Travel Planner best
需要非零 RL reward
个人兴趣
frontier teacher 的 internal chain-of-thought
tool name、arguments、observations
environment 最终 success / failure
| 方法 | Teacher | Student | RL |
|---|---|---|---|
| π-Distill | privileged、联合更新 | unprivileged、匹配 teacher | 联合 |
| OPSD variant | privileged self-teacher | on-policy rollout | KL penalty + reward |
15,885 traces;300/500 tasks 有 PI
1,986 traces;45 training tasks
每题保留最短成功 trajectory
| 项 | 设置 |
|---|---|
| Backbones | Qwen3-4B/8B;R1-Distill-Llama-8B |
| Context | 25K |
| Temperature | 0.75 |
| Steps | Retail 600;Travel 400 |
| Hardware | 2×H100 |
teacher similarity 只能 shaping;最终 task outcome 仍需 environment verifier。
compile、run、screenshot 名称
command、fixture、scene
failure → repair 的压缩经验
action-only PI + outcome reward
无官方 code、trace generation 未公开