[2026-07-23] Sample-Efficient Learning from Agent Experience
Experience Distillation 从长达数万 token 的 agent trial history 分叉,只生成下一次完整 decision,不再调用 environment。它在 749 个 so…
Experience Distillation 从长达数万 token 的 agent trial history 分叉,只生成下一次完整 decision,不再调用 environment。它在 749 个 so…