3×32
default latent tokens
48.78
4B LiveCodeBench
<30%
rollout budget
7/10
个人兴趣
LOPD 检索成功 experiences,并把它们压成 continuous latent tokens。
default latent tokens
4B LiveCodeBench
rollout budget
个人兴趣
3 successes
frozen backbone + LoRA
8-layer QFormer
latent-conditioned
on-policy KL
比长 trajectory 短,end-to-end learnable
不可读,难检查 leakage 与语义
dual variable 保持 teaching privilege;L2 anchor 限制 latent drift。
| Domain | Training data | Evaluation |
|---|---|---|
| Tool use | 2,349 EnvScaler tasks | EnvScaler / BFCL / ACEBench |
| Code | ≈7K verified TACO | LiveCodeBench / HumanEval+ / MBPP+ |
最早达到 0.637
没有稳定继续增益
same-task disabled
same-task allowed,单独报告
readable contexts + verifier + routing
latent compression with leakage controls