01 · QUESTIONarXiv:2608.13040 · 2026-08-13

Privileged context 能不能不再由人手写?

LOPD 检索成功 experiences,并把它们压成 continuous latent tokens。

3×32

default latent tokens

48.78

4B LiveCodeBench

<30%

rollout budget

7/10

个人兴趣

来源:Abstract;main tables1 / 9
02 · PIPELINEarXiv:2608.13040 · 2026-08-13

Experience 先检索,再编码与压缩

1Retrieve

3 successes

2Encode

frozen backbone + LoRA

3Compress

8-layer QFormer

4Teacher

latent-conditioned

5Student

on-policy KL

来源:Method overview2 / 9
03 · REPRESENTATIONarXiv:2608.13040 · 2026-08-13

每条 experience 默认 32 latent tokens

优点

比长 trajectory 短,end-to-end learnable

代价

不可读,难检查 leakage 与语义

来源:architecture settings3 / 9
04 · MARGINarXiv:2608.13040 · 2026-08-13

防止 composer 把 teacher 变弱来“作弊”

teacher advantage × (2·reward − 1) ≥ margin

dual variable 保持 teaching privilege;L2 anchor 限制 latent drift。

来源:Privileged-margin objective4 / 9
05 · SETTINGarXiv:2608.13040 · 2026-08-13

Tool-use 与 code generation 两条线

DomainTraining dataEvaluation
Tool use2,349 EnvScaler tasksEnvScaler / BFCL / ACEBench
Code≈7K verified TACOLiveCodeBench / HumanEval+ / MBPP+
来源:Experiment section5 / 9
06 · RESULTarXiv:2608.13040 · 2026-08-13

Margin 决定 joint training 是否退化

Frozen composer
0.573
Joint no margin
0.551
LOPD m=.05
0.637
EnvScaler reward ×100 显示;根据 ablation 重绘6 / 9
07 · RETRIEVALarXiv:2608.13040 · 2026-08-13

更多 experience 不单调更好

3 items

最早达到 0.637

>3 items

没有稳定继续增益

来源:retrieval ablation7 / 9
08 · LEAKAGEarXiv:2608.13040 · 2026-08-13

默认 allow_self_retrieval=true 必须改

Safe report

same-task disabled

Oracle only

same-task allowed,单独报告

代码审计:configs and memory bank8 / 9
09 · VERDICTarXiv:2608.13040 · 2026-08-13

适合第二阶段,不适合最早一轮实验

先做

readable contexts + verifier + routing

再做

latent compression with leakage controls

兴趣程度 7/109 / 9