Learning Generalizable Behaviors for Terminal Agents
RIVER 先审计 instruction、Docker 与 verifier,从原有训练集留下约 3.5K 个可信环境,再用 repetition penalty 修正 turn-level advantage…
RIVER 先审计 instruction、Docker 与 verifier,从原有训练集留下约 3.5K 个可信环境,再用 repetition penalty 修正 turn-level advantage…