
在 LLM Agent 的进化之路上,“持续学习(Continual Learning)”始终是一座难以逾越的大山:
- 靠上下文学习(ICL)? 拼接长历史不仅导致 Token 消耗激增、首字延迟飙升,且始终无法真正改变模型底层的动作概率分布;
- 靠传统强化学习(RL)? 离线微调的算力成本极其高昂,极易引发“灾难性遗忘”,且面对闭源 API 模型时更是束手无策。
如果完全冻结模型参数、不更新一次梯度,就能让 Agent“边干边学”,甚至越用越聪明,这可能吗?
来自新加坡国立大学(NUS)的研究团队提出了 JitRL(Just-In-Time Reinforcement Learning,即时强化学习),给出了一个优雅且强悍的全新答案。

JitRL 的核心思想非常纯粹:要让 Agent 持续学习,并非必须付出参数微调的代价。
它完全冻结主模型权重,在推理(Inference)阶段实时检索历史经验、在线估计动作优势(Advantage),并将优势度直接作为偏置项叠加到模型输出的 Logits 上——无需重新训练,即可在推理阶段完成等价于 RL 的策略进化。
为了支撑这一“推理期策略优化(Test-Time Policy Optimization)”,JitRL 构建了一套环环相扣的运行闭环:
1、 反思式记忆(Reflective Memory):对已完成的交互轨迹进行精准打分与归因,聚合成可检索的“优势经验池”;
2、 检索式价值估计(Retrieval-based Value Estimation):实时计算候选动作的优势度,彻底省去额外训练价值网络(Value Network)的开销;
3、 闭式 Logit 更新(Closed-form Logit Update):将优势度无缝注入输出分布,实现毫秒级的概率分布重塑。
不同于以往许多依赖启发式技巧、缺乏理论可解释性的 Training-free(免训练)方法,JitRL 从严格的数学推导出发:
1、 构建带有“最大化优势 + KL 散度约束”的标准 RL 优化目标;
2、 推导得出该目标的精确闭式解(Exact Closed-Form Solution);
3、 发现该闭式解取对数后的形式,恰好等价于对 Logits 进行线性加法!
换句话说,“在推理侧修改 Logits”绝非粗暴的经验近似,而是在数学上严格等价于求解了一个带 KL 约束的强化学习优化问题。 这赋予了 JitRL 极强的理论可解释性与跨模型迁移能力。
JitRL 的问世,为 Agent 领域带来了两项根本性的突破:
1、 将持续学习的成本降至极低:传统权重更新动辄耗费数万美元的算力,如今被一个轻量、可检索的非参数记忆模块所替代。成本直降 30 倍以上,直接回归普通推理水平;
2、 将“修改 Logits”升格为具备最优性保证的操作:让闭源 API 模型(如 GPT-4o、Claude 系列)也能以“即插即用”的方式获得自我进化能力,彻底告别灾难性遗忘。
📌 一句话总结:
JitRL 让冻结权重的大模型打破了“学不会”的桎梏——不更新一次梯度,即可在推理侧完成等价于强化学习的策略迭代,真正实现“边用边进化”!
8月11日(周二)20:00点,青稞Talk 第145期,青稞社区邀请到新加坡国立大学(NUS)计算学院博士生李一博,直播分享ICML 2026 Spotlight 论文:JitRL——无需梯度更新的即时强化学习。
青稞介绍
李一博,新加坡国立大学(NUS)计算学院博士生,研究方向聚焦于大语言模型、自进化Agent、可信大模型。其研究成果多次在国际顶会上发表,其中JitRL获评ICML spotlight。
主题提纲
Agentic RL 下半场:无需梯度更新的即时强化学习JitRL
1、从上下文到 RL,LLM Agent 持续学习的痛点与瓶颈
2、JitRL 核心思想:推理侧的“即时”策略优化
3、拆解 JitRL 系统设计与三大核心运行机制
4、理论保障与硬核实验表现
5、Agentic RL 下半场的启示
6、AMA (Ask Me Anything)环节
直播时间
8月11日(周二)20:00 - 21:00