ICML 2026学习

幽灵 人工智能 2

强化学习不需要人类反馈!基于赋权的无监督强化学习 | ICML 2026 是在讲啥

豆包

关键词:Empowerment(赋权 / 赋能),信息论视角的内在动机 (Intrinsic Motivation) 强化学习,无外部人类奖励、不需要人类偏好标注arXiv。
先搞懂:什么是赋权 Empowerment
赋权是一个 2005 年就诞生的信息论概念:

赋权 = 智能体对环境的可控影响力大小。数学上就是动作和未来状态之间的互信息 Mutual Information:我做出不同动作,能多大程度改变后续世界的状态arXiv。
赋权高的状态:我做不同动作,环境会出现完全不一样结果;我能掌控很多可能性。
赋权低的状态:不管我怎么操作,环境几乎不变,怎么做结果都差不多。
类比人:小孩到处乱摸、摆弄玩具,本质就是在最大化赋权 —— 寻找 “我的动作能显著改变世界” 的场景,不是为了某个外部任务奖励,纯粹探索控制力本身ResearchGa…。
传统 RL:人写奖励函数,告诉 Agent “什么行为是好的”。 赋权 RL:不给外部任务奖励;内在奖励就是最大化赋权,鼓励 Agent 去往自己能强烈影响环境的状态,学习各式各样可控的技能arXiv。

这篇 ICML2026 论文在解决什么老问题
现在大模型 / 机器人主流对齐:

PPO‑RLHF:需要人类标注偏好,成本高、人类会有偏见,标注质量决定上限。
GRPO、RLIF:不用真人标注,但依赖模型自己生成的伪反馈,容易出现模式崩塌、退化,目标是启发式的,缺少严谨信息论约束OpenReview。
本文核心主张:完全抛弃人类反馈、抛弃伪标签,直接用赋权(Empowerment)作为唯一内在目标做预训练。

两层工作流程
预训练阶段(无任何人类输入) Agent 只跟环境交互,优化目标:最大化赋权。 输出一堆多样化、可控制的基础技能集:移动、抓取、开关物体、各类操作;不针对任何具体下游任务。
没有告诉它 “该干什么活”,只教会它:学会怎么操纵、影响这个世界。
下游微调阶段(零 / 少样本) 来了新任务(比如 “把杯子放到桌上”),不需要重新大规模 RL,直接复用预训练学到的整套可控技能库,快速适配新目标。
论文指出旧赋权方案的两大痛点(本文改进点)
旧的 Variational Empowerment 经常翻车:

语义漂移(Semantic Drift):技能隐变量 z 和真实环境能力慢慢脱节,回放缓冲区里的旧轨迹标签失效,训练越来越低效。
过拟合无关观测噪声:Agent 会去利用背景颜色、坐标这类无关视觉细节,学出来的技能换个场景直接失效,泛化差。
本文改进:

增加均匀性正则项,保证技能隐变量 z 分布足够均匀;
回放缓冲区做动态重标记 relabeling,把过期失效的轨迹标签用当前模型重新修正,抑制语义漂移;
优化变分下界,过滤掉环境里不可控的无关视觉噪声,只保留 “Agent 真正能改变” 的信息做赋权计算。
简单讲:让赋权不再被画面背景干扰,真的去学 “我动作能改变什么”,而不是记住画面像素。
和 RLHF / GRPO 直观对比
表格

方案
是否要人类反馈
奖励来源
风险
RLHF
✅需要
人类标注偏好
标注成本高、人类偏见
GRPO(RLIF)
❌不需要真人,但依赖模型自生成伪样本
模型自己输出的正确性打分
容易模式崩塌、幻觉放大
本文赋权无监督 RL
❌完全不需要人类反馈
信息论:最大化智能体对环境的可控影响力
预训练只学通用能力,不会直接输出任务答案,需要下游适配
⚠️重要误区:不是训练完直接就能做任务。 赋权预训练产出的是一套强大的基础技能库,不是直接解决目标任务;就像小孩天天摆弄世界学会各种操作,但你还需要告诉他具体任务目标。
迁移到大模型 Agent 语境(现在大家最关心的)
传统赋权大多用在机器人 MuJoCo;这篇把这套思路推向 LLM Agent:

LLM Agent 的 “赋权”:Agent 的工具调用、行动,能多大程度改变外部环境状态。 内在奖励:不是人类说这个回答好不好;而是看:我的不同动作,能不能带来环境状态的显著区分。
价值:Agent 预训练阶段完全不需要人类打分,靠 “我能不能操控改变环境” 做内在动机,学习工具使用、环境交互能力。

局限:

纯赋权不会对齐人类价值观,只会学 “怎么影响世界”,不会自动学会 “什么事应该做”;后续依然需要轻量对齐。
环境必须有可观测状态变化;纯文本问答没有外部环境,赋权很难定义,更适合工具 Agent、机器人、网页操作 Agent,不适合直接做聊天模型。
和你之前技术管线的思想共鸣
和凡人修仙传 UE 资产库逻辑相似:预训练阶段产出大量可复用技能资产库,下游任务按需调用,而不是每个任务从零训练。
和 Lean 形式化验证思想有一点相通:用信息论客观目标代替人类主观打分,减少人为引入的偏见与标注噪声。
一句话总结全文
不需要人类标注反馈,基于信息论的赋权 (Empowerment) 作为内在动机,让智能体通过最大化自身对环境的可控影响力,无监督预训练出一套泛化的技能库;修复了旧赋权算法的漂移、过拟合问题,下游任务再复用这套技能快速适配。

  • 暂无回复内容

分享本页
返回顶部