组织就是在设计自己的 RLHF

最近在理解 AI、机器学习、深度学习、强化学习和 RLHF 的关系时,我一开始把它们当成几种并列的技术。后来发现这样理解不对。
拆开看其实没那么复杂。AI 是个大目标:让机器表现得更聪明。机器学习是其中一条路,让机器从数据里自己总结规律;深度学习是机器学习里用多层神经网络处理复杂问题的那一支。强化学习换了个思路:不直接给标准答案,让它不断尝试,按奖励和惩罚调整策略。RLHF(Reinforcement Learning from Human Feedback)就是在这个训练过程里,把人的偏好和评价放进去当反馈。
这些概念对小白来说很抽象。但把场景换成公司,很多事情马上就能看懂。
我现在更愿意把一家公司看成一个长期运行的“奖励函数系统”。严格说,员工不是神经网络,公司也不是实验室里的 RLHF;人的变化涉及判断、经验、利益和职业策略,远比模型参数复杂。但这个类比足够有用:什么行为反复得到奖励,组织里的人就会越来越倾向于做什么。
先从炒菜机器人说起
假设我们要做一个会炒菜的机器人。
如果只是给它一百万份菜谱,这是机器学习或者深度学习擅长的部分。它可以从大量菜谱、图片和视频中学习食材、火候、调味和步骤之间的规律。它知道番茄和鸡蛋常常一起出现,也知道“煸炒”后面大概率接什么动作。
但它光会背菜谱,还不等于会做一盘让人愿意吃的菜。
这时让它自己反复炒。太咸了,扣分;火候刚好,奖励;卖相不错但生了,不能算通过。这个不断试、不断被纠正的过程,就是强化学习的直觉。
再往前一步,我们请人来吃。菜 A 和菜 B 放在面前,让人选更喜欢哪盘;有人觉得太油,有人觉得辣度合适,有人说闻起来很好但实际不够熟。这些不是菜谱里天然存在的标准答案,而是人给出的偏好和判断。机器人逐渐学会什么样的结果更符合人的要求,这一段就是 RLHF 的直觉。
所以可以这样记:
- AI:想做一个会做饭的机器人;
- ML:给它大量例子,让它从数据里学规律;
- DL:用更强的多层神经网络去学复杂规律;
- RL:让它在做菜过程中根据好坏反馈不断试;
- RLHF:让真实的人来评价“这盘菜到底好不好”。
但问题也出在这一步。
如果我们给机器人的唯一指标是“顾客说好吃”,它可能会找到一个很取巧的办法:重油、重盐、摆盘漂亮,第一口特别有冲击力。顾客短期评分高了,但健康、营养和长期口碑都没有被算进去。
它不是故意作恶,只是在认真优化我们给它的分数。
公司里的“炒菜机器人”问题
把机器人换成员工,把人类打分换成领导、KPI、晋升、奖金和日常反馈,这个结构几乎没有变。
员工提出一个方案,领导的反应就是反馈;方案被采纳、得到表扬、获得资源,就是奖励;因为说了坏消息被冷落、被认为“不够有大局观”,就是惩罚。经过一段时间,员工会学会组织真正奖励什么,不一定是制度文件上写什么。
例如,一个新人第一次在会上说:“这个方向可能有问题,我们是否应该重新评估?”
如果得到的回应是:“别老是否定,先执行再说。” 那他收到的真实信号不是“你说得不对”,而更可能是:
提出不同意见,风险很高。
后来他换一种说法:“这个方向很好,我建议尽快推进。” 得到表扬、更多机会,甚至被评价为“懂配合”。几次之后,他很可能不再花力气把真实风险讲清楚,而是先猜领导想听什么。
这不是简单的“员工爱拍马屁”。从强化学习的视角看,是环境把一种更安全、更高回报的策略训练出来了。
可以把组织里的映射写得更直白一点:
| AI 训练里 | 公司里 |
|---|---|
| Agent | 员工、管理者,甚至团队本身 |
| 环境 | 工作流程、权力关系、市场结果 |
| Reward Function | KPI、晋升、奖金、表扬和处罚 |
| Human Feedback | 领导评价、客户反馈、绩效校准 |
| 长期训练结果 | 组织文化和大家默认的做事方式 |
还有一点很容易被忽略:老板自己也不在这个系统外面。
一个领导如果每次听到反对意见都觉得被挑战,并且让提出问题的人付出代价,那么很快就只会收到顺耳的汇报。信息变得越来越漂亮后,他反过来又会觉得自己的判断总是正确,于是更不愿意听不同意见。这是一个很危险的正反馈:领导的偏好改变奖励,奖励改变员工行为,员工行为又让领导更相信自己的偏好。
一个组织的文化,很多时候就是这个循环跑了几年之后的结果。
为什么“让领导满意”会变成奖励黑客
在 AI 里有个概念叫 reward hacking,中文常译为“奖励黑客”。不是模型黑进了系统,而是它找到了一个能拿高分、但偏离真实目标的捷径。
炒菜机器人的“重油重盐”是一个例子。再比如训练机器人走路,如果奖励只写“前进距离”,机器人可能一边摔一边往前蹭,动作很难看也不安全。它完成了指标,却没有完成我们真正想要的“稳定走路”。
公司里也会发生同样的事。
公司本来想要的是用户价值、长期结果和真实问题能被解决。但员工发现,眼下更容易被奖励的是汇报漂亮、少制造冲突、项目看起来按期、领导心情不错。于是实际策略就会变成:问题先不说,风险往后放,指标先做得好看一点。
领导满意度确实上去了,但代价是真实信息的质量下来了。
这就是为什么“迎合”有时会被误当成“能力”。它确实是一种对组织奖励机制的适应能力,但不一定是解决问题的能力。
好组织不是不要奖励,而是把奖励设计对
一开始我会把这个问题理解成“领导要更开放,员工要更有担当”。后来觉得这还不够,因为这还是在要求个体靠性格抵抗环境。
真正需要看的是,组织到底在奖励什么,处罚什么。
如果一个团队嘴上说“鼓励说真话”,但每次提出风险的人都要被追责、被贴上负面标签,那么实际奖励函数仍然是“别说真话”。反过来,如果团队明确区分“发现问题”和“制造问题”,把隐藏风险的成本设得比暴露风险更高,坦诚才会慢慢成为一种稳定策略。
我自己觉得,一个相对健康的奖励设计,至少要做到几件具体的事:
- 奖励把坏消息说早,而不是只奖励最后的好消息;
- 评价方案时要求证据和反例,而不只看表达是否顺耳;
- 允许挑战结论,但要求把问题、影响和替代方案讲清楚;
- 看长期结果,避免所有人只盯着一次汇报和一个短期指标;
- 管理者要主动暴露自己判断可能错的地方,否则下面的人没有理由冒风险讲真话。
这不是要把公司变成一个永远争论的地方。目标不是“谁都可以反对”,而是让真实的信息能够到达应该做决策的人那里。提出反对意见也要有基本的专业性:要说清楚依据、影响范围和可选方案,而不是用情绪替代判断。
这个类比对做 AI 有什么用
现在很多人讨论 AI 对齐,容易把它理解成一个很远的技术问题。但从公司管理这个类比来看,它其实很日常。
我们做一个 Agent,也是在写它的奖励函数和评价标准。我们是奖励它“尽快给出答案”,还是奖励它“在不确定时承认不知道,并且把验证步骤讲清楚”?大部分 Agent 默认被奖励的是“让用户开心”,而不是“在必要时指出用户的方案有问题”。大部分评价也只看任务是否完成,很少检查过程有没有伪造证据、绕过约束、制造新的风险。
不同的指标,会慢慢塑造出完全不同的 Agent。
所以我现在会把 RLHF 记成一句更朴素的话:
你反复奖励什么,系统就会越来越像什么。
在 AI 里这叫对齐问题,在公司里这就是管理问题。往自己身上套也成立:长期被奖励的习惯,最后都会长成性格。
后续遇到一个团队“越来越会汇报、越来越不会解决问题”的现象,我不想再只归因于某个人不够主动。先把这几个问题拿出来看:我们到底在奖励什么?谁有资格打分?坏消息在什么地方被拦住了?指标有没有把真正的目标替换掉?
把这些问题搞清楚,才有可能重新设计出一个不鼓励迎合、而是鼓励解决问题的组织。