2103 字
11 分钟
这奖励,十分滴珍贵

如果把我们自身抽象成经由巨量 Transformer (变压器,变形金刚) 或堆叠或组合出来的一个模型,那么从出生那一刻起,我们的参数已经进行了随机初始化,经由学校中统一的教学,不同学科的知识通过 SFT (监督微调,Supervised Fine-Tuning) 过程灌输到了大脑,而其他后天的经历,都可以算作是一种 RL (强化学习,Reinforcement learning) 过程。

所以面对所有的情况,都可以将其抽象成一个数学问题,只要定义好清楚的目标和奖励,并通过不断的尝试得到对应的反馈,我们就能不停迭代优化自身。

这对吗?最近有些动摇

先前在互联网如山般的垃圾堆中翻找到了一篇文章,其中讲到

一位理科学院院长告诉刘云杉,曾有一个绩点高达3.89的学生来申请奖金学,老师们一看,几乎所有难的、具有挑战的课程,他都巧妙地回避了,所以成绩单很漂亮。老师们追问他为什么不选有挑战的课,他说,那不是他的兴趣所在。老师们又问:“什么是兴趣?”他说,兴趣就是被承认,如果不被承认,就说明没有胜任力,自然也就没有兴趣。

我想到过去选修课学分的一部分,其实也是这样过来的:从上一届学长学姐那边获取了某某课程做个 PPT 然后上台 Pre 一下就有 90+ 分数的信息,就去照做了。

整个系统对外宣称着提升能力、拓展视野、培养兴趣,但只有身在其中,才知道里面几乎是只留存下了一个指标。我无权苛责当时只是普通学生之一的自己,那时候的目标确实是高绩点,因为它意味着保研资格、更宽的就业空间等等。也正如上面这篇文章中所述:不管你未来走哪一条路,绩点都是基本保障。在这个“奇怪”系统中,所有的远方,都需要这总量有限的船票到达。所以,即使是重新回到那一刻,我仍然会选择那门水课。

不过我其实不想再谈“内卷”这件事了,在不增长的市场中,这种情况像是必然。我想说的是,在这种近乎只留下一种指标的情况下,貌似我们都自然而然凭借着强大的工具理性,成功探索出了那条 reward hacking 的道路,并且在模型代际中一直传递下去。世上本没有 reward hacking,走的人多了,也便成了 reward hacking。

这套奖励机制拿了 MVP。

不管是社会心理学中的认知吝啬鬼理论还是行为经济学所提及的最小努力法则,它们都传达着一个概念:我们的大脑是很聪明的,会自动选择消耗最少的行为进行。所以我想,如果我们自身作为一个模型,从能量消耗的角度来看,理应稳定复现已验证的模式,没必要消耗额外的能量、承担那么多不确定性来探索。

在固定的目标和奖励下进行训练,探索一种可以成功并且最省力的策略是自然而然的吧。诡异的是,这种“成功”策略的出现,却又引发将我们推离目标的斥力。所以,古德哈特定律指出了这一点,“当一个指标变成目标时,它就不再是一个好指标。”

这不禁让我有了个暴论:目前整个系统,在不停的训练出在那些不同学科卷子上拿到高分的 overfit 的模型,然后投放到整个环境中。整个系统并不需要强迫个体服从,它只需要指定某几个具体的“安全屋入口”,在暴风雪中的个体们便会发了狂般涌去。而模型从象牙塔环境进入下一个阶段后,又有挂着“实习”“履历”“论文”等等的新安全屋出现。这令人悲伤,因为我觉得经由这样系统训练出来的模型,失去了探索新模式的动力,会自然而然收束到几条确定的道路上。

这种公式化的训练,让我想到了平日的健身。

奖励和成就感的不断供给,强化了“继续训练”的行为逻辑。这里暂且狭隘地将健身的目的定义为能使用更大的重量。但是健身成果的增长曲线也遵循着边际效益递减的概念,即健身中,相同的动作和重量持续重复后,就会出现“健身平台期”。这种毫无增长的训练反而让动力消减。所以在健身中,引入了新的破局之法,通过“渐进超负荷”或者是新的动作刺激来跨过所谓“平台期”。

那么回到之前的想法,为了达成某个目的,确实需要对应的奖励和反馈,奖励让我们 keep moving,反馈则指示着策略的有效性。但是训练策略带来的增速是逐渐放缓的。所以要调整训练策略,尝试引入新的变化。那么,先前这种将自身当作模型训练的思维看起来就又是可行的,因为这套过程它理应是动态的,即,策略具有时效性,因为受训对象的状态在不停变化。

可相较于健身,日常生活并不相同,即,长期优化的方向尚不明朗,也缺乏进行控制变量实验的可能,光是这些因素就足以让任何的优化算法都暗淡。

接下来我会用最直白,最直接,最不绕弯子、最干脆、最不墨迹的话来说,就是健身目的性很强,并且反馈也非常及时:能推起某个重量了,或是照个镜子看看肌肉。但是日常生活不一样,它的反馈有着延迟和噪声,又或者是难以量化的,而我们大概率仍在用着旧策略对反馈信息进行赋值,甚至忽视新环境中重要的新信号。

虽然我们终究只能关注到眼前这一方小小世界,但这并不意味着,只能维持原来的策略状态,至少在上下文已经变化时,仍可以重新判断过去策略是否过时,以及所追逐的奖励信号,问一句:这奖励,它对吗?

先前读到徐宥大佬的一篇博客,记录了他在 16 年的创业故事,其中有句话印象很深

未来并不是线性展开的。

眼前的最优解、次优解,长期看来并不一定是全局的优解,甚至可能连一个极值点也算不上。这意味着当前的选择是否正确,与我们最终抵达哪里之间,并不存在一条可以持续求解的稳定路径。我们并不知道航向哪里,因为我们是船,既不是风,也不是浪,看起来能调整的只有自身帆面的大小和角度。但本文也不是一篇痛批局部最优是错误的碎碎念,它没有错,因为目前的上下文中确实没有更好的解。

航行的船只并不能选择风浪,更无从知道哪条航线能最快地通向港口,但这并不影响我们跌跌撞撞抵达目标。真正危险的点在于,这阵风浪过去后,在原来的帆面已经完成使命之后,我们仍然把它当成关于未来的答案,将一个时期的奖励系统原封不动地迁移到下一个时期,成为旧时代的遗孤。

海图上的航线还显示着原来的路径,你便准备继续照着它走。

“可是船长,风向变了。而且,船有发动机……”

这奖励,十分滴珍贵
https://suburbiaxx.fun/posts/a6541657/
作者
SuburbiaXX
发布于
2026-07-29
许可协议
CC BY-NC-SA 4.0