贝尔曼方程最重要的启发,不是教人“精确计算人生”,而是提供一种看待连续决策的方式:今天的选择,既产生眼前结果,也把你带到一个新的状态;真正值得优化的,是“当下收益 + 未来可能性”。

贝尔曼方程常写成:

V(s)= maxa [ r(s,a) +γ𝔼 [V(s)] ]

其中:

把它翻译成生活语言就是:

一个决定好不好,不能只看它现在让我得到什么,还要看它会把我变成谁、带到哪里,以及以后还能做什么。

一、不要只选择“收益最高的行动”,要选择“更好的下一个状态”

生活中常见的错误,是只比较即时结果。

例如两份工作:

如果只看即时奖励 r,甲可能更好;如果把未来状态的价值 V(s′) 算进去,乙可能更优。

因此,评价一个选择时,不妨多问一句:

这个决定完成后,我会进入一个怎样的状态?

好的状态通常具有一些共同特征:身体尚好、认知更清晰、能力更强、关系更稳、现金流可持续,而且保留着一定的行动自由。

这也解释了为什么学习、锻炼、储蓄、建立信誉等事情短期看起来“回报不高”,长期却很有价值:它们主要不是提供一次性收益,而是在提高未来所有决策的质量。

二、人生不是一次总决策,而是一系列滚动决策

很多焦虑来自这样一种误解:

我现在必须做出一个决定,确定未来十年的人生。

贝尔曼思想则把大问题拆成连续的小问题。你不需要一次看清全部路径,只需要努力做出一个能把你带到较好状态的下一步,然后在新状态中重新计算。

比如职业转型,不一定要问:

我该不该永远离开这个行业?

可以改成:

接下来三个月,我能否用较低成本验证自己是否适合另一个方向?

于是行动可能变成:

这相当于把一个巨大、不可逆的决定,改造成一组可观察、可调整的状态转移。

人生中的很多“终身选择”,其实都可以改写为“下一阶段选择”。

三、好的决定往往会增加未来的选择权

在不确定环境中,未来价值很大一部分来自选择权。

假设两个行动的短期收益相近:

后者的价值不一定立即体现在收入上,但它增加了未来可选行动的数量。

因此,在高度不确定的时期,值得优先考虑那些:

例如先做小规模试验,再全面投入;先建立应急储蓄,再考虑高风险转换;先学习可迁移技能,再押注某个具体平台。

可以把它概括为:

不确定时,不必急着找到唯一正确答案,而要尽量进入“以后仍然有好牌可打”的状态。

四、重视长期,不等于忽视当下

贝尔曼方程中有一个折扣因子 γ。它提醒我们,未来很重要,但不能被无限夸大。

如果一个人把 γ 设得太低,就容易只追求即时满足:

但如果把 γ 想象得过高,也会出现另一种问题:为了遥远目标无限推迟生活。

健康的策略不是一味牺牲当下,而是让当下与未来形成可持续的配合:

今天的生活不能把明天毁掉,明天的理想也不能把今天完全取消。

五、真正重要的是“重复发生的决策”

一次选择的影响有限,反复选择的影响巨大。

每天晚睡一次,代价可能很小;如果“疲惫—拖延—熬夜—更疲惫”成为稳定循环,问题就不再是一次奖励,而是进入了一个低价值状态。

反过来,许多好习惯也不是因为某一次收益巨大,而是它们不断把人推向更好的状态:

身体稍好 精力更高 工作质量提升 情绪更稳定 更容易继续运动

所以,生活管理不能只依赖意志力,还要设计“状态转移”:

一个理想系统并不是要求你每天都英明,而是让普通状态下的你也比较容易做出好选择。

六、决策质量取决于你如何定义“奖励”

数学模型中,目标函数一旦确定,系统就会努力优化它。生活中最大的风险往往不是执行不力,而是奖励定义错了。

如果把收入设为唯一奖励,人可能牺牲健康和关系;如果把他人认可设为唯一奖励,人可能失去自主判断;如果把效率设为唯一奖励,休息、友谊和好奇心都会被误判为浪费。

现实中的“奖励”至少包括:

这些维度无法完全用一个数字折算。因此,贝尔曼方程带来的更深层提醒是:

在努力优化人生之前,先检查自己究竟在优化什么。

很多“成功但不幸福”的情况,本质上不是优化失败,而是对一个狭窄指标优化得过于成功。

七、信息本身也是一种收益

有些行动的直接结果很小,但能显著减少不确定性。

例如你不知道自己是否适合创业。与其反复思考,不如做一次低成本实验:

即使实验没有赚钱,它也可能带来高价值信息。

所以评价行动时,除了问“它能否成功”,还要问:

无论成功或失败,我能学到什么?

能够快速产生可靠反馈的行动,通常优于长期停留在抽象推演中的行动。思考能够排除明显错误,但很多人生问题必须通过进入新状态才能得到答案。

八、先处理会持续恶化的状态变量

贝尔曼框架还提醒我们,不同状态变量会相互影响。

比如健康下降,不只产生身体成本,还会影响情绪、收入、关系和判断;严重债务也不仅是财务问题,它会压缩人的选择空间,使其更容易接受短视方案。

因此,某些变量具有基础性:

当这些变量接近危险边界时,最优策略通常不是追求更高上限,而是先避免系统崩溃。

换句话说:

人生决策不仅要追求期望收益,还要避免进入难以恢复的坏状态。

这也是为什么风险管理常比“押中最大机会”更重要。只有没有出局,未来价值才仍然存在。

九、不要把暂时的状态误认为固定的自我

贝尔曼方程中的 s 是“当前状态”,而不是永恒身份。

“我现在不擅长表达”与“我就是一个不会表达的人”,是两种完全不同的认识。前者把问题视为状态,意味着可以通过行动转移;后者把它变成身份,仿佛没有下一步。

更有建设性的表达是:

这种语言不是自我安慰,而是在保留行动空间。

十、生活并不完全满足贝尔曼方程

贝尔曼思想很有启发,但不能机械套用。现实人生与标准动态规划有几个重要差别:

第一,人生的奖励并不清晰,而且会变化。二十岁看重的东西,四十岁未必仍然相同。

第二,未来状态的概率很难准确估计。人际关系、时代变化和偶然事件都具有高度不确定性。

第三,人的偏好会被行动本身改变。学习音乐不只是满足原有兴趣,也可能创造新的兴趣;承担责任也可能改变一个人的人格和价值观。

第四,有些事情的价值来自投入本身,而不是最终结果。友情、创作、照顾家人,未必适合被理解为纯粹的收益最大化。

第五,人生不是单人游戏。你的选择会影响他人的状态,他人的选择也会影响你。承诺、信任和伦理不能简单压缩为个人回报。

所以,贝尔曼方程适合作为思维工具,而不是人生宗教。

一个可实际使用的决策模板

  1. 我当前真实的状态是什么?区分事实、情绪和自我评价。
  2. 我现在实际有哪些行动?不只比较“做”与“不做”,还要寻找小规模试验和中间方案。
  3. 每个行动的即时收益和成本是什么?包括金钱、时间、情绪、健康和关系。
  4. 它会把我带到什么状态?我会获得什么能力、信息、资源和约束?
  5. 新状态保留了多少选择权?是否容易退出、调整或转向?
  6. 最坏状态是否可承受?不只看平均收益,也要看是否存在不可逆损失。
  7. 我准备在什么时候重新评估?不把今天的决定变成永远不允许修改的承诺。

最后,可以把贝尔曼方程对生活的启发浓缩为一句话:

不必每次都决定整个人生;努力做出一个既照顾当下、又能把自己送往更好下一状态的选择,然后继续观察、学习和更新。

成熟的决策,不是永远猜中遥远的未来,而是在无法完全看清未来时,仍然能够一步步进入更有能力、更有余地、也更愿意生活下去的状态。