决定论与随机建模的哲学博弈:预测模型如何在不确定性中寻找秩序
2026/9/23 6:47:02 网站建设 项目流程

做预测模型做到第5年的时候,我开始反复琢磨一个问题:当一条回归曲线明明能很好地拟合历史数据,下一秒却被现实无情打脸时,我们到底在用什么逻辑解释世界?这个问题听起来有点玄,可真把它拆开,它就是你在大街小巷的每一个预测平台上都能看到的矛盾:人类一边试图找到万事万物的规律,一边又不得不给所有预测加上置信区间。

这个矛盾背后的主线,就是标题里说的“决定论与随机建模的哲学博弈”。它把一个看起来纯理论的问题变成了每天都要面对的工程选择。你选什么算法、怎么解释模型的输出、敢不敢把预测结果交给业务方,背后都是你对“世界到底是不是确定的”这个问题的态度。所以我打算花一整篇的篇幅,把这条线从头到尾捋一遍:决定论为什么那么迷人,随机性到底从哪里冒出来,随机建模又是如何在哲学和实用之间走钢丝,以及我们这些实际拿模型干活的人,该怎么在这个“秩序中的迷雾”里自处。

1. 决定论的黄金年代:从牛顿钟表到拉普拉斯妖

1.1 牛顿方程里为什么没有“随机”二字

在牛顿那个年代,天体运行是可以用方程精确预测的。你用牛顿运动定律算出彗星经过的轨道,它就会在那个时间点经过那个位置,误差只在观测精度,而不在理论本身。这套理论给人类带来的震撼不只是算得准,更是在世界观层面:如果几个简洁的方程就能描述行星运动,那为什么不能描述一块石头的下落、一滴水的飞溅、甚至一个人的选择?

于是“钟表宇宙”的比喻出现了。宇宙被想象成一个上好了发条的巨大机械钟,所有的过去和未来都已经被写在初始条件和运动规律里。所谓随机,在那个框架下只代表“我们暂时不知道原因”,而不是“世界真的存在不确定性”。“上帝不掷骰子”这个表达,与其说是科学判断,不如说是这种决定论世界观的信仰宣言。对一个坚持决定论的人来说,你抛一枚硬币,它的旋转速度、空气阻力、桌面材质全都可以测量,只要信息足够,结果在一开始就是确定的。

这个思路在经典物理时代确实无往不利。工程师可以用牛顿力学设计桥梁,航海家可以用天体力学定位船只,误差可以进入修正项,但那只是“精度”问题,不是“逻辑”问题。正因为这样,决定论才不只是一个学术观点,它变成了一种人格底色:相信规律,相信秩序,相信一切现象背后都有一条可以追到底的因果链。

1.2 拉普拉斯妖:一个关于全知的假设

18世纪末,法国数学家拉普拉斯提出了一个今天听起来有点科幻的思想实验:如果存在一个智能体,它知道宇宙中所有粒子在某一时刻的位置和动量,并且掌握所有力学定律,那么它就能推算出全部过去和未来的每一个事件。这个智能体后来被人称作“拉普拉斯妖”。

拉普拉斯妖的可怕之处在于它逻辑上几乎无懈可击。只要你接受宇宙是封闭的、规律是完备的、信息是足够的,那么未来就已经被“锁定”了。你所谓的“做选择”,只是在按设定好的剧本演出。这个结论让很多哲学家睡不着觉,因为它直接威胁到自由意志的概念:如果每个念头都是前一个状态的必然结果,那“我”到底在哪里?

但我自己在看拉普拉斯妖时,注意到一个容易忽略的细节:这个思想实验的前提条件极其苛刻。你必须掌握所有粒子的精确信息,而“精确”这个词在真实的物理测量里是一个永远达不到的理想。海森堡的不确定性原理,就把“同时知道位置和动量”这条路从物理学上堵死了。所以拉普拉斯妖与其说是一个科学论断,不如说是一个暴露边界的思想实验:它逼你回答,当信息不全时,我们的认知还剩下多少合法性。

1.3 机械论世界观对近代科学的影响

决定论在科学史上的功劳不能抹杀。没有机械论世界观,现代科学很难拒绝神秘主义和超自然解释。一个苹果落地不是因为天上的精灵动了手,而是因为万有引力。这种“去找机制”的研究范式,让生物、化学、经济全都沿着还原论的路线发展了几百年。

但问题也随之而来。一旦你把复杂系统简化为一组微分方程,就容易产生“只要方程够多,世界就可预测”的幻觉。我见过很多做量化交易的朋友,花了一堆精力去改良模型里的非线性项,却忘了市场本身是一个参与者会适应、会对抗、会变化的复杂系统。这个世界更像是一个正在被自己观察和改变的系统,它并不同情那些完美方程的持有者。机械论给我们提供了强大的杠杆,但它不该被当成世界本质教条。

2. 随机性从哪里冒出来:量子、混沌与信息缺失

2.1 量子力学:上帝掷骰子吗?

量子力学大概是物理学里最让决定论者难受的一个分支。在亚原子尺度,单次测量结果是无法精确预测的:一个电子打在屏幕上的位置是概率性的,同一实验重复一万次,你只能预测落点的分布,却预测不了某一次具体的落点。

更麻烦的是,不确定性不是因为我们仪器不够好,而是被写进了理论内核。哥本哈根诠释直接说:在测量之前,粒子的状态是叠加的,你问它“你实际在哪里”这个问题本身在量子层面就不成立。当然,也有隐变量理论试图保住决定论的底裤,把量子随机性解释成隐藏信息的结果。但贝尔不等式实验的种种证据,让“局域隐变量”这条路走得非常艰难。

这里我想强调一个认知转变:量子力学带来的冲击不是一个“例外”在打扰规律,而是让我们看到,在宇宙最基础的运作方式里,“概率”可能和“位置”“速度”一样原初。这种视角一旦接受,随机就不再是无知的代名词,反而成了底层语言的一部分。

2.2 混沌系统:蝴蝶效应与初始条件敏感

比量子力学更让预测者头疼的,是介于决定论与随机之间的混沌现象。洛伦茨当年用三阶微分方程模拟天气,发现初始条件的微小差异会在几十步后导致完全不同的演化路径。方程本身是完全确定的,但结果从实际操作上几乎无法预测,因为你永远测不到绝对的无穷精度。

对混沌系统来说,问题不在“不知道规律”,而在“给不出足够精确的初始状态”。蝴蝶效应说的不是蝴蝶真的能引发风暴,而是系统对初始条件的敏感依赖,让“差之毫厘”变成了“谬以千里”。这给决定论打了一个很漂亮的回旋球:哪怕世界是确定的,只要你对初始条件的测量有一丁点误差,长期预测依然等于瞎猜。

所以我一直觉得,混沌是把“哲学上的决定论”和“实践上的不可预测”分开的最干净的一个概念。一个工程预测人员如果不理解混沌,就特别容易犯一个错误:因为模型确定性强,就过分相信点估计;而实际上,你面对的可能就是一个确定性内核+极端外推脆弱性的系统。

2.3 一个关键区分:内在随机性与认知随机性

聊到这里,有必要把两种“随机”分开。第一种叫内在随机性,意思是世界本身就以不可预测的方式演化,量子力学可能属于这一类。第二种叫认知随机性,意思是世界本身可能是确定的,但我们因为信息不完备、计算力不够,只能把未知部分当随机处理。

这个区分极端重要,因为它直接影响你建模时的数学选择。如果你相信内在随机性,那模型中的噪声项就是“真实存在”的,你的目标就是把信号从噪声中分离。如果你相信认知随机性,那噪声项只是“你还没找到的变量”的遮羞布,你的目标就该是不断缩小噪声,而不是接受它。

现实是,大多数微观世界和复杂社会系统里,我们根本分不清这两种随机。于是随机建模哲学就形成了一个微妙的中庸立场:它不再断言世界真的随机,也不奢求全知,而是承认“在给定信息下,概率是我们描述未来的最优语言”。这个立场的总目标,不是说出未来是什么样,而是说出“根据现有信息,未来该用什么倾向去期待”。

3. 随机建模的工程哲学:为什么我们选择用概率描述世界

3.1 统计力学的启示:大量粒子的平均行为

如果你去翻热力学教材,会看到一个很奇特的场面:物理学家明明可以用牛顿力学描述每个气体分子,却选择用温度、压力、熵这些统计量来描述整个气体。玻尔兹曼和吉布斯的巨大贡献在于:当粒子数量多到无法逐个追踪,你不需要知道每个粒子的轨迹,只需要知道它们的概率分布,就能推导出整个体系的宏观性质。

这套思路的哲学切口在于:它把“准确描述个体”替换成了“准确描述分布”。温度不是某个分子的动能,而是大量分子动能的统计效果。这让我在做起业务预测时很有代入感:你确实不知道某个用户明天会不会下单,但你可以很有把握地说一万个用户里大概会有多少比例下单。统计力学所以能成功,不是因为放弃了个体,而是换了一个更合适的尺度去理解世界。

3.2 天气与市场:从单点预测到概率预报

我曾见过很多业务方跑来要我“预测一个数”,比如“下个月这个指标的数值是多少”。我在做过几次惨痛教训之后,学会了一件事:比起给一个单点,不如给一套分位数和置信区间。天气预报告诉我们“明天降水概率70%”,而不是“明天一定下雨”,这不代表气象学家退步了,而是他们诚实承认了混沌和初始误差的存在。

概率预报真正改变的不是输出形式,而是决策方式。当你知道有70%概率下雨时,你出门带伞的决策不只是“对或不对”,而是变成了一个风险权衡。同样,在给业务方做预测时,如果你只说“预计下月销售额100万”,对方可能会把100万当成板上钉钉的目标;但如果你说“有六成概率会落在90到110万,低增长情景是70万”,对方至少能提前想好备选方案。这不是在玩文字游戏,而是在用概率结构传递不确定性信息,这才是随机建模真正的价值。

3.3 机器学习里的“随机”不是随便,而是正则化

做机器学习的人对“随机”一点也不陌生:随机梯度下降、Dropout、随机森林、贝叶斯神经网络……这些名字里都带着随机,但它们的“随机”都不是为了搞事,而是为了让模型在训练集和测试集之间保持稳定。你如果在训练时把所有数据都按固定顺序喂进去,模型很容易记住噪声;加入随机性,反而能打散这种虚假规律。

从哲学上看,机器学习里的随机化有一个隐蔽的信念:世界存在大量我们无法建模的复杂依赖,与其强行模拟每一个细节,不如通过引入噪声来让模型保持谦逊。Dropout让每个神经元不依赖固定队友,随机森林让每棵树看到不同的样本切片,这些都是“用随机换鲁棒”的代表作。对我而言,这类操作简直就是随机建模哲学的工程化落地:承认我们无法掌握全部结构,那就用概率化手段来缓解过拟合带来的虚假确定感。

4. 决定论与随机建模的核心交锋:预测、因果与自由意志

4.1 科学能预测未来吗:决定论逻辑下的预测

如果世界是决定论的,那么预测未来就只是一个计算问题。理论上,只要给定完备的初始条件和准确的规律,你就能知道明天、明年、甚至下一个世纪会发生什么。但这里面藏着一个逻辑陷阱:预测这个行为本身,会影响被预测的系统。你预测明天股价会涨,于是今天买了股票,这个“买”的动作反过来改变了股价历史。这在哲学上叫“自指”问题,在工程上叫“反馈效应”。

所以即使是决定论框架,在涉及人类行为的领域,预测也永远不是中立的旁观者。你发布一个“某某商品即将缺货”的预测,可能立刻导致大量囤货,导致缺货成真;反过来,你预测“不会缺货”,也可能让消费者囤货意愿下降,结果一直不缺。决定论的世界里允许存在完备的规律,但规律如果包含人类对规律的认知与反应,就会形成难以闭合的循环。这也是为什么我始终对“宏观式全知预测”抱有怀疑——不是怀疑逻辑,而是怀疑系统是否真的可以旁观看待自己。

4.2 自由意志问题:决定论与道德责任的纠缠

有关自由意志的争论历史悠久。粗略地分,有三派:强决定论认为人没有自由意志,一切行为都是因果链条上的必然;自由意志论认为人类拥有真正的选择能力,世界的开放性是根本性的;相容论则试图调和二者,主张即便因果链条存在,只要行为出于自己的意图和理性反思,仍可称之为自由。

这个争论对做人是有影响的。如果一切选择都被预先决定,那“努力”“自律”这些概念会不会变成一场自欺欺人的演出?我倒觉得,就算走上决定论,也不意味着放弃责任。因为无论行为是不是预先决定,惩罚和奖赏、教育和激励本身依然是因果链条的一部分,会对未来的行为产生影响。你之所以改变,不是因为你“自由”,而是因为这个世界的规则本来就把“被说服、被教育、被影响”写进了演化剧本里。

随机建模在这里提供了一个别致的视角:我们在建模中引入随机性,不是在说自由意志赢得了物理定律,而是在说,当我们无法从底层完全预测一个人时,概率描述反而更能保留人的主体性和尊严。把行为看成带有概率分布的倾向,远比把它看成一条铁轨上的一个点要宽容得多。

4.3 从“真实随机”到“有效随机”:建模者的实用主义

到了建模落地阶段,我还发现“随机”这个词还有一个变体:有效随机。有效随机不关心世界本体到底是不是随机的,它只关心“在当前模型复杂度下,要不要把某个东西当作随机来处理”。如果一个变量对目标有影响,但你和业务方都付不起准确测量它的成本,那把它当作随机噪声,通常好过忽略它或者强行填充一个虚假的确定值。

这就是实用主义立场的价值。我们做模型,不是为了回答“上帝掷不掷骰子”的形而上问题,而是为了在有限信息、有限算力、有限时间下,产出最佳决策依据。有效随机是建模者与混沌世界达成的停火协议:你承认自己看不全棋盘,于是把看不全的部分用一个漂亮的概率分布包起来,送给决策端,让他们知道这一块是可波动的。其实很多数据分析师处理缺失值时的第一反应是删掉或者填平均值,但更有哲学素养的处理是:把缺失部分作为不确定性来源显式地放进模型里,让下游直接看到风险。

5. 实操视角:我在做模型时踩过的几个坑

5.1 把“模型假设”当成“世界真理”

我早期做模型时,最常犯的错就是把正态性假设当作普世真理。业务数据明明有长尾、有断尾,我还是要硬套正态分布,因为这样好算置信区间。结果模型在均值附近还不错,一到尾部就完全崩溃。严格来说,这并不是“数据违背了假设”,而是“我违背了随机建模的原则”——随机建模之所以是“建模”,就是因为它承认假设只是工具,不是真相。

后来我学乖了一件事:每个概率假设都要写一条可验证的检验规则。正态性假设用QQ图先测一测;独立性假设用自相关图先看一眼;平稳性假设用滚动均值铺一铺。如果你不愿意验证假设,那所谓随机建模无异于用漂亮的概率公式给虚假的确定性披上外衣。这既是对自己不负责,也是对业务方不负责。

5.2 忽略概率背后的人为设定

贝叶斯建模特别让我警惕的地方在于:先验分布可以和事实脱节。你选一个很强势的先验,哪怕数据不是很支持,后验也容易被带偏。这本来无所谓对错,因为先验是主观信念的表达,但如果你不告诉读者或者用户“这里包含了我的主观判断”,就显得不够诚实。

我见过一个量化模型,作者拍脑袋给某个参数设定了一个极窄的先验分布,结果后续所有预测都依赖这个拍脑袋参数。他把模型的输出写得像完全从数据中长出来的一样,却对自己的先验闭口不提。这种做法在哲学上非常不体面:随机建模之所以有效,正是因为它把“已知”和“未知”分得清清楚楚;一旦你悄悄把主观偏好塞进模型又拒不承认,这个分界线就崩了。

5.3 用随机过程拟合一切:过拟合与伪相关的教训

随机过程的最大魔力在于:它灵活到几乎能拟合任何形状的时间序列。但这份灵活是一把双刃剑。我给你一个完全随机的白噪声序列,你也能用高阶自回归模型把它拟合得头头是道,然而做样本外预测时,它立刻原形毕露。许多做金融量化的人反复被市场教训,就是因为把历史噪声当成了规律。

我的防坑策略非常简单:必须做样本外验证。把数据集按时间切分,前段拟合,后段验证,绝不做随意K折,因为时间序列一旦打乱顺序,就失去了时间结构,验证就变成了自欺。另外,我还会用一个“随机基准”做对照:把数据打乱生成的随机版本丢进同一个模型,如果模型在随机数据上也拟合得很好,就说明它只是善于记忆,而不是真找到了结构。这套“随机对照”的做法,可以说是把随机建模的哲学反用到模型验证上,用随机来识别伪规律。

6. 常见误区与思考工具速查

6.1 四个容易混淆的概念对比

我把这个领域里最容易混淆的几组概念整理成一张表,方便在讨论时使用:

概念核心含义常见误解建模中的作用
决定论一切事件由先前状态和规律唯一确定“承认决定论=完全知道未来”提供了追寻因果机制的动机
混沌确定系统中的极端初始敏感性“混沌=完全随机”解释了为什么确定模型也无法长期预测
内在随机世界在底层就以概率方式存在“概率是主观幻觉”为概率语言提供了本体论支持
认知随机由于信息不足而被迫使用概率描述“概率等于无知”给了有限信息和有限算力一个合法出口

这张表放在手边特别有用。每次和同事争论“这个噪声到底是真的还是假的”时,我都会先请他们说明自己说的是内在随机还是认知随机。这能省下大量无意义的争吵,把话题拉回到实际问题。

6.2 面对不确定性的三种可用态度

我会把理论上的态度归纳为三种,三种都有人成功。

第一种,坚决追因。也就是无论多复杂,我都相信背后存在确定规律,然后拼命去挖更多变量、更多数据、更高精度。这种态度适合那些真正有稳定物理机制的系统,比如卫星轨道、电路设计。在这种场合,你用概率模型反而显得偷懒。

第二种,坦然建模。不问世界是否真的随机,而是把不确定性当作现成的输入,用概率工具去产出分布结果。这种方式适合业务环境复杂、变量难以穷尽的领域,比如用户行为、宏观经济、疾病传播。它的核心是承认边界,并在边界内做到最优。

第三种,敬畏谦逊。把不确定性当作人类认知的天然天花板,对付它最好的办法不是预测准确,而是强化决策韧性。也就是不把宝全押在“对未来的判断”上,而是构建能适应多种未来的策略。这种态度适合那些混沌感极强的系统,比如长期战略、技术演进。

没有哪一种是绝对正确,因为建模本来就是“在特定问题约束下选择合适的抽象层级”。你用一个假设去描述世界,不是为了证明世界就是那样的,而是为了让下一次决策稍微聪明一点。

6.3 如何把这场博弈落到自己身上

我们很多人在工作和生活里,其实也同时扮演着决定论者和随机建模者。面对自己可控的事情,比如锻炼身体、学习技能,你最好相信决定论:你投入一点,就有一点反馈,因果链条清晰可见。但面对那些你控制不了的事情,比如市场波动、他人评价、运气成分占主导的结果,你最好切换到随机建模模式,不再苛求“每次都对”,而是设计一个让自己长期占优的流程。

所以当我再看到“秩序中的迷雾”这个题目时,我想到的不只是理论,而是一套实践哲学:在能控制的地方做减法、找因果,在不能控制的地方做分布、做容错。你不需要成为拉普拉斯妖,也不需要向随机性低头。你只需要做一个诚实且灵活的建模者,在已知和未知之间,找到自己能站稳的位置。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询