终于证明:Transformer真的在做贝叶斯享享学AI

7/31/2026

哥大终于证明:Transformer真的在做贝叶斯

构建贝叶斯风洞受控环境,已知真实后验闭式解且可证明无法记忆,解决天然数据集无解析后验、推理和记忆混淆的长期验证难题。

拆解出Transformer实现贝叶斯推理的统一几何机制,明确残差流、前馈网络与注意力模块的分工,揭示架构差异带来的性能本质分界。

本文主要研究方法是首先搭建了贝叶斯风洞受控实验环境,在该环境中真实后验分布存在闭式解析解,且从数学层面完全阻断模型的记忆路径,为Transformer贝叶斯推理能力验证提供公平可控的测试条件。研究团队通过多组对照实验,对比同等参数量与容量的多层感知机和Transformer的性能差异,再结合几何诊断手段,拆解出Transformer内部残差流、前馈网络与注意力模块的协同运行逻辑,追踪训练过程中低维权流形的演化轨迹,最终完整揭示其实现贝叶斯推理的底层几何机制。

贝叶斯推理原语:不同架构的可实现性对比

本图横向排布Transformer、Mamba(SSM)、LSTM三类主流序列模型,纵向对应随机存取绑定、信念传递、信念累积三类贝叶斯推理核心能力。通过绿、黄、红三色标识能力完成度:Transformer可完整覆盖三类能力,Mamba仅在随机存取绑定上存在慢运行、难扩展的局限,LSTM仅能完成信念累积,完全无法实现前两项核心推理原语,直观呈现不同序列架构在贝叶斯推理能力上的本质性能分界。

Mamba 发现隐马尔可夫模型信念空间的五角形几何结构

本图由两张主成分分析降维可视化子图组成,展示Mamba最终隐层的表征分布。左图用不同颜色标注样本对应的最可能HMM状态,呈现出6个边界清晰的聚类簇,精准对应HMM信念空间的五角形几何结构。右图以色条映射后验熵数值,直观呈现不同表征点的不确定性分布,图中标注的相关系数仅为0.02,佐证Mamba以极低误差完整复现了HMM滤波过程的信念空间几何特性。

V=20增量监督场景:模型表现与贝叶斯基准对比

本图对比展示了序列推理任务中不同模型的性能差异。左图呈现序列不同位置的熵值变化,Transformer的平均绝对误差仅0.0230,熵值曲线几乎和贝叶斯最优基准完全重合,而MLP的平均绝对误差达1.8540,全程远高于最优熵值线。右图统计熵校准绝对误差,Transformer的误差始终维持在接近0的极低水平,远低于设定的0.1比特目标阈值,MLP误差则随序列位置持续攀升,直观证明Transformer在该增量监督任务中,熵校准能力和推理表现远优于普通MLP,高度逼近贝叶斯理论最优上限。

本表统计了两类不同任务场景下,模型输出分布和理想贝叶斯分布的偏差表现。在双射任务中,全新键场景的分布偏差处于极低水平,重复键场景下的偏差更是几乎可以忽略不计。在隐马尔可夫模型的全序列位置任务中,整体偏差同样被控制在极小区间,所有场景下的误差都维持在很低的层级,直观印证了该模型的推理分布高度贴合贝叶斯最优结果,在各类实验场景中都能实现高精度的贝叶斯后验复现,充分展现出模型在对应推理任务上的优异表现。

Scroll for more