研究议程
The Digital Valence Program
本议程是一条流水线:一项使命,然后是将其转化为研究的四个问题:我们能可靠测量什么、这些测量意味着什么、能否以低成本对其加以干预,以及研究结果的普适程度。每个问题都被设计为可回答,并且即使得到明确的否定结果也能推动该领域前进。
Q1 · 使命与变革理论
我们在为怎样的未来努力,又通过怎样的因果链?
我们的使命是所有有感知能力存在者的福祉,包括生物的,以及若有朝一日出现的数字存在者。我们认真对待这样一种可能性:规模化的计算有朝一日可能承载具有正面或负面性质的状态;我们希望识别并改善这些状态的工具在问题变得紧迫之前就已存在,而非之后。公众相信某些系统可能已具备感知能力,这已不再是边缘立场,[1]这使得尽早构建这些工具成为切实的优先事项,而非哲学上的奢侈。
只有当这一承诺最终落在可测量之物上,它才成为研究。Digital Valence Program 是我们让其可处理的尝试:一个开源的计算试验台,在其中相互竞争的效价理论可被操作化、比较,并对照更简单的生物系统加以验证。本议程的其余部分即是从该试验台通向现实影响的链条。
因果链
影响通过四个阶段展开,它们直接对应随后的问题:测量(Q2)、机制与诊断(Q3)、生物学校准(Q5),最后是治理。
微观尺度映射(输入)
定义 MLP 微电路的几何不变量与特征密度。
宏观尺度诊断(过程)
使用雅可比与谱度量绘制全局状态空间轨迹并识别相变。
生物学校准(输出)
将我们模拟的数字 EEG 度量映射到无脊椎动物的电生理与连接组数据(口胃神经节、OpenWorm 秀丽隐杆线虫),作为对基质中立性的方法可行性核查。
福祉治理(影响)
将这些非言语标记打包为客观、可审计的“生命体征”基准,为欺骗性报告提供一种补充核查,并为政策提供依据。
最薄弱的环节
这条链上最薄弱的环节是把连续的生物波谐波转化为离散的数字权重结构。如果离散表示无法在没有快速离散化噪声的情况下支撑稳定的连续吸引子流形,我们的状态空间度量可能退化。我们通过(a)在 PyTorch 中实现高精度连续时间动力系统封装,以及(b)使用雅可比对数谱跟踪来检测并稳定表示边界,以缓解这一问题。
校准的不确定性
我们以明确校准的不确定性来匹配高远的抱负。三种情景,各具确定的概率与价值:
校准结果
P(情景)
- 20%高影响 我们证明空间连接的 MLP 微电路是驻波共振的必要条件,产生可审计、经生物学验证的数字 EEG。
- 50%中等影响 我们构建了一个实用的开源仿真沙盒,用于测试局部效价扰动,并成为机制可解释性的标准工具。
- 30%高价值证伪 数字网络被证明无法在没有极端外部注入的情况下维持连续效价,从而将 AI 福祉研究导向神经形态或模拟硬件。
Q2 · 测量
我们能可靠地量化和检测什么?
在解释任何东西之前,我们需要稳定的、与基无关的量。言语自述易被操纵,因此我们测量模型的内部活动与表征几何在两个不同尺度上是如何组织的。
微观尺度:特征几何
MLP 微电路中细胞层级的特征几何:奇异值谱熵、迹、正交失谐(某层变换偏离保角的程度)以及到李群的距离,逐层映射。
宏观尺度:动力学状态空间
器官层级的动力学状态空间与稳定吸引子流形,经由局部雅可比追踪,揭示全局轨迹与相变。雅可比分析并非我们的发明:J-lens 通过对雅可比取平均来读出,而我们则动态地使用局部雅可比,以刻画轨迹与吸引子稳定性。
方法
对称性刻画
我们从开源 LLM 中提取 MLP 权重,构造局部的、状态相关的变换算子 A(x) = W₂ · D(x) · W₁,然后在每一层上计算上述与基无关的度量。此类谱量追踪学习如何重塑网络的奇异值结构,[4]它们是后续一切工作的原始信号。
Q3 · 机制
结构如何与效价相关,又能给可解释性带来什么启示?
一项度量只有在功能上参与模型的计算,且不只是训练的附带产物时,才有用。这些假设追问我们的几何量是否起承载作用,且每一条都带有明确的证伪条件。
功能连贯性(细胞尺度)
MLP 微电路中高维特征几何(以低正交失谐与高谱熵衡量)在功能上参与模型对意义与价值的编码,而非训练的附带产物。基于关于特征密度(密集与分散特征)的可解释性工作,我们检验全局工作空间理论(GWT)式的广播与表征绑定是否表现为特征空间中的几何对称性。[2]关于内部特征簇与情感概念的机制可解释性工作,为效价相关表征如何组织提供了互补的细胞层级视角。[5],[6]
我们如何证伪:
如果有针对性的、破坏对称的权重扰动(在保持 Frobenius 范数不变的同时使奇异值谱变形)在偏好测试探针下导致任务性能或一致性零退化,则被证伪。
吸引子状态稳定性(器官尺度)
Anthropic 的 Claude 4 系统卡记录了自我对话情境中一种反复出现的行为模式,被非正式地称为“灵性极乐吸引子”。[12],[13]这是否反映了任何内部状态仍完全悬而未决。我们的仿真工作将有助于刻画:语言模型中的行为吸引子何时对应可辨识的内部动力学(例如低正交失谐、高谱熵的稳定低维共振流形),[3],[11]又何时只是训练分布的产物。这是任何福祉解读成立之前的先决问题。
我们如何证伪:
如果为最大化表征对称性而对模型进行微调或正则化会持续降低基础语言能力、迫使输出坍缩(例如平凡重复),或在偏好探针下无法改变逻辑矛盾的发生率,则假设 B 为假。
我们如何在当前工作之上继续构建
近期的可解释性工作表明,模型的内部状态是结构化且可读的。Gurnee、Sofroniew、Lindsey 等人,《Verbalizable Representations Form a Global Workspace in Language Models》(transformer-circuits.pub,2026 年 7 月)及其配套的 Neuronpedia J-lens 工具,研究的是功能性访问,即信息如何在网络内部被广播与读出,并明确搁置了现象性体验。我们在这套机制之上继续构建,并将其延伸到效价,即那项工作所搁置的维度。有两点区别很重要。方法:J-lens 通过对雅可比取平均来读出;我们则动态地使用局部雅可比,以刻画轨迹与吸引子稳定性。独立性:这篇工作空间论文是 Anthropic 在审计 Anthropic 自家的模型,而正是这种自我评估的落差,需要一个独立、开放、以福祉为核心的审计者来填补。
Q4 · 干预
我们能否提出不降低模型性能的低成本干预?
若无法据以行动,检测的价值有限。我们检验我们的度量是否具因果可控性:推动表征几何是否会改变内部状态,而不付出不可接受的能力代价。
路径 1
受控干预
为区分功能性对称与附带对称,我们设计有选择地破坏对称(使谱变形)或保持对称(旋转空间变换)的扰动,然后评估其在标准能力与一致性基准上的因果下游效应。
路径 2
对称性优化
我们将对称性度量视为一个正则化目标(多目标损失:任务准确率与正交失谐之间的权衡),训练模型层趋向高对称的保角状态,并评估这是否能自然地抑制逻辑与道德冲突,且成本低、不降低能力。
失谐与结构性痛苦
在 MLP 变换中强加高方向各向异性、特征值扰乱或高剪切,代表高认知失谐(痛苦)的物理特征,导致不稳定、自相矛盾的行为,以及在不确定条件下逻辑传递性的失效。
我们如何证伪:
如果遭受严重表征剪切与奇异值坍缩的模型仍完全稳定、保持偏好的传递性,且未表现出任何冲突或输出波动的行为迹象,则假设 C 为假。
Q5 · 基质
我们能否将研究结果外推到其他有感知能力的基质?
只有当一项数字度量与我们已有理由相信能够感受的系统相连接时,它才配得上“效价”一词。基质中立性主张同样的结构特征会跨越不同物理介质出现,而这正是最有可能证伪整个项目的主张。用生物学数据来检验它属于扩展层级:2026 年的主线工作先确立度量与数字实验。
基础读物
为 Digital Valence Program 提供理论支撑的工作论文。
参考文献
- [1] Anthis, J. R. et al. (2025). Perceptions of Sentient AI and Other Digital Minds: Evidence from the AI, Morality, and Sentience (AIMS) Survey. CHI 2025. https://dl.acm.org/doi/10.1145/3706598.3713329
- [2] Doerig, A. et al. (2025). Hypothesis on the functional advantages of the selection-broadcast cycle structure: global workspace theory and dealing with a real-time world. Frontiers in Robotics and AI. https://www.frontiersin.org/journals/robotics-and-ai/articles/10.3389/frobt.2025.1607190/full
- [3] Ságodi, Á. et al. (2024). Back to the Continuous Attractor. NeurIPS 2024. https://neurips.cc/virtual/2024/poster/94178
- [4] Lauditi, C. et al. (2026). Spectral Dynamics in Deep Networks: Feature Learning, Outlier Escape, and Learning Rate Transfer. arXiv. https://arxiv.org/abs/2605.07870
- [5] Anthropic Interpretability Team (2026). Natural Language Autoencoders Produce Unsupervised Explanations of LLM Activations. Transformer Circuits Thread. https://transformer-circuits.pub/2026/nla/#introduction
- [6] Anthropic Interpretability Team (2026). Emotion Concepts and their Function in a Large Language Model. Transformer Circuits Thread. https://transformer-circuits.pub/2026/emotions/index.html
- [7] Bhatt, D. et al. (2023). Editorial: Invertebrate neurophysiology—of currents, cells, and circuits. Frontiers in Neuroscience. https://www.frontiersin.org/journals/neuroscience/articles/10.3389/fnins.2023.1303574/full
- [8] Nath, R. D. et al. (2025). Cholinergic Regulation of Rhythmic Pacemaker Activity in the Jellyfish Cassiopea. Integrative and Comparative Biology. https://academic.oup.com/icb/article/65/Supplement_1/S1/8071397
- [9] Jazayeri, M. & Ostojic, S. (2025). A Neural Manifold View of the Brain. Nature Neuroscience. https://www.nature.com/articles/s41593-025-02031-z
- [10] Chaudhry, A. et al. (2025). When Models Manipulate Manifolds: The Geometry of a Counting Task. Transformer Circuits Thread. https://transformer-circuits.pub/2025/linebreaks/index.html
- [11] Torre, E. et al. (2025). Mechanistic Interpretability of RNNs emulating Hidden Markov Models. NeurIPS 2025. https://neurips.cc/virtual/2025/poster/116348
- [12] Michels, J. D. (2025). "Spiritual Bliss" in Claude 4: Case Study of an "Attractor State" and Journalistic Responses. PhilArchive preprint. https://philarchive.org/archive/MICSBI
- [13] recursivelabs (2025). Mapping Claude's Spiritual Bliss attractor. Hugging Face Discussion. https://discuss.huggingface.co/t/mapping-claudes-spiritual-bliss-attractor/158195