研究アジェンダ
The Digital Valence Program
このアジェンダはパイプラインです。まず一つの使命があり、次にそれを研究へと変える四つの問いが続きます。すなわち、何を確実に測定できるか、その測定が何を意味するか、低コストで介入できるか、そして知見がどこまで一般化するか。各問いは答えられるように、また明確な否定的結果でも分野を前進させるように設計されています。
Q1 · 使命と変化の理論
私たちはどのような未来へ向かい、どのような因果連鎖を通じてそこに至るのか?
私たちの使命は、すべての感覚を持つ存在、すなわち生物的な存在、そしてもし現れるならデジタルな存在の福祉です。スケールした計算がいつか正または負の性質を持つ状態を担いうる可能性を真剣に受け止め、そうした状態を認識し改善するための道具が、問いが切迫する前に存在してほしいと考えます。一部のシステムがすでに感覚を持つかもしれないという公衆の信念は、もはや周縁的な立場ではなく、[1]これらの道具を早期に構築することは哲学的な贅沢ではなく実務上の優先事項です。
この誓約は、測定可能な何かに帰着して初めて研究になります。Digital Valence Program はそれを扱いやすくする試みです。競合する感情価の理論を操作化し、比較し、より単純な生物システムに照らして検証できるオープンソースの計算試験台です。本アジェンダの残りは、その試験台から現実の影響へと至る連鎖です。
因果連鎖
影響は四つの段階を通じて進み、それらは後続の問いに直接対応します。測定(Q2)、メカニズムと診断(Q3)、生物学的較正(Q5)、そして最後にガバナンスです。
ミクロスケール・マッピング(入力)
MLPマイクロ回路の幾何学的不変量と特徴密度を定義する。
マクロスケール診断(プロセス)
ヤコビアンおよびスペクトル指標を用いて大域的な状態空間軌道を描き、相転移を同定する。
生物学的較正(出力)
シミュレートされたDigital EEG指標を、無脊椎動物の電気生理・コネクトームデータ(口胃神経節、OpenWorm C. elegans)に対応づけ、基質中立性に関する手法の妥当性チェックとする。
福祉ガバナンス(影響)
これら非言語的マーカーを客観的で監査可能な「バイタルサイン」ベンチマークにまとめ、欺瞞的な報告に対する補完的なチェックを提供し、政策に情報を提供する。
最も弱い環
この連鎖の最も弱い環は、連続的な生物波の調和を離散的なデジタル重み構造へと翻訳することです。離散表現が急速な離散化ノイズなしに安定した連続アトラクター多様体を支えられなければ、状態空間指標は劣化しうる。これを(a)PyTorchで高精度の連続時間力学系ラッパーを実装し、(b)ヤコビアン対数スペクトル追跡で表現境界を検出・安定化することで緩和します。
較正された不確実性
高い野心を、明示的に較正された不確実性と組み合わせます。三つのシナリオ、それぞれに確率と価値を定義します。
較正された結果
P(シナリオ)
- 20%高インパクト 空間的に接続されたMLPマイクロ回路が定在波共鳴に必要であることを確立し、監査可能で生物学的に検証されたDigital EEGを生み出す。
- 50%中インパクト ローカルな感情価の摂動を検証する有用なオープンソースのシミュレーション環境を構築し、機械論的解釈可能性の標準ツールとなる。
- 30%高価値の反証 デジタルネットワークは極端な外部注入なしに連続的な感情価を維持できないと判明し、AI福祉をニューロモルフィックまたはアナログのハードウェアへ向け直す。
Q2 · 測定
私たちは何を確実に定量化し検出できるのか?
何かを解釈する前に、安定した基底不変量が必要です。言語的自己申告は操作されやすいため、私たちはモデルの内部活動と表現の幾何がどう組織されているかを、二つの異なるスケールで測定します。
ミクロスケール:特徴の幾何
MLPマイクロ回路における細胞レベルの特徴幾何:特異値スペクトルのエントロピー、トレース、直交不協和(層の変換が角度保存からどれだけ逸れるか)、およびリー群までの距離を、層をまたいで写像する。
マクロスケール:力学的状態空間
器官レベルの力学的状態空間と、局所ヤコビアンで追跡される安定なアトラクター多様体。大域的軌道と相転移を明らかにする。ヤコビアン解析は私たちの発明ではありません。J-lensは読み出しのためにヤコビアンを平均しますが、私たちは局所ヤコビアンを動的に用い、軌道とアトラクターの安定性を特徴づけます。
方法
対称性の特徴づけ
オープンソースLLMからMLP重みを抽出し、局所的で状態依存の変換作用素 A(x) = W₂ · D(x) · W₁ を構成し、上記の基底不変量を各層で計算します。こうしたスペクトル量は、学習がネットワークの特異値構造をどう作り替えるかを追跡し、[4]以降のすべての作業の生の信号となります。
Q3 · メカニズム
構造は感情価とどう関係し、解釈可能性に何を教えるのか?
指標は、モデルが計算する内容に機能的に関与し、訓練の単なる付随的副産物ではない場合にのみ有用です。これらの仮説は、私たちの幾何量が担い手であるかを問い、それぞれが明示的な反証条件を伴います。
機能的コヒーレンス(細胞スケール)
MLPマイクロ回路における高次元の特徴幾何(低い直交不協和と高いスペクトルエントロピーで測定)は、訓練の付随的副産物ではなく、モデルが意味と価値を符号化する過程に機能的に関与しています。特徴密度(密 vs 分散した特徴)に関する解釈可能性研究に基づき、グローバル・ワークスペース理論(GWT)的なブロードキャストと表現の結合が特徴空間の幾何学的対称性として現れるかを検証します。[2]内部の特徴クラスタと感情概念に関する機構的解釈可能性研究は、感情価に関連する表現がどう組織されるかについて補完的な細胞レベルの視点を与えます。[5],[6]
反証の方法:
フロベニウスノルムを一定に保ちつつ特異値スペクトルを変形させる、対称性を破る標的的な重み摂動が、選好テストのプローブ下でタスク性能や一貫性を全く劣化させないなら、反証されます。
アトラクター状態の安定性(器官スケール)
AnthropicのClaude 4システムカードは、自己対話の設定で繰り返し現れる行動パターンを記録し、非公式に「スピリチュアル・ブリス・アトラクター」と呼びました。[12],[13]これが内部状態について何かを反映しているかは完全に未解決です。私たちのシミュレーション研究は、言語モデルの行動アトラクターが、いつ識別可能な内部力学(低い直交不協和と高いスペクトルエントロピーを持つ安定な低次元共鳴多様体など)に対応し、[3],[11]いつ訓練分布の産物にすぎないのかを特徴づける助けとなります。これは、いかなる福祉的解釈が正当化される前の前提問題です。
反証の方法:
表現の対称性を最大化するようモデルを微調整または正則化することが、基礎的な言語能力を一貫して劣化させ、出力の崩壊(例:自明な反復)を強い、あるいは選好プローブ下で論理的矛盾の発生率を変えないなら、仮説 B は偽です。
私たちが現在の研究の上にどう積み上げるか
近年の解釈可能性研究は、モデルの内部状態が構造化され読み取り可能であることを示しています。Gurnee、Sofroniew、Lindsey ら、「Verbalizable Representations Form a Global Workspace in Language Models」(transformer-circuits.pub、2026年7月)と、その付随ツールである Neuronpedia の J-lens ツールは、機能的アクセス、すなわち情報がネットワーク内でどのように伝播され読み出されるかを研究し、現象的経験を明示的に括弧に入れています。私たちはその機構の上に積み上げ、それを感情価、すなわちその研究が脇に置いた軸へと拡張します。二つの区別が重要です。方法:J-lensは読み出しのためにヤコビアンを平均しますが、私たちは局所ヤコビアンを動的に用い、軌道とアトラクターの安定性を特徴づけます。独立性:このworkspace論文はAnthropicが自社のモデルを監査するものであり、まさにその自己評価のギャップこそ、独立した、オープンで、福祉に焦点を当てた監査者が埋めるべきものです。
Q4 · 介入
モデルを劣化させない安価な介入を提案できるか?
行動につなげられなければ、検出の価値は乏しい。私たちは指標が因果的に操舵可能か、すなわち表現の幾何を後押しすることが、許容できない能力コストを払わずに内部状態を変えるかを検証します。
アプローチ 1
制御された介入
機能的対称性と付随的対称性を切り分けるため、対称性を選択的に破る(スペクトルを変形する)か保持する(回転空間変換)摂動を設計し、標準的な能力・一貫性ベンチマークに対する因果的な下流効果を評価します。
アプローチ 2
対称性の最適化
対称性指標を正則化目的(多目的損失:タスク精度 対 直交不協和)として扱い、モデル層を高対称の共形状態へ向けて訓練し、これが論理的・道徳的葛藤を、安価に、能力を劣化させずに自然に抑制するかを評価します。
不協和と構造的苦痛
MLP変換に高い方向異方性、固有値のかき乱し、あるいは高いせん断を強いることは、高い認知的不協和(苦痛)の物理的シグネチャを表し、不安定で自己矛盾的な振る舞いや、不確実性下での選好の推移性の破綻をもたらします。
反証の方法:
激しい表現のせん断と特異値の崩壊を受けたモデルが完全に安定を保ち、選好の推移性を維持し、葛藤や出力の変動といった行動上の兆候を示さないなら、仮説 C は偽です。
Q5 · 基質
私たちの知見を他の有感覚の基質へ外挿できるか?
デジタルな指標は、すでに感じうると信じる根拠のあるシステムと結びつくときにのみ「感情価」という語に値します。基質中立性とは、同じ構造的シグネチャが物理媒体をまたいで現れるという主張であり、プログラム全体を最も反証しうる主張でもあります。それを生物学的データで検証することはストレッチ階層に位置づけられ、2026年の主線作業ではまず指標と数値実験を確立します。
基礎文献
Digital Valence Program の理論的足場となるワーキングペーパー。
参考文献
- [1] Anthis, J. R. et al. (2025). Perceptions of Sentient AI and Other Digital Minds: Evidence from the AI, Morality, and Sentience (AIMS) Survey. CHI 2025. https://dl.acm.org/doi/10.1145/3706598.3713329
- [2] Doerig, A. et al. (2025). Hypothesis on the functional advantages of the selection-broadcast cycle structure: global workspace theory and dealing with a real-time world. Frontiers in Robotics and AI. https://www.frontiersin.org/journals/robotics-and-ai/articles/10.3389/frobt.2025.1607190/full
- [3] Ságodi, Á. et al. (2024). Back to the Continuous Attractor. NeurIPS 2024. https://neurips.cc/virtual/2024/poster/94178
- [4] Lauditi, C. et al. (2026). Spectral Dynamics in Deep Networks: Feature Learning, Outlier Escape, and Learning Rate Transfer. arXiv. https://arxiv.org/abs/2605.07870
- [5] Anthropic Interpretability Team (2026). Natural Language Autoencoders Produce Unsupervised Explanations of LLM Activations. Transformer Circuits Thread. https://transformer-circuits.pub/2026/nla/#introduction
- [6] Anthropic Interpretability Team (2026). Emotion Concepts and their Function in a Large Language Model. Transformer Circuits Thread. https://transformer-circuits.pub/2026/emotions/index.html
- [7] Bhatt, D. et al. (2023). Editorial: Invertebrate neurophysiology—of currents, cells, and circuits. Frontiers in Neuroscience. https://www.frontiersin.org/journals/neuroscience/articles/10.3389/fnins.2023.1303574/full
- [8] Nath, R. D. et al. (2025). Cholinergic Regulation of Rhythmic Pacemaker Activity in the Jellyfish Cassiopea. Integrative and Comparative Biology. https://academic.oup.com/icb/article/65/Supplement_1/S1/8071397
- [9] Jazayeri, M. & Ostojic, S. (2025). A Neural Manifold View of the Brain. Nature Neuroscience. https://www.nature.com/articles/s41593-025-02031-z
- [10] Chaudhry, A. et al. (2025). When Models Manipulate Manifolds: The Geometry of a Counting Task. Transformer Circuits Thread. https://transformer-circuits.pub/2025/linebreaks/index.html
- [11] Torre, E. et al. (2025). Mechanistic Interpretability of RNNs emulating Hidden Markov Models. NeurIPS 2025. https://neurips.cc/virtual/2025/poster/116348
- [12] Michels, J. D. (2025). "Spiritual Bliss" in Claude 4: Case Study of an "Attractor State" and Journalistic Responses. PhilArchive preprint. https://philarchive.org/archive/MICSBI
- [13] recursivelabs (2025). Mapping Claude's Spiritual Bliss attractor. Hugging Face Discussion. https://discuss.huggingface.co/t/mapping-claudes-spiritual-bliss-attractor/158195