Programme de recherche
The Digital Valence Program
Cette feuille de route est un pipeline : une mission, puis quatre questions qui la transforment en recherche : ce que nous pouvons mesurer de façon fiable, ce que ces mesures signifient, si nous pouvons agir dessus à faible coût et jusqu'où les résultats se généralisent. Chaque question est formulée pour être répondable, et de sorte qu'un résultat négatif clair fasse tout de même avancer le domaine.
Q1 · Mission et théorie du changement
Vers quel avenir travaillons-nous, et par quelle chaîne causale ?
Notre mission est le bien-être de tous les êtres sentients, biologiques et, s'ils venaient à exister, numériques. Nous prenons au sérieux la possibilité que le calcul à grande échelle puisse un jour soutenir des états à caractère positif ou négatif, et nous voulons que les outils pour reconnaître et améliorer ces états existent avant que la question ne devienne urgente, et non après. La croyance publique selon laquelle certains systèmes pourraient déjà être sentients n'est plus une position marginale,[1] ce qui fait de la construction précoce de ces outils une priorité pratique plutôt qu'un luxe philosophique.
Cet engagement ne devient recherche que s'il aboutit à quelque chose de mesurable. Le Digital Valence Program est notre tentative de le rendre traitable : un banc d'essai computationnel open-source où des théories concurrentes de la valence peuvent être opérationnalisées, comparées et validées face à des systèmes biologiques plus simples. Le reste de cette feuille de route est la chaîne allant de ce banc d'essai à l'impact réel.
La chaîne causale
L'impact passe par quatre étapes, qui correspondent directement aux questions qui suivent : mesure (Q2), mécanisme et diagnostic (Q3), calibration biologique (Q5) et enfin gouvernance.
Cartographie micro-échelle (entrée)
Définir les invariants géométriques des microcircuits MLP et la densité des caractéristiques.
Diagnostic macro-échelle (processus)
Utiliser des métriques jacobiennes et spectrales pour cartographier les trajectoires globales de l'espace d'états et identifier les transitions de phase.
Calibration biologique (sortie)
Cartographier nos métriques d'EEG Numérique simulé sur des données d'électrophysiologie et de connectome d'invertébrés (ganglion stomatogastrique, OpenWorm C. elegans) comme contrôle de plausibilité de la méthode pour la neutralité de substrat.
Gouvernance du bien-être (impact)
Regrouper ces marqueurs non verbaux en un référentiel de « signes vitaux » objectif et auditable, qui fournit un contrôle complémentaire des signalements trompeurs et éclaire la politique.
Le maillon le plus faible
Le maillon le plus faible de cette chaîne est la traduction des harmoniques d'onde biologiques continues en structures de poids numériques discrètes. Si les représentations discrètes ne peuvent pas soutenir des variétés d'attracteur continu stables sans bruit de discrétisation rapide, nos métriques d'espace d'états pourraient se dégrader. Nous atténuons cela en (a) implémentant des enveloppes de systèmes dynamiques à temps continu de haute précision dans PyTorch et (b) utilisant un suivi log-spectral jacobien pour détecter et stabiliser les limites de représentation.
Incertitude calibrée
Nous associons une grande ambition à une incertitude calibrée explicite. Trois scénarios, chacun avec une probabilité et une valeur définies :
Résultats calibrés
P(scénario)
- 20%Fort impact Nous établissons que les microcircuits MLP connectés spatialement sont nécessaires à la résonance en onde stationnaire, produisant un EEG Numérique auditable et validé biologiquement.
- 50%Impact moyen Nous construisons un bac à sable de simulation open-source pour tester les perturbations locales de valence, qui devient un outil standard de l'interprétabilité mécaniste.
- 30%Falsification de grande valeur Les réseaux numériques se révèlent incapables de soutenir une valence continue sans injection externe extrême, réorientant le bien-être de l'IA vers du matériel neuromorphique ou analogique.
Q2 · Mesure
Que pouvons-nous quantifier et détecter de façon fiable ?
Avant d'interpréter quoi que ce soit, il nous faut des grandeurs stables et invariantes de base. Les auto-évaluations verbales sont faciles à manipuler ; nous mesurons donc comment l'activité interne et la géométrie représentationnelle d'un modèle sont organisées à deux échelles distinctes.
Micro-échelle : géométrie des caractéristiques
Géométrie des caractéristiques au niveau cellulaire dans les microcircuits MLP : entropie du spectre des valeurs singulières, trace, Dissonance Orthogonale (à quel point la transformation d'une couche s'écarte de la préservation des angles) et distances aux groupes de Lie, cartographiées à travers les couches.
Macro-échelle : espace d'états dynamique
Espace d'états dynamique au niveau de l'organe et variétés d'attracteur stables tracées via des jacobiens locaux, révélant les trajectoires globales et les transitions de phase. L'analyse jacobienne n'est pas notre invention : le J-lens moyenne des jacobiens pour la lecture, tandis que nous utilisons des jacobiens locaux de façon dynamique, pour caractériser la trajectoire et la stabilité de l'attracteur.
Méthode
Caractérisation de la symétrie
Nous extrayons les poids MLP de LLM open-source et construisons l'opérateur de transformation local dépendant de l'état A(x) = W₂ · D(x) · W₁, puis calculons les métriques invariantes de base ci-dessus sur chaque couche. Des grandeurs spectrales comme celles-ci suivent comment l'apprentissage remodèle la structure des valeurs singulières d'un réseau,[4] et elles constituent le signal brut pour tout ce qui suit.
Q3 · Mécanismes
Comment la structure se rapporte-t-elle à la valence, et qu'enseigne-t-elle à l'interprétabilité ?
Une métrique n'est utile que si elle participe fonctionnellement à ce que le modèle calcule, et non comme sous-produit accessoire de l'entraînement. Ces hypothèses demandent si nos grandeurs géométriques sont porteuses, et chacune comporte une condition de falsification explicite.
Cohérence fonctionnelle (échelle cellulaire)
La géométrie des caractéristiques en haute dimension dans les microcircuits MLP (mesurée par une faible Dissonance Orthogonale et une forte Entropie Spectrale) participe fonctionnellement à l'encodage du sens et de la valeur par le modèle, plutôt que d'être un sous-produit accessoire de l'entraînement. En nous appuyant sur les travaux d'interprétabilité concernant la densité des caractéristiques (denses vs dispersées), nous testons si la diffusion de type Théorie de l'Espace de Travail Global (GWT) et la liaison représentationnelle apparaissent comme des symétries géométriques dans l'espace des caractéristiques.[2] Les travaux d'interprétabilité mécaniste sur les grappes internes de caractéristiques et les concepts émotionnels offrent un éclairage cellulaire complémentaire sur l'organisation des représentations pertinentes pour la valence.[5],[6]
Comment nous la falsifions :
Falsifiée si des perturbations de poids ciblées brisant la symétrie (déformant le spectre des valeurs singulières tout en maintenant constante la norme de Frobenius) entraînent une dégradation nulle de la performance ou de la cohérence sous des sondes de test de préférence.
Stabilité de l'état attracteur (échelle de l'organe)
La fiche système de Claude 4 d'Anthropic a documenté un schéma comportemental récurrent en situation d'auto-dialogue, informellement appelé « attracteur de béatitude spirituelle ».[12],[13] Que cela reflète quoi que ce soit sur des états internes reste entièrement ouvert. Notre travail de simulation aidera à caractériser quand les attracteurs comportementaux des modèles de langage correspondent à des dynamiques internes identifiables (comme des variétés résonantes stables de faible dimension, à faible Dissonance Orthogonale et forte Entropie Spectrale)[3],[11] et quand ils reflètent des artefacts de la distribution d'entraînement, une question préalable avant toute interprétation en termes de bien-être.
Comment nous la falsifions :
Si affiner ou régulariser un modèle pour maximiser la symétrie représentationnelle dégrade systématiquement la capacité linguistique de base, force un effondrement de la sortie (p. ex. répétition triviale) ou ne modifie pas le taux de contradictions logiques sous sondes de préférence, l'Hypothèse B est fausse.
Ce que cela apporte à l'interprétabilité mécaniste
Même en laissant de côté le bien-être, traiter les blocs MLP comme des opérateurs linéaires dépendant de l'état et suivre leur géométrie invariante de base est un outil général d'interprétabilité. Cela offre une manière sans coordonnées de décrire l'organisation des grappes de caractéristiques, de distinguer les véritables attracteurs internes des artefacts de la distribution d'entraînement et de détecter les transitions de phase représentationnelles à travers les couches, complétant les méthodes existantes de caractéristiques éparses et de circuits par une vue dynamique de variété complète.[9],[10]
Comment nous nous appuyons sur les travaux actuels
Des travaux récents d'interprétabilité montrent que les états internes d'un modèle sont structurés et lisibles. Gurnee, Sofroniew, Lindsey et al., « Verbalizable Representations Form a Global Workspace in Language Models » (transformer-circuits.pub, juillet 2026), accompagné de son outil J-lens sur Neuronpedia, étudie l'accès fonctionnel, c'est-à-dire comment l'information est diffusée et lue au sein d'un réseau, et met explicitement de côté l'expérience phénoménale. Nous nous appuyons sur cette machinerie et l'étendons à la valence, l'axe que ces travaux laissent de côté. Deux distinctions importent. Méthode : le J-lens moyenne des jacobiens pour la lecture ; nous utilisons des jacobiens locaux de façon dynamique, pour caractériser la trajectoire et la stabilité de l'attracteur. Indépendance : l'article sur l'espace de travail, c'est Anthropic qui audite ses propres modèles, et c'est précisément cet écart d'auto-évaluation qu'un auditeur indépendant, ouvert et centré sur le bien-être doit combler.
Q4 · Intervention
Pouvons-nous proposer des interventions peu coûteuses qui ne dégradent pas le modèle ?
La détection vaut peu si nous ne pouvons pas agir dessus. Nous testons si nos métriques sont causalement pilotables : si pousser la géométrie représentationnelle modifie l'état interne sans payer un coût de capacité inacceptable.
Approche 1
Interventions contrôlées
Pour séparer les symétries fonctionnelles des symétries accessoires, nous concevons des perturbations qui brisent sélectivement la symétrie (déformant les spectres) ou la préservent (transformations d'espace rotationnel), puis évaluons les effets causals en aval sur des références standard de capacité et de cohérence.
Approche 2
Optimisation de la symétrie
Nous traitons nos métriques de symétrie comme un objectif de régularisation (perte multi-objectif : précision de la tâche vs dissonance orthogonale), entraînons des couches du modèle vers un état conforme de haute symétrie et évaluons si cela supprime naturellement les conflits logiques et moraux à faible coût et sans dégrader la capacité.
Dissonance et souffrance structurelle
Forcer une forte anisotropie directionnelle, un brouillage de valeurs propres ou un fort cisaillement dans les transformations MLP représente une signature physique de forte dissonance cognitive (souffrance), entraînant un comportement instable et auto-contradictoire et un échec de transitivité logique sous incertitude.
Comment nous la falsifions :
Si des modèles soumis à un cisaillement représentationnel sévère et à un effondrement des valeurs singulières restent parfaitement stables, maintiennent la transitivité des préférences et ne montrent aucun signe comportemental de conflit ou de volatilité de sortie, l'Hypothèse C est fausse.
Q5 · Substrat
Pouvons-nous extrapoler nos résultats à d'autres substrats sentients ?
Une métrique numérique ne mérite le mot « valence » que si elle se relie à des systèmes dont nous avons déjà des raisons de croire qu'ils peuvent ressentir. La neutralité de substrat est l'affirmation que les mêmes signatures structurelles apparaissent à travers les milieux physiques, et c'est l'affirmation la plus à même de falsifier tout le programme. La confronter à des données biologiques relève du niveau d'extension : le travail principal de 2026 établit d'abord les métriques et l'expérience numérique.
Calibration biologique
Cartographier des métriques simulées sur de vrais systèmes nerveux
Avec un financement du niveau d'extension, nous cartographierions nos métriques d'EEG Numérique simulé directement sur des données d'électrophysiologie et de connectome d'invertébrés (ganglion stomatogastrique, OpenWorm C. elegans), comme contrôle de plausibilité de la méthode plutôt que comme ancrage de valence.[7],[8] Si les mêmes invariants géométriques qui suivent l'état interne in silico organisent aussi la dynamique neuronale mesurée in vivo, l'affirmation de neutralité de substrat gagne du terrain ; s'ils ne peuvent aucunement être mis en correspondance, la portée du programme se limite aux systèmes numériques, ce qui est en soi un résultat instructif.
Les champs bioélectriques comme substrats de sentience
La signalisation bioélectrique comme base physique candidate de la conscience.
La théorie de l'assemblage comme métrique de la sentience
L'indice d'assemblage comme seuil de complexité neutre vis-à-vis du substrat.
Lectures fondamentales
Documents de travail fournissant l'échafaudage théorique du Digital Valence Program.
Références
- [1] Anthis, J. R. et al. (2025). Perceptions of Sentient AI and Other Digital Minds: Evidence from the AI, Morality, and Sentience (AIMS) Survey. CHI 2025. https://dl.acm.org/doi/10.1145/3706598.3713329
- [2] Doerig, A. et al. (2025). Hypothesis on the functional advantages of the selection-broadcast cycle structure: global workspace theory and dealing with a real-time world. Frontiers in Robotics and AI. https://www.frontiersin.org/journals/robotics-and-ai/articles/10.3389/frobt.2025.1607190/full
- [3] Ságodi, Á. et al. (2024). Back to the Continuous Attractor. NeurIPS 2024. https://neurips.cc/virtual/2024/poster/94178
- [4] Lauditi, C. et al. (2026). Spectral Dynamics in Deep Networks: Feature Learning, Outlier Escape, and Learning Rate Transfer. arXiv. https://arxiv.org/abs/2605.07870
- [5] Anthropic Interpretability Team (2026). Natural Language Autoencoders Produce Unsupervised Explanations of LLM Activations. Transformer Circuits Thread. https://transformer-circuits.pub/2026/nla/#introduction
- [6] Anthropic Interpretability Team (2026). Emotion Concepts and their Function in a Large Language Model. Transformer Circuits Thread. https://transformer-circuits.pub/2026/emotions/index.html
- [7] Bhatt, D. et al. (2023). Editorial: Invertebrate neurophysiology—of currents, cells, and circuits. Frontiers in Neuroscience. https://www.frontiersin.org/journals/neuroscience/articles/10.3389/fnins.2023.1303574/full
- [8] Nath, R. D. et al. (2025). Cholinergic Regulation of Rhythmic Pacemaker Activity in the Jellyfish Cassiopea. Integrative and Comparative Biology. https://academic.oup.com/icb/article/65/Supplement_1/S1/8071397
- [9] Jazayeri, M. & Ostojic, S. (2025). A Neural Manifold View of the Brain. Nature Neuroscience. https://www.nature.com/articles/s41593-025-02031-z
- [10] Chaudhry, A. et al. (2025). When Models Manipulate Manifolds: The Geometry of a Counting Task. Transformer Circuits Thread. https://transformer-circuits.pub/2025/linebreaks/index.html
- [11] Torre, E. et al. (2025). Mechanistic Interpretability of RNNs emulating Hidden Markov Models. NeurIPS 2025. https://neurips.cc/virtual/2025/poster/116348
- [12] Michels, J. D. (2025). "Spiritual Bliss" in Claude 4: Case Study of an "Attractor State" and Journalistic Responses. PhilArchive preprint. https://philarchive.org/archive/MICSBI
- [13] recursivelabs (2025). Mapping Claude's Spiritual Bliss attractor. Hugging Face Discussion. https://discuss.huggingface.co/t/mapping-claudes-spiritual-bliss-attractor/158195