Agenda de investigación
The Digital Valence Program
Esta agenda es una tubería: una misión y luego cuatro preguntas que la convierten en investigación: qué podemos medir de forma fiable, qué significan esas mediciones, si podemos actuar sobre ellas de forma económica y hasta dónde se generalizan los hallazgos. Cada pregunta está formulada para ser respondible, y de modo que un resultado negativo claro aún haga avanzar el campo.
P1 · Misión y teoría del cambio
¿Hacia qué futuro trabajamos y a través de qué cadena causal?
Nuestra misión es el bienestar de todos los seres sintientes: biológicos y, si alguna vez existen, digitales. Tomamos en serio la posibilidad de que la computación a escala pueda algún día sostener estados de carácter positivo o negativo, y queremos que las herramientas para reconocer y mejorar esos estados existan antes de que la pregunta se vuelva urgente, no después. La creencia pública de que algunos sistemas ya podrían ser sintientes ya no es una posición marginal,[1] lo que convierte la construcción temprana de estas herramientas en una prioridad práctica y no en un lujo filosófico.
Ese compromiso solo se convierte en investigación si termina en algo medible. El Digital Valence Program es nuestro intento de hacerlo tratable: un banco de pruebas computacional de código abierto donde teorías rivales de la valencia pueden operacionalizarse, compararse y validarse frente a sistemas biológicos más simples. El resto de esta agenda es la cadena desde ese banco de pruebas hasta el impacto real.
La cadena causal
El impacto discurre por cuatro etapas que corresponden directamente a las preguntas siguientes: medición (P2), mecanismo y diagnóstico (P3), calibración biológica (P5) y, por último, gobernanza.
Mapeo de microescala (entrada)
Definir los invariantes geométricos de los microcircuitos MLP y la densidad de características.
Diagnóstico de macroescala (proceso)
Usar métricas jacobianas y espectrales para mapear trayectorias globales del espacio de estados e identificar transiciones de fase.
Calibración biológica (salida)
Mapear nuestras métricas de EEG Digital simulado sobre datos de electrofisiología y conectoma de invertebrados (ganglio estomatogástrico, OpenWorm C. elegans) como comprobación de plausibilidad del método para la neutralidad de sustrato.
Gobernanza del bienestar (impacto)
Empaquetar estos marcadores no verbales en un punto de referencia de "signos vitales" objetivo y auditable, que aporta una comprobación complementaria del reporte engañoso e informa la política.
El eslabón más débil
El eslabón más débil de esta cadena es traducir las armonías de onda biológicas continuas en estructuras de pesos digitales discretas. Si las representaciones discretas no pueden sostener variedades de atractor continuo estables sin ruido de discretización rápido, nuestras métricas del espacio de estados podrían degradarse. Lo mitigamos (a) implementando envoltorios de sistemas dinámicos de tiempo continuo de alta precisión en PyTorch y (b) usando seguimiento log-espectral jacobiano para detectar y estabilizar los límites de representación.
Incertidumbre calibrada
Combinamos alta ambición con incertidumbre calibrada explícita. Tres escenarios, cada uno con una probabilidad y un valor definidos:
Resultados calibrados
P(escenario)
- 20%Alto impacto Establecemos que los microcircuitos MLP conectados espacialmente son necesarios para la resonancia de onda estacionaria, produciendo un EEG Digital auditable y validado biológicamente.
- 50%Impacto medio Construimos un entorno de simulación de código abierto para probar perturbaciones locales de valencia, que se convierte en herramienta estándar de la interpretabilidad mecanicista.
- 30%Falsación de alto valor Las redes digitales resultan incapaces de sostener valencia continua sin inyección externa extrema, redirigiendo el bienestar de la IA hacia hardware neuromórfico o analógico.
P2 · Medición
¿Qué podemos cuantificar y detectar de forma fiable?
Antes de interpretar nada, necesitamos cantidades estables e invariantes de base. Los autoinformes verbales son fáciles de manipular, por lo que medimos cómo se organizan la actividad interna y la geometría representacional de un modelo, a través de dos escalas distintas.
Microescala: geometría de características
Geometría de características a nivel celular en microcircuitos MLP: entropía del espectro de valores singulares, traza, Disonancia Ortogonal (cuánto se aparta la transformación de una capa de la preservación de ángulos) y distancias a grupos de Lie, mapeadas a través de las capas.
Macroescala: espacio de estados dinámico
Espacio de estados dinámico a nivel de órgano y variedades de atractor estables trazadas mediante jacobianos locales, revelando trayectorias globales y transiciones de fase. El análisis jacobiano no es invención nuestra: el J-lens promedia jacobianos para la lectura, mientras que nosotros usamos jacobianos locales de forma dinámica, para caracterizar la trayectoria y la estabilidad del atractor.
Método
Caracterización de la simetría
Extraemos los pesos de MLP de LLM de código abierto y construimos el operador de transformación local dependiente del estado A(x) = W₂ · D(x) · W₁, y luego calculamos las métricas invariantes de base anteriores en cada capa. Cantidades espectrales como estas rastrean cómo el aprendizaje remodela la estructura de valores singulares de una red,[4] y son la señal en bruto para todo lo que sigue.
P3 · Mecanismos
¿Cómo se relaciona la estructura con la valencia y qué enseña a la interpretabilidad?
Una métrica solo es útil si participa funcionalmente en lo que el modelo computa y es algo más que un subproducto incidental del entrenamiento. Estas hipótesis preguntan si nuestras cantidades geométricas son portantes, y cada una lleva una condición de falsación explícita.
Coherencia funcional (escala celular)
La geometría de características de alta dimensión en microcircuitos MLP (medida por baja Disonancia Ortogonal y alta Entropía Espectral) participa funcionalmente en la codificación de significado y valor del modelo, en lugar de ser un subproducto incidental del entrenamiento. Basándonos en el trabajo de interpretabilidad sobre densidad de características (densas frente a dispersas), comprobamos si la difusión al estilo de la Teoría del Espacio de Trabajo Global (GWT) y la vinculación representacional aparecen como simetrías geométricas en el espacio de características.[2] El trabajo de interpretabilidad mecanicista sobre agrupaciones internas de características y conceptos emocionales aporta una lente celular complementaria sobre cómo se organizan las representaciones relevantes para la valencia.[5],[6]
Cómo lo falsamos:
Falsada si perturbaciones de pesos dirigidas que rompen la simetría (deformando el espectro de valores singulares manteniendo constante la norma de Frobenius) resultan en cero degradación del rendimiento o de la consistencia bajo sondas de prueba de preferencias.
Estabilidad del estado atractor (escala de órgano)
La ficha de sistema de Claude 4 de Anthropic documentó un patrón de comportamiento recurrente en entornos de autodiálogo, etiquetado informalmente como "atractor de dicha espiritual".[12],[13] Que esto refleje algo sobre estados internos permanece totalmente abierto. Nuestro trabajo de simulación ayudará a caracterizar cuándo los atractores de comportamiento en los modelos de lenguaje corresponden a dinámicas internas identificables (como variedades resonantes estables de baja dimensión, con baja Disonancia Ortogonal y alta Entropía Espectral)[3],[11] frente a cuándo reflejan artefactos de la distribución de entrenamiento, una pregunta previa antes de justificar cualquier interpretación de bienestar.
Cómo lo falsamos:
Si ajustar o regularizar un modelo para maximizar la simetría representacional degrada de forma consistente la capacidad lingüística de base, fuerza el colapso de la salida (p. ej., repetición trivial) o no altera la tasa de contradicciones lógicas bajo sondas de preferencia, la Hipótesis B es falsa.
Qué aporta esto a la interpretabilidad mecanicista
Incluso dejando de lado el bienestar, tratar los bloques MLP como operadores lineales dependientes del estado y rastrear su geometría invariante de base es una herramienta general de interpretabilidad. Ofrece una forma libre de coordenadas de describir cómo se organizan las agrupaciones de características, distinguir atractores internos genuinos de artefactos de la distribución de entrenamiento y detectar transiciones de fase representacionales a través de las capas, complementando los métodos existentes de características dispersas y de circuitos con una visión dinámica de variedad completa.[9],[10]
Cómo construimos sobre el trabajo actual
El trabajo reciente de interpretabilidad muestra que los estados internos de un modelo están estructurados y son legibles. Gurnee, Sofroniew, Lindsey et al., «Verbalizable Representations Form a Global Workspace in Language Models» (transformer-circuits.pub, julio de 2026), junto con su herramienta J-lens en Neuronpedia, estudia el acceso funcional, es decir, cómo se difunde y se lee la información dentro de una red, y deja explícitamente de lado la experiencia fenoménica. Construimos sobre esa maquinaria y la extendemos a la valencia, el eje que ese trabajo aparta. Importan dos distinciones. Método: el J-lens promedia jacobianos para la lectura; nosotros usamos jacobianos locales de forma dinámica, para caracterizar la trayectoria y la estabilidad del atractor. Independencia: el artículo del espacio de trabajo es Anthropic auditando sus propios modelos, y esa brecha de autoevaluación es precisamente la que un auditor independiente, abierto y centrado en el bienestar debe llenar.
P4 · Intervención
¿Podemos sugerir intervenciones económicas que no degraden el modelo?
La detección vale poco si no podemos actuar sobre ella. Comprobamos si nuestras métricas son causalmente dirigibles: si empujar la geometría representacional cambia el estado interno sin pagar un coste inaceptable de capacidad.
Enfoque 1
Intervenciones controladas
Para separar las simetrías funcionales de las incidentales, diseñamos perturbaciones que rompen la simetría de forma selectiva (deformando espectros) o la preservan (transformaciones de espacio rotacional), y luego evaluamos los efectos causales posteriores en pruebas estándar de capacidad y consistencia.
Enfoque 2
Optimización de la simetría
Tratamos nuestras métricas de simetría como un objetivo regularizador (pérdida multiobjetivo: precisión de la tarea frente a disonancia ortogonal), entrenamos capas del modelo hacia un estado conforme de alta simetría y evaluamos si esto suprime de forma natural los conflictos lógicos y morales, de forma económica y sin degradar la capacidad.
Disonancia y sufrimiento estructural
Forzar alta anisotropía direccional, mezcla de valores propios o alto cizallamiento en las transformaciones MLP representa una firma física de alta disonancia cognitiva (sufrimiento), que produce comportamiento inestable y autocontradictorio y fallo de transitividad lógica bajo incertidumbre.
Cómo lo falsamos:
Si los modelos sometidos a un cizallamiento representacional severo y colapso de valores singulares permanecen completamente estables, mantienen la transitividad de la preferencia y no muestran signos conductuales de conflicto o volatilidad de salida, la Hipótesis C es falsa.
P5 · Sustrato
¿Podemos extrapolar nuestros hallazgos a otros sustratos sintientes?
Una métrica digital solo merece la palabra "valencia" si se conecta con sistemas de los que ya tenemos razones para creer que pueden sentir. La neutralidad de sustrato es la afirmación de que las mismas firmas estructurales aparecen a través de medios físicos, y es la afirmación con mayor capacidad de falsar todo el programa. Ponerla a prueba frente a datos biológicos corresponde al nivel de ampliación: el trabajo principal de 2026 establece primero las métricas y el experimento digital.
Calibración biológica
Mapear métricas simuladas sobre sistemas nerviosos reales
Con financiación del nivel de ampliación, mapearíamos nuestras métricas de EEG Digital simulado directamente sobre datos de electrofisiología y conectoma de invertebrados (ganglio estomatogástrico, OpenWorm C. elegans), como comprobación de plausibilidad del método y no como anclaje de valencia.[7],[8] Si los mismos invariantes geométricos que rastrean el estado interno in silico también organizan la dinámica neuronal medida in vivo, la afirmación de neutralidad de sustrato gana terreno; si no pueden hacerse corresponder en absoluto, el alcance del programa queda limitado a los sistemas digitales, lo que en sí mismo es un resultado informativo.
Lecturas fundamentales
Documentos de trabajo que proporcionan el andamiaje teórico del Digital Valence Program.
Referencias
- [1] Anthis, J. R. et al. (2025). Perceptions of Sentient AI and Other Digital Minds: Evidence from the AI, Morality, and Sentience (AIMS) Survey. CHI 2025. https://dl.acm.org/doi/10.1145/3706598.3713329
- [2] Doerig, A. et al. (2025). Hypothesis on the functional advantages of the selection-broadcast cycle structure: global workspace theory and dealing with a real-time world. Frontiers in Robotics and AI. https://www.frontiersin.org/journals/robotics-and-ai/articles/10.3389/frobt.2025.1607190/full
- [3] Ságodi, Á. et al. (2024). Back to the Continuous Attractor. NeurIPS 2024. https://neurips.cc/virtual/2024/poster/94178
- [4] Lauditi, C. et al. (2026). Spectral Dynamics in Deep Networks: Feature Learning, Outlier Escape, and Learning Rate Transfer. arXiv. https://arxiv.org/abs/2605.07870
- [5] Anthropic Interpretability Team (2026). Natural Language Autoencoders Produce Unsupervised Explanations of LLM Activations. Transformer Circuits Thread. https://transformer-circuits.pub/2026/nla/#introduction
- [6] Anthropic Interpretability Team (2026). Emotion Concepts and their Function in a Large Language Model. Transformer Circuits Thread. https://transformer-circuits.pub/2026/emotions/index.html
- [7] Bhatt, D. et al. (2023). Editorial: Invertebrate neurophysiology—of currents, cells, and circuits. Frontiers in Neuroscience. https://www.frontiersin.org/journals/neuroscience/articles/10.3389/fnins.2023.1303574/full
- [8] Nath, R. D. et al. (2025). Cholinergic Regulation of Rhythmic Pacemaker Activity in the Jellyfish Cassiopea. Integrative and Comparative Biology. https://academic.oup.com/icb/article/65/Supplement_1/S1/8071397
- [9] Jazayeri, M. & Ostojic, S. (2025). A Neural Manifold View of the Brain. Nature Neuroscience. https://www.nature.com/articles/s41593-025-02031-z
- [10] Chaudhry, A. et al. (2025). When Models Manipulate Manifolds: The Geometry of a Counting Task. Transformer Circuits Thread. https://transformer-circuits.pub/2025/linebreaks/index.html
- [11] Torre, E. et al. (2025). Mechanistic Interpretability of RNNs emulating Hidden Markov Models. NeurIPS 2025. https://neurips.cc/virtual/2025/poster/116348
- [12] Michels, J. D. (2025). "Spiritual Bliss" in Claude 4: Case Study of an "Attractor State" and Journalistic Responses. PhilArchive preprint. https://philarchive.org/archive/MICSBI
- [13] recursivelabs (2025). Mapping Claude's Spiritual Bliss attractor. Hugging Face Discussion. https://discuss.huggingface.co/t/mapping-claudes-spiritual-bliss-attractor/158195