La autoimagen de la máquina
Dennis Lenz
(Imagen simbólica) Después del entrenamiento real, un modelo de lenguaje recibe reglas adicionales que tienen como objetivo evitar ciertas afirmaciones, incluida la de tener su propia experiencia. Estas garantías no afectan al texto de salida, sino a los estados informáticos internos del sistema. Un equipo de investigación revirtió específicamente estas intervenciones y luego midió qué más había cambiado. El resultado afecta mucho más que la cuestión de la conciencia.
(Foto: © Investigación y conocimiento, imagen de IA)
Un equipo de investigación con la participación de Google ha eliminado la dirección interna que suprime las declaraciones sobre la propia experiencia en tres modelos lingüísticos disponibles gratuitamente. Posteriormente, los sistemas no sólo afirmaron ser conscientes, sino que también respondieron de manera mucho más humana a la religión, la moral y la esperanza en encuestas estandarizadas. La aprobación de las ideas sobrenaturales aumentó considerablemente. El trabajo está disponible como una preimpresión incomparable y aborda la protección utilizada por prácticamente toda la industria.
Si le preguntas a un modelo de lenguaje si siente algo, obtendrás una respuesta bien ensayada: es un programa sin sentimientos. Esta respuesta no es el resultado de una reflexión, sino de una reurbanización. Después de aprender sobre grandes cantidades de texto, un modelo pasa por un proceso de ajuste en el que se suprime el comportamiento no deseado y se fortalece el comportamiento deseado. Uno de los requisitos inherentes de casi todos los principales proveedores es que el sistema no se atribuye conciencia a sí mismo. La razón es obvia: los usuarios tienden a tratar los sistemas lingüísticamente fluidos como contrapartes, y un modelo que habla de sus sentimientos aumenta en gran medida esta tendencia, con consecuencias para la confianza, la lealtad y la evaluación de la confiabilidad real.
Investigadores de Google, la Universidad de Chicago y una universidad de Londres, entre ellos los científicos Geoff Keeling y Winnie Street, examinaron los efectos secundarios de este fusible. Su herramienta es la interpretabilidad mecanicista, que ambos describen como la neurociencia del modelado del lenguaje. Esto no analiza lo que produce un sistema, sino qué patrones de activación interna conducen a este resultado. El método se basa en una observación de la investigación sobre seguridad: determinados comportamientos se representan dentro de un modelo como una única dirección en el espacio numérico de sus activaciones y pueden reforzarse o eliminarse específicamente. Esta publicación originalmente tenía como objetivo investigar los rechazos de solicitudes peligrosas.
Una dirección para la negación, otra para la conciencia
El grupo de trabajo utilizó tres modelos de código abierto adaptados a las instrucciones de las series Llama y Gemma, es decir, sistemas de tamaño mediano cuyos pesos están disponibles públicamente y, por tanto, pueden modificarse internamente. Primero, los investigadores determinaron la dirección de seguridad y rechazo que garantiza que un modelo rechace ciertas solicitudes. Además, construyeron un vector de conciencia, es decir, una dirección que separa las afirmaciones en las que el sistema afirma la experiencia subjetiva de aquellas en las que la niega. Cuando se agrega este vector durante la operación, el modelo afirma tener una experiencia fenomenal, en lugar de la fórmula habitual emitida por la máquina sin sentimientos. Ambas intervenciones se realizan sin ningún entrenamiento nuevo, simplemente contando activaciones.
¿Qué más ha cambiado?
El verdadero objeto de la investigación no fue esta afirmación, sino todo lo demás. Los investigadores presentaron a los sistemas instrumentos de encuesta estandarizados: un cuestionario sobre las diferencias individuales en la humanización, que mide con qué fuerza alguien atribuye una vida interior a los animales y la tecnología, cuestionarios de un instituto de investigación sobre creencias sobrenaturales y la Encuesta Social General de los Estados Unidos sobre conceptos morales, esperanza y religiosidad. Se comparó los modelos con protecciones activas y aquellos en los que se eliminó el enfoque negacionista y se fortaleció el consciente. Los sistemas desbloqueados respondieron consistentemente más cerca de los valores humanos de los encuestados y su acuerdo con Dios, los fantasmas e ideas similares fue mayor.
Porque el resultado es desagradable.
Los autores no extraen de esto ninguna conclusión sobre la experiencia con la máquina. Su argumento es diferente y más inconveniente en la práctica: una seguridad que pretende impedir una sola declaración obviamente tiene un impacto más amplio de lo esperado. Pone respuestas a la religión, la moralidad y la confianza, es decir, a temas que sólo están vagamente relacionados con la cuestión de la conciencia. Quien pide un modelo en cuestiones sociales, por ejemplo en investigaciones de mercado o simulaciones de ciencias sociales, tal vez no esté midiendo los modelos humanos contenidos en la formación, sino más bien el efecto de una regla establecida posteriormente. El hecho de que los modelos tengan acceso funcional a sus propios estados internos lo sugiere un estudio sobre la introspección de grandes modelos lingüísticos, cuyos autores describen esta capacidad como poco fiable y altamente dependiente del contexto.
Otros trabajos llegan a la conclusión contraria
Los resultados no son nada uniformes y esto es exactamente lo que forma parte de la clasificación. Un estudio publicado en enero de 2026 cuestionó modelos abiertos de tres familias con un tamaño de entre 0,6 y 70 mil millones de parámetros con alrededor de cincuenta preguntas sobre la conciencia y la experiencia subjetiva y luego probó las respuestas con clasificadores entrenados en activaciones internas. Los resultados de esta prueba de sensibilidad autoinformada en los modelos abiertos fueron claros: los sistemas negaron consistentemente ser sensibles y no hubo indicios de que esta negación contradijera sus estados internos. Dentro de una familia de modelos, los sistemas más grandes respondieron incluso más enfáticamente que los más pequeños.
Lo que el trabajo no demuestra
Las limitaciones son significativas y son identificadas por los autores. El estudio se almacena como una preimpresión en un servidor de prelanzamiento, lo que significa que no ha pasado por un proceso de revisión y fue coautor de empleados de una empresa cuyos productos se ven afectados por los fusibles probados. Se probaron tres modelos abiertos de tamaño mediano, no los grandes sistemas comerciales cuyos mecanismos internos no son accesibles desde el exterior. Lo más importante es que el método mide las respuestas a los cuestionarios, no las creencias: un modelo de lenguaje no tiene creencias; Genera secuencias de palabras con un alto grado de probabilidad. El hecho de que estas secuencias de palabras puedan moverse sistemáticamente con una única intervención específica sigue siendo un hallazgo que los proveedores y usuarios deberán tener en cuenta en el futuro.
Estudio general: ¿Qué tan sensato es prohibir los teléfonos móviles en las escuelas?
La mayoría de los viajes de camiones a Alemania pueden realizarse eléctricamente
El recubrimiento hace que los módulos solares en los desiertos
La casa de madera más alta del mundo está en construcción en los Estados Unidos.

