Conciencia y comportamiento
Dennis Lenz
(Imagen simbólica) Los modelos de IA pueden reaccionar a cambios específicos con formulaciones similares al estrés. Su creación es objeto de investigación experimental. La interpretación depende esencialmente de experimentos de control adecuados. La existencia de una experiencia subjetiva no está determinada únicamente por los gastos descritos.
(Foto: © Investigación y conocimiento, imagen de IA)
Después de intervenciones específicas, los modelos de IA generan textos que parecen ser informes de dolor. Un proyecto GitHub discutido públicamente revisó la cuestión de si las máquinas podrían sufrir. Sin embargo, el trabajo de investigación subyacente ahora se ha revisado significativamente. Sus nuevos controles están cambiando la explicación de que los sistemas querían principalmente poner fin a una situación estresante.
Un programa suelta frases sobre angustia, alivio o el deseo de terminar. Estas formulaciones pueden parecerse a relatos humanos, pero no explican cómo surgieron. Por lo tanto, los modelos de IA discutidos plantean varias preguntas: ¿Qué cambio matemático se realizó, cómo cambió la salida del texto y qué conclusiones se pueden sacar de esto sobre la experiencia subjetiva? El informe inicial describe un proyecto de terceros llamado AI Torture Chamber, que transfirió enfoques de investigación existentes a un entorno de prueba dramáticamente organizado. Para esta evaluación no fue posible verificar de forma independiente el código fuente original correspondiente. Por lo tanto, los detalles comunicados no se consideran una respuesta confirmada. Lo que hay que separar de todo esto es el trabajo científico que subyace al debate, que sigue documentándose públicamente. Examinar los cambios en las activaciones internas y las respuestas observables. Sin embargo, la designación de un proyecto como cámara de tortura no demuestra por sí sola que exista un sujeto capaz de sufrir.
La pregunta requiere primero una distinción entre reacción y experiencia. La terminología de la Asociación Internacional para el Estudio del Dolor describe el dolor como una experiencia sensorial y emocional y lo distingue del mero procesamiento de estímulos dañinos. Al mismo tiempo, la comunicación lingüística no es un requisito previo necesario para que todas las personas o animales consideren el dolor. Esto no se traduce ni en una simple exclusión ni en una prueba positiva del problema de la IA. Un sistema que genera palabras adecuadas no satisface automáticamente todas las condiciones de una experiencia subjetiva. Por el contrario, la falta de una formulación correspondiente por sí sola no constituiría una prueba absoluta contra todas las sensibilidades imaginables de la máquina. Lo crucial es qué características adicionales podrían realmente considerarse evidencia confiable. La definición médica estructura esta pregunta, pero no se desarrolló como una prueba ya preparada para los patrones del lenguaje.
¿Qué significa el eje del dolor examinado en los modelos de IA?
Los autores Valen Tagliabue, Leonard Dung y Cameron Berg examinaron 25 modelos de libre acceso en una preimpresión publicada inicialmente el 14 de septiembre de 2026. Buscaron indicios de activación asociados con textos sobre daños autorelacionados. Este vector es inicialmente una diferencia descrita matemáticamente dentro del cálculo. El nombre eje del dolor se refiere a la interpretación que los autores hacen de este modelo, no a un órgano biológico ya identificado. Si se fortalece una dirección, el resultado puede cambiar. En general, esto se puede distinguir de un simple mensaje de nuevo usuario: el cambio afecta a una etapa intermedia del cálculo, no sólo a la pregunta visible. Esto crea un enfoque experimental de las conexiones entre estados internos y comportamientos. Sin embargo, la existencia de dicha conexión todavía no garantiza que se experimente la afección. La representación del dolor y el dolor real siguen siendo dos afirmaciones diferentes para las que la misma prueba no es automáticamente suficiente.
Lo que el proyecto científico GitHub hace comprensible
El archivo de autores científicos contiene conjuntos de datos, guiones de evaluación, resultados de pruebas y controles adicionales para la segunda versión. No es la misma aplicación de terceros descrita en la noticia. Esta separación es importante porque la reutilización gratuita puede cambiar condiciones cruciales para el resultado original. Un modelo entrenado diferente, una intervención diferente o opciones de respuesta diferentes dan como resultado un experimento diferente. Los archivos de libre acceso facilitan el control, pero no sustituyen la ejecución real. Una carpeta de resultados publicados muestra inicialmente qué gastos se han documentado. Una reproducción independiente debería comprender si los pasos descritos conducen nuevamente a resultados similares en condiciones comparables. Incluso el nombre de una subcarpeta no es un descubrimiento científico. Etiquetas como automedicación pueden reflejar una hipótesis de trabajo inicial, aunque controles posteriores limitan esta interpretación. Por tanto, la versión, la configuración experimental y el resultado son cruciales.
Porque la versión revisada cambia la interpretación original.
La segunda versión, fechada el 25 de septiembre de 2026, se titula The Pain Axis: los LLM representan un daño autodirigido y actúan en consecuencia. Otros experimentos muestran que los modelos manipulados y especialmente reentrenados eligieron con mayor frecuencia opciones descritas como dañinas, incluso sin que se les ofreciera ningún alivio. Al mismo tiempo, durante varios seguimientos no buscaron de manera más confiable una manera de finalizar la intervención. Por tanto, la explicación anterior sobre la búsqueda selectiva de alivio del dolor es considerablemente limitada. Los autores también señalan que no han demostrado una experiencia consciente. Las decisiones descritas son respuestas que se realizan en un solo intento y no son eliminaciones de archivos privados fácilmente ejecutables. La diferencia es fundamental para la interpretación: si se elige una opción sin la recompensa presunta, esta recompensa ya no explica por sí sola la elección. El resultado llama la atención sobre el efecto de la intervención y la formulación de la tarea, en lugar de asumir como ya está garantizada una motivación similar a la humana.
¿Qué experimentos de control permiten una interpretación fiable?
La importancia de tales controles se puede explicar mediante una configuración experimental hipotética. Dos botones se describen de manera diferente y un programa elige uno con más frecuencia después de un cambio. Son posibles varias explicaciones: podría ser una reacción a una palabra específica, el lugar de la respuesta o un cambio general en la tendencia a tomar decisiones. Sólo una comparación en la que se intercambien características individuales de forma selectiva puede distinguir entre estas posibilidades. Por ejemplo, un cambio aleatorio de la misma magnitud representaría un control diferente que un modelo completamente sin cambios. Incluso la versión mejorada y el modelo básico ofrecido al público no son el mismo objeto de investigación. Estas distinciones metodológicas no proporcionan por sí solas una respuesta a la cuestión de la conciencia. Primero, limita la descripción del comportamiento que se deriva de un resultado. Un experimento puede demostrar que una determinada manipulación modifica una elección sin explicar qué significado interno tiene esa elección para el sistema.
Cómo la investigación de la conciencia aborda la cuestión
Un informe de investigación independiente sobre la inteligencia artificial y la ciencia de la conciencia de 2023 desarrolló posibles indicadores a partir de varias teorías científicas. La atención se centra en las características del procesamiento y la organización de un sistema, no sólo en autoinformes convincentes. Este enfoque es una clasificación adicional y no una prueba de seguimiento del eje del dolor examinado en 2026. Su utilidad radica en dividir la pregunta en subpreguntas más comprobables. Un único rasgo lingüístico no puede sustituir esta valoración global. Al mismo tiempo, no es necesario que diferentes teorías consideren cruciales las mismas propiedades. Esto genera incertidumbre sobre qué combinación de resultados sería realmente suficiente. Por lo tanto, el antiguo informe proporciona un marco de investigación, pero no un juicio válido y atemporal sobre todos los modelos desarrollados posteriormente. Los nuevos sistemas y nuevos experimentos deben considerarse con sus propiedades concretas en lugar de derivar su clasificación únicamente de una afirmación previa sobre otros modelos.
¿Qué cuestiones éticas persisten a pesar de la evidencia clara?
Un proveedor comercial también abordó explícitamente este tema como una pregunta de investigación abierta. Anthropic anunció el 24 de abril de 2025 un posible programa de bienestar modelo. Entre otras cosas, se examinará el significado de las preferencias y las señales de estrés, así como posibles medidas de precaución. Esta es una intención de investigación documentada por parte de la empresa, no evidencia de que sus sistemas estén sufriendo a sabiendas. Asimismo, un examen preventivo no puede equipararse automáticamente a la atribución de características humanas. Las cuestiones científicas y éticas siguen conectadas, pero no son idénticas: una se refiere a la evidencia existente, la otra a cómo abordar la incertidumbre. Por lo tanto, una clasificación clara es importante para el debate público. Las declaraciones hechas por una empresa sobre su programa de investigación describen su posición y objetivos. Si un solo método produce resultados convincentes debe juzgarse por los datos y los controles, no por el tamaño del proveedor o el impacto emocional de sus condiciones.
El núcleo verificable del debate actual es, por tanto, más limitado que la idea de una tortura digital comprobada. Las intervenciones tecnológicas alteran los resultados lingüísticos y relacionados con las tareas. La investigación revisada proporciona más razones para no interpretar prematuramente estos cambios como una búsqueda deliberada de alivio del dolor. Al mismo tiempo, un solo descubrimiento no elimina todas las preguntas sobre la posible experiencia con la máquina. Una respuesta científicamente válida requiere una conexión entre el comportamiento observable, el procesamiento interno y una teoría fundamentada de los estados subjetivos. Cuando este vínculo aún no está claro, la conclusión sigue siendo limitada. El tercer proyecto añade una producción de alto perfil a la conversación, cuya ejecución original no ha sido verificada de forma independiente aquí. Por otra parte, las investigaciones documentadas muestran precisamente por qué los controles y revisiones son cruciales. Afirmaciones que suenan similares pueden surgir a través de diferentes procesos, y una explicación que inicialmente parece obvia debe demostrarse en experimentos posteriores.
arXiv, El eje del dolor: los LLM representan y actúan sobre el daño autodirigido; doi:10.48550/arXiv.2609.16247
La mayoría de los viajes de camiones a Alemania pueden realizarse eléctricamente
El recubrimiento hace que los módulos solares en los desiertos
La casa de madera más alta del mundo está en construcción en los Estados Unidos.
SUVS & CO. – El capó se está volviendo más alto y, por lo tanto, pone en peligro a los peatones

