mira adentro
Dennis Lenz
(Imagen simbólica) Los chatbots con IA a veces dan respuestas incorrectas con gran certeza y, a la inversa, dudan de las correctas. Investigadores de la Universidad de California en Riverside examinaron lo que sucede dentro de los modelos lingüísticos. Por tanto, la confianza en uno mismo y la corrección están controladas por varias características internas. Esto abre la posibilidad de hacer modelos más conservadores cuando es probable que estén equivocados.
(Foto: © Investigación y conocimiento, imagen de IA)
Los chatbots con IA suelen dar respuestas incorrectas con gran seguridad y, a la inversa, advierten de la incertidumbre incluso si son correctas. Investigadores de la Universidad de California en Riverside han descubierto el motivo. En los modelos lingüísticos examinados, la confianza y la corrección están controladas por varias características internas. Por tanto, la confianza de un modelo no es una indicación fiable de la exactitud de su respuesta.
Excelentes modelos de lenguaje como ChatGPT, Gemini o Llama responden millones de preguntas todos los días, desde tareas hasta planificación de viajes y preguntas sobre salud. Suelen formular sus respuestas de forma fluida y convincente, independientemente de si son correctas. Por lo tanto, los usuarios suelen orientarse por el tono de voz: si un modelo parece cierto, es más probable que crean en la respuesta; si expresa dudas, es más probable que lo interroguen. Sin embargo, es precisamente esta hipótesis la que resulta problemática. Los modelos de habla producen repetidamente declaraciones falsas, las llamadas alucinaciones, y las presentan con el mismo tono seguro de sí mismo que las correctas. Por el contrario, un modelo puede expresar dudas incluso si su respuesta es correcta. Este es un problema clave para los desarrolladores porque los modelos de lenguaje preparan cada vez más decisiones y completan tareas de forma independiente. Se necesitan mejores formas de determinar cuándo las respuestas de una IA son confiables y cuándo no. Luego, un equipo dirigido por el científico informático Het Patel de la Universidad de California en Riverside examinó los patrones del lenguaje.
Los investigadores examinaron dos modelos de lenguaje abierto cuyos procesos internos pueden analizarse desde el exterior: Llama-3.1-8B de Meta y Gemma-2-9B de Google. Presentaron a ambos modelos preguntas de opción múltiple y clasificaron las respuestas en cuatro grupos según si eran correctas o incorrectas y si el modelo parecía seguro o peligroso. Luego utilizaron herramientas llamadas codificadores automáticos dispersos para descomponer la actividad interna de los modelos e identificar qué características se activan durante qué comportamiento, como lo describió la Universidad de California Riverside en su anuncio del 23 de septiembre. Estos codificadores automáticos traducen los patrones numéricos difíciles de entender de una red neuronal en características individuales más fáciles de interpretar. Esto le permite observar qué bloques de construcción se iluminan en el modelo al responder una pregunta y si estos bloques de construcción difieren entre respuestas seguras e inciertas.
Donde los chatbots de IA separan la seguridad y el conocimiento
El resultado central: la confianza en uno mismo y la equidad surgen de diversas características internas de los modelos examinados. Las características asociadas con un desempeño seguro se superponen sólo parcialmente con aquellas asociadas con una respuesta correcta. Por tanto, ambas propiedades pueden divergir, y esto es exactamente lo que explica los dos patrones de error típicos. En un caso, la característica de seguridad está activa incluso si falta la base de conocimientos para la respuesta y el modelo afirma con confianza un error. En el otro caso, el modelo es correcto, pero el dispositivo de seguridad sigue siendo débil, lo que genera dudas innecesarias. Los investigadores ven esto como una contradicción con la suposición generalizada de que la confianza de un modelo es un indicador confiable de la exactitud de sus respuestas. Para los usuarios esto significa: un tono seguro dice poco sobre la exactitud de una respuesta. Sigue siendo esencial comprobar las declaraciones importantes utilizando fuentes fiables.
Adaptar las características internas de forma específica
El descubrimiento no es sólo una explicación, sino que también podría conducir a una solución. Si la seguridad y la corrección dependen de características internas distintas, estas características pueden verse influenciadas de forma específica. El objetivo sería un modelo que actúe con confianza cuando tiene razón y se vuelva más cauteloso cuando es probable que esté equivocado. Patel también ve el enfoque como un método general: los investigadores podrían buscar características internas asociadas con otros comportamientos deseables o indeseables y ver si estos pueden fortalecerse o debilitarse mediante intervenciones. Estas intervenciones específicas en la actividad interna de los modelos lingüísticos se consideran una herramienta prometedora para hacer que los sistemas de IA sean más transparentes y controlables. El trabajo apareció como una publicación previa en el servidor de preimpresión arXiv y aún no ha sido revisado por revisores independientes. Inicialmente, los resultados se aplican sólo a los dos modelos comparativamente pequeños examinados.
Porque sobreestimar la inteligencia artificial es peligroso
La cuestión de qué tan bien una IA evalúa su propia incertidumbre se vuelve más importante cuanto más responsabilidad asumen los modelos de lenguaje. En el ámbito de la medicina, el derecho o el asesoramiento financiero, una declaración falsa y segura de sí misma puede causar daños considerables si se acepta sin verificación. Esto es especialmente complicado en el caso de los llamados agentes de inteligencia artificial, que realizan diferentes pasos de trabajo de forma independiente, uno tras otro. Una señal de seguridad falsa determina si un error se detecta a tiempo o si se traslada a pasos posteriores. Otros grupos de investigación también están trabajando para hacer que los modelos de lenguaje sean más honestos acerca de su incertidumbre. Los investigadores del MIT demostraron en primavera que algunos procedimientos de entrenamiento llevan a los modelos a responder cualquier pregunta con un alto grado de certeza porque son recompensados por las respuestas correctas y castigados por las incorrectas, sin tener en cuenta los matices. El trabajo de Riverside complementa esta idea con una explicación de lo que sucede dentro de los modelos.
Qué pueden obtener los usuarios
El estudio tiene algunas implicaciones prácticas para la vida cotidiana con chatbots. El tono de la respuesta no es un indicador de calidad; una declaración formulada con especial firmeza no merece automáticamente más confianza que una prudente. Cuando estén involucradas cuestiones de salud, financieras o legales, las respuestas de los modelos lingüísticos deben compararse con fuentes independientes. También puede resultar útil volver a hacer la misma pregunta a un chatbot de forma diferente y comparar las respuestas, porque los resultados contradictorios indican incertidumbre. Los investigadores de Riverside ahora quieren transferir su enfoque a modelos más grandes y otros tipos de tareas. Si se confirmara que la confianza en uno mismo y la justicia pueden estar específicamente alineadas, los futuros chatbots podrían indicar más claramente cuándo se puede confiar en ellos. Hasta entonces, la investigación crítica sigue siendo la mejor protección contra los errores de autoestima cometidos por la IA.
arXiv, ¿La incertidumbre y la corrección de LLM están codificadas por las mismas características? Una disociación funcional a través de escasos codificadores automáticos; doi:10.48550/arxiv.2604.19974


