Incertidumbre mensurable
Dennis Lenz
(Imagen simbólica) Las respuestas de la IA pueden parecer lingüísticamente convincentes y, sin embargo, no ser fiables. Un nuevo análisis matemático examina más evidencia de esta incertidumbre. Su conexión con la física cuántica no significa que se haya utilizado una computadora cuántica para este propósito. Una señal de advertencia sobre la calidad de la respuesta no sustituye a la evidencia independiente de su exactitud.
(Foto: © Investigación y conocimiento, imagen de IA)
Las respuestas de la IA pueden parecer convincentes, pero aún tienen una base incierta. Un procedimiento matemático pretende hacer que estos casos sean más fáciles de reconocer. Para ello, combina la importancia de las diferentes respuestas con métodos inspirados en la física cuántica. La investigación proporciona un indicador mejorado de incertidumbre, pero no proporciona evidencia general de que una afirmación sea cierta.
Un modelo de lenguaje puede generar varias respuestas fluidas a la misma pregunta. Algunos difieren sólo en la estructura de la oración, otros se contradicen en un punto crucial. Para evaluar las respuestas de la IA, estas dos situaciones no son equivalentes. Una elección diferente de palabras no es inicialmente un error. Sin embargo, diferentes afirmaciones sobre el mismo hecho claramente identificable plantean una cuestión de contenido. La investigación sobre la autoevaluación de modelos lingüísticos lleva varios años investigando qué información sobre la fiabilidad de una respuesta se puede obtener del propio modelo. Debe hacerse una distinción entre consultar con una fuente independiente. Un sistema puede asignar una alta probabilidad a una formulación sin haber demostrado un evento documentado. Asimismo, una frase redactada cuidadosamente no es necesariamente incorrecta. Por lo tanto, la certeza lingüística, la probabilidad calculada y la precisión fáctica deben considerarse por separado antes de que una nueva cifra clave pueda interpretarse de manera significativa.
Un enfoque importante considera no sólo las cadenas de caracteres, sino también el significado de los textos producidos. El trabajo sobre entropía semántica publicado en Nature en 2024 resume respuestas que son equivalentes en contenido. Un ejemplo sencillo elegido aquí para su explicación sería especificar una duración como diez minutos o un sexto de hora. Ambas expresiones se refieren al mismo período de tiempo. Sin embargo, una respuesta de veinte minutos sería una declaración diferente. Un procedimiento que sólo cuenta palabras diferentes podría considerar erróneamente las dos primeras formulaciones como un desacuerdo de contenido. La agrupación por significado pretende capturar esta misma diferencia. Luego puede considerar si las respuestas generadas contienen predominantemente la misma afirmación o se distribuyen en varias opciones contradictorias. Esto no mide directamente un hecho externo, sino más bien un patrón en el comportamiento de respuesta. Esta distinción proporciona la base para utilizar la incertidumbre como señal de advertencia sin confundirla con una revisión completa del contenido.
Lo que también capta la investigación sobre las respuestas de la IA
Pragatheeswaran Vipulanandan, Kamal Premaratne y Dilip Sarkar de la Universidad de Miami amplían este enfoque para incluir la incertidumbre en las probabilidades de posibles secuencias de texto. Su estudio, publicado en ICLR 2026, ya se publicó como preimpresión el 27 de enero de 2026. Los autores informan sobre 116 configuraciones experimentales con diferentes patrones de lenguaje y tareas de cuatro conjuntos de datos. Eso no significa 116 participantes humanos en la prueba. El enfoque adicional considera qué tan sensibles son las probabilidades calculadas a pequeños cambios matemáticos. Para clasificarlo se puede distinguir entre un valor estimado y su resiliencia. Dos cálculos pueden dar inicialmente el mismo valor, incluso si un pequeño cambio en las cantidades subyacentes afecta significativamente sólo a uno de ellos. Por tanto, la información adicional no sólo se refiere al resultado, sino también a su estabilidad. Transferido a la evaluación de la respuesta, su objetivo es evitar que un cálculo inicial incierto sea tratado como uno más sólido. Esta es una extensión de la medición de la incertidumbre y no un nuevo conjunto de hechos para el modelo del lenguaje.
Porque no se necesita una computadora cuántica para este propósito
El método utiliza redes tensoriales cuánticas como herramienta matemática y se estudió en hardware informático convencional. La referencia aquí a la física cuántica se refiere al método de representación y cálculo utilizado, no a un estado cuántico probado en el modelo del lenguaje. Una estructura matemática puede resultar útil en diferentes áreas de aplicación sin que estas áreas se vuelvan físicamente idénticas. Por ejemplo, utilizar una ecuación de onda no transforma un cálculo en un experimento con una onda de agua real. Asimismo, el término red tensorial cuántica no implica conocimiento del software ni una ventaja de velocidad automática sobre todos los demás métodos. Tal afirmación de desempeño requeriría comparaciones separadas. En cambio, la pregunta relevante es si el cálculo adicional proporciona una indicación útil de respuestas poco confiables. Para ello, es necesario evaluar los resultados de tareas verificables mediante métodos de comparación adecuados. El origen técnico de una fórmula no reemplaza esta prueba. Incluso la capacidad de ejecutarlo en una computadora normal no dice nada sobre cuán altos serían el esfuerzo computacional y los requisitos de memoria para una aplicación práctica específica.
Qué significan realmente las métricas mejoradas
Los autores informan mejoras en AUROC y AURAC en comparación con los métodos comparativos examinados. Estas cantidades no deben leerse como un porcentaje inmediato de respuestas correctas. La documentación de evaluación de la República de China describe la relación entre los casos detectados y las falsas alarmas en diferentes umbrales de decisión. Un valor de incertidumbre se puede utilizar, por ejemplo, para clasificar las respuestas según su necesidad de prueba. Dónde se encuentra la línea entre lo discreto y lo llamativo es una determinación adicional. Si se cambia, tanto la cantidad de respuestas problemáticas detectadas como la cantidad de advertencias innecesarias cambian. En cambio, AURAC evalúa la exactitud de las respuestas restantes, manteniendo los casos particularmente inciertos. Un filtro de este tipo puede hacer que las respuestas devueltas parezcan más confiables, incluso si el modelo aún no responde correctamente a las preguntas retenidas. Por lo tanto, el beneficio debe evaluarse junto con el número de preguntas efectivamente respondidas. Un alto nivel de precisión con unas pocas respuestas seleccionadas significa algo diferente que el mismo nivel de precisión con una cobertura casi completa de todas las preguntas formuladas.
Porque las respuestas consistentes aún pueden ser incorrectas
La limitación fundamental se puede demostrar sin más suposiciones sobre un conjunto de datos específico. Supongamos que un sistema llama al mismo valor incorrecto cada vez que se repite. Por lo tanto, su comportamiento de respuesta es consistente, incluso si la afirmación no es cierta. Una medición de las diferencias entre respuestas no puede detectar este error simplemente distinguiendo con mayor precisión entre oraciones idénticas. Así, trabajos anteriores sobre entropía semántica distinguen respuestas cambiantes e infundadas de resultados sistemáticamente incorrectos. Ambas pueden resumirse en la vida cotidiana bajo el término alucinaciones, pero no necesariamente se basan en el mismo mecanismo. Por el contrario, ni siquiera un conflicto entre múltiples respuestas prueba cuál de ellas es la correcta. Se requiere más información para esta decisión. Esto implica un límite claro a la interpretación: un valor alto de incertidumbre justifica un examen más detenido, un valor bajo no la reemplaza esencialmente. La cuestión de la verdad de un enunciado sigue siendo diferente de la cuestión de qué tan estable un modelo produce este enunciado o qué alternativas produce cuando se produce repetidamente.
¿Qué requisitos limitan el uso práctico?
El nuevo método requiere acceso a las probabilidades de los componentes de texto generados. Una interfaz que devuelve sólo el texto de la respuesta finalizada no cumple automáticamente este requisito. Además, la evaluación depende de si las diferentes formulaciones están agrupadas correctamente en términos de contenido. Estas restricciones afectan a dos niveles diferentes: el acceso a los datos necesarios y la calidad de su procesamiento. Incluso los datos de origen totalmente disponibles no evitan una asignación incorrecta. Por lo tanto, para realizar una prueba práctica sería necesario aclarar en primer lugar si la aplicación utilizada proporciona realmente la información solicitada. Luego debe verificar si la evaluación funciona con sus preguntas y tipos de respuestas reales. El resultado de tareas de conocimiento y cálculo seleccionadas no se puede transferir a ninguna otra aplicación simplemente debido a términos técnicos similares. Por ejemplo, las respuestas largas pueden contener varias afirmaciones parcialmente independientes. Por tanto, un único valor resumido deja abierta la frase que causa la incertidumbre. Si una aplicación evalúa declaraciones individuales por separado o conserva el texto completo, cambia el significado de la señal de advertencia para un flujo de trabajo posterior.
En qué se diferencia la incertidumbre de una respuesta ya preparada
Para determinar los posibles beneficios, se puede considerar un procedimiento de prueba hipotético. Una aplicación genera una respuesta y también calcula un valor de incertidumbre. Si se excede un umbral predeterminado, puede solicitar información adicional, someter la respuesta a revisión humana o renunciar a una declaración definitiva. Estas posibilidades no son éxitos en el uso real ya demostrados por el estudio. Describen diferentes consecuencias que podrían extraerse de una misma medición. Esto crea varios requisitos: más investigaciones requieren fuentes adecuadas, la revisión humana lleva tiempo y una respuesta rechazada no aborda la pregunta original. Por lo tanto, un indicador de incertidumbre es sólo un componente de un sistema verificable. Su desempeño debe considerarse junto con los próximos pasos. La contribución científica radica en el desarrollo de otra indicación mensurable de conducta de respuesta problemática. La formulación de que una IA reconoce su propia ignorancia es una abreviatura ilustrativa de esto. Lo que se demuestra es discriminación estadística, autoconocimiento no humano y ninguna garantía de respuestas libres de errores.
ICLR 2026, Cuantificación de la incertidumbre semántica de las alucinaciones en LLM: un método basado en redes de tensores cuánticos; doi:10.48550/arXiv.2601.20026






