origen de la maquina
Dennis Lenz
(Imagen simbólica) Los textos de IA son cada vez más difíciles de distinguir de las formulaciones humanas, especialmente después de que un modelo de lenguaje simplemente ha reescrito el contenido existente. Un nuevo sistema de clasificación combina características lingüísticas con modelos modernos de lenguaje neuronal. En un gran corpus de prueba, el método logró una alta tasa de éxito para tres clases de texto diferentes. Aún no está claro si el reconocimiento de IA sigue siendo tan fiable con patrones y tipos de texto completamente nuevos.
(Foto: © Investigación y conocimiento, imagen de IA)
Un texto puede provenir íntegramente de un ser humano, generarse íntegramente a partir de un modelo de lenguaje o simplemente reformularse mediante una inteligencia artificial. Especialmente la tercera variante dificulta cada vez más la detección de la IA. Un nuevo sistema ahora debería poder distinguir entre estos tres orígenes y lograr una tasa de éxito superior al 96% dentro de un corpus de prueba grande. Sin embargo, lo crucial es lo que realmente dice este número y cuáles son sus limitaciones.
Dado que los grandes modelos de lenguaje han podido generar texto fluido, el problema del reconocimiento de la fuente ha cambiado. Los primeros textos de IA a menudo podían reconocerse por estructuras de oraciones uniformes, transiciones notables o formulaciones recurrentes. Los modelos modernos escriben de forma mucho más variable. Se vuelve aún más difícil cuando una persona crea su propio texto y luego un modelo de lenguaje sólo cambia el estilo, la elección de palabras y la estructura de la oración. En cuanto al contenido, la idea proviene del ser humano, pero lingüísticamente el documento tiene características de procesamiento mecánico. Los detectores clásicos que sólo distinguen entre humanos y máquinas a menudo no tratan esta forma híbrida como una categoría separada. El nuevo trabajo comienza allí mismo. Construye una clasificación de texto con tres clases: escrito por humanos, completamente generado por IA y reformulado por IA. Esta distinción es relevante para universidades, editores, reseñas de productos y plataformas porque la simple cuestión del contenido completamente generado ya no capta una porción cada vez mayor del uso real.
El desafío también es evidente en el hecho de que a los humanos también les resulta sorprendentemente difícil distinguir sus orígenes. En un estudio anterior, los lingüistas no pudieron distinguir de manera confiable entre textos humanos y ChatGPT. Por lo tanto, los sistemas técnicos no se limitan a buscar palabras sospechosas individuales. El reconocimiento de IA moderno analiza patrones estadísticos en muchas funciones a la vez. Esto incluye distribución de palabras, longitud de oraciones, estructuras gramaticales, propiedades estilísticas y representaciones abstractas de modelos de lenguaje neuronal. Esto permite que un detector reconozca patrones que son difíciles de percibir para un lector humano. Al mismo tiempo, surge un problema fundamental: tan pronto como los nuevos generadores escriben de forma diferente a los modelos del material de formación, el rendimiento puede disminuir. Por lo tanto, una alta precisión dentro de un conjunto de datos controlado no es prueba de confiabilidad universal en Internet.
161788 textos forman la base del reconocimiento de IA
Para el estudio, los autores compilaron un corpus de un total de 161.788 ejemplos de texto. Esto incluyó 46.844 textos escritos por humanos, 57.247 textos totalmente generados por IA y 57.697 contenidos reescritos. Las reseñas de productos de Amazon y las publicaciones de Twitter sirvieron como material fuente. Para las variantes de la máquina, el equipo utilizó varios modelos de lenguajes actuales, incluidos GPT, DeepSeek y Kimi. El contenido completamente generado se creó utilizando instrucciones de cero disparos, mientras que los ejemplos reformulados se generaron utilizando instrucciones de pocos disparos. Esto significa que el sistema no sólo debería reconocer un único generador. El estudio publicado en Scientific Reports dividió el conjunto de datos en 113.249 ejemplos de entrenamiento, 16.180 ejemplos de validación y 32.359 textos para la prueba final.
Porque las características individuales típicas de la IA ya no son suficientes
Por lo tanto, el nuevo proceso combina dos fuentes de información fundamentalmente diferentes. Una parte consta de 68 rasgos lingüísticos y estilísticos especialmente construidos. Estas incluyen, por ejemplo, propiedades léxicas, sintácticas y estilométricas. La segunda parte utiliza representaciones de modelos de transformadores modernos. Se obtuvieron características adicionales de RoBERTa y Sentence Transformer, creando un vector de características de 168 dimensiones. Luego, los investigadores probaron varios algoritmos clásicos, como el bosque aleatorio, la máquina de vectores de soporte y la regresión logística. Paralelamente, RoBERTa y DeBERTa se desarrollaron directamente sobre los textos sin procesar. El enfoque es interesante porque el aprendizaje profundo no reemplaza simplemente todos los criterios hechos a mano. En cambio, el trabajo examina si las medidas lingüísticas explícitas y las representaciones neuronales abstractas se complementan entre sí. Las pruebas de ablación sugieren que ambos tipos de información contribuyen al rendimiento general del sistema.
Sólo RoBERTa posee ya más del 95%.
Los modelos de transformadores lograron resultados significativamente mejores que los métodos individuales clásicos. RoBERTa logró una precisión del 95,49% en la prueba. La DeBERTa se situó en el 94,88%. Luego, los investigadores combinaron varios modelos. Un conjunto que promedió las probabilidades predichas aumentó la precisión al 95,66%. La tasa de éxito más alta provino del llamado apilamiento. No es simplemente un modelo único el que toma la decisión final. Inicialmente, varios modelos de referencia proporcionan sus estimaciones, que luego se combinan con otro modelo forestal aleatorio. Este sistema alcanzó el 96,46%. Esto dio como resultado la cifra redondeada del 96% en el título. Sin embargo, solo se aplica a la tarea de prueba definida con las tres clases y el conjunto de datos actual. Por lo tanto, un solo ensayo extranjero no puede clasificarse correctamente automáticamente con una probabilidad del 96%.
Los textos de IA reescritos siguen siendo la clase más difícil
Lo que resulta particularmente revelador no es el mayor número total, sino más bien la distribución de los errores. El contenido reformulado por IA fue más difícil de reconocer que el texto completamente generado en prácticamente todos los métodos probados. Esto es plausible porque estos documentos combinan propiedades lingüísticas y semánticas de ambos mundos. La idea inicial, la estructura argumental o la experiencia personal pueden ser de origen humano, mientras que un modelo cambia el ritmo de la oración y la elección de las palabras. Como resultado, desaparecen algunas referencias clásicas al lenguaje generado por máquinas. Esta forma mixta es particularmente relevante para el uso práctico. Los estudiantes, autores o especialistas en marketing no necesariamente tienen que pedirle a un modelo que escriba un texto completo para cambiar su estilo. Una sola pasada de revisión es suficiente. Por lo tanto, las limitaciones de tales sistemas recuerdan otro problema de los modelos lingüísticos modernos: los chatbots basados en inteligencia artificial pueden parecer muy seguros incluso cuando dan respuestas incorrectas. Una superficie convincente no revela de forma fiable el origen o la calidad reales.
El 96% no es un detector de IA universal
Esta restricción es crucial para las escuelas y universidades. Un clasificador puede funcionar muy bien con tipos de texto y generadores conocidos y aún tener problemas con un modelo nuevo, un idioma diferente o textos muy modificados. Las reseñas de productos y las publicaciones breves en las redes sociales también difieren estructuralmente de los artículos académicos, periodísticos o documentos legales. Por lo tanto, los autores mencionan explícitamente la generalización a generadores desconocidos y nuevos dominios como el siguiente paso de la investigación. Incluso si la probabilidad es alta, un resultado automático no debe tratarse como prueba de engaño sin un examen más detenido. Incluso pequeños porcentajes de error pueden generar numerosas falsas sospechas cuando se revisan grandes cantidades de textos. Por lo tanto, el reconocimiento de IA es más adecuado como señal técnica dentro de una prueba más amplia que como juez único de la autoría de un documento.
Varios grupos de investigación combinan características lingüísticas y aprendizaje profundo
El estudio se llevó a cabo con la participación de la Universidad COMSATS de Islamabad, la Universidad Nacional de Jeju y la Universidad Recep Tayyip Erdogan. El perfil oficial de Muhammad Shahzad Faisal enumera el procesamiento del lenguaje natural, la recuperación de información, el aprendizaje automático y la inteligencia artificial generativa como sus intereses de investigación. También cabe destacar una declaración de transparencia por parte de los autores: se utilizó ChatGPT para la revisión lingüística del manuscrito. Los autores declaran haber comprobado personalmente posteriormente el contenido revisado y asumir la responsabilidad del mismo. Especialmente en un estudio de textos de IA, esta nota destaca cuán borrosa se ha vuelto la línea entre la producción de textos humanos y automáticos en la vida cotidiana. Por tanto, el progreso real de los trabajos reside menos en una solución final que en una clasificación más realista de esta fase intermedia.
Informes científicos, aprendizaje profundo híbrido para la clasificación tripartita de texto escrito por humanos, generado por IA y redactado por IA; doi:10.1038/s41598-026-73841-9
La mayoría de los viajes de camiones a Alemania pueden realizarse eléctricamente
El recubrimiento hace que los módulos solares en los desiertos
La casa de madera más alta del mundo está en construcción en los Estados Unidos.
SUVS & CO. – El capó se está volviendo más alto y, por lo tanto, pone en peligro a los peatones

