8 de septiembre de 2026
Nuestras Noticias – Actualidad y Eventos Locales al Instante
Image default
Tecnología

Un nuevo método computacional encuentra patrones ocultos en grandes conjuntos de datos

La puntuación es post


TI en Duisburgo


Dennis Lenz

Un nuevo método computacional encuentra patrones ocultos en grandes conjuntos de datos

(Imagen simbólica) Los datos de medición procedentes de la tecnología, la biología o la economía a menudo contienen simultáneamente varias conexiones diferentes que sólo pueden describirse de forma imprecisa con un único modelo. Investigadores del Instituto Paluno de la Facultad de Ciencias de la Computación de la Universidad de Duisburg-Essen han desarrollado un método llamado CluBS que agrupa puntos de datos según si siguen la misma ecuación matemática. No es necesario conocer de antemano ni el número ni la estructura de estas ecuaciones. El método se probó en 211 conjuntos de datos reales y sintéticos.

(Foto: © Investigación y conocimiento)

Quienes quieren sacar conclusiones de los datos de medición suelen buscar un modelo único que se ajuste a todo. Sin embargo, a menudo en el mismo conjunto de datos se esconden varias leyes completamente diferentes al mismo tiempo. Los informáticos de la Universidad de Duisburg-Essen han desarrollado un proceso que selecciona de forma independiente dichos grupos sin saber primero qué están buscando.

El problema se puede mostrar con un ejemplo sencillo. Supongamos que algunos de los valores medidos siguen la función f(x) = 2*x, mientras que otra parte de la misma serie de mediciones se describe mejor mediante g(x) = x*x. Si reduce ambos grupos a un modelo común, obtendrá una curva que realmente no se ajusta a ninguno de los grupos y cuya importancia es correspondientemente baja. En la práctica, esto es exactamente lo que siempre sucede: un automóvil se comporta de manera diferente cuando hace frío que cuando hace calor, las plantas crecen en patrones diferentes en diferentes condiciones y los clientes reaccionan de manera diferente a los precios dependiendo de la situación. Tendría sentido agrupar los datos de antemano, pero para hacerlo ya necesitaría saber las conexiones que realmente desea encontrar.

Las soluciones anteriores atacan en un punto diferente. Los métodos de agrupación clásicos como K-Means ordenan los puntos de datos en función de qué tan cerca están entre sí en el espacio. Esto funciona bien siempre que los diferentes grupos puedan separarse espacialmente, por ejemplo cuando dos nubes de puntos están significativamente separadas. Sin embargo, si los grupos se superponen porque sus valores están en la misma área y solo su comportamiento es diferente, estos métodos fallan. Precisamente aquí entra en juego el trabajo de Peter Zdankin, Arne Kummerow y Torben Weis del instituto de investigación Paluno de la Facultad de Informática de la Universidad de Duisburg-Essen.

Tal vez también te interese leer  China es el primer país en cruzar la producción de energía solar de 1,000 GW

Se agrupan según el comportamiento.

Su método se llama CluBS, abreviatura de Clustering Behavioral Similarity, y organiza puntos de datos no por proximidad, sino según si pueden describirse mediante la misma ecuación matemática. El proceso es una interacción de dos pasos. En primer lugar, el método utiliza la regresión simbólica para buscar una función que describa lo mejor posible un grupo preliminar de puntos de datos. No se especifica la forma de esta función; en cambio, el proceso combina de forma independiente variables, números y operaciones aritméticas en una ecuación adecuada. A continuación se comprueba qué otros puntos de datos pueden registrarse con la misma función y, por tanto, pertenecen al grupo, como explica la Universidad de Duisburg-Essen en su comunicado.

Hasta que ya nada cambie

Esta alternancia entre búsqueda y asignación de funciones se repite hasta que ambas ya casi no cambian y la ecuación encontrada y el grupo asociado son estables. Luego, el proceso comienza de nuevo con los datos restantes y continúa a través de todo el conjunto de datos hasta que esté disponible una descripción general de todos los comportamientos que contiene. El punto crucial es que no es necesario saber de antemano ni el número de grupos, ni la estructura de las funciones, ni la pertenencia de los puntos de datos individuales. Esto distingue este enfoque de los procedimientos en los que los expertos determinan de antemano cuántos grupos deben buscarse, un requisito que en la práctica a menudo se basa en conjeturas.

Probado en 211 conjuntos de datos

El equipo del CluBS utilizó 211 conjuntos de datos reales y sintéticos para la evaluación. Para los datos sintéticos se conocía la solución correcta, de modo que fue posible comprobar si el proceso realmente encontró las conexiones integradas. Los datos reales fueron más reveladores: allí los investigadores a menudo encontraron evidencia de que varias funciones explican las observaciones mejor que un modelo uniforme que debería cubrirlo todo. Los hallazgos aparecieron en las actas de la 32ª Conferencia ACM sobre Descubrimiento de Conocimiento y Análisis de Datos, o KDD, una de las conferencias emblemáticas de la industria, donde los artículos se revisan antes de su aceptación.

Tal vez también te interese leer  Porque la humanidad también es indispensable en 2025

Porque esto va más allá de la informática

La ventaja no reside tanto en las estadísticas como en la explicabilidad. Muchos métodos modernos de aprendizaje automático proporcionan predicciones precisas, pero ninguna justificación inteligible porque su funcionamiento interno se compone de millones de parámetros. Una ecuación matemática, por otro lado, se puede leer, verificar y clasificar técnicamente y revela qué cantidades están conectadas y cómo. Esta es una diferencia significativa para ingenieros, biólogos o economistas, porque una fórmula permite sacar conclusiones sobre el mecanismo subyacente. El nivel que ha alcanzado hoy la evaluación de datos se puede comprobar de forma impresionante en otros lugares, por ejemplo cuando una inteligencia artificial reconstruye en tiempo real lo que una persona está viendo en ese momento.

¿Qué pasa después?

Como siguiente paso, los investigadores quieren ampliar los posibles usos de las predicciones. Hasta la fecha, el método agrupa datos existentes; en el futuro podrá decidir de manera confiable cuál de las funciones encontradas aplicar, incluso cuando se desconozcan los valores. El valor práctico depende precisamente de esto, porque sólo así será posible predecir, en una nueva medición, en qué estado operativo se encuentra un sistema y cómo seguirá comportándose. Además, no está claro qué tan bien el método puede manejar cantidades muy grandes de datos y valores medidos muy ruidosos, ya que la regresión simbólica requiere un uso computacional intensivo. Este es el punto de partida habitual de un procedimiento que no se presentó hasta el verano de 2026 y ahora comienzan las pruebas por parte de otros grupos de trabajo.

Actas de la 32ª Conferencia ACM SIGKDD sobre descubrimiento de conocimientos y minería de datos, CluBS: Agrupación de similitud de comportamiento; doi:10.1145/3770855.3817875




Related posts

El chip de silicio alcanza por primera vez las prestaciones de la fibra de vidrio

Nuestras Noticias

China es el primer país en cruzar la producción de energía solar de 1,000 GW

Nuestras Noticias

Por primera vez es posible la comunicación entre dos personas en un sueño

Nuestras Noticias