inicio / artículos / el ouroboros de los datos: lo que pasa cuando la ia se entrena con ia

El ouroboros de los datos: lo que pasa cuando la IA se entrena con IA

Los modelos se están quedando sin datos humanos y empiezan a alimentarse de su propia salida. Esto es lo que la evidencia dice sobre el colapso de modelos, sin el pánico ni la negación de siempre.

Hagan la prueba con una fotocopiadora vieja. Fotocopien una hoja. Después fotocopien la fotocopia. Después esa. Repitan cincuenta veces. Lo que queda al final no es el documento original degradado un poco: es ruido con forma de documento. Los bordes se pierden primero. Después el detalle fino. Al final, la mancha se come todo.

Esa es, con una precisión que no esperaba encontrar en una metáfora de oficina, la descripción exacta de lo que le puede pasar a un modelo de lenguaje entrenado con su propia salida. Se llama model collapse, y desde 2024 dejó de ser una curiosidad de paper para convertirse en un problema con nombre y apellido en la industria.

El mecanismo, sin misticismo

No hay nada esotérico acá. Es estadística de primer año, aplicada a una escala que la vuelve peligrosa. Un modelo genera texto. Ese texto —barato, abundante, disponible en cualquier rincón de la web— termina mezclado en el próximo lote de entrenamiento, del propio modelo o de otro. El nuevo modelo aprende un poco menos de la distribución real del mundo y un poco más de la distribución que el modelo anterior creyó que era el mundo. Repetido varias generaciones, el resultado converge hacia algo cada vez más angosto: menos variedad, menos casos raros, más repetición de lo promedio.

Ahí está el punto que a mí me interesa de verdad, el que conecta esto con algo más viejo que la inteligencia artificial: lo que desaparece primero no es el promedio. Es la cola. Los eventos infrecuentes, las formas de hablar poco comunes, los casos límite, la variedad genuina que vive en los extremos de cualquier distribución real. Y si hay algo que la historia de los sistemas complejos enseña es que la cola es exactamente donde vive la información que más importa. El evento raro no es ruido: es la señal que un sistema necesita para no ser frágil frente a lo inesperado. Un modelo que pierde sus colas no se vuelve “un poco peor”. Se vuelve ciego a todo lo que no haya visto ya masticado mil veces.

Lo que dice la evidencia (que no es lo que gritaron los titulares)

Acá hay que tener cuidado, porque el tema se prestó para el pánico fácil. Nature lo puso en tapa en 2024. El Wall Street Journal lo comparó con endogamia. Todo muy dramático, muy vendible, y parcialmente exagerado.

La investigación más reciente matiza bastante ese apocalipsis. Un estudio de 2024 mostró algo importante: el colapso catastrófico aparece cuando reemplazás los datos reales por sintéticos generación tras generación. Pero si en cambio acumulás —sumás datos sintéticos a los reales existentes, sin borrar la base original— el modelo se mantiene notablemente más estable, incluso a distintas escalas. Investigadores de Stanford, usando ocho definiciones distintas del fenómeno, encontraron que muchos de los escenarios catastróficos son evitables bajo condiciones realistas. Y un análisis publicado en Physical Review Letters en 2026 fue todavía más lejos: alcanza con un solo punto de datos genuinamente real mezclado en el entrenamiento para frenar el colapso, incluso cuando la mayoría del resto es sintético.

Esto no es una absolución. Es una corrección de precisión, que es lo único que me interesa cuando hablo de riesgo: el problema no es “usar datos sintéticos”, el problema es un diseño ingenuo de pipeline que borra el ancla a la realidad. La negligencia, no la síntesis, es la causa.

Pero tampoco es momento de relajarse del todo. En febrero de 2026, Communications of the ACM —una publicación que no se entusiasma fácil— confirmó que el colapso ya no es un riesgo teórico: aparece en sistemas de producción, hoy. Herramientas comerciales de recorte de fondo fallando específicamente en ciertas texturas de pelo. Generadores de imágenes volviéndose cada vez más homogéneos entre sí. Nada apocalíptico, todo silencioso, que es la forma en que las fallas serias suelen empezar.

El fin que nadie pidió

Lo que me resulta genuinamente interesante de este problema es que es, en el fondo, un problema de fragilidad estructural disfrazado de problema técnico. Un sistema que necesita variedad para funcionar bien, y que sistemáticamente destruye su propia fuente de variedad porque esa fuente es más barata que la real, es un sistema que está comprando estabilidad de corto plazo con fragilidad de largo plazo. Es el mismo patrón de siempre: uno optimiza lo que puede medir fácil —costo por token de entrenamiento, velocidad de generación de datos sintéticos— y termina degradando lo que no puede medir fácil hasta que explota.

Y hay una ironía particular en esto para cualquiera que trabaje con datos todos los días: el dato humano, genuino, con todos sus errores y su ruido y su variedad incómoda, se está convirtiendo en el recurso escaso de la era de la IA. Durante años tratamos el contenido humano como algo infinito, gratis, sin valor propio más que el inmediato. Ahora resulta que es, literalmente, el ancla que evita que el sistema entero se vaya a la deriva. Los grandes laboratorios ya están chocando contra lo que llaman el “muro de datos” —el agotamiento de texto humano de calidad disponible para entrenar—, y la carrera hacia pipelines sintéticos masivos es, en el fondo, una apuesta a que el problema del colapso está más resuelto de lo que en realidad está.

La lección de fondo

No hace falta ser catastrofista para tomarse esto en serio, y no hace falta ser negacionista para no entrar en pánico. Lo que hace falta es lo de siempre: no confundir “todavía no colapsó” con “no puede colapsar”. Un sistema puede parecer perfectamente sano durante mucho tiempo mientras pierde, generación tras generación, la variedad que lo hacía robusto frente a lo inesperado. Eso no se nota en el promedio. Se nota el día que aparece un caso que el sistema nunca vio, porque ya se había olvidado de que esos casos existían.

La pregunta que me parece más honesta para cualquiera que trabaje con modelos o con datos no es “¿va a colapsar la IA?”. Es más aburrida y más útil: ¿cuánta agua real, humana, con ruido genuino, estás manteniendo en tu pipeline, y sabés efectivamente cuánta es?