Hace un par de generaciones, detectar arte de IA era casi un truco de fiesta — manos deformadas, texto de fondo distorsionado, piel que parecía aerografiada hasta lo irreal. Los modelos de difusión más recientes han cerrado silenciosamente la mayoría de esas brechas, y las herramientas de detección tienen que esforzarse mucho más para mantenerse al día, con una precisión que varía mucho más de lo que la mayoría asume.
Generar con los modelos más nuevosLas manos distorsionadas, los dedos extra, el texto de fondo confuso y la simetría facial inquietante eran señales fiables de los modelos de la era 2022–2023. Las generaciones más recientes, entrenadas con conjuntos de datos más grandes, mejor supervisión anatómica y mayor resolución nativa, han corregido la mayoría de estos patrones de fallo específicos — precisamente por eso ya no funcionan como una prueba visual rápida.
Los detectores modernos en su mayoría dejaron de buscar errores visuales obvios y pasaron a huellas estadísticas invisibles para el ojo humano — artefactos en el dominio de la frecuencia dejados por el proceso de generación, residuos de patrones de ruido característicos del muestreo por difusión y, cuando está presente, metadatos de procedencia incrustados. Es un tipo de evidencia fundamentalmente distinto a "esa mano se ve mal".
Pruebas comparativas independientes de 2026 encontraron que los detectores líderes alcanzaban entre 91–94 % de precisión en imágenes de generadores conocidos como Midjourney, DALL-E y Stable Diffusion XL bajo condiciones de prueba limpias. Esa precisión cae drásticamente en condiciones reales — la recompresión, las capturas de pantalla o pequeñas ediciones hacen que la precisión de algunas herramientas caiga por debajo del 5 %, y contra generadores más nuevos y de mayor fidelidad, construidos específicamente para ser más difíciles de identificar, ninguna herramienta en pruebas independientes superó el 60 %.
La fidelidad sigue aumentando de generación en generación, y la detección está fundamentalmente tratando de alcanzarla en lugar de ir por delante. Para cualquiera que compare generadores de IA, esto también es una señal de calidad en sí misma — un modelo más nuevo y de mayor fidelidad no es solo "más bonito de ver", es precisamente el tipo de resultado que a la detección actual más le cuesta marcar como sintético.
No de forma fiable con los modelos actuales. Las señales visuales que funcionaban hace un par de generaciones de modelos — distorsión de manos, errores de texto de fondo — se han entrenado en su mayoría fuera de los modelos más nuevos.
La detección es más difícil en video porque hay más fotogramas y más consistencia temporal que modelar, aunque se aplican las mismas técnicas subyacentes de dominio de frecuencia y patrón de ruido, y las herramientas en esta área están mejorando rápidamente.
Sí, de forma medible — las pruebas comparativas independientes encontraron específicamente que las herramientas de detección actuales rinden mucho peor contra generadores más nuevos y de mayor fidelidad que contra los más antiguos y conocidos.
Los estándares de procedencia como las credenciales de contenido incrustadas son la señal más fiable donde están presentes, pero se adoptan de forma inconsistente y son fáciles de eliminar mediante la recodificación, así que no son una solución universal hoy en día.











