Il y a quelques générations de modèles, repérer l'art IA était presque un jeu de société — mains difformes, texte d'arrière-plan illisible, peau qui semblait aérographiée jusqu'à l'irréel. Les modèles de diffusion plus récents ont discrètement comblé la plupart de ces lacunes, et les outils de détection doivent travailler bien plus dur pour suivre, avec une précision qui varie bien plus que la plupart des gens ne le supposent.
Générer avec les modèles les plus récentsMains déformées, doigts en trop, texte d'arrière-plan brouillé et symétrie faciale étrange étaient des signes fiables des modèles de l'ère 2022–2023. Les générations plus récentes, entraînées sur des jeux de données plus vastes avec une meilleure supervision anatomique et une résolution native plus élevée, ont corrigé la plupart de ces modes d'échec spécifiques — c'est exactement pourquoi ils ne fonctionnent plus comme test visuel rapide.
Les détecteurs modernes ont largement cessé de chercher des erreurs visuelles évidentes et se sont tournés vers des empreintes statistiques invisibles à l'œil humain — artefacts dans le domaine fréquentiel laissés par le processus de génération, résidus de motifs de bruit caractéristiques de l'échantillonnage par diffusion et, quand elles sont présentes, des métadonnées de provenance intégrées. C'est un type de preuve fondamentalement différent de « cette main a l'air fausse ».
Des benchmarks indépendants de 2026 ont trouvé que les détecteurs les plus performants atteignaient 91 à 94 % de précision sur des images de générateurs connus comme Midjourney, DALL-E et Stable Diffusion XL dans des conditions de test propres. Cette précision chute fortement en conditions réelles — la recompression, les captures d'écran ou de petites retouches font tomber la précision de certains outils sous les 5 %, et face à des générateurs plus récents et plus fidèles, spécifiquement conçus pour être plus difficiles à identifier, aucun outil en test indépendant n'a dépassé 60 %.
La fidélité continue de grimper de génération en génération, et la détection court fondamentalement après plutôt que de rester en tête. Pour quiconque compare des générateurs IA, c'est aussi un signal de qualité en soi — un modèle plus récent et plus fidèle n'est pas seulement « plus joli à regarder », c'est précisément le type de sortie que la détection actuelle a le plus de mal à signaler comme synthétique.
Pas de façon fiable avec les modèles actuels. Les indices visuels qui fonctionnaient il y a quelques générations de modèles — déformation des mains, erreurs de texte d'arrière-plan — ont largement disparu des modèles plus récents à force d'entraînement.
La détection est plus difficile sur vidéo car il y a plus d'images et de cohérence temporelle à modéliser, bien que les mêmes techniques sous-jacentes de domaine fréquentiel et de motif de bruit s'appliquent, et les outils dans ce domaine s'améliorent rapidement.
Oui, de façon mesurable — des benchmarks indépendants ont spécifiquement trouvé que les outils de détection actuels performaient bien moins bien face aux générateurs plus récents et plus fidèles que face aux anciens, bien connus.
Les normes de provenance comme les credentials de contenu intégrés sont le signal le plus fiable là où ils sont présents, mais leur adoption est incohérente et ils sont faciles à effacer par recodage, donc ce n'est pas une solution universelle aujourd'hui.











