Concept Modèles de diffusion
Génération de texte où le modèle raffine tout un bloc par passes successives, au lieu d'écrire token par token comme l'autorégression.
SFEIR AI · Publié le 26 juin 2026 · Mis à jour le 26 août 2026
Raffiner un bloc plutôt qu'écrire mot à mot
Les modèles de diffusion appliquent au texte la technique qui a donné les générateurs d'images (DALL·E, Midjourney, Stable Diffusion). Au lieu de prédire le token suivant de gauche à droite, le modèle part d'un brouillon entièrement bruité et le raffine en plusieurs passes, en travaillant sur toute la séquence à la fois. L'attention est bidirectionnelle : chaque mot voit ceux qui le suivent. Google décrit le principe dans les mêmes termes : un modèle « qui apprend à générer ses sorties en convertissant du bruit aléatoire en texte ou en code cohérent ».
Trois annonces, trois états de disponibilité
L'approche sort du laboratoire en 2025. Le 26 février, Inception Labs — startup issue de Stanford, cofondée en 2024 par Stefano Ermon, Aditya Grover et Volodymyr Kuleshov — dévoile Mercury Coder, présenté comme le premier modèle de langage à diffusion à l'échelle commerciale. Son rapport technique rapporte des débits mesurés par un tiers, Artificial Analysis : 1 109 tokens par seconde pour Mercury Coder Mini et 737 pour Mercury Coder Small, sur GPU H100. Le 20 mai 2025, Google DeepMind annonce à son tour Gemini Diffusion, comme modèle de recherche expérimental accessible sur liste d'attente, en revendiquant un débit cinq fois supérieur à celui de Gemini 2.0 Flash-Lite — un facteur annoncé par l'éditeur, à la différence des mesures d'Artificial Analysis.
Ces trois objets ne sont pas au même stade. Gemini Diffusion reste une démonstration sur liste d'attente ; Mercury est proposé par API et en déploiement sur site pour des clients entreprise ; DiffusionGemma, publié par Google en juin 2026, se télécharge librement sur Hugging Face — environ 26 milliards de paramètres pour 4 milliards actifs, sous licence Apache 2.0 déclarée sur son dépôt.
Une force pour l'édition, pas la page blanche
Parce que la séquence reste modifiable jusqu'au bout, la diffusion excelle sur les tâches d'édition : reformulation, infilling (combler un trou entre un début et une fin fixés), refactoring et correction de bugs. C'est le cœur de la maintenance logicielle. Google annonce pour DiffusionGemma jusqu'à quatre fois plus de tokens par seconde qu'un modèle autorégressif comparable — chiffre d'éditeur, non mesuré par un tiers.
Une brique spécialisée, pas un remplaçant
La diffusion reste en retrait sur le raisonnement étape par étape et les longs contextes ; Google recommande Gemma 4 classique pour la qualité maximale. Une contrainte découle directement du mécanisme : rien n'étant achevé avant la fin du débruitage, ces modèles ne diffusent pas leur sortie au fil de l'eau, ce qui demande d'adapter l'interface conversationnelle. Le bon usage est hybride : la diffusion comme brique d'édition locale rapide et de faible latence (IDE, agents, exécution edge), l'autorégression pour le raisonnement et la conversation.
Questions fréquentes
Quelle différence entre un modèle de diffusion et un modèle autorégressif ?
Un modèle autorégressif écrit le texte token par token, de gauche à droite, sans revenir en arrière. Un modèle de diffusion part d'un bloc bruité et le raffine par passes successives, en gardant toute la séquence modifiable. Il peut donc corriger ses erreurs et combler un trou au milieu.
Quels éditeurs ont annoncé de tels modèles ?
Inception Labs avec Mercury Coder, dévoilé le 26 février 2025 ; Google DeepMind avec Gemini Diffusion, annoncé le 20 mai 2025 comme modèle de recherche expérimental ; puis Google avec DiffusionGemma, publié en juin 2026 sur Hugging Face.
Ces modèles sont-ils disponibles ?
Selon lequel. Gemini Diffusion reste une démonstration sur liste d'attente. Mercury est proposé par API et en déploiement sur site pour des clients entreprise. DiffusionGemma se télécharge librement, sous la licence Apache 2.0 déclarée sur son dépôt.
Quel est l'intérêt principal de la diffusion pour le texte ?
La vitesse : la génération parallèle permet des débits élevés — 1 109 et 737 tokens par seconde pour les deux tailles de Mercury Coder sur H100, mesurés par Artificial Analysis selon le rapport technique d'Inception Labs.
Quelle est la limite pour une interface de chat ?
Rien n'est visible avant la fin du débruitage : ces modèles ne diffusent pas leur sortie au fil de l'eau, contrairement aux modèles autorégressifs. L'interface conversationnelle doit être adaptée en conséquence.
Les modèles de diffusion vont-ils remplacer les LLM actuels ?
Non, pas à court terme. Ils restent en retrait sur le raisonnement et les longs contextes. Leur intérêt est d'être une brique spécialisée pour l'édition rapide (autocomplétion, infilling, refactoring) dans des pipelines hybrides.