Le 23 juillet 2026, le laboratoire allemand Black Forest Labs a lancé FLUX 3, un modèle entraîné en même temps sur l'image, la vidéo et l'audio, capable de produire vingt secondes de vidéo sonore depuis un seul prompt. Sa singularité est architecturale, pas quantitative : sur la durée, le prix ou la qualité mesurée, il n'est premier nulle part. Dans un marché où six modèles se partagent quatre axes différents, la vraie question n'est plus lequel est le meilleur, mais lequel correspond à votre usage.
Chaque nouveau modèle vidéo est présenté comme une révolution. Pour savoir ce qu'il en est vraiment, il faut le replacer dans un paysage qui a énormément bougé en six mois. Voici ce que propose FLUX 3, et surtout où il se situe face à ceux que vous utilisez peut-être déjà.
Qui est Black Forest Labs
Le nom est moins connu que Google ou ByteDance, mais il pèse. Black Forest Labs est une société de recherche allemande basée à Fribourg, fondée par l'équipe qui était au coeur de Stable Diffusion. Autrement dit, les gens qui ont largement popularisé la génération d'images open source. Le réalisateur Martin Scorsese figure parmi ses conseillers. Jusqu'ici, la famille FLUX était réservée à l'image fixe, avec une solide réputation sur le respect des prompts.
Sa vraie singularité : un seul cerveau pour trois sens
Voici ce qui distingue réellement FLUX 3, et ce n'est pas un chiffre. La plupart des outils qui produisent de la vidéo sonore assemblent en réalité plusieurs modèles séparés derrière une interface commune : un modèle génère l'image, un autre l'anime, un troisième fabrique le son, et une couche logicielle recolle les morceaux.
FLUX 3 a été entraîné conjointement sur l'image, la vidéo et l'audio, dans une architecture unique, via une approche baptisée Self-Flow. Il apprend la structure spatiale, le mouvement, le son et les interactions physiques ensemble plutôt que comme des tâches distinctes. C'est un exemple abouti de ce que nous décrivions dans notre article sur les modèles multimodaux.
Conséquence pratique : le son n'est pas ajouté après coup, il est natif. Le modèle fait correspondre l'audio aux événements visibles, gère le dialogue multilingue, et produit des expressions faciales plus cohérentes parce qu'il a appris le lien entre un visage qui parle et le son qui en sort.
Le paysage réel, en juillet 2026
Passons à ce qui manque à la plupart des articles sur le sujet : la comparaison. Voici où se situent les principaux modèles sur les axes qui comptent vraiment.
| Modèle | Durée en un seul passage | Prix indicatif | Son point fort |
|---|---|---|---|
| Seedance 2.5 (ByteDance) | 30 s, sans raccord | Variable selon plateforme | La plus longue durée native, 4K, jusqu'à 50 références |
| Gemini Omni Flash (Google) | ~10 s (aperçu plafonné) | ~0,10 $/seconde | En tête des quatre classements Artificial Analysis |
| FLUX 3 (Black Forest Labs) | 20 s | Non communiqué | Architecture unifiée image, son, vidéo, action |
| Kling 3.0 (Kuaishou) | 15 s | ~0,11 à 0,14 $/s (Turbo) | 4K natif à 60 fps, storyboards multi-plans, lip-sync par personnage |
| Veo 3.1 (Google) | ~8 s | 0,05 à 0,40 $/s selon palier | Le meilleur polyvalent, dialogue en 48 kHz |
| Runway Gen-4.5 | 5 à 10 s | Selon abonnement | Le contrôle le plus fin : pinceaux de mouvement, écosystème pro |
Ce tableau raconte une histoire simple : aucun modèle ne gagne sur tous les axes. Seedance 2.5 domine la durée avec ses trente secondes sans raccord. Gemini Omni Flash domine la qualité mesurée et le prix. Kling 3.0 domine la finition technique en 4K à 60 images par seconde. Runway domine le contrôle créatif. Et FLUX 3 arrive au milieu du peloton sur la durée, sans prix public.
Sur le classement Artificial Analysis texte-vers-vidéo avec audio, où des humains votent sans savoir quel modèle a produit quoi, l'ordre était le suivant : Gemini Omni Flash en tête avec un Elo d'environ 1 240, puis Seedance 2.0 en 720p à 1 225, HappyHorse-1.1 d'Alibaba à 1 149, et Kling 3.0 Pro à 1 110. Runway Gen-4.5, numéro un à son lancement fin 2025 avec 1 247, est sorti du top 10. Le rythme de renouvellement de ce marché est brutal.
Ce que valent les chiffres de Black Forest Labs
Le laboratoire annonce des comparaisons flatteuses issues de ses propres tests de préférence : FLUX 3 aurait été préféré à Luma Ray 3.2 dans 93% des cas et à Runway Gen-4.5 dans 77%.
Mais les chiffres les plus honnêtes sont ceux que le laboratoire publie sur ses concurrents les plus sérieux. Face à Seedance 2.0 et à Gemini Omni Flash, le résultat tourne autour de 52%, ce qui signifie que sur une vidéo de dix secondes générée depuis du texte, les modèles sont statistiquement indistinguables. Battre les modèles en retrait tout en faisant jeu égal avec les leaders, c'est une performance honorable, pas une domination. Et comme nous le rappelons dans notre article sur les benchmarks, ces comparaisons viennent du vendeur et n'ont pas été auditées.
L'absence de prix, un problème réel
C'est la case rouge du tableau, et elle est disqualifiante à court terme. Sans grille tarifaire publiée, impossible de calculer un coût par projet ni de comparer sérieusement. Quand Gemini Omni Flash affiche 0,10 dollar la seconde et Kling Turbo autour de 0,12, un modèle sans prix ne peut pas entrer dans une décision d'achat.
Deux autres manques s'ajoutent. Le déploiement est partiel : seul FLUX 3 Video est en accès anticipé, la partie image doit suivre. Et les poids ne sont pas ouverts, ce qui est notable pour un laboratoire dont la réputation s'est bâtie sur l'open source. Une version à poids ouverts est promise plus tard dans l'année, sans date. Comme nous l'écrivions à propos de Kimi K3, une promesse au calendrier n'est pas un fichier sur votre disque dur.
Le pari caché : la robotique
Si FLUX 3 ne vise pas la première place des classements, que vise-t-il ? La réponse se trouve dans la partie la plus inattendue de l'annonce. La même architecture qui génère des vidéos alimente FLUX-mimic, un modèle vidéo-action développé avec la société mimic robotics, actuellement testé par Audi sur une ligne de production.
La logique se tient : pour générer une vidéo crédible, un modèle doit comprendre comment les objets bougent, tombent, se déforment et sonnent. C'est exactement ce dont un robot a besoin pour manipuler le monde physique. Black Forest Labs parie que l'IA physique et la création de contenu reposent sur la même fondation. Ses concurrents optimisent pour de plus belles vidéos ; lui construit un modèle du monde dont la vidéo n'est qu'une sortie parmi d'autres. C'est un pari de long terme, impossible à évaluer aujourd'hui.
Alors, lequel choisir ?
La bonne question n'est pas quel est le meilleur modèle, mais quel axe compte pour vous. Si vous avez besoin d'un plan long sans raccord, Seedance 2.5. Si vous cherchez le meilleur rapport qualité-prix avec des allers-retours conversationnels, Gemini Omni Flash. S'il vous faut du 4K broadcast et du dialogue multi-personnages, Kling 3.0. Si le contrôle créatif fin prime, Runway. Si vous voulez le polyvalent le plus sûr, Veo 3.1.
Et FLUX 3 ? Pour l'instant, c'est un modèle à surveiller plutôt qu'à adopter. Son architecture unifiée est intellectuellement la plus ambitieuse du lot, et son ambition robotique pourrait le rendre pertinent d'une façon que les autres ne visent même pas. Mais tant qu'il n'a ni prix public, ni poids ouverts, ni déploiement complet, il reste une promesse bien construite dans un marché où six concurrents livrent déjà.
Ce qui frappe, en regardant ce tableau, c'est la vitesse à laquelle la hiérarchie se recompose. Runway était numéro un il y a huit mois et n'est plus dans le top 10. Le leader d'aujourd'hui sera peut-être dépassé à la rentrée. Pour un créateur, la conclusion pratique est peut-être celle-ci : ne construisez pas votre travail autour d'un modèle, construisez-le autour de ce que vous voulez raconter, et changez d'outil quand un meilleur arrive. Ils arrivent vite.