- Black Forest Labs et mimic robotics ont développé FLUX-mimic, testé et déployé sur les lignes de production d’Audi, en combinant la prédiction d’actions robotiques avec le backbone FLUX 3, entraîné conjointement sur l’image, la vidéo et l’audio
- La prédiction vidéo, qui représente plus de 95 % du calcul d’entraînement, permet d’apprendre le contact, le mouvement, le poids et les relations de cause à effet ; les actions robotiques de faible dimension sont également traitées comme une modalité supplémentaire représentant la même réalité physique
- Juste après l’ajout de la prédiction d’actions, la qualité de génération vidéo a chuté jusqu’à 10 %, mais elle a retrouvé son niveau initial après 3 500 étapes, confirmant qu’un même backbone peut assurer à la fois génération et prédiction d’actions
- En unifiant apprentissage génératif et apprentissage de représentations avec Self-Flow, puis en connectant un décodeur d’actions léger, le système atteint moins de 80 ms pour le traitement du backbone sur une seule NVIDIA RTX 5090, et un temps de réaction robotique total de 101 ms
- Le modèle du monde, entraîné à grande échelle sur la vidéo générale et les tâches de manipulation, s’adapte à de nouvelles tâches avec peu de démonstrations et réessaie après un échec, ce qui le rend utile pour des opérations de production jusque-là coûteuses à automatiser, comme les pièces flexibles et la manipulation de précision
Un seul backbone pour la génération de contenu et le contrôle robotique
- Après FLUX 1·FLUX 2, centrés sur la génération d’images, FLUX 3 apprend dès le départ conjointement l’image, la vidéo et l’audio afin de générer du contenu audiovisuel de manière unifiée
- Black Forest Labs a fourni à mimic robotics une version précoce de FLUX 3, et les deux entreprises ont combiné leur expertise en apprentissage et déploiement robotique ainsi qu’en modèles de fondation pour développer FLUX-mimic
- mimic prend en charge ses propres robots, l’apprentissage robotique, la manipulation fine et le déploiement en environnement de production
- Black Forest Labs apporte ses modèles visuels de fondation et ses capacités d’apprentissage et de modélisation multimodaux
- FLUX-mimic est un modèle vidéo-action de manipulation générale fondé sur le backbone FLUX 3, intégré au système de déploiement full-stack de mimic
- Le même backbone génère des contenus image, vidéo et audio tout en exécutant des actions dans le domaine de l’IA physique
Apprendre le monde physique par la prédiction vidéo
- Plus de 95 % du calcul d’entraînement de FLUX 3 est consacré à la prédiction vidéo
- Pour créer des vidéos réalistes, il faut apprendre le contact, le mouvement, le poids ainsi que les causes et les effets ; si ces éléments sont mal modélisés, la vidéo produite paraît elle aussi artificielle
- Le processus consistant à rendre le monde avec précision est lié à l’apprentissage de son fonctionnement
- L’audio est une modalité de faible dimension, représentant moins de 0,5 % des tokens dans les vidéos 720p avec son
- Un modèle qui comprend la vidéo peut apprendre les relations causales entre une voix synchronisée avec les mouvements des lèvres et des effets sonores liés à des événements physiques
- Les actions robotiques sont elles aussi des représentations d’état de faible dimension, étroitement couplées aux observations visuelles
- Les actions, l’audio et les images vidéo représentent chacun partiellement une même réalité physique
- La prédiction d’actions ne consiste pas à créer un modèle de fondation distinct, mais à connecter au modèle du monde existant un autre mode d’observation
Une qualité de génération retrouvée après l’apprentissage des actions
- Lorsque la prédiction d’actions a été ajoutée à l’entraînement à grande échelle, les scores d’évaluation humaine pour la génération texte-vidéo et image-vidéo ont d’abord chuté jusqu’à 10 %
- La qualité s’est rétablie à mesure que le modèle apprenait la structure de l’espace d’actions et alignait sa représentation interne du monde ; après 3 500 étapes, il a retrouvé son niveau initial de génération vidéo tout en devenant capable de prédire les actions
- L’intégration des actions dans les entrées et sorties a provoqué une confusion temporaire, mais n’a pas sacrifié durablement la capacité des compétences existantes
- Il n’est pas nécessaire d’avoir des modèles de fondation séparés pour la génération vidéo et la prédiction d’actions : le même backbone unique accomplit les deux tâches
Une architecture qui décode l’action depuis la représentation du monde
- FLUX-mimic décode les actions robotiques à partir de la représentation interne du monde que FLUX 3 a apprise pour la génération vidéo
- Selon l’approche utilisée d’abord dans mimic-video, des caractéristiques intermédiaires sont extraites du chemin de prédiction vidéo de FLUX, puis un décodeur d’actions léger est entraîné par-dessus
- Les performances dépendent de deux facteurs liés
- Qualité du modèle du monde : sans compréhension de la manière dont le monde bouge, une simulation précise est également difficile, ce qui est directement lié à la qualité de génération
- Qualité de la représentation : si les relations causales entre modalités sont entremêlées de façon non linéaire dans l’espace des caractéristiques, le décodeur d’actions doit les interpréter avec une difficulté comparable à celle des entrées brutes
- Les modèles génératifs offrent une simulation de haute qualité et des lois de passage à l’échelle prévisibles avec l’augmentation du calcul, mais ils produisent des représentations moins découplées que les méthodes spécialisées d’apprentissage de représentations, ce qui peut limiter leur utilité pour les tâches aval nécessitant une compréhension du monde
Unifier génération et apprentissage de représentations avec Self-Flow
- Self-Flow unifie l’apprentissage génératif et l’apprentissage de représentations dans un seul framework
- Après son application, la qualité du modèle du monde et celle des représentations s’améliorent ensemble
- Les performances du modèle du monde, mesurées par la qualité de génération de vidéos, d’images et d’audio, augmentent
- La qualité des représentations, mesurée par le taux de réussite de tâches de contrôle robotique simulées, s’améliore également
- FLUX 3 étend Self-Flow pour apprendre dès le départ une large gamme de dynamiques du monde et de capacités de manipulation
- Des dizaines de millions d’heures de contenu vidéo général
- Des centaines de milliers d’heures de contenu vidéo centré sur la manipulation humaine et robotique
- Cet entraînement à grande échelle permet d’étendre les résultats de Self-Flow obtenus en laboratoire à des environnements réels de production et de logistique
Tâches en usine et performances sur benchmarks
- mimic déploie FLUX-mimic sur des tâches industrielles réelles
- Kitting consistant à placer des pièces dans des plateaux structurés
- Insertion d’unités de commande électronique dans des dispositifs de fixation avec peu de jeu
- Assemblage de pièces
- Manipulation de matériaux souples et flexibles comme des fils ou des câbles
- Même lorsque le backbone FLUX est entièrement gelé, le décodeur d’actions obtient de meilleures performances que les précédents modèles vision-langage-action, qui ne parvenaient pas à réussir les tâches dans cette configuration
- Lorsque le backbone et le décodeur d’actions sont affinés ensemble, FLUX-mimic atteint des taux de réussite de tâches de tout premier niveau
- L’entraînement à grande échelle fournit au backbone des connaissances sur le monde et l’action, tandis que Self-Flow rend ces connaissances facilement décodables dans les représentations de caractéristiques
Apprendre avec peu de démonstrations et récupérer après un échec
- Lorsque les lois physiques sont déjà encodées dans une représentation accessible, s’adapter à une nouvelle tâche consiste à relier cette tâche précise aux connaissances existantes, plutôt qu’à réapprendre le fonctionnement du monde
- Dans les expériences Self-Flow, le nombre d’étapes d’apprentissage de prédiction d’actions nécessaires pour atteindre le même taux de réussite est réduit de moitié par rapport à un modèle vidéo n’utilisant pas Self-Flow
- Dans l’article mimic-video, le modèle vidéo-action montre une efficacité d’échantillonnage jusqu’à 10 fois supérieure à celle des modèles vision-langage-action, et FLUX-mimic combine ces deux effets
- Si le robot échoue à saisir un objet, il peut effectuer une récupération d’échec naturelle en ajustant sa pose pour le saisir à nouveau et terminer la tâche
- Comme il est impossible d’inclure tous les types d’échecs dans les données de démonstration, les comportements de récupération non démontrés proviennent d’un modèle qui a déjà appris le fonctionnement du monde
Un système robotique qui réagit en 101 ms
- Dans les environnements réels, le modèle doit agir au rythme des changements de l’environnement, et l’essentiel du coût de calcul de FLUX-mimic provient de son plus grand composant, le backbone
- Une représentation du monde bien structurée permet d’atteindre les mêmes performances avec moins de paramètres, ce qui rend possible l’utilisation d’un backbone plus petit et plus rapide
- Le backbone optimisé s’exécute en moins de 80 ms sur une seule NVIDIA RTX 5090, de l’entrée à la génération de la représentation du monde, soit un ordre de grandeur comparable au temps de réaction visuelle humain
- mimic optimise les éléments suivants pour réduire les latences supplémentaires dans l’ensemble de la pile de déploiement
- Décodeur d’actions
- Latences interprocessus entre capteurs, modèle et actionneurs
- Découpage temps réel qui superpose prédiction et exécution afin d’éviter les à-coups du robot
- Avec toutes les optimisations appliquées, le temps de réaction final du système robotique autonome est de 101 ms
Application sur les lignes de production d’Audi
- Malgré un niveau élevé d’automatisation, Audi continuait à traiter manuellement les pièces flexibles et les tâches de manipulation de précision
- La production de produits premium implique de nombreuses variantes, ce qui rend coûteuse la reconception au cas par cas de cellules robotiques programmées de manière traditionnelle
- Les systèmes fondés sur l’apprentissage changent cette structure de coûts
- L’Audi Production Lab collabore avec mimic pour tester et déployer FLUX-mimic
- Le système réalise des manipulations complexes d’objets souples qui étaient impossibles avec les robots existants
- Il peut être utilisé pour assister les employés, améliorer l’efficacité et étendre l’automatisation flexible de la production et de la logistique
- L’efficacité d’échantillonnage et la robustesse de FLUX-mimic ne viennent pas d’une ingénierie propre à chaque tâche, mais du backbone FLUX 3 et de représentations décodables, ce qui favorise le transfert entre tâches, secteurs et matériels
- Un même modèle de fondation d’intelligence visuelle génère des images, des vidéos et de l’audio tout en pilotant les robots d’une ligne de production
1 commentaires
Commentaires sur Hacker News
Il semble qu’à l’intérieur d’un modèle multimodal de génération vidéo bien entraîné, un modèle de représentation du monde se forme, et que son extraction pour l’appliquer à la robotique fonctionne bien
L’idée qu’un modèle vidéo comprenne la matière, la lumière et le monde n’est pas nouvelle, mais il est rare de voir un labo vidéo se transformer en labo de robotique. Cela pourrait devenir une trajectoire business consistant à changer d’échelle via la génération vidéo, puis à utiliser cette capacité pour entraîner des robots
La main de BFL, qui donne l’impression de cacher plusieurs dispositifs dans un gant, est aussi intéressante. Robotics-1 de Xiami crée des vidéos d’entraînement avec un gripper classique et un gant de type gripper, mais le modèle BFL semble ne pas avoir besoin de ce type d’équipement. Comme le hardware est un domaine difficile, je suis curieux de voir la suite de cette approche
https://waymo.com/blog/2026/02/the-waymo-world-model-a-new-f...
Luma Labs https://lumalabs.ai/news/luma-open-physical-ai-lab
Runway https://runway.com/product/robotics
Vers 3 min 30, la scène où le bras robotique remet en place une moulure de fenêtre après trois tentatives était assez impressionnante. C’est la première fois que je vois ce type de résolution de problème après un échec, et je me demande si c’est une technique nouvelle
Dans l’explication selon laquelle « pour les tâches qui nécessitent une compréhension du monde, des représentations moins désintriquées sont moins utiles », la formulation qui rend le concept d’“entangled” par représentations moins désintriquées est amusante. En décrivant le monde réel, on finit par rendre le concept lui-même encore plus embrouillé ; ça ressemble bien à une tournure typique de LLM
La technologie progresse à ce point, et pourtant les films semblent pires que jamais, ce qui me rend triste. Pour trouver quelque chose de correct, je regarde souvent des films vieux de plusieurs décennies ; même avec des marionnettes ridicules, la construction du récit était 1 000 fois meilleure
Ce n’est pas seulement un problème de capital-risque ; cela rejoint ce qu’on appelle le Hollywood No. À l’inverse, le problème peut aussi être le Hollywood No lui-même, et dans le jeu vidéo, on a appelé cela la positivité toxique
Ravi de voir une coopération entre startups européennes
C’est le futur, tout en étant déjà le présent. J’aimerais que vous partagiez aussi cela avec vos proches qui sont en dehors du développement logiciel et de l’ingénierie
Nous fonçons droit vers une crise où la valeur des humains ne possédant pas les moyens de production baisse encore davantage. Une période sombre semble approcher