Black Forest Labs fait piloter des bras robotiques par ses modèles vidéo

— AGENTS

FLUX 3 Action prend une instruction, une image de caméra et l'état des articulations pour produire en même temps le geste et l'image qui doit en résulter. Sur un bras Franka, il réussit 28 tentatives sur 30, un score qui parle davantage aux ingénieurs en robotique qu'aux studios créatifs.

Black Forest Labs fait piloter des bras robotiques par ses modèles vidéo

Black Forest Labs, la maison derrière FLUX et ses générateurs d'images, publie un modèle qui commande des bras robotiques. FLUX 3 Action reçoit une consigne, une image de caméra et la position des articulations, puis produit dans le même mouvement la commande motrice à exécuter et l'image qui doit en résulter. Le même cerveau prévoit le geste et ce que l'œil va voir ensuite, ce qui évite de faire deux calculs séparés pour une seule décision.

Ce modèle s'adresse aux équipes qui entraînent des robots à manipuler des objets, pas aux directions artistiques. Les données d'entraînement viennent massivement de vidéo, complétées par des séquences de jeux vidéo et de la téléopération sur quatorze configurations de bras robotiques. Sur un bras Franka testé en conditions réelles, le modèle réussit 28 tentatives sur 30, un score supérieur aux modèles concurrents cités dans le même protocole. C'est un résultat de laboratoire de robotique, obtenu sur un échantillon de trente essais, loin d'une chaîne de production industrielle.

Le signal intéressant se loge ailleurs. Black Forest Labs construit sa réputation créative sur des générateurs d'images utilisés dans des ateliers de conception visuelle. Voir cette même équipe investir dans le contrôle robotique dit où va son énergie de recherche et où elle place ses paris commerciaux. Un studio qui dépend de FLUX pour ses visuels regarde ainsi une entreprise qui élargit son terrain de jeu bien au-delà de l'image fixe.

La réserve tient à l'échelle du test. Trente tentatives par tâche ne suffisent pas à juger la fiabilité d'un système destiné à manipuler des objets réels sans supervision constante. Le protocole hybride associant ce modèle à un raisonneur plus lent montre d'ailleurs que la vitesse seule ne suffit pas à garantir un taux de réussite complet, il faut parfois repasser la main à un système plus lent et plus cher.

Ce genre d'investissement en robotique se finance avec les mêmes ressources que celles consacrées aux modèles d'image. Un éditeur qui diversifie ainsi ses efforts de recherche redistribue son attention, et donc potentiellement son rythme d'amélioration sur les outils que les créatifs utilisent aujourd'hui. La question à se poser demain matin n'est pas celle du robot, mais celle de la prochaine mise à jour de FLUX et du temps qu'elle mettra à sortir.

Sources

Umiros Média