Grok Imagine Video 1.5 : la cohérence de personnage

— AUDIOVISUEL

xAI ajoute à Imagine Video 1.5 la génération en 1080p natif, jusqu'à sept images de référence par plan et une voix associée à un personnage pour le garder identique d'une séquence à l'autre. Reste que cette continuité, cœur du problème en motion design, arrive d'abord réservée aux abonnements les plus chers aux États-Unis.

Grok Imagine Video 1.5 : la cohérence de personnage

Ce qui change avec cette mise à jour n'est pas la qualité d'image, c'est la promesse de cohérence. Jusqu'ici, générer un personnage ou un produit identique sur plusieurs plans vidéo restait le vrai casse-tête de l'IA générative appliquée au motion design, bien plus que la résolution ou la fluidité du mouvement. xAI s'attaque directement à ce point avec sept images de référence utilisables dans une même génération, de quoi fixer un visage, un packaging ou un décor pendant qu'on fait varier l'action autour.

À mes yeux, c'est le motion designer publicitaire qui devrait regarder ça de près, celui qui doit livrer une série de plans pour un même spot avec un mascotte ou un produit reconnaissable d'une scène à l'autre. Imaginer un brief où le client valide un personnage sur une image, puis demande cinq déclinaisons d'actions en gardant le même visage et la même voix, c'est exactement le type de demande qui, avant, obligeait à retoucher plan par plan pour éviter les dérives visuelles. Ajouter une voix associée à ce même personnage pour la garder stable entre les séquences, c'est cocher une deuxième case qui pesait lourd en reprises.

La réserve tient en une phrase : cette fonction de voix par personnage démarre uniquement sur les abonnements les plus chers, et seulement aux États-Unis, avant une ouverture progressive annoncée sans calendrier précis. Difficile de ne pas y voir une fonction encore en rodage plutôt qu'un outil de production généralisé, ce qui change la manière de le vendre à un client pressé.

Le vrai apport reste réel : le rendu natif en 1080p sur le texte-vers-vidéo comme sur l'image-vers-vidéo évite le détour habituel par un second outil d'amélioration de définition, une étape que beaucoup de studios budgétisent encore en interne. Combiné à la génération audio intégrée, avec dialogues et ambiances produits dans le même passage, l'outil rapproche un peu plus le prototype animé du livrable final, sans pour autant remplacer l'étalonnage et le mixage propres à une vraie chaîne de post-production.

Reste à savoir si, le jour où la voix par personnage sera ouverte à tous les abonnements et à toutes les zones, un studio osera vraiment y confier un personnage récurrent de marque plutôt qu'un simple test de faisabilité.

Sources

Umiros Média