Dynamique générative d’images
(generative-dynamics.github.io)- Une approche qui applique une prior de l’espace image aux mouvements d’une scène à une seule image fixe, afin de la transformer en vidéo en boucle ou en scène dynamique interactive
- L’apprentissage utilise des trajectoires extraites de séquences vidéo réelles contenant des mouvements oscillatoires naturels, comme des arbres, des fleurs, une bougie ou des vêtements agités par le vent
- Le modèle traite les mouvements de longue durée dans le domaine de Fourier et prédit un volume spectral à partir d’une image unique via un échantillonnage par diffusion ajusté en fréquence
- Le volume spectral prédit est converti en texture de mouvement pour l’ensemble de la vidéo, puis utilisé pour générer des vidéos en boucle et permettre l’interaction avec des objets dans de vraies photos
- La démo nécessite un navigateur compatible WebGL2 et, pour des raisons de vitesse, utilise un mesh-warping au lieu du modèle de rendu haute qualité de l’article
Créer une scène dynamique à partir d’une image fixe
- Generative Image Dynamics est une méthode de modélisation d’une prior de l’espace image pour les mouvements d’une scène
- L’entrée est une image fixe unique, et la sortie est une vidéo en boucle fluide ou une scène dynamique avec laquelle l’utilisateur peut interagir
- On peut consulter le papier, arXiv et les matériaux complémentaires
- Ce travail a reçu le CVPR 2024 Best Paper Award
Prior de mouvement et méthode de rendu
- Les données d’apprentissage sont un ensemble de trajectoires de mouvement extraites de séquences vidéo réelles
- Des mouvements naturels et oscillatoires, comme des arbres, des fleurs, une bougie ou des vêtements agités par le vent, sont utilisés comme exemples
- Le modèle apprend une prior dense et de long terme sur le mouvement dans le domaine de Fourier
- À partir d’une image unique, il prédit un volume spectral via un échantillonnage par diffusion ajusté en fréquence
- Le volume spectral peut être converti en texture de mouvement sur l’ensemble de la vidéo
- Combiné à un module de rendu basé sur l’image, cela permet plusieurs applications
- Transformer une image fixe en vidéo en boucle fluide
- Interpréter le volume spectral comme une base modale dans l’espace image pour permettre une interaction réaliste avec des objets dans de vraies photos
- La réponse dynamique des objets aux sollicitations de l’utilisateur est simulée à l’aide de l’analyse modale de Davis et al.
Démo et usages supplémentaires
- La démo montre comment la scène se met en mouvement lorsqu’on clique sur un point de l’image, qu’on le fait glisser puis qu’on le relâche
- Le navigateur doit prendre en charge WebGL2
- Pour des raisons de vitesse, elle utilise un mesh-warping au lieu du modèle de rendu haute qualité présenté dans l’article
- Il est possible d’ajuster l’amplitude de la texture de mouvement pour réduire ou accentuer l’animation
- L’interpolation de la texture de mouvement prédite permet de générer des vidéos au ralenti
- Parmi les travaux antérieurs liés figurent Animating Pictures with Stochastic Motion Textures, Image-space Modal Bases for Plausible Manipulation of Objects in Video, Visual Vibration Analysis
1 commentaires
Commentaires sur Hacker News
Le secret d’un cinémagraphe 10/10, c’est que plus c’est subtil, plus l’impact est fort. L’idéal est que la personne qui regarde pense d’abord voir une photo fixe, puis que son cerveau réalise avec un temps de retard : « attends, il y a quelque chose de bizarre, ce n’est pas une photo, c’est une vidéo ».
C’est aussi intéressant de voir que la quantité de mouvement diffère entre la première et la deuxième image ; c’est peut-être lié à la densité autour du pointeur. Les exemples de mouvements lents sont vraiment apaisants à regarder.
Ça pourrait devenir une fonctionnalité de base des fonds d’écran de bureau et de téléphone. Si ça peut aussi gérer les mouvements doux de l’eau ou des nuages, ce serait très bien pour l’appliquer sélectivement à des photos, par exemple dans des documentaires historiques.