Comme je n’aimais pas laisser un onglet Telegram ouvert toute la journée pour discuter avec des agents locaux (Hermes/OpenClaw), j’ai créé un avatar pour le remplacer. Avec deux fenêtres persistantes de type visioconférence sur l’écran (avatar + chat), l’agent ne se contente pas de lire ses réponses, il les « joue ».
-
L’avatar n’utilise pas de GPU à l’exécution. Au lieu d’une inférence en temps réel, il choisit et joue parmi une trentaine de clips pré-rendus selon les tags d’émotion de la sortie du LLM. Avec
[working], il met des lunettes et prend des notes ; avec le tag[confirm], des boutons de validation/annulation s’affichent pour demander confirmation avant une action irréversible ; le code et les logs ne sont pas lus à voix haute, mais affichés sous forme de cartes. Le GPU est entièrement réservé au modèle. -
Il ne remplace pas l’agent : il s’y connecte comme un connecteur. L’architecture fait que la passerelle effectue un dial-out vers le WebSocket local ouvert par l’application ; du point de vue de l’agent, c’est simplement un canal supplémentaire. Le menu de commandes slash de l’agent est aussi récupéré et affiché tel quel.
-
Audio bidirectionnel : Edge TTS (remplaçable par un moteur local) + Silero VAD · faster-whisper.
-
Open core (MIT). Un avatar de démarrage gratuit est inclus, donc après clonage, ça fonctionne immédiatement. Cet avatar lui-même a été créé uniquement avec des outils locaux gratuits (Animagine XL → HunyuanVideo 1.5 i2v), ce qui en fait aussi un exemple prouvant que la méthode décrite dans la documentation fonctionne réellement.
Ce que j’ai appris en le développant : avec les modèles de diffusion vidéo, il est plus difficile que prévu de produire des micro-expressions à partir de prompts. Wan 2.2 5B arrivait à générer un grand sourire bouche ouverte, mais pour des émotions exprimées par les sourcils comme « inquiétude » ou « colère », le résultat restait simplement inexpressif ; en passant à HunyuanVideo 1.5 (distillation progressive 8.3B), c’était à la fois plus rapide sur la même carte 12 Go et les expressions faciales ressortaient correctement.
Pour l’instant, il n’existe qu’une version Windows et il n’y a pas de lip-sync en temps réel (contrepartie de l’approche pré-rendue).
Aucun commentaire pour le moment.