Bonjour.
J’ai récemment créé une extension Chrome qui convertit automatiquement les actions effectuées dans le navigateur en guide utilisateur (SOP).
Contrairement à l’enregistrement d’écran classique, elle collecte les clics et les événements de saisie avec le contexte DOM, puis les recompose en étapes de travail faciles à comprendre pour un humain.
Le pipeline actuel est le suivant :
Browser Recording → DOM Context Extraction → Solar Pro 3 → AI Validation → Word / PDF / Markdown
La partie la plus difficile lors de l’implémentation a été de déterminer « jusqu’où considérer qu’il s’agit d’une seule étape ».
Si l’on enregistre les événements du navigateur tels quels, le résultat devient trop fragmenté ; à l’inverse, si l’on fusionne trop d’actions, l’intention importante de l’utilisateur disparaît. Pour l’instant, j’ai mis en place une approche qui fusionne les événements selon des critères comme les changements du DOM, l’état des saisies et les transitions de page ; Solar Pro 3 génère ensuite une description en langage naturel de chaque étape, puis une IA vérifie une nouvelle fois l’ordre et les éventuels éléments manquants.
À ce stade, l’étape de génération de documents est implémentée, et j’expérimente ensuite une direction où le manuel généré est utilisé comme Task Plan structuré. L’objectif est d’aller au-delà d’un simple document pour évoluer vers un workflow exécutable permettant à un agent IA de comprendre le travail, de guider l’utilisateur ou de reproduire des tâches répétitives dans le navigateur.
Interaction Segmentation et Task Planning sont encore en cours d’amélioration. J’aimerais beaucoup avoir les retours de personnes ayant des recherches ou une expérience d’implémentation sur le sujet.
Aucun commentaire pour le moment.