2 points par mir22 1 일 전 | Aucun commentaire pour le moment. | Partager sur WhatsApp

Les jours où j’avais besoin de réconfort, il n’y avait nulle part où aller parler, alors j’ai commencé à le créer moi-même. Je suis en terminale et je le conçois et l’exploite seul.

Vous pouvez commencer à discuter immédiatement en invité, sans inscription ni adresse e-mail. En arrivant, Aru prend d’abord de vos nouvelles, mémorise la conversation, puis, quand vous revenez, vous appelle par votre nom et reprend l’échange là où il s’était arrêté.

Différences avec les services existants

Les assistants généralistes comme ChatGPT répondent à chaque fois comme s’ils rencontraient un nouvel interlocuteur, et les services de type character chat sont souvent conçus pour maximiser l’immersion et le temps passé. Aru prend la direction opposée : la continuité (la mémoire) en est l’axe central, mais le succès est défini par le fait que l’utilisateur ait moins besoin du service, et les formulations qui encouragent la dépendance ainsi que les dark patterns sont interdits.

Détails techniques

Gate de réflexion inférentielle : si une phrase comme « trouve pourquoi je me sens comme ça » est envoyée vers une recherche en ne voyant que le mot-clé (« trouve »), cela gâche un moment où la personne a besoin de réconfort. C’est pourquoi, pour les requêtes déclenchées par mot-clé, l’intention est réévaluée juste avant l’exécution via un appel à un LLM ultra-léger, et si l’énoncé est conversationnel, la recherche est annulée. En cas d’échec de la décision, le jugement initial par mot-clé est conservé (fail-open). La structure consiste donc à réévaluer avant l’exécution de l’outil, et non à filtrer après génération.
Mémoire : la mémoire structurée (nom, préférences, contexte en cours) et l’archive du texte source sont séparées (SQLite + recherche de similarité en 2-grammes coréens). Les conversations sensibles ne sont pas enregistrées par défaut, et l’utilisateur peut les consulter, modifier et supprimer lui-même.
Sécurité : en cas de détection de signaux de crise, les coordonnées d’un organisme spécialisé (numéro national intégré de prévention du suicide 109) sont présentées en priorité. La frontière indiquant qu’il ne s’agit pas d’un service professionnel de santé mentale est maintenue à la fois dans l’interface et dans le persona.
Stack : FastAPI + vanilla JS, modèles fournis via API (model-agnostic), un seul droplet Docker/Caddy, 296 tests de régression, et mesure intégrée de la rétention par cohortes anonymes.
C’est une bêta précoce, donc il y a encore beaucoup de points à améliorer. En particulier, je travaille à améliorer la qualité de la première conversation et le taux de conversion de l’écran d’entrée. Essayez-le et signalez-moi les passages qui vous paraissent maladroits ; je les corrigerai. Je ne consulte pas le texte des conversations privées et ne vérifie que des métriques anonymisées.

Cas réel

Il est déjà arrivé qu’Aru fasse une recherche web après qu’un utilisateur a demandé une chanson, puis continue malgré tout à répondre à côté. En regardant les logs, la recherche avait bien été exécutée, mais le problème venait des termes de recherche. Dans la question de suivi « dis-moi quel est le thème de cette chanson », le système lançait une recherche sur « le thème de cette chanson » sans y inclure le mot-clé du sujet de la conversation précédente (le nom du morceau). Désormais, lorsqu’un démonstratif (« cette chanson ») est détecté, le système va chercher le mot-clé thématique dans l’énoncé précédent pour le recomposer. En l’exploitant, j’ai appris que la génération de requêtes de recherche pour les questions de suivi est une difficulté cachée de ce type de service.

Dispositifs pour pouvoir l’exploiter seul

Comme je l’exploite seul, j’ai fait en sorte que des règles travaillent à la place des humains. Automatisation des snapshots de données et de la vérification d’intégrité avant déploiement, séparation physique des logs de trafic entre utilisateurs réels / évaluation / opérateur / bots (parce que mes propres tests ont déjà pollué les métriques), et exécution complète des tests de régression avant chaque déploiement.

Aucun commentaire pour le moment.

Aucun commentaire pour le moment.