Dans un secteur où des références de pièces inventées ou des calculs discrètement erronés peuvent se retrouver jusque dans les plans, les nomenclatures et les commandes,
je travaille depuis quelques mois avec un harnais qui traite les réponses des LLM comme des documents « interdits de diffusion avant validation ».
Je publie un snapshot de curation anonymisé, sans informations personnelles ni métier.
- 13 types de portes de validation avant émission de la réponse : blocage des inventions (interdiction de générer par estimation des références de pièces ou des DOI),
réexécution arithmétique via Bash, isolation des prompt injections, comparaison avec la sortie réelle des outils lorsqu’un modèle affirme « l’avoir exécuté »,
et porte anti-récidive qui fige les cas d’échec dans un jeu d’or de régression - Tous les chiffres clés, citations et affirmations causales reçoivent un niveau de confiance sur 3 échelons — les citations fondées sur la mémoire restent au mieux en jaune, le vert n’est accordé qu’après vérification réelle
- Les conclusions à seuil de sécurité sont redérivées en parallèle avec des modèles hétérogènes (Gemini, Groq, OpenAI CLI), puis jugées sur leur convergence — principe de base : l’auto-vérification par le même modèle partage les mêmes angles morts
- Pipeline d’INTAKE supply chain pour les skills/plugins externes : isolation → scan statique → lecture humaine attentive → rebuild, et import uniquement après cela
(les instructions en langage naturel sont traitées comme une menace du même niveau que le code) - Les nouveaux vérificateurs passent d’abord en mode shadow pour mesurer leur taux de faux positifs avant promotion, et les affirmations validées sont chargées dans un registre pour comparaison automatique des contradictions
Les hooks de gate et les vérificateurs sont du code Python réellement exécutable, avec des tests de régression inclus.
Après clonage, on peut les lancer directement sans dépendances supplémentaires :
python3 eval/tests/test_g9_regression.py --hook hooks/g9_arith_enforce.py
python3 hooks/tests/test_glossary_hook.py
En câblant les hooks avec settings.example.json, les gates fonctionnent aussi dans votre propre environnement.
Ce n’est pas une distribution monolithique à déployer telle quelle, mais une structure où l’on sélectionne et branche les hooks/vérificateurs à l’unité.
Une grande partie de la documentation est en coréen, l’architecture et le README sont en anglais.
Aucun commentaire pour le moment.