- Un ensemble de guides pratiques et d’exemples pour implémenter des applications Claude, couvrant un large spectre allant de la création d’agents au RAG, à l’utilisation d’outils, au multimodal et à l’évaluation
- Les exemples Claude Agent SDK et Managed Agents incluent des patterns d’exploitation comme l’orchestration multi-agent, la gestion de sessions, le déploiement, la gestion des incidents, la détection de vulnérabilités et la mémoire utilisateur
- Propose des techniques de mémoire et de compression du contexte pour les agents à longue exécution, d’appels d’outils programmatiques, de recherche d’outils basée sur des embeddings et de sous-agents asynchrones
- Des exemples d’implémentation permettent de couvrir le RAG, la génération SQL, les graphes de connaissances, le résumé de documents, le traitement d’images et de voix, ainsi que l’évaluation, les coûts, l’observabilité et les garde-fous
- Couvre les déploiements Docker, Modal et Kubernetes, la gestion de versions et le rollback des prompts, l’approbation humaine et l’analyse des coûts, et peut servir à la fois au développement et aux opérations en production
Évaluation des agents et garde-fous
- Reproduire les scores de référence de recherche agentique de Claude : reproduit les scores DeepSearchQA et BrowseComp avec un harnais Messages API, en utilisant des appels d’outils programmatiques, la compression côté serveur et un budget de tâche
- Fallback de classificateur et facturation de Claude Fable 5 : détecte le blocage par le classificateur de sécurité pour basculer vers Opus 4.8, et couvre les fallbacks côté serveur ou client SDK, le streaming et les nouvelles modifications de facturation
- Évaluation des outils : exécute une évaluation d’agents parallèle sur les outils, indépendamment du fichier des tâches d’évaluation
- Construire des évaluations : construit un système d’évaluation pour mesurer et améliorer les performances de Claude sur des indicateurs clés
- Générer des données de test synthétiques pour les modèles de prompt : génère des cas de test synthétiques pour évaluer et améliorer les prompts Claude
- Construire un filtre de modération avec Claude : crée un filtre de modération de contenu personnalisé en définissant des règles et des catégories dans le prompt
Patterns multi-agent et workflows
- Orchestration multi-agent asynchrone : couvre la structure de messagerie et de cycle de vie d’une équipe fixe de N agents échangeant des messages entre pairs via un hub partagé, ainsi que de sous-agents asynchrones créés dynamiquement
- Multi-agent : orchestrer une équipe de spécialistes : un coordinateur pilote un chercheur web, un responsable de consultation de fichiers et un spécialiste tarifaire basé sur des règles pour rédiger une proposition commerciale
- Inclut le champ
multiagent, les événementsthread_createdetthread_message_received, ainsi que des restrictions de périmètre des outils par rôle
- Inclut le champ
- Outcomes : un agent qui vérifie son propre travail : construit une boucle de notation et d’amélioration dans laquelle un rédacteur produit un résumé de recherche avec citations, puis un évaluateur sans état vérifie les URL et les citations avant de demander des corrections jusqu’à validation
- Couvre les événements
user.define_outcomeetspan.outcome_evaluation_*, ainsi que la rédaction de critères d’évaluation exécutables par l’évaluateur
- Couvre les événements
- Workflows de base : propose trois patterns multi-LLM qui échangent coût ou latence contre performance
- Évaluateur-optimiseur : structure itérative où un LLM génère un résultat et un autre LLM fournit un retour d’évaluation
- Orchestrateur-travailleurs : un LLM central délègue dynamiquement les tâches et synthétise les résultats des LLM travailleurs
- Utiliser Haiku comme sous-agent : des sous-agents Haiku extraient des rapports financiers et Opus synthétise les résultats
Claude Agent SDK
- Un agent de recherche en une ligne : construit un agent de recherche autonome avec Claude Code SDK et
WebSearch - Agent chef de cabinet : crée un système multi-agent avec des sous-agents, des hooks, des styles de sortie et un mode planification
- Agent d’observabilité : connecte l’agent à des systèmes externes via un serveur MCP pour gérer la surveillance GitHub et les workflows CI
- Agent de fiabilité de site : diagnostique et corrige des incidents avec des outils MCP en lecture/écriture, puis rédige un rapport post-incident
- Migrer depuis OpenAI Agents SDK : prend l’exemple d’un agent d’approbation de dépenses pour faire correspondre outils, garde-fous, sessions et handoffs aux éléments de base de Claude Agent SDK
- Construire un navigateur de sessions : liste et consulte les sessions Agent SDK sur disque, puis permet de les renommer, taguer et forker afin de créer une barre latérale sans parseur séparé d’historique de conversation
- Agent de détection de vulnérabilités : modélise les menaces sur des cibles en C, détecte des bugs de sécurité mémoire avec les outils de fichiers intégrés, puis les classe dans un rapport structuré
- Hébergement d’un agent : déploie un agent de recherche en trois étapes — Docker, Modal et Kubernetes — tout en conservant la même image de conteneur et la même interface HTTP
Claude Managed Agents
- Créer un agent qui se souvient des utilisateurs : apprend et mémorise les préférences utilisateur au fil de plusieurs interactions grâce à un stockage de mémoire
- Créer un agent de réponse aux incidents SRE avec Claude Managed Agents : lorsqu’une alerte se déclenche, lit les logs et les runbooks, identifie la cause racine, ouvre une PR de correction, puis la fusionne après approbation humaine
- Créer un agent d’analyse de données : utilise un environnement sandbox et des montages de fichiers pour convertir des CSV en rapports HTML avec graphiques interactifs
- Créer un bot Slack d’analyse de données : lorsqu’on mentionne le bot avec un CSV, génère un rapport d’analyse dans le fil et prend en charge les échanges de suivi dans la même session
- Tutoriel Managed Agents : améliorer une suite de tests en échec : corrige trois bugs du package
calc.pyen utilisant la création d’agents, d’environnements et de sessions, les montages de fichiers et une boucle d’événements en streaming - Tutoriel Managed Agents : configuration de production : couvre les identifiants MCP basés sur un coffre-fort, le webhook
session.status_idledpour faire intervenir un humain sans connexion longue durée, et le CRUD du cycle de vie des ressources - Tutoriel Managed Agents : versionnement des prompts et rollback : crée une v1 sur le serveur, l’évalue avec un jeu de tests étiqueté, puis détecte une régression en v2 et épingle la session à la version 1
- inclut
agents.update, l’épinglage de version danssessions.create, et l’endroit où se déplacent les points de contrôle de revue lorsque le prompt n’est pas du code
- inclut
Gestion de la mémoire et du contexte
- Ingénierie du contexte : mémoire, compression et suppression d’outils : compare, pour les agents à longue exécution, quand appliquer chaque stratégie, leurs coûts et la façon de les combiner
- Compression de la mémoire de session : compresse instantanément la mémoire de session des longues conversations grâce au threading en arrière-plan et au cache de prompts
- Compression automatique du contexte : gère les limites de contexte dans les workflows d’agents longue durée en compressant automatiquement l’historique des conversations
- Mémoire et gestion du contexte dans Claude Sonnet 4.6 : construit un agent à mémoire persistante avec les outils de mémoire de Claude et l’édition du contexte
- Cache de prompt spéculatif : prépare le cache à l’avance pendant que l’utilisateur rédige sa requête afin de réduire le temps de réponse du premier token
- Cache de prompts dans l’API Claude : met en cache et réutilise le contexte des prompts afin de réduire les coûts et le temps de réponse
Utilisation d’outils et intégrations externes
- Appels d’outils programmatiques : fait écrire à Claude le code d’appel d’outils dans un environnement d’exécution de code afin de réduire la latence et la consommation de tokens
- Recherche d’outils avec des embeddings : fait évoluer les applications Claude jusqu’à des milliers d’outils grâce à une recherche dynamique basée sur des embeddings sémantiques
- Appels d’outils parallèles dans Claude 3.7 Sonnet : active les appels parallèles en utilisant le méta-pattern d’outil batch comme contournement
- Choix d’outil : force ou automatise le choix d’outil de Claude avec le paramètre
tool_choice - Outil de prise de notes combinant Pydantic et l’utilisation d’outils Anthropic : crée des outils typés sûrs validés par des modèles Pydantic
- Utiliser un outil calculatrice dans Claude : fournit un outil calculatrice pour les opérations arithmétiques et la résolution de problèmes mathématiques
- Créer un agent de service client avec des outils côté client : construit un chatbot utilisant des outils de recherche client et de gestion des commandes
- Extraire du JSON structuré avec Claude et l’utilisation d’outils : extrait des données JSON structurées à partir de plusieurs entrées
- Utiliser l’API Wolfram Alpha LLM comme outil dans Claude : intègre la Wolfram Alpha LLM API pour les requêtes de calcul et les réponses
- Agent d’enrichissement de threat intelligence : examine et recoupe des indicateurs de compromission issus de plusieurs sources de renseignement sur les menaces, les mappe à MITRE ATT&CK et génère des rapports pour SIEM/SOAR
Recherche, RAG et traitement des connaissances
- Construire un graphe de connaissances avec Claude : extrait les entités et les relations de textes non structurés, puis supprime les doublons pour prendre en charge les requêtes de graphe multi-hop
- Text-to-SQL avec Claude : convertit le langage naturel en SQL à l’aide du RAG, du raisonnement pas à pas et de techniques d’auto-amélioration
- Améliorer le RAG avec la recherche contextuelle : ajoute du contexte aux chunks avant l’embedding et applique la mise en cache des prompts pour améliorer la précision du RAG
- Génération augmentée par récupération : construit et optimise un système RAG avec indexation par résumés et reranking
- Classification avec Claude : construit un système de classification pour des tickets d’assurance en exploitant le RAG et le raisonnement pas à pas
- Citations : fournit des citations détaillées et vérifiables des sources pour les requêtes basées sur des documents
- Résumer le contenu de pages web avec Claude 3 Haiku : récupère le contenu depuis des URL et le résume avec Claude 3 Haiku
- Créer des requêtes SQL avec Claude : génère du SQL à partir de questions en langage naturel en fournissant le contexte du schéma de base de données
- Génération augmentée par récupération avec Pinecone : connecte Claude à la base de données vectorielle Pinecone pour implémenter le RAG et la recherche sémantique
- Construire un système RAG avec Claude 3 et MongoDB : construit un chatbot Claude·MongoDB utilisant l’actualité tech comme base de connaissances
- Agent RAG Claude 3 et LangChain v1 : crée un agent RAG avec les patterns du framework d’agents mis à jour de LangChain v1
- Agent multi-documents : construit un RAG pour de vastes collections de documents avec DocumentAgents et le pattern ReAct
- Pipeline RAG avec LlamaIndex : crée un pipeline de base pour la recherche documentaire et les questions-réponses
- Moteur RouterQuery : achemine les requêtes vers différents index avec
RouterQueryEnginede LlamaIndex - SubQuestionQueryEngine : décompose les requêtes complexes en sous-questions couvrant plusieurs documents
- « Téléverser » des PDF vers Claude via l’API : traite et résume des documents PDF par extraction et encodage du texte
- Recherche itérative dans Wikipedia avec Claude : notebook legacy d’un workflow de recherche effectuant des recherches itératives dans Wikipedia avec Claude 2
Multimodal, voix et documents
- Fournir un outil de recadrage pour améliorer l’analyse d’images : agrandit des zones précises de graphiques, documents et diagrammes pour les analyser en détail
- Utiliser conjointement la vision et les outils dans Claude : combine compréhension d’images et outils pour extraire des données structurées depuis des images comme des tableaux nutritionnels
- Bonnes pratiques pour utiliser la vision avec Claude : fournit des techniques et conseils pour améliorer les performances de traitement des images
- Bien démarrer : transmettre des images à Claude : transmet des images à l’API Claude 3 pour effectuer une analyse textuelle basée sur la vision
- Transcrire des documents avec Claude : extrait et structure le texte non structuré d’images et de PDF
- Travailler avec des graphiques et des présentations : extrait des informations de graphiques et de présentations avec la vision de Claude
- Multimodal : réalise compréhension d’images et raisonnement avec l’abstraction Anthropic MultiModal LLM de LlamaIndex
- Assistant vocal à faible latence avec ElevenLabs : combine les fonctions parole-texte et texte-parole d’ElevenLabs avec Claude
- Transcrire de l’audio avec Deepgram et préparer des questions d’entretien avec Anthropic : transcrit l’audio et génère des questions d’entretien avec Claude
Réponses, raisonnement et prompts
- Pensée étendue : utiliser la pensée étendue étape par étape de Claude avec gestion du budget
- Pensée étendue combinée à l’utilisation d’outils : combiner pensée étendue et outils dans des workflows en plusieurs étapes
- Prompting pour l’esthétique frontend : explique comment rédiger des prompts pour générer des frontends distinctifs et aboutis, tout en évitant une esthétique générique
- Résumer avec Claude : résumer des documents juridiques, avec évaluations et techniques avancées
- Échantillonner des réponses Claude au-delà de la limite maximale de tokens : générer de longues réponses dépassant
max_tokensgrâce au préremplissage et à la continuation de messages - Metaprompt : générer un prompt de départ pour une tâche afin de réduire le problème de la page blanche
- Prompter Claude en « mode JSON » : obtenir une sortie JSON fiable grâce à des techniques de prompt, sans échantillonnage contraint
- Traitement par lots avec la Message Batches API : traiter de grands volumes de requêtes de façon asynchrone avec une réduction des coûts de 50 %
Skills et applications métier
- Claude Skills pour les applications financières : construire des tableaux de bord financiers et des analyses de portefeuille avec les Skills Excel, PowerPoint et PDF
- Créer des Skills personnalisées pour Claude : créer, déployer et gérer des Skills qui étendent les workflows propres à une organisation
- Présentation des Claude Skills : créer des documents, analyser des données et automatiser des workflows avec les Skills Excel, PowerPoint et PDF
- Fine-tuning de Claude 3 Haiku sur Amazon Bedrock : fournit la procédure pour fine-tuner Claude 3 Haiku sur Amazon Bedrock pour des tâches personnalisées
- Cookbook de l’Admin API pour l’usage et les coûts : accéder et analyser par programmation les données d’usage et de coûts de l’API Claude via l’Admin API
Patterns d’agents LlamaIndex et contributions de la communauté
- Agent ReAct : construire avec LlamaIndex un agent ReAct qui exécute des workflows de raisonnement et d’action basés sur des outils
- Les contributions de la communauté sont acceptées pour de nouvelles idées de Cookbook, avec un guide de contribution disponible
1 commentaires
Avis sur Hacker News
Honnêtement, presque toutes les ressources sur l’usage de l’IA me paraissent inutiles. Il suffit de demander directement à l’IA comment faire, et si c’est une manière d’utiliser l’IA, autant attendre qu’Anthropic/OpenAI l’intègre au harness ou en fasse une fonctionnalité mineure
Les workflows d’agents, la gestion de la mémoire ou le harness engineering donnent eux aussi souvent l’impression d’être surtout de la démonstration
Les techniques et frameworks IA les plus récents sont absorbés ou remplacés tous les trois mois, donc cela semble peu rentable d’y investir
.mdde toutes sortes de choses et polluent le contexteAu final, il faut quand même laisser le LLM rechercher ces ressources, donc ce sont peut-être des documents destinés au LLM plus qu’aux humains
Donc, sauf nécessité absolue, j’évite les plugins et MCP et j’utilise des prompts solides. Cela m’a permis d’éviter d’imposer au LLM des optimisations dépassées qui freinent son évolution
Les images avant/après de frontend aesthetic prompting sont ridicules. On dirait que personne n’a vérifié si cette skill améliorait réellement le design
Les résultats de frontend aesthetic prompting sont fades avant application, puis fades avec des dégradés après application
J’utilise chez moi les skills de Matt Pocock, et ils sont excellents. Ils sont conçus pour être déclenchés manuellement par l’utilisateur plutôt qu’appelés automatiquement, donc leur seule présence ne consomme pas beaucoup de contexte
Au lieu d’exclure le programmeur du résultat final, ils l’incitent à réfléchir plus en profondeur au résultat. Les grill skills aident à clarifier les exigences réelles, et la skill prototype aide à explorer les décisions difficiles qu’on ne peut prendre qu’en testant directement
Le OpenAI Cookbook est aussi utile. D’autres laboratoires IA publient aussi souvent des exemples et des cookbooks sur GitHub et Hugging Face, donc cela vaut la peine de continuer à les suivre
Les agents de code produisent bien plus souvent, en frontend qu’en backend, des bugs, des fonctionnalités cassées ou incomplètes et des choses maladroites. Cela semble venir de la différence de vérifiabilité entre les deux domaines, et une simple suite de tests de base ne suffit pas
Une approche comme gstack de Garry Tan semble pertinente, mais je ne sais pas si c’est assez mûr pour être adopté. Certains disent aussi que Gemini 3.5 Flash est meilleur qu’Opus ou GPT-5.5 pour le travail frontend ; j’aimerais savoir si cela vient de ses capacités multimodales, de sa compréhension de Chrome, ou de retours d’utilisateurs réels
Pour obtenir des résultats créatifs, il faut le demander activement, mais c’est bien pour un design frontend standard. En revanche, je ne l’utilise que pour tester des idées, pas pour ajouter ou modifier des fonctionnalités arbitraires
Je croyais que c’était un vrai livre de cuisine pour générer avec des LLM des recettes plausibles et réellement réalisables, mais on n’en est apparemment pas encore là
Après avoir reçu une recette, c’est aussi amusant de lui demander une ou deux fois « rends-la meilleure » pour voir ce qui sort
Je pensais que c’était un nouveau produit pour générer des recettes avec Claude
Avant comme après l’application du cookbook, le design donne dans les deux cas l’impression d’avoir été fait en vibe coding. Je ne suis pas assez designer pour en identifier précisément la cause, mais l’éventail de styles que Claude sait produire semble assez limité
Peut-être qu’en spécifiant plus précisément les changements nécessaires, on pourrait atténuer cette tendance
L’UI aurait dû être relue au moins une fois. Même un simple espacement de tableau n’est pas correctement aligné