1 points par GN⁺ 3 시간 전 | 1 commentaires | Partager sur WhatsApp
  • Un ensemble de guides pratiques et d’exemples pour implémenter des applications Claude, couvrant un large spectre allant de la création d’agents au RAG, à l’utilisation d’outils, au multimodal et à l’évaluation
  • Les exemples Claude Agent SDK et Managed Agents incluent des patterns d’exploitation comme l’orchestration multi-agent, la gestion de sessions, le déploiement, la gestion des incidents, la détection de vulnérabilités et la mémoire utilisateur
  • Propose des techniques de mémoire et de compression du contexte pour les agents à longue exécution, d’appels d’outils programmatiques, de recherche d’outils basée sur des embeddings et de sous-agents asynchrones
  • Des exemples d’implémentation permettent de couvrir le RAG, la génération SQL, les graphes de connaissances, le résumé de documents, le traitement d’images et de voix, ainsi que l’évaluation, les coûts, l’observabilité et les garde-fous
  • Couvre les déploiements Docker, Modal et Kubernetes, la gestion de versions et le rollback des prompts, l’approbation humaine et l’analyse des coûts, et peut servir à la fois au développement et aux opérations en production

Évaluation des agents et garde-fous

Patterns multi-agent et workflows

  • Orchestration multi-agent asynchrone : couvre la structure de messagerie et de cycle de vie d’une équipe fixe de N agents échangeant des messages entre pairs via un hub partagé, ainsi que de sous-agents asynchrones créés dynamiquement
  • Multi-agent : orchestrer une équipe de spécialistes : un coordinateur pilote un chercheur web, un responsable de consultation de fichiers et un spécialiste tarifaire basé sur des règles pour rédiger une proposition commerciale
    • Inclut le champ multiagent, les événements thread_created et thread_message_received, ainsi que des restrictions de périmètre des outils par rôle
  • Outcomes : un agent qui vérifie son propre travail : construit une boucle de notation et d’amélioration dans laquelle un rédacteur produit un résumé de recherche avec citations, puis un évaluateur sans état vérifie les URL et les citations avant de demander des corrections jusqu’à validation
    • Couvre les événements user.define_outcome et span.outcome_evaluation_*, ainsi que la rédaction de critères d’évaluation exécutables par l’évaluateur
  • Workflows de base : propose trois patterns multi-LLM qui échangent coût ou latence contre performance
  • Évaluateur-optimiseur : structure itérative où un LLM génère un résultat et un autre LLM fournit un retour d’évaluation
  • Orchestrateur-travailleurs : un LLM central délègue dynamiquement les tâches et synthétise les résultats des LLM travailleurs
  • Utiliser Haiku comme sous-agent : des sous-agents Haiku extraient des rapports financiers et Opus synthétise les résultats

Claude Agent SDK

  • Un agent de recherche en une ligne : construit un agent de recherche autonome avec Claude Code SDK et WebSearch
  • Agent chef de cabinet : crée un système multi-agent avec des sous-agents, des hooks, des styles de sortie et un mode planification
  • Agent d’observabilité : connecte l’agent à des systèmes externes via un serveur MCP pour gérer la surveillance GitHub et les workflows CI
  • Agent de fiabilité de site : diagnostique et corrige des incidents avec des outils MCP en lecture/écriture, puis rédige un rapport post-incident
  • Migrer depuis OpenAI Agents SDK : prend l’exemple d’un agent d’approbation de dépenses pour faire correspondre outils, garde-fous, sessions et handoffs aux éléments de base de Claude Agent SDK
  • Construire un navigateur de sessions : liste et consulte les sessions Agent SDK sur disque, puis permet de les renommer, taguer et forker afin de créer une barre latérale sans parseur séparé d’historique de conversation
  • Agent de détection de vulnérabilités : modélise les menaces sur des cibles en C, détecte des bugs de sécurité mémoire avec les outils de fichiers intégrés, puis les classe dans un rapport structuré
  • Hébergement d’un agent : déploie un agent de recherche en trois étapes — Docker, Modal et Kubernetes — tout en conservant la même image de conteneur et la même interface HTTP

Claude Managed Agents

Gestion de la mémoire et du contexte

Utilisation d’outils et intégrations externes

Recherche, RAG et traitement des connaissances

Multimodal, voix et documents

Réponses, raisonnement et prompts

Skills et applications métier

Patterns d’agents LlamaIndex et contributions de la communauté

  • Agent ReAct : construire avec LlamaIndex un agent ReAct qui exécute des workflows de raisonnement et d’action basés sur des outils
  • Les contributions de la communauté sont acceptées pour de nouvelles idées de Cookbook, avec un guide de contribution disponible

1 commentaires

 
GN⁺ 3 시간 전
Avis sur Hacker News
  • Honnêtement, presque toutes les ressources sur l’usage de l’IA me paraissent inutiles. Il suffit de demander directement à l’IA comment faire, et si c’est une manière d’utiliser l’IA, autant attendre qu’Anthropic/OpenAI l’intègre au harness ou en fasse une fonctionnalité mineure
    Les workflows d’agents, la gestion de la mémoire ou le harness engineering donnent eux aussi souvent l’impression d’être surtout de la démonstration

    • En 2023, on apprenait assidûment le CoT, ReAct, etc. en disant que le prompt engineering allait devenir la nouvelle ingénierie logicielle, mais en 2024, tout cela est devenu largement inutile avec les modèles de raisonnement et les mises à jour du harness
      Les techniques et frameworks IA les plus récents sont absorbés ou remplacés tous les trois mois, donc cela semble peu rentable d’y investir
    • À mesure que les capacités des modèles augmentent, ils absorbent eux-mêmes les outils périphériques, donc ces outils ont une durée de validité trop courte. On a déjà vu ce schéma se répéter
    • Vercel a montré qu’un simple fichier Markdown unique avec des consignes claires peut être plus efficace que l’appel d’outils, et a aussi présenté une manière d’utiliser des index compressés. J’ai moi aussi passé des heures à essayer de finaliser l’appel d’outils pour aboutir à un constat similaire, et depuis je n’utilise plus que Claude.md, Agents.md, et éventuellement Project.md
    • Les LLM semblent très mauvais pour exploiter d’autres LLM à l’intérieur d’un harness. Si on les laisse faire, ils remplissent les fichiers .md de toutes sortes de choses et polluent le contexte
      Au final, il faut quand même laisser le LLM rechercher ces ressources, donc ce sont peut-être des documents destinés au LLM plus qu’aux humains
    • Au moment où tout le monde encensait MCP, les skills étaient devenus une alternative plus efficace, et une gestion agressive du contexte est devenue moins importante avec les longues fenêtres de contexte et les fonctions d’agent. Si une technique est vraiment bonne, il y a de fortes chances qu’elle soit intégrée à la version suivante
      Donc, sauf nécessité absolue, j’évite les plugins et MCP et j’utilise des prompts solides. Cela m’a permis d’éviter d’imposer au LLM des optimisations dépassées qui freinent son évolution
  • Les images avant/après de frontend aesthetic prompting sont ridicules. On dirait que personne n’a vérifié si cette skill améliorait réellement le design

    • Tous les résultats présentés ressemblent à une régression plutôt qu’à une amélioration
    • Beaucoup de guides recommandent aveuglément la skill de design frontend comme dans un culte cargo typiquement LLM, alors que le contenu réel ne correspond pas à ce que les gens imaginent
    • Le site avec l’esthétique appliquée ressemble à un keygen du début des années 2000, il ne manque plus que la techno
    • Le résultat est franchement assez gênant. En gros, c’est du niveau de « mettre un fond noir et une police horriblement large »
    • Je me demande s’ils ont choisi des exemples où la différence avant/après est maximale pour donner l’impression que ça marche. Personnellement, dans tous les exemples, le design avant application me paraît meilleur
  • Les résultats de frontend aesthetic prompting sont fades avant application, puis fades avec des dégradés après application

    • Dans certains exemples, la version d’avant est meilleure, et le seul cas qu’on pourrait vraiment qualifier d’amélioration est l’exemple de blog
    • Je préfère même la version sans esthétique appliquée
    • Cela ajoute aussi les labels en majuscules, une caractéristique typique des pages conçues par IA
  • J’utilise chez moi les skills de Matt Pocock, et ils sont excellents. Ils sont conçus pour être déclenchés manuellement par l’utilisateur plutôt qu’appelés automatiquement, donc leur seule présence ne consomme pas beaucoup de contexte
    Au lieu d’exclure le programmeur du résultat final, ils l’incitent à réfléchir plus en profondeur au résultat. Les grill skills aident à clarifier les exigences réelles, et la skill prototype aide à explorer les décisions difficiles qu’on ne peut prendre qu’en testant directement

  • Le OpenAI Cookbook est aussi utile. D’autres laboratoires IA publient aussi souvent des exemples et des cookbooks sur GitHub et Hugging Face, donc cela vaut la peine de continuer à les suivre

  • Les agents de code produisent bien plus souvent, en frontend qu’en backend, des bugs, des fonctionnalités cassées ou incomplètes et des choses maladroites. Cela semble venir de la différence de vérifiabilité entre les deux domaines, et une simple suite de tests de base ne suffit pas
    Une approche comme gstack de Garry Tan semble pertinente, mais je ne sais pas si c’est assez mûr pour être adopté. Certains disent aussi que Gemini 3.5 Flash est meilleur qu’Opus ou GPT-5.5 pour le travail frontend ; j’aimerais savoir si cela vient de ses capacités multimodales, de sa compréhension de Chrome, ou de retours d’utilisateurs réels

    • Il peut aussi y avoir des options couplées à un agent, comme la skill Front End Design de Claude, mais je ne l’ai pas utilisée moi-même. Magic Patterns est particulièrement bon pour la génération de prototypes initiaux quand il est piloté par un agent qui connaît les fonctionnalités et les contraintes
      Pour obtenir des résultats créatifs, il faut le demander activement, mais c’est bien pour un design frontend standard. En revanche, je ne l’utilise que pour tester des idées, pas pour ajouter ou modifier des fonctionnalités arbitraires
    • Les agents gèrent mal les mises à jour d’état asynchrones complexes, car il est difficile de les exprimer dans le contexte. En revanche, ils s’en sortent correctement pour créer des composants complexes de manière isolée ou pour implémenter des fonctionnalités faiblement couplées comme des animations
  • Je croyais que c’était un vrai livre de cuisine pour générer avec des LLM des recettes plausibles et réellement réalisables, mais on n’en est apparemment pas encore là

    • Depuis plus d’un an, je cuisine quelques fois par mois avec l’aide de LLM, et neuf fois sur dix ça marche bien. Les recettes moyennes contenues dans les poids du modèle sont généralement solides, et il est aussi très bon pour la substitution d’ingrédients, par exemple quand on dit « je n’ai pas l’ingrédient X » ou « rends ça végétarien »
      Après avoir reçu une recette, c’est aussi amusant de lui demander une ou deux fois « rends-la meilleure » pour voir ce qui sort
    • J’apprends la cuisine italienne avec ChatGPT, et à part quelques essais-erreurs, ça fonctionne étonnamment bien
    • J’ai cuisiné quelques fois avec Gemini cette année, et c’était meilleur que prévu. On peut lui dire « j’ai tels ingrédients dans mon placard et je veux un régime keto », puis affiner les options par la conversation
    • Moi aussi, je m’attendais à un outil numérique de planification des repas
  • Je pensais que c’était un nouveau produit pour générer des recettes avec Claude

    • J’utilise les projets Claude pour les recettes, et c’est excellent pour recommander des plats et adapter les recettes aux ingrédients disponibles dans le placard, donc moi aussi j’espérais un tel produit
    • En pratique, on peut aussi l’utiliser à cette fin
  • Avant comme après l’application du cookbook, le design donne dans les deux cas l’impression d’avoir été fait en vibe coding. Je ne suis pas assez designer pour en identifier précisément la cause, mais l’éventail de styles que Claude sait produire semble assez limité
    Peut-être qu’en spécifiant plus précisément les changements nécessaires, on pourrait atténuer cette tendance

  • L’UI aurait dû être relue au moins une fois. Même un simple espacement de tableau n’est pas correctement aligné