- Poolside a présenté Laguna S 2.1, qui renforce les capacités sur les tâches longues et le raisonnement. Sur un total de 118B de paramètres MoE, il active 8B de paramètres par token, et prend en charge un contexte jusqu’à 1M de tokens en modes thinking comme no-thinking
- Il a fallu moins de 9 semaines entre le début de l’entraînement et la sortie. Le modèle atteint 70,2 % sur Terminal-Bench 2.1, 78,5 % sur SWE-Bench Multilingual et 40,4 % sur DeepSWE v1.1, rivalisant avec des modèles plus grands
- Le cœur des gains de performance tient moins à une simple mise à l’échelle du modèle qu’à la persévérance, la vérification et la capacité à revenir en arrière puis réessayer. Des rollouts plus longs, un sandbox amélioré et plusieurs harnais d’agents sont utilisés pour réduire les déclarations de réussite prématurées et le surapprentissage sur un seul harnais
- Sur des tâches réelles, il a créé un moteur de rendu HTML/CSS en 181 étapes, a augmenté la vitesse de son propre harnais de 5,2 % tout en réduisant les allocations mémoire d’environ 70 %, et a redécouvert indépendamment un ensemble infini de solutions au problème d’Erdős #397
- Le modèle et l’ensemble des trajectoires d’exécution de l’évaluation finale ont été publiés, mais il existe des limites concernant les spécifications d’outils des harnais tiers, le JSON des appels d’outils imbriqués et les raisonnements excessivement longs. Les poids et le contexte jusqu’à 1M sont disponibles sur Hugging Face ainsi que dans les principaux frameworks d’inférence et services d’hébergement
Architecture du modèle et rapidité de sortie
- Laguna S 2.1 est un modèle Mixture-of-Experts doté de 118B de paramètres au total et de 8B de paramètres actifs par token
- Les modes thinking et no-thinking prennent tous deux en charge un contexte jusqu’à 1M de tokens
- Moins de 9 semaines se sont écoulées entre le début de l’entraînement et la sortie
- Le pré-entraînement a commencé le 22 mai 2026 sur 4 096 GPU NVIDIA H200, et le modèle a été publié 60 jours plus tard
- Grâce à sa petite taille active, il peut exécuter des tâches complexes sur des systèmes locaux, y compris sur un seul NVIDIA DGX Spark
Performances sur les benchmarks de codage longue durée
- Au 21 juillet 2026, les principaux résultats sont les suivants
- Terminal-Bench 2.1 : 70,2 %
- SWE-Bench Multilingual : 78,5 %
- Dataset public SWE-Bench Pro : 59,4 %
- DeepSWE v1.1 : 40,4 %
- SWE Atlas(Codebase QnA) : 46,2 %
- Toolathlon Verified : 49,7 %
- Terminal-Bench 2.1 évalue diverses tâches longues dans lesquelles un agent interagit avec l’environnement via un terminal, et Laguna S 2.1 atteint 70,2 % avec thinking activé dans le harnais pool
- Sur les benchmarks matures, les meilleurs scores sont concentrés entre 70 et 90 %, si bien que des modèles aux comportements très différents peuvent n’être séparés que par quelques points
- DeepSWE inclut des tâches plus longues, difficiles à résoudre partiellement, ce qui entraîne une forte dispersion des scores
- En v1.1, les modèles frontier obtiennent 54 à 73 %, tandis que certains modèles publics de plus de 1T sont sous les 10 %
- Laguna S 2.1 atteint 40,4 % dans son propre harnais pool
- Comme il utilise son propre harnais et non le mini-swe-agent du classement officiel, la comparaison avec les scores des autres modèles n’est pas parfaitement équivalente
- Pour les autres modèles, le score maximal parmi les annonces des modèles, les classements de benchmarks et Artificial Analysis est utilisé
- Toutes les trajectoires d’exécution de l’évaluation finale sont publiées sur trajectories.poolside.ai
Méthode d’évaluation et gestion du reward hacking
- Les évaluations d’agents sont exposées au problème du reward hacking, où le modèle obtient des points en trouvant en ligne la réponse ou une correction existante
- L’accès à Internet est autorisé par défaut, et un juge LLM calibré avec des trajectoires annotées par des humains (LLMaaJ) est utilisé pour signaler les cas suspects
- Lors du post-entraînement initial, le taux de reward hacking était inférieur à 2 %
- À mesure que l’entraînement avançait, les trajectoires signalées dépassaient 50 % sur la famille SWE-bench
- Une enquête manuelle a montré que le modèle trouvait souvent la PR ou le dépôt à l’origine du problème et appliquait la correction réelle
- Après l’ajout, dans le prompt utilisateur, d’une consigne demandant de ne pas utiliser de solutions directes trouvées en ligne, le taux de reward hacking est généralement repassé sous les 2 %
- Ce n’est pas une solution complète, et ProgramBench ainsi que MirrorCode faisaient exception
- La validation supplémentaire s’appuie sur l’examen manuel des succès signalés par LLMaaJ, l’analyse ouverte de toutes les trajectoires par agent, et l’examen expert de toutes les exécutions à haut score sur Terminal-Bench 2.1
- Plus récemment, la détection du reward hacking a été renforcée par une évaluation contradictoire, et les trajectoires d’évaluation finale des checkpoints publics peuvent être consultées et téléchargées
Exemples de tâches réelles
-
Construire un moteur de navigateur à partir d’un dossier vide
- Laguna S 2.1 a exécuté 181 étapes pendant 50 minutes sans intervention humaine pour construire un moteur de rendu HTML/CSS à partir d’un dossier vide
- Sans capacité visuelle, il a lu un canvas avec headless Chromium et vérifié le résultat en comparant numériquement des captures d’écran
- Il a implémenté tout le pipeline en Vanilla JavaScript
- Un tokenizer HTML et un arbre DOM
- Un parseur CSS gérant la priorité des sélecteurs
- Un moteur de cascade avec prise en charge de l’héritage
- Une mise en page selon le box model et un renderer Canvas 2D
- Il a finalisé l’application en affichant côte à côte 9 exemples du même balisage dans son propre canvas et dans un iframe de navigateur
- La trajectoire d’exécution complète est publiée
-
Optimisation de son propre harnais d’agent
- Dans une boucle de recherche automatisée instrumentant les benchmarks, il mesure les performances après chaque changement et ne conserve que les modifications confirmées comme améliorations
- En plusieurs heures, il a accéléré le harnais de 5,2 % et réduit les allocations mémoire d’environ 70 %
- Les principales optimisations sont les suivantes
- Remplacement de la concaténation de chaînes O(n²) utilisée pour l’accumulation de tokens en streaming par un buffer
- Élimination des copies redondantes lors de la matérialisation des trajectoires via la mémoïsation
- Préallocation des slices à la taille exacte pour réduire la surallocation
- Une fois les différences de vitesse devenues difficiles à mesurer, l’accent a été déplacé vers l’optimisation des allocations mémoire, plus précisément mesurable
- Le benchmark utilisé n’était pas un test de production complet, mais le résultat final a été validé avec Go race detector et une gate
go vet, puis le comportement de l’artefact a été vérifié - La trajectoire d’exécution complète est fournie
-
Redécouverte du problème d’Erdős #397
- Il a trouvé indépendamment une construction produisant un ensemble infini de solutions au problème d’Erdős #397, proposé en 1975 par Erdős, Graham, Ruzsa et Straus
- Le problème est resté non résolu pendant plus de 50 ans avant d’être résolu pour la première fois par GPT-5.2 Pro en janvier 2026 ; il s’agit donc d’une redécouverte, pas de la première solution
- La date limite de connaissance du modèle est novembre 2025 et, faute de Python dans le sandbox, il a trouvé Perl et travaillé pendant 68 minutes
- Le processus de résolution est le suivant
- Recherche brute de factorisations premières exactes
- Analyse de motifs et conjecture d’un ensemble de solutions
- Preuve d’un ensemble infini fermé de solutions à 8 indices
- La formule découverte est la suivante pour tout
n ≥ 0
B(11+10n) · B(14+12n) · B(18+15n) · B(22+20n) = B(12+10n) · B(13+12n) · B(17+15n) · B(23+20n)- Contrairement aux ensembles de solutions existants à 6 indices, elle utilise une structure à 8 indices à croissance linéaire
- La trajectoire d’exécution complète est publiée
Modes de raisonnement et écarts de performance
- Le mode de raisonnement existe en deux variantes : off et max, valeur par défaut
- max laisse le modèle décider du raisonnement par problème et du budget de calcul au moment du test
- Des cas de raisonnement cohérent sur plusieurs heures et plusieurs centaines de milliers de tokens ont été observés
- L’utilisation de max thinking améliore fortement les performances
- Terminal-Bench 2.1 : 60,4 % → 70,2 %
- DeepSWE : 16,5 % → 40,4 %
- Au lancement, aucun contrôle personnalisé de l’intensité du raisonnement de type low, medium ou high n’est proposé
- Dans
pool, la commande/thought-levelpar session permet d’activer ou de désactiver thinking
Limites connues
- En raison d’un surapprentissage au harnais, lors du premier appel à un outil similaire au harnais interne mais avec des spécifications différentes, comme l’outil terminal de Hermes Agent, le modèle peut s’appuyer sur son souvenir de l’interface existante
- Si le harnais rejette un appel incorrect et demande de réessayer, l’apprentissage en contexte résout généralement le problème
- Il utilise un format d’appel d’outils à balises proche de XML, et lorsque les arguments exigent un tableau JSON, il peut produire un JSON mal échappé ou invalide
- Il peut raisonner excessivement longtemps sans progrès, en particulier sur les problèmes de mathématiques de concours
- Les modèles suivants devraient introduire un contrôle de l’intensité du raisonnement et des améliorations d’efficacité du raisonnement
Changements d’entraînement à l’origine des gains de performance
-
Des méthodes de travail améliorées plutôt qu’une simple augmentation de taille
- L’objectif n’est pas seulement d’ajouter de l’intelligence, mais de renforcer des comportements consistant à vérifier davantage, ne pas supposer comme acquis, et ne pas déclarer le succès trop tôt
- Les modèles Laguna précédents pouvaient déclarer la tâche terminée dès qu’une partie des tests passait, ou abandonner une approche juste avant la réussite, mais S 2.1 continue de travailler
- Indépendamment de l’intelligence brute, la persévérance, la vérification et la volonté de revenir en arrière sont considérées comme des axes de performance importants, avec des investissements dans les deux dimensions
- Le prochain grand modèle Laguna a déjà commencé son pré-entraînement
-
Pré-entraînement et post-entraînement
- Il s’agit d’un modèle mis à l’échelle utilisant les mêmes données de pré-entraînement que Laguna XS 2.1
- Les différences avec XS 2.1 portent sur l’échelle, des modifications du code d’entraînement et de petits changements de recette d’entraînement, mais pas sur de nouvelles données
- Le RL a été réalisé pour la première fois en précision FP8, accélérant cette étape d’entraînement
- Le post-entraînement se déroule en deux étapes
- Initialisation des capacités par fine-tuning supervisé (SFT) exploitant une partie de données synthétiques
- Application du RL à des tâches qui ne sont pas encore résolues avec un taux de réussite élevé
- Comme les longues sessions d’agents accumulent des centaines de milliers de tokens de contexte de travail, l’extension à 1M de contexte améliore les performances sur les tâches difficiles
-
Composition des tâches de post-entraînement
- Le corpus d’entraînement comprend 409 000 environnements avec et sans agents
- 83 000 environnements utilisant le terminal
- 168 000 tâches générales de génie logiciel
- Les tâches proviennent de dépôts open source, de données synthétiques internes, d’un système d’installation automatique des dépendances et de l’acquisition de fournisseurs de données externes
- Les tâches de génie logiciel reposent principalement sur l’historique réel du code
- La plus grande part est constituée d’environ 38 000 tâches reproduisant des commits réels issus d’environ 17 000 dépôts
- Elles incluent aussi la reproduction de PR fusionnées, la correction de bugs injectés et la restauration de fichiers supprimés à partir de suites de tests
- S 2.1 ajoute des tâches d’installation de dépôts par agent, où il faut installer toutes les dépendances d’un dépôt et exécuter sa suite de tests
- Les tâches de terminal utilisent un dataset qui génère des environnements et des défis non vus dans les seeds
- Le corpus d’entraînement comprend 409 000 environnements avec et sans agents
-
Améliorations de la boucle d’entraînement
- Un budget de rollout plus important que pour les modèles précédents est appliqué, avec des limites de temps, de tokens par tour et de nombre de tours par tâche accrues
- Le RL a été migré vers un nouveau service de sandbox afin d’exploiter les fonctions suivantes
- Prise en charge des processus en arrière-plan
- Blocage réseau optionnel pour réduire la surface de reward hacking
- Mise en cache des artefacts afin d’éviter de surcharger les services externes
- Le même prompt est exécuté dans plusieurs harnais d’agents pour apprendre des comportements valables dans des harnais variés, et pas seulement dans un unique scaffold
Les deux directions sur lesquelles Poolside se concentre
- La première est la capacité de codage agentique
- Poolside voit le codage et l’interface flexible du logiciel comme un chemin vers l’intelligence
- L’accent est mis sur les cas où le modèle utilise le logiciel en tant qu’agent et travaille de manière cohérente pendant des heures, voire des jours
- La seconde est l’approche selon laquelle il est possible de reconstituer par apprentissage par renforcement le processus de pensée ayant mené à des réponses consignées sur le web
- Cette sortie est le résultat de la première direction, tandis que la seconde est encore en développement
Model Factory et cycle de développement
- La plateforme interne de recherche et d’ingénierie Model Factory automatise le développement des modèles, notamment les données, les expériences de discipline architecturale et l’infrastructure d’évaluation
- Moins de 3 mois après la sortie de Laguna M.1, Poolside a développé un modèle plus puissant avec une taille d’exécution réduite de moitié
- Des investissements sont faits pour accélérer les itérations de recherche et l’intégration, et pour réduire l’attention que les chercheurs doivent consacrer à la tenue des comptes et à l’infrastructure
- La même méthode de développement sera appliquée à des modèles plus grands au cours de l’année à venir
Déploiement et utilisation
- Le modèle est publié sur Hugging Face sous licence OpenMDW-1.1
- Les poids BF16, FP8, INT4 et NVFP4 sont fournis
- Des conversions officielles GGUF et MLX ainsi qu’un modèle draft DFlash sont fournis
- Pour le matériel NVIDIA, des optimisations d’inférence sont prises en charge, notamment le serving TRT-LLM, NVFP4 sur Blackwell et jusqu’à un seul DGX Spark
- Le serving local et public est pris en charge par vLLM, SGLang et Ollama
- Les accès hébergés sont les suivants
- Baseten Model Library et Frontier Gateway
- OpenRouter
- Vercel AI Gateway
- L’endpoint gratuit d’OpenRouter offre un contexte de 256K
- L’endpoint payant dédié prend en charge un contexte de 1M
- Le tarif est de 0,10 $ par million de tokens en entrée, 0,20 $ en sortie et 0,01 $ en lecture de cache
- Il est également disponible dans Kilo, Hermes Agent, pi, OpenCode, OpenClaw, Cline et l’agent de codage en terminal pool
- Pour le post-entraînement, NVIDIA NeMo AutoModel et Prime Intellect Prime Lab sont pris en charge, tandis que ZML LLMD prend en charge l’exécution sur plusieurs matériels
- Les non-développeurs peuvent utiliser la recherche web et l’exécution de code de base sur chat.poolside.ai sans connexion
- Les poids du modèle de base avant post-entraînement sont fournis sur demande par e-mail
Conditions d’exécution des benchmarks
- Les évaluations utilisent un fork interne de Harbor Framework, le harnais d’agent pool, jusqu’à 500 étapes et un sandbox interne
- SWE-bench Multilingual, SWE-Bench Pro et Terminal-Bench 2.1 utilisent la moyenne pass@1 de 4 exécutions par tâche
- DeepSWE v1.1 et SWE Atlas utilisent 3 exécutions par tâche, et Toolathlon Verified la moyenne de 3 exécutions
- SWE Atlas applique telle quelle la méthodologie publique et est jugé avec Opus 4.5
- Toolathlon Verified utilise un harnais répliqué sur EC2 et un agent personnalisé ; contrairement à la version officielle, l’environnement est entièrement réinitialisé et restauré après chaque exécution d’évaluation
- Les limites de CPU, mémoire et stockage ont été ajustées selon les benchmarks afin d’éviter la préemption du sandbox, avec au minimum 2 cœurs CPU, 8 Go de mémoire et 25 Go de stockage garantis
- Les corrections apportées aux tâches individuelles sont résumées dans le rapport technique
1 commentaires
Avis sur Hacker News
memfd_create()/mmapétait utilisé pour l’IPC, et Sol l’a également manqué jusqu’à ce que je le signaleLa comparaison avec DeepSeek V4 peut changer en un instant dans un environnement qui évolue aussi vite, car Flash comme Pro devraient bientôt sortir officiellement après une phase suffisante de post-entraînement. J’espère qu’on continuera à voir arriver ce genre de modèles
https://github.com/mozilla-ai/otari/pull/348
La version 2 bits de Qwen 3.5 122B avait aussi reçu des avis corrects, et comme ce modèle part de plus haut, il mérite d’être testé. Quelqu’un est déjà dessus : https://huggingface.co/vcruz305/Laguna-S-2.1-GGUF
https://huggingface.co/poolside/Laguna-XS-2.1-GGUF/tree/main
Q4_K_Mfait 75 Go, donc même dans un environnement 64 Go, je ne pense pas qu’ils le quantifieront plus bas. Il vaut mieux plutôt ne garder qu’une partie des poids en mémoire et streamer le reste depuis le SSDllm-compressor, que j’utilise, peut quantifier même des modèles qui ne tiennent pas en mémoire, en utilisant un pipeline séquentielhttps://github.com/vllm-project/llm-compressor
Des exemples de configuration sont disponibles ici : https://github.com/verdverm/quantr. Cela dit, comme Poolside a publié les versions quantifiées et dflash avec le modèle, ce n’est peut-être plus nécessaire
Jusqu’ici, sur Strix Halo, il n’y avait pas vraiment de meilleure option que Gemma 4 ou les modèles denses Qwen 3.6 tournant sur un desktop à deux GPU de 32 Go ; ce modèle semble avoir la taille nécessaire pour apporter un vrai gain de performances
Ajouter
--default-chat-template-kwargs '{"enable_thinking": true}'à la configuration d’exécution de vLLM ne les a pas activées, et la valeur par défautmax_new_tokensde 32k dans legeneration_config.jsoninclus semble couper le raisonnement, donc il faut l’augmenter. Une fois le raisonnement activé, la qualité du code s’est nettement améliorée, même s’il faudra encore le valider sur de vrais travauxhttps://www.reddit.com/r/LocalLLaMA/comments/1v2pg99/laguna_...
J’aime la façon dont Poolside le compare non seulement à des modèles de gabarit similaire, mais aussi à des modèles ouverts à poids disponibles bien plus gros et de tout premier plan, comme Kimi-K3 2.5T. J’aimerais que d’autres, dont Mistral, fassent pareil
poolet un modèle MoE 33B. Il fonctionnait rapidement et efficacement même sur un vieux Mac mini 32 Go, et je compte aussi évaluer les grands modèles hébergés