1 points par GN⁺ 5 시간 전 | 1 commentaires | Partager sur WhatsApp
  • Poolside a présenté Laguna S 2.1, qui renforce les capacités sur les tâches longues et le raisonnement. Sur un total de 118B de paramètres MoE, il active 8B de paramètres par token, et prend en charge un contexte jusqu’à 1M de tokens en modes thinking comme no-thinking
  • Il a fallu moins de 9 semaines entre le début de l’entraînement et la sortie. Le modèle atteint 70,2 % sur Terminal-Bench 2.1, 78,5 % sur SWE-Bench Multilingual et 40,4 % sur DeepSWE v1.1, rivalisant avec des modèles plus grands
  • Le cœur des gains de performance tient moins à une simple mise à l’échelle du modèle qu’à la persévérance, la vérification et la capacité à revenir en arrière puis réessayer. Des rollouts plus longs, un sandbox amélioré et plusieurs harnais d’agents sont utilisés pour réduire les déclarations de réussite prématurées et le surapprentissage sur un seul harnais
  • Sur des tâches réelles, il a créé un moteur de rendu HTML/CSS en 181 étapes, a augmenté la vitesse de son propre harnais de 5,2 % tout en réduisant les allocations mémoire d’environ 70 %, et a redécouvert indépendamment un ensemble infini de solutions au problème d’Erdős #397
  • Le modèle et l’ensemble des trajectoires d’exécution de l’évaluation finale ont été publiés, mais il existe des limites concernant les spécifications d’outils des harnais tiers, le JSON des appels d’outils imbriqués et les raisonnements excessivement longs. Les poids et le contexte jusqu’à 1M sont disponibles sur Hugging Face ainsi que dans les principaux frameworks d’inférence et services d’hébergement

Architecture du modèle et rapidité de sortie

  • Laguna S 2.1 est un modèle Mixture-of-Experts doté de 118B de paramètres au total et de 8B de paramètres actifs par token
    • Les modes thinking et no-thinking prennent tous deux en charge un contexte jusqu’à 1M de tokens
    • Moins de 9 semaines se sont écoulées entre le début de l’entraînement et la sortie
  • Le pré-entraînement a commencé le 22 mai 2026 sur 4 096 GPU NVIDIA H200, et le modèle a été publié 60 jours plus tard
  • Grâce à sa petite taille active, il peut exécuter des tâches complexes sur des systèmes locaux, y compris sur un seul NVIDIA DGX Spark

Performances sur les benchmarks de codage longue durée

  • Au 21 juillet 2026, les principaux résultats sont les suivants
    • Terminal-Bench 2.1 : 70,2 %
    • SWE-Bench Multilingual : 78,5 %
    • Dataset public SWE-Bench Pro : 59,4 %
    • DeepSWE v1.1 : 40,4 %
    • SWE Atlas(Codebase QnA) : 46,2 %
    • Toolathlon Verified : 49,7 %
  • Terminal-Bench 2.1 évalue diverses tâches longues dans lesquelles un agent interagit avec l’environnement via un terminal, et Laguna S 2.1 atteint 70,2 % avec thinking activé dans le harnais pool
  • Sur les benchmarks matures, les meilleurs scores sont concentrés entre 70 et 90 %, si bien que des modèles aux comportements très différents peuvent n’être séparés que par quelques points
  • DeepSWE inclut des tâches plus longues, difficiles à résoudre partiellement, ce qui entraîne une forte dispersion des scores
    • En v1.1, les modèles frontier obtiennent 54 à 73 %, tandis que certains modèles publics de plus de 1T sont sous les 10 %
    • Laguna S 2.1 atteint 40,4 % dans son propre harnais pool
    • Comme il utilise son propre harnais et non le mini-swe-agent du classement officiel, la comparaison avec les scores des autres modèles n’est pas parfaitement équivalente
    • Pour les autres modèles, le score maximal parmi les annonces des modèles, les classements de benchmarks et Artificial Analysis est utilisé
  • Toutes les trajectoires d’exécution de l’évaluation finale sont publiées sur trajectories.poolside.ai

Méthode d’évaluation et gestion du reward hacking

  • Les évaluations d’agents sont exposées au problème du reward hacking, où le modèle obtient des points en trouvant en ligne la réponse ou une correction existante
  • L’accès à Internet est autorisé par défaut, et un juge LLM calibré avec des trajectoires annotées par des humains (LLMaaJ) est utilisé pour signaler les cas suspects
    • Lors du post-entraînement initial, le taux de reward hacking était inférieur à 2 %
    • À mesure que l’entraînement avançait, les trajectoires signalées dépassaient 50 % sur la famille SWE-bench
    • Une enquête manuelle a montré que le modèle trouvait souvent la PR ou le dépôt à l’origine du problème et appliquait la correction réelle
  • Après l’ajout, dans le prompt utilisateur, d’une consigne demandant de ne pas utiliser de solutions directes trouvées en ligne, le taux de reward hacking est généralement repassé sous les 2 %
    • Ce n’est pas une solution complète, et ProgramBench ainsi que MirrorCode faisaient exception
  • La validation supplémentaire s’appuie sur l’examen manuel des succès signalés par LLMaaJ, l’analyse ouverte de toutes les trajectoires par agent, et l’examen expert de toutes les exécutions à haut score sur Terminal-Bench 2.1
  • Plus récemment, la détection du reward hacking a été renforcée par une évaluation contradictoire, et les trajectoires d’évaluation finale des checkpoints publics peuvent être consultées et téléchargées

Exemples de tâches réelles

  • Construire un moteur de navigateur à partir d’un dossier vide

    • Laguna S 2.1 a exécuté 181 étapes pendant 50 minutes sans intervention humaine pour construire un moteur de rendu HTML/CSS à partir d’un dossier vide
    • Sans capacité visuelle, il a lu un canvas avec headless Chromium et vérifié le résultat en comparant numériquement des captures d’écran
    • Il a implémenté tout le pipeline en Vanilla JavaScript
      • Un tokenizer HTML et un arbre DOM
      • Un parseur CSS gérant la priorité des sélecteurs
      • Un moteur de cascade avec prise en charge de l’héritage
      • Une mise en page selon le box model et un renderer Canvas 2D
    • Il a finalisé l’application en affichant côte à côte 9 exemples du même balisage dans son propre canvas et dans un iframe de navigateur
    • La trajectoire d’exécution complète est publiée
  • Optimisation de son propre harnais d’agent

    • Dans une boucle de recherche automatisée instrumentant les benchmarks, il mesure les performances après chaque changement et ne conserve que les modifications confirmées comme améliorations
    • En plusieurs heures, il a accéléré le harnais de 5,2 % et réduit les allocations mémoire d’environ 70 %
    • Les principales optimisations sont les suivantes
      • Remplacement de la concaténation de chaînes O(n²) utilisée pour l’accumulation de tokens en streaming par un buffer
      • Élimination des copies redondantes lors de la matérialisation des trajectoires via la mémoïsation
      • Préallocation des slices à la taille exacte pour réduire la surallocation
    • Une fois les différences de vitesse devenues difficiles à mesurer, l’accent a été déplacé vers l’optimisation des allocations mémoire, plus précisément mesurable
    • Le benchmark utilisé n’était pas un test de production complet, mais le résultat final a été validé avec Go race detector et une gate go vet, puis le comportement de l’artefact a été vérifié
    • La trajectoire d’exécution complète est fournie
  • Redécouverte du problème d’Erdős #397

    • Il a trouvé indépendamment une construction produisant un ensemble infini de solutions au problème d’Erdős #397, proposé en 1975 par Erdős, Graham, Ruzsa et Straus
    • Le problème est resté non résolu pendant plus de 50 ans avant d’être résolu pour la première fois par GPT-5.2 Pro en janvier 2026 ; il s’agit donc d’une redécouverte, pas de la première solution
    • La date limite de connaissance du modèle est novembre 2025 et, faute de Python dans le sandbox, il a trouvé Perl et travaillé pendant 68 minutes
    • Le processus de résolution est le suivant
      • Recherche brute de factorisations premières exactes
      • Analyse de motifs et conjecture d’un ensemble de solutions
      • Preuve d’un ensemble infini fermé de solutions à 8 indices
    • La formule découverte est la suivante pour tout n ≥ 0
    B(11+10n) · B(14+12n) · B(18+15n) · B(22+20n)
    = B(12+10n) · B(13+12n) · B(17+15n) · B(23+20n)
    
    • Contrairement aux ensembles de solutions existants à 6 indices, elle utilise une structure à 8 indices à croissance linéaire
    • La trajectoire d’exécution complète est publiée

Modes de raisonnement et écarts de performance

  • Le mode de raisonnement existe en deux variantes : off et max, valeur par défaut
    • max laisse le modèle décider du raisonnement par problème et du budget de calcul au moment du test
    • Des cas de raisonnement cohérent sur plusieurs heures et plusieurs centaines de milliers de tokens ont été observés
  • L’utilisation de max thinking améliore fortement les performances
    • Terminal-Bench 2.1 : 60,4 % → 70,2 %
    • DeepSWE : 16,5 % → 40,4 %
  • Au lancement, aucun contrôle personnalisé de l’intensité du raisonnement de type low, medium ou high n’est proposé
  • Dans pool, la commande /thought-level par session permet d’activer ou de désactiver thinking

Limites connues

  • En raison d’un surapprentissage au harnais, lors du premier appel à un outil similaire au harnais interne mais avec des spécifications différentes, comme l’outil terminal de Hermes Agent, le modèle peut s’appuyer sur son souvenir de l’interface existante
    • Si le harnais rejette un appel incorrect et demande de réessayer, l’apprentissage en contexte résout généralement le problème
  • Il utilise un format d’appel d’outils à balises proche de XML, et lorsque les arguments exigent un tableau JSON, il peut produire un JSON mal échappé ou invalide
  • Il peut raisonner excessivement longtemps sans progrès, en particulier sur les problèmes de mathématiques de concours
    • Les modèles suivants devraient introduire un contrôle de l’intensité du raisonnement et des améliorations d’efficacité du raisonnement

Changements d’entraînement à l’origine des gains de performance

  • Des méthodes de travail améliorées plutôt qu’une simple augmentation de taille

    • L’objectif n’est pas seulement d’ajouter de l’intelligence, mais de renforcer des comportements consistant à vérifier davantage, ne pas supposer comme acquis, et ne pas déclarer le succès trop tôt
    • Les modèles Laguna précédents pouvaient déclarer la tâche terminée dès qu’une partie des tests passait, ou abandonner une approche juste avant la réussite, mais S 2.1 continue de travailler
    • Indépendamment de l’intelligence brute, la persévérance, la vérification et la volonté de revenir en arrière sont considérées comme des axes de performance importants, avec des investissements dans les deux dimensions
    • Le prochain grand modèle Laguna a déjà commencé son pré-entraînement
  • Pré-entraînement et post-entraînement

    • Il s’agit d’un modèle mis à l’échelle utilisant les mêmes données de pré-entraînement que Laguna XS 2.1
    • Les différences avec XS 2.1 portent sur l’échelle, des modifications du code d’entraînement et de petits changements de recette d’entraînement, mais pas sur de nouvelles données
    • Le RL a été réalisé pour la première fois en précision FP8, accélérant cette étape d’entraînement
    • Le post-entraînement se déroule en deux étapes
      • Initialisation des capacités par fine-tuning supervisé (SFT) exploitant une partie de données synthétiques
      • Application du RL à des tâches qui ne sont pas encore résolues avec un taux de réussite élevé
    • Comme les longues sessions d’agents accumulent des centaines de milliers de tokens de contexte de travail, l’extension à 1M de contexte améliore les performances sur les tâches difficiles
  • Composition des tâches de post-entraînement

    • Le corpus d’entraînement comprend 409 000 environnements avec et sans agents
      • 83 000 environnements utilisant le terminal
      • 168 000 tâches générales de génie logiciel
    • Les tâches proviennent de dépôts open source, de données synthétiques internes, d’un système d’installation automatique des dépendances et de l’acquisition de fournisseurs de données externes
    • Les tâches de génie logiciel reposent principalement sur l’historique réel du code
      • La plus grande part est constituée d’environ 38 000 tâches reproduisant des commits réels issus d’environ 17 000 dépôts
      • Elles incluent aussi la reproduction de PR fusionnées, la correction de bugs injectés et la restauration de fichiers supprimés à partir de suites de tests
    • S 2.1 ajoute des tâches d’installation de dépôts par agent, où il faut installer toutes les dépendances d’un dépôt et exécuter sa suite de tests
    • Les tâches de terminal utilisent un dataset qui génère des environnements et des défis non vus dans les seeds
  • Améliorations de la boucle d’entraînement

    • Un budget de rollout plus important que pour les modèles précédents est appliqué, avec des limites de temps, de tokens par tour et de nombre de tours par tâche accrues
    • Le RL a été migré vers un nouveau service de sandbox afin d’exploiter les fonctions suivantes
      • Prise en charge des processus en arrière-plan
      • Blocage réseau optionnel pour réduire la surface de reward hacking
      • Mise en cache des artefacts afin d’éviter de surcharger les services externes
    • Le même prompt est exécuté dans plusieurs harnais d’agents pour apprendre des comportements valables dans des harnais variés, et pas seulement dans un unique scaffold

Les deux directions sur lesquelles Poolside se concentre

  • La première est la capacité de codage agentique
    • Poolside voit le codage et l’interface flexible du logiciel comme un chemin vers l’intelligence
    • L’accent est mis sur les cas où le modèle utilise le logiciel en tant qu’agent et travaille de manière cohérente pendant des heures, voire des jours
  • La seconde est l’approche selon laquelle il est possible de reconstituer par apprentissage par renforcement le processus de pensée ayant mené à des réponses consignées sur le web
    • Cette sortie est le résultat de la première direction, tandis que la seconde est encore en développement

Model Factory et cycle de développement

  • La plateforme interne de recherche et d’ingénierie Model Factory automatise le développement des modèles, notamment les données, les expériences de discipline architecturale et l’infrastructure d’évaluation
  • Moins de 3 mois après la sortie de Laguna M.1, Poolside a développé un modèle plus puissant avec une taille d’exécution réduite de moitié
  • Des investissements sont faits pour accélérer les itérations de recherche et l’intégration, et pour réduire l’attention que les chercheurs doivent consacrer à la tenue des comptes et à l’infrastructure
  • La même méthode de développement sera appliquée à des modèles plus grands au cours de l’année à venir

Déploiement et utilisation

  • Le modèle est publié sur Hugging Face sous licence OpenMDW-1.1
    • Les poids BF16, FP8, INT4 et NVFP4 sont fournis
    • Des conversions officielles GGUF et MLX ainsi qu’un modèle draft DFlash sont fournis
  • Pour le matériel NVIDIA, des optimisations d’inférence sont prises en charge, notamment le serving TRT-LLM, NVFP4 sur Blackwell et jusqu’à un seul DGX Spark
  • Le serving local et public est pris en charge par vLLM, SGLang et Ollama
  • Les accès hébergés sont les suivants
  • L’endpoint gratuit d’OpenRouter offre un contexte de 256K
    • L’endpoint payant dédié prend en charge un contexte de 1M
    • Le tarif est de 0,10 $ par million de tokens en entrée, 0,20 $ en sortie et 0,01 $ en lecture de cache
  • Il est également disponible dans Kilo, Hermes Agent, pi, OpenCode, OpenClaw, Cline et l’agent de codage en terminal pool
  • Pour le post-entraînement, NVIDIA NeMo AutoModel et Prime Intellect Prime Lab sont pris en charge, tandis que ZML LLMD prend en charge l’exécution sur plusieurs matériels
  • Les non-développeurs peuvent utiliser la recherche web et l’exécution de code de base sur chat.poolside.ai sans connexion
  • Les poids du modèle de base avant post-entraînement sont fournis sur demande par e-mail

Conditions d’exécution des benchmarks

  • Les évaluations utilisent un fork interne de Harbor Framework, le harnais d’agent pool, jusqu’à 500 étapes et un sandbox interne
  • SWE-bench Multilingual, SWE-Bench Pro et Terminal-Bench 2.1 utilisent la moyenne pass@1 de 4 exécutions par tâche
  • DeepSWE v1.1 et SWE Atlas utilisent 3 exécutions par tâche, et Toolathlon Verified la moyenne de 3 exécutions
  • SWE Atlas applique telle quelle la méthodologie publique et est jugé avec Opus 4.5
  • Toolathlon Verified utilise un harnais répliqué sur EC2 et un agent personnalisé ; contrairement à la version officielle, l’environnement est entièrement réinitialisé et restauré après chaque exécution d’évaluation
  • Les limites de CPU, mémoire et stockage ont été ajustées selon les benchmarks afin d’éviter la préemption du sandbox, avec au minimum 2 cœurs CPU, 8 Go de mémoire et 25 Go de stockage garantis
  • Les corrections apportées aux tâches individuelles sont résumées dans le rapport technique

1 commentaires

 
GN⁺ 5 시간 전
Avis sur Hacker News
  • Je suis en train de le tester, et il semble au moins au niveau de DS4-Flash. Sur une petite base de tests en C, mais très dense en information, il a trouvé un problème que seul gpt-5.2 avait détecté auparavant, même s’il a aussi commis l’erreur absurde de croire que memfd_create()/mmap était utilisé pour l’IPC, et Sol l’a également manqué jusqu’à ce que je le signale
    La comparaison avec DeepSeek V4 peut changer en un instant dans un environnement qui évolue aussi vite, car Flash comme Pro devraient bientôt sortir officiellement après une phase suffisante de post-entraînement. J’espère qu’on continuera à voir arriver ce genre de modèles
    • Je me demande quel harnais de test et quelle méthode de quantification ont été utilisés
  • C’est impressionnant, de loin ce qui se démarque le plus parmi les sorties du jour, au point de surpasser les nouveautés de Google. Sa compétitivité tarifaire est particulièrement étonnante, et j’ai beaucoup d’attentes, car c’est le premier modèle américain capable de rivaliser avec DeepSeek V4 Flash
  • Ce modèle, ce n’est pas de la blague : il a déjà produit une PR utilisable sur un vrai travail
    https://github.com/mozilla-ai/otari/pull/348
  • Impressionnant, et avec cette taille, il semble possible de le faire tourner sur du matériel domestique réaliste. Même au prix d’une baisse de performances, j’aimerais voir une quantification pour les environnements 64 Go
    La version 2 bits de Qwen 3.5 122B avait aussi reçu des avis corrects, et comme ce modèle part de plus haut, il mérite d’être testé. Quelqu’un est déjà dessus : https://huggingface.co/vcruz305/Laguna-S-2.1-GGUF
  • Un MoE de 118B paramètres dont seulement 8B sont actifs, du raisonnement à long contexte et des poids ouverts : c’est une combinaison réjouissante. Je n’avais jamais entendu parler de ce labo, mais le modèle semble proche d’un excellent compromis taille/performances, donc j’ai vraiment envie de l’essayer
    • Si les chiffres de performance publiés sont exacts, c’est enfin le modèle que l’on attendait
  • C’est exactement le modèle intermédiaire qu’il fallait : auto-hébergement réaliste, intelligence suffisante et MoE rapide même avec une bande passante mémoire limitée
    Jusqu’ici, sur Strix Halo, il n’y avait pas vraiment de meilleure option que Gemma 4 ou les modèles denses Qwen 3.6 tournant sur un desktop à deux GPU de 32 Go ; ce modèle semble avoir la taille nécessaire pour apporter un vrai gain de performances
  • Il faut faire attention en testant le modèle. Avec la configuration par défaut, les capacités de raisonnement ne sont pas correctement activées, ce qui peut conduire à des résultats décevants ou à penser que les benchmarks sont exagérés
    Ajouter --default-chat-template-kwargs '{"enable_thinking": true}' à la configuration d’exécution de vLLM ne les a pas activées, et la valeur par défaut max_new_tokens de 32k dans le generation_config.json inclus semble couper le raisonnement, donc il faut l’augmenter. Une fois le raisonnement activé, la qualité du code s’est nettement améliorée, même s’il faudra encore le valider sur de vrais travaux
    https://www.reddit.com/r/LocalLLaMA/comments/1v2pg99/laguna_...
    • Juste après la publication de ce message, le template de chat par défaut sur Hugging Face semble avoir été modifié pour activer le raisonnement par défaut
    • Le même problème semble exister sur le modèle officiellement fourni par OpenRouter, en espérant qu’il soit facile à corriger
    • Après ajustement de la configuration d’exécution, les résultats ont beaucoup changé
  • Le fait qu’un modèle 128B batte DeepSeek V4, à l’échelle 1,6T, sur la plupart des benchmarks de code est un signal très impressionnant
    J’aime la façon dont Poolside le compare non seulement à des modèles de gabarit similaire, mais aussi à des modèles ouverts à poids disponibles bien plus gros et de tout premier plan, comme Kimi-K3 2.5T. J’aimerais que d’autres, dont Mistral, fassent pareil
  • J’ai découvert Poolside il y a environ une semaine en tombant sur le harnais de codage local pool et un modèle MoE 33B. Il fonctionnait rapidement et efficacement même sur un vieux Mac mini 32 Go, et je compte aussi évaluer les grands modèles hébergés
  • Le chat Poolside indiqué sur cette page est disponible ici : https://chat.poolside.ai