11 points par ninebow 2025-09-10 | Aucun commentaire pour le moment. | Partager sur WhatsApp

[2025/09/01 ~ 07] Sélection d’articles de recherche IA/ML à suivre cette semaine

PyTorchKR🔥🇰🇷 🤔💭

1️⃣ Limites et contrôle des grands modèles de langage : plusieurs articles ont abordé les limites des grands modèles de langage (LLM) et les moyens de les contrôler. En particulier, « On the Fundamental Impossibility of Hallucination Control in Large Language Models » présente une impossibilité théorique : les LLM ne peuvent pas atteindre simultanément une représentation fidèle des connaissances et la préservation de l’information, tout en soulignant l’identité mathématique entre hallucination et créativité. Cela fournit une base pour mieux gérer ces comportements dans les systèmes d’IA.

2️⃣ Techniques d’apprentissage et d’optimisation efficaces : des articles comme « Fantastic Pretraining Optimizers and Where to Find Them » et « Communication Efficient LLM Pre-training with SparseLoCo » explorent de nouvelles méthodes d’optimisation pour améliorer l’efficacité de l’entraînement des LLM. En particulier, SparseLoCo exploite la sparsification et la quantification pour améliorer l’efficacité de la communication, avec de meilleurs résultats à la fois sur les performances et sur les coûts de communication.

3️⃣ Amélioration de la collaboration et de la mémoire dans les systèmes multi-agents : « Anemoi: A Semi-Centralized Multi-agent Systems Based on Agent-to-Agent Communication MCP server from Coral Protocol » et « Memp: Exploring Agent Procedural Memory » proposent des approches visant à améliorer la collaboration dans les systèmes multi-agents ainsi que la mémoire procédurale des agents. Anemoi améliore les performances grâce à une collaboration directe entre agents, tandis que Memp permet aux agents de disposer d’une mémoire procédurale apprenable, rendant possibles des mises à jour et des améliorations continues.


Étude sur l’impossibilité fondamentale du contrôle des hallucinations dans les grands modèles de langage / On the Fundamental Impossibility of Hallucination Control in Large Language Models

Présentation de l’article

Le problème des hallucinations dans les grands modèles de langage (LLM) affecte de manière critique la fiabilité et la précision des systèmes d’intelligence artificielle, et cette étude cherche à en établir mathématiquement l’impossibilité fondamentale. Les auteurs expliquent des ensembles d’informations en bits à l’aide de l’idée d’enchères et analysent le processus par lequel plusieurs composants forment une réponse en mobilisant leur connaissance partielle. Cette recherche fournit une base mathématique aux hallucinations et à la créativité à travers trois domaines mathématiques indépendants : la théorie de la conception de mécanismes, la théorie des règles de score propres, et une analyse directe de l’architecture des transformeurs. En particulier, les auteurs proposent une méthode pour quantifier la surconfiance ou la génération de réponses intuitives, des caractéristiques qui apparaissent à la fois dans les hallucinations et dans la créativité.

L’étude introduit également les concepts de mesure de l’information sémantique et d’opérateur émergent pour modéliser le raisonnement limité, et souligne que si le raisonnement limité génère de l’information accessible, un raisonnement idéal et illimité préserve strictement le contenu sémantique. Grâce à cette analyse, les auteurs démontrent que les hallucinations et l’imagination sont des phénomènes mathématiquement identiques, provenant d’écarts touchant à la véracité, à la préservation de l’information sémantique, à la divulgation des connaissances pertinentes et à l’optimalité sous contraintes de connaissance. Cette étude fournit une base théorique susceptible d’avoir des implications importantes pour la conception et l’évaluation des systèmes d’IA, tout en offrant des pistes pour les recherches futures. On peut attendre de ces contributions qu’elles soulèvent de nouvelles questions à l’intersection de la théorie de l’information et de l’IA, et qu’elles approfondissent la compréhension de la nature de l’information.

Résumé (Abstract)

Cet article établit un théorème fondamental d’impossibilité : aucun LLM capable d’effectuer une agrégation de connaissances non triviale ne peut simultanément atteindre une représentation véridique des connaissances, la conservation de l’information sémantique, la divulgation complète des connaissances pertinentes et l’optimalité sous contrainte de connaissance. Cette impossibilité ne relève pas d’une limite d’ingénierie, mais de la structure mathématique même de l’agrégation d’informations. Les auteurs établissent ce résultat en décrivant le processus d’inférence comme une enchère d’idées, où des composants distribués se disputent la formulation des réponses en exploitant leurs connaissances partielles. La preuve s’étend sur trois domaines mathématiques indépendants : la théorie de la conception de mécanismes (Green-Laffont), la théorie des règles de score propres (Savage) et l’analyse architecturale directe des transformers (convexité Log-Sum-Exp). En particulier, les auteurs montrent comment quantifier la production de réponses trop confiantes ou intuitives — la signature à la fois de l’hallucination et de la créativité, ou de l’imagination. Pour étayer cette analyse, ils introduisent les concepts complémentaires de mesure de l’information sémantique et d’opérateur d’émergence afin de modéliser le raisonnement borné dans un cadre général. Ils prouvent que, si le raisonnement borné génère une information accessible, source d’intuitions et d’inspirations précieuses, le raisonnement idéalisé non contraint préserve strictement le contenu sémantique. En montrant que l’hallucination et l’imagination sont des phénomènes mathématiquement identiques — fondés sur des écarts de véracité, de conservation de l’information sémantique, de divulgation des connaissances pertinentes et d’optimalité sous contrainte de connaissance —, ils proposent une base de principe pour gérer ces comportements dans les systèmes d’IA avancés. Enfin, ils présentent quelques idées spéculatives pour inspirer l’évaluation et l’amélioration de la théorie proposée.

This paper establishes a fundamental impossibility theorem: no LLM capable of performing non-trivial knowledge aggregation can simultaneously achieve truthful knowledge representation, semantic information conservation, complete revelation of relevant knowledge, and knowledge-constrained optimality. The impossibility is not an engineering limitation but arises from the mathematical structure of information aggregation itself. We establish this result by describing the inference process as an auction of ideas, where distributed components compete exploiting their partial knowledge to shape responses. The proof spans three independent mathematical domains: mechanism design theory (Green-Laffont), the theory of proper scoring rules (Savage), and direct architectural analysis of transformers (Log-Sum-Exp convexity). In particular, we show how to quantify the creation of overconfident or intuitive responses-the signature of both hallucination and creativity, or imagination. To support this analysis, we introduce the complementary concepts of the semantic information measure and the emergence operator to model bounded reasoning in a general setting. We prove that while bounded reasoning generates accessible information, providing valuable insights and inspirations, the idealized unconstrained reasoning strictly preserves semantic content. By demonstrating that hallucination and imagination are mathematically identical phenomena-grounded in departures from truthfulness, semantic information conservation, revelation of relevant knowledge, and knowledge-constrained optimality-we offer a principled foundation for managing these behaviors in advanced AI systems. Finally, we present some speculative ideas to inspire evaluation and refinements of the proposed theory.

Lien vers l’article

https://arxiv.org/abs/2506.06382


Des optimiseurs de préentraînement fantastiques et où les trouver / Fantastic Pretraining Optimizers and Where to Find Them

Présentation de l’article

Les optimiseurs de préentraînement jouent un rôle important dans l’entraînement des grands modèles de langage, et AdamW s’est imposé comme le standard pendant longtemps. Cependant, des travaux récents affirmant que des optimiseurs alternatifs offrent des gains de vitesse de 1,4× à 2× montrent en réalité que ces affirmations sont exagérées. Cette étude pointe deux problèmes majeurs à l’origine de ces conclusions. D’une part, l’ajustement des hyperparamètres peut être réalisé de manière déséquilibrée ; d’autre part, les configurations d’évaluation peuvent être limitées ou trompeuses. Pour y remédier, les auteurs ont comparé de manière systématique 10 optimiseurs de deep learning sur différentes échelles de modèles et divers ratios données-modèle.

La méthodologie centrale de l’étude consiste à décomposer le cadre d’ajustement des hyperparamètres en trois étapes. Dans la première, les hyperparamètres de chaque optimiseur sont affinés en détail afin d’obtenir les meilleures performances. Dans la deuxième, l’optimisation se concentre uniquement sur les éléments des hyperparamètres qui nécessitent un ajustement, afin de réduire les besoins en mémoire. Enfin, dans la troisième, des lois d’échelle sont appliquées pour prédire les valeurs optimales des hyperparamètres en fonction de la taille du modèle et du budget de données. Cette méthodologie garantit une comparaison équitable et reproductible entre les optimiseurs, et les résultats soulignent que les optimiseurs basés sur des matrices affichent des performances systématiquement supérieures à celles des optimiseurs basés sur des scalaires.

Cette recherche met en avant l’importance de l’ajustement des hyperparamètres ainsi que la nécessité d’évaluations sur différentes échelles de modèles et divers ratios données-modèle, tout en montrant que les hyperparamètres optimaux pour un optimiseur peuvent être sous-optimaux pour un autre. Ces conclusions devraient contribuer de manière importante à définir des critères pour la conception et l’évaluation futures des optimiseurs.

Résumé (Abstract)

AdamW est depuis longtemps l’optimiseur dominant dans le préentraînement des modèles de langage, malgré de nombreuses affirmations selon lesquelles des optimiseurs alternatifs offriraient une accélération de 1,4x à 2x. Nous avançons que deux faiblesses méthodologiques ont empêché des comparaisons équitables et freiné l’adoption pratique : (i) un réglage inégal des hyperparamètres et (ii) des configurations d’évaluation limitées ou trompeuses. Pour remédier à ces deux problèmes, nous menons une étude systématique de dix optimiseurs de deep learning sur quatre échelles de modèles (0.1B-1.2B de paramètres) et différents ratios données/modèle (de 1 à 8x l’optimum de Chinchilla). Nous constatons que des comparaisons à la fois équitables et instructives exigent un réglage rigoureux des hyperparamètres ainsi que des évaluations sur une gamme de tailles de modèles et de ratios données/modèle, réalisées en fin d’entraînement. Premièrement, des hyperparamètres optimaux pour un optimiseur peuvent être sous-optimaux pour un autre, ce qui rend injuste tout transfert aveugle d’hyperparamètres. Deuxièmement, l’accélération réelle de nombreux optimiseurs proposés par rapport à des baselines correctement réglées est plus faible que ce qui est annoncé et diminue avec la taille du modèle, jusqu’à seulement 1,1x pour des modèles de 1.2B de paramètres. Troisièmement, comparer des checkpoints intermédiaires avant d’atteindre le budget d’entraînement visé peut être trompeur, car le classement entre deux optimiseurs peut s’inverser au cours de l’entraînement en raison de la décroissance du learning rate. Notre enquête approfondie montre que tous les optimiseurs les plus rapides, comme Muon et Soap, utilisent des matrices comme préconditionneurs — en multipliant les gradients par des matrices plutôt que par des scalaires appliqués élément par élément. Cependant, le gain de vitesse des optimiseurs fondés sur des matrices est inversement proportionnel à l’échelle du modèle, passant de 1,4x par rapport à AdamW pour des modèles de 0.1B de paramètres à seulement 1,1x pour des modèles de 1.2B de paramètres.

AdamW has long been the dominant optimizer in language model pretraining, despite numerous claims that alternative optimizers offer 1.4 to 2x speedup. We posit that two methodological shortcomings have obscured fair comparisons and hindered practical adoption: (i) unequal hyperparameter tuning and (ii) limited or misleading evaluation setups. To address these two issues, we conduct a systematic study of ten deep learning optimizers across four model scales (0.1B-1.2B parameters) and data-to-model ratios (1-8x the Chinchilla optimum). We find that fair and informative comparisons require rigorous hyperparameter tuning and evaluations across a range of model scales and data-to-model ratios, performed at the end of training. First, optimal hyperparameters for one optimizer may be suboptimal for another, making blind hyperparameter transfer unfair. Second, the actual speedup of many proposed optimizers over well-tuned baselines is lower than claimed and decreases with model size to only 1.1x for 1.2B parameter models. Thirdly, comparing intermediate checkpoints before reaching the target training budgets can be misleading, as rankings between two optimizers can flip during training due to learning rate decay. Through our thorough investigation, we find that all the fastest optimizers such as Muon and Soap, use matrices as preconditioners -- multiplying gradients with matrices rather than entry-wise scalars. However, the speedup of matrix-based optimizers is inversely proportional to model scale, decreasing from 1.4x over AdamW for 0.1B parameter models to merely 1.1x for 1.2B parameter models.

Lien vers l’article

https://arxiv.org/abs/2509.02046

Pour aller plus loin

https://wandb.ai/marin-community/optimizer-scaling


Anemoi : serveur MCP pour systèmes multi-agents semi-centralisés fondé sur la communication inter-agents / Anemoi: A Semi-Centralized Multi-agent Systems Based on Agent-to-Agent Communication MCP server from Coral Protocol

Présentation de l’article

Anemoi est un système multi-agents semi-centralisé (Multi-Agent System, MAS) fondé sur le modèle de communication A2A (Agent-to-Agent) de Coral Protocol, qui permet une coordination efficace des tâches grâce à une coopération directe entre agents. Les MAS centralisés traditionnels fonctionnent en général avec un agent planificateur qui coordonne à sens unique plusieurs agents d’exécution, ce qui entraîne une dépendance aux capacités du planificateur ainsi que des problèmes de perte d’information et de redondance dus à des communications limitées entre agents. Anemoi a été conçu pour résoudre ces problèmes et propose une architecture dans laquelle tous les agents peuvent surveiller en temps réel l’avancement, identifier les goulots d’étranglement et suggérer des améliorations.

Au cœur d’Anemoi se trouve l’utilisation du serveur MCP (Multi-Agent Communication Protocol) de communication A2A de Coral Protocol, afin d’assurer une circulation fluide de l’information entre agents. Le système combine un agent planificateur et plusieurs agents d’exécution spécialisés par domaine, fournissant un plan initial tout en permettant aux workers de se coordonner directement. Cela réduit la dépendance à un planificateur centralisé, permet des mises à jour adaptatives du plan et minimise les transferts redondants de contexte, pour une exécution plus rentable.

Anemoi a été évalué sur le benchmark GAIA et a atteint une précision de 52,73 % en utilisant un petit LLM (GPT-4.1-mini) comme planificateur. Cela dépasse de 9,09 % OWL, la baseline open source la plus performante dans la même configuration, qui obtenait 43,63 %. Ces résultats montrent que le modèle de communication A2A semi-centralisé d’Anemoi peut contribuer à améliorer les performances des systèmes multi-agents.

Cette recherche ouvre de nouvelles perspectives pour les systèmes multi-agents grâce à une coopération directe entre agents et à une meilleure circulation de l’information, et devrait apporter une contribution importante au développement futur de systèmes d’IA généralisés. L’implémentation d’Anemoi est disponible en open source sur GitHub, offrant aux chercheurs l’opportunité d’exploiter ce système pour développer diverses applications.

Résumé(Abstract)

Les avancées récentes des systèmes multi-agents généralistes (MAS) ont principalement suivi un paradigme combinant context engineering et centralisation, dans lequel un agent planificateur coordonne plusieurs agents d’exécution via une transmission unidirectionnelle de prompts. Bien qu’efficace avec des modèles de planification puissants, cette conception souffre de deux limites critiques : (1) une forte dépendance aux capacités du planificateur, qui entraîne une baisse des performances lorsqu’un petit LLM alimente ce rôle ; et (2) une communication inter-agents limitée, où la collaboration repose sur une concaténation coûteuse de prompts et une injection de contexte, générant redondance et perte d’information. Pour répondre à ces défis, nous proposons Anemoi, un MAS semi-centralisé construit sur le serveur MCP de communication Agent-to-Agent (A2A) de Coral Protocol. Contrairement aux conceptions traditionnelles, Anemoi permet une collaboration inter-agents structurée et directe, donnant à tous les agents la capacité de suivre la progression, d’évaluer les résultats, d’identifier les goulets d’étranglement et de proposer des améliorations en temps réel. Ce paradigme réduit la dépendance à un planificateur unique, prend en charge des mises à jour adaptatives du plan et minimise les transferts redondants de contexte, ce qui permet une exécution plus scalable et plus rentable. Évalué sur le benchmark GAIA, Anemoi a atteint une précision de 52,73 % avec un petit LLM (GPT-4.1-mini) comme planificateur, dépassant de +9,09 % OWL (43,63 %), la baseline open source la plus performante, à configuration LLM identique. Notre implémentation est disponible publiquement sur https://github.com/Coral-Protocol/Anemoi.

Recent advances in generalist multi-agent systems (MAS) have largely followed a context-engineering plus centralized paradigm, where a planner agent coordinates multiple worker agents through unidirectional prompt passing. While effective under strong planner models, this design suffers from two critical limitations: (1) strong dependency on the planner's capability, which leads to degraded performance when a smaller LLM powers the planner; and (2) limited inter-agent communication, where collaboration relies on costly prompt concatenation and context injection, introducing redundancy and information loss. To address these challenges, we propose Anemoi, a semi-centralized MAS built on the Agent-to-Agent (A2A) communication MCP server from Coral Protocol. Unlike traditional designs, Anemoi enables structured and direct inter-agent collaboration, allowing all agents to monitor progress, assess results, identify bottlenecks, and propose refinements in real time. This paradigm reduces reliance on a single planner, supports adaptive plan updates, and minimizes redundant context passing, resulting in more scalable and cost-efficient execution. Evaluated on the GAIA benchmark, Anemoi achieved 52.73% accuracy with a small LLM (GPT-4.1-mini) as the planner, surpassing the strongest open-source baseline OWL (43.63%) by +9.09% under identical LLM settings. Our implementation is publicly available at https://github.com/Coral-Protocol/Anemoi.

Lien vers l’article

https://arxiv.org/abs/2508.17068

Pour aller plus loin

https://github.com/Coral-Protocol/Anemoi


SparseLoCo pour le pré-entraînement de LLM efficace en communication / Communication Efficient LLM Pre-training with SparseLoCo

Présentation de l’article

Améliorer l’efficacité de la communication dans le processus de pré-entraînement des grands modèles de langage (LLM) est un sujet de recherche particulièrement important. Les algorithmes récents d’apprentissage distribué suscitent un grand intérêt, car ils sont utiles pour entraîner des LLM dans des environnements à bande passante limitée, entre data centers ou via Internet. Cependant, les méthodes existantes nécessitent encore de transmettre l’intégralité des gradients du modèle, ce qui peut créer des goulets d’étranglement de communication et entraîner une dégradation des performances. Pour résoudre ce problème, SparseLoCo a été proposé comme un algorithme d’apprentissage efficace en communication, qui utilise la sparsification Top-k et la quantification sur 2 bits afin d’atteindre des taux de compression extrêmes tout en améliorant les performances.

L’innovation centrale de SparseLoCo consiste à approximer le momentum externe en combinant error feedback et sparsification agressive. Cela permet de réduire le coût de communication tout en améliorant les performances du modèle. Les résultats montrent empiriquement que SparseLoCo offre des avantages significatifs à la fois en performances et en coût de communication dans divers environnements soumis à des contraintes de communication. En particulier, avec une sparsité de 1 à 3 % et une quantification sur 2 bits, la méthode réduit nettement le coût de communication par rapport à DDP (Distributed Data Parallel), tout en maintenant, voire en améliorant, les performances.

Cette recherche propose une nouvelle méthode pour accroître l’efficacité de la communication dans le pré-entraînement des LLM, et ouvre des perspectives d’évolution pour SparseLoCo grâce à davantage d’expériences et d’optimisations. SparseLoCo devrait apporter une contribution importante à l’amélioration de l’efficacité de l’entraînement des grands modèles, et ainsi aider à ouvrir de nouvelles orientations pour la recherche et le développement autour des LLM.

Résumé(Abstract)

Les algorithmes d’apprentissage distribué efficaces en communication suscitent récemment un intérêt considérable en raison de leurs avantages pour l’entraînement de grands modèles de langage (LLM) dans des environnements à bande passante limitée, comme entre des data centers ou via internet. Bien que ces méthodes réduisent la fréquence des communications, elles nécessitent encore en général de transmettre une copie complète des gradients du modèle, ce qui crée un goulot d’étranglement de communication même sur les liaisons inter-data centers. En outre, elles peuvent légèrement dégrader les performances par rapport à une baseline AdamW DDP naïve. Si la quantification et le retour d’erreur sont souvent appliqués pour réduire la taille du pseudo-gradient, dans le contexte du pré-entraînement des LLM, les approches existantes n’ont pas réussi à exploiter en plus la sparsification et n’ont obtenu qu’une quantification limitée. Dans ce travail, nous présentons SparseLoCo, un algorithme d’entraînement efficace en communication pour les LLM qui exploite efficacement la sparsification Top-k et la quantification afin d’atteindre des taux de compression extrêmes allant jusqu’à 1-3 % de sparsité et une quantification sur 2 bits, tout en surpassant DiLoCo en pleine précision. Notre observation principale est que le momentum externe peut être approximé localement par un retour d’erreur combiné à une sparsité agressive, et que l’agrégation creuse peut en réalité améliorer les performances du modèle. Nous démontrons empiriquement, dans une gamme de contextes d’entraînement de LLM sous contrainte de communication, que SparseLoCo apporte des avantages significatifs à la fois en performance et en coût de communication.

Communication-efficient distributed training algorithms have received considerable interest recently due to their benefits for training Large Language Models (LLMs) in bandwidth-constrained settings, such as across data centers and over the internet. Despite reducing communication frequency, these methods still typically require communicating a full copy of the model's gradients-resulting in a communication bottleneck even for cross-datacenter links. Furthermore, they can slightly degrade performance compared to a naive AdamW DDP baseline. While quantization and error feedback are often applied to reduce the pseudo-gradient's size, in the context of LLM pre-training, existing approaches have been unable to additionally leverage sparsification and have obtained limited quantization. In this work, we introduce SparseLoCo, a communication-efficient training algorithm for LLMs that effectively leverages Top-k sparsification and quantization to reach extreme compression ratios of up to 1-3% sparsity and 2-bit quantization while outperforming full-precision DiLoCo. Our key observations are that outer momentum can be locally approximated by an error feedback combined with aggressive sparsity and that sparse aggregation can actually improve model performance. We empirically demonstrate in a range of communication-constrained LLM training settings that SparseLoCo provides significant benefits in both performance and communication cost.

Lien vers l’article

https://arxiv.org/abs/2508.15706


Routage adaptatif des LLM sous contraintes budgétaires / Adaptive LLM Routing under Budget Constraints

Présentation de l’article

Les avancées des grands modèles de langage (LLM) ont révolutionné le domaine du traitement du langage naturel, mais le coût élevé de ces modèles ainsi que la capacité à répondre de manière appropriée à des types de requêtes variés restent des défis majeurs. Cette étude reformule le problème du routage des LLM comme un problème de bandit contextuel et propose un nouvel algorithme, Preference-prior Informed LinUCB for Adaptive Routing (PILOT), qui sélectionne le LLM optimal sous contrainte budgétaire. Les approches existantes d’apprentissage supervisé sont limitées par leur besoin de grands jeux de données annotés ; pour dépasser cette limite, cette étude développe une méthodologie qui ajuste dynamiquement le choix du LLM à partir des retours utilisateurs.

PILOT se compose de deux étapes principales. Dans la première, des données hors ligne sur les préférences humaines sont exploitées pour construire un espace d’embedding partagé reflétant l’affinité entre les requêtes et les LLM. Au cours de ce processus, la triplet loss est minimisée afin d’apprendre efficacement la relation entre requêtes et LLM. Dans la seconde étape, un feedback de bandit en ligne est intégré afin de sélectionner le LLM approprié pour chaque requête et d’observer la récompense associée, ce qui améliore continuellement les performances. Cette approche permet une allocation flexible des ressources tenant compte du budget et offre la capacité de s’adapter à des besoins utilisateurs variés.

La contribution principale de cette étude réside dans la formalisation du problème du routage des LLM sous contraintes budgétaires et dans la proposition de l’algorithme PILOT pour le résoudre. Les résultats expérimentaux montrent que PILOT surpasse les baselines bandit existantes sur divers jeux de données et parvient à maximiser l’efficacité coût-performance. Ces résultats constituent une contribution importante pour le déploiement et l’utilisation pratiques des LLM ; parmi les pistes futures figurent une meilleure adaptation à la diversité des besoins utilisateurs ainsi qu’une application à un plus grand nombre de jeux de données.

Résumé (Abstract)

Les grands modèles de langage (LLM) ont révolutionné le traitement du langage naturel, mais la diversité de leurs capacités et de leurs coûts pose des défis dans les applications réelles. Le routage de LLM répond à ce problème en sélectionnant dynamiquement le LLM le plus adapté à chaque requête/tâche. Les approches précédentes traitaient cela comme un problème d’apprentissage supervisé, en supposant une connaissance complète des appariements optimaux entre requêtes et LLM. Cependant, dans des scénarios réels, ces correspondances exhaustives n’existent pas et les requêtes des utilisateurs évoluent. Nous proposons donc d’étudier le routage de LLM comme un problème de bandit contextuel, ce qui permet une prise de décision adaptative à partir d’un feedback de type bandit, sans exiger une inférence exhaustive sur tous les LLM pour toutes les requêtes, contrairement au routage supervisé. Pour résoudre ce problème, nous développons un espace d’embedding partagé pour les requêtes et les LLM, dans lequel leurs embeddings sont alignés de manière à refléter leur affinité. Cet espace est d’abord appris à partir de données hors ligne de préférences humaines, puis affiné via un feedback de bandit en ligne. Nous concrétisons cette idée à travers Preference-prior Informed Linucb fOr adaptive rouTing (PILOT), une nouvelle extension de LinUCB. Pour prendre en compte la diversité des budgets utilisateurs pour le routage de modèles, nous introduisons une politique de coût en ligne modélisée comme un problème de sac à dos à choix multiples, garantissant un routage efficace en ressources.

Large Language Models (LLMs) have revolutionized natural language processing, but their varying capabilities and costs pose challenges in practical applications. LLM routing addresses this by dynamically selecting the most suitable LLM for each query/task. Previous approaches treat this as a supervised learning problem, assuming complete knowledge of optimal query-LLM pairings. However, real-world scenarios lack such comprehensive mappings and face evolving user queries. We thus propose to study LLM routing as a contextual bandit problem, enabling adaptive decision-making using bandit feedback without requiring exhaustive inference across all LLMs for all queries (in contrast to supervised routing). To address this problem, we develop a shared embedding space for queries and LLMs, where query and LLM embeddings are aligned to reflect their affinity. This space is initially learned from offline human preference data and refined through online bandit feedback. We instantiate this idea through Preference-prior Informed Linucb fOr adaptive rouTing (PILOT), a novel extension of LinUCB. To handle diverse user budgets for model routing, we introduce an online cost policy modeled as a multi-choice knapsack problem, ensuring resource-efficient routing.

Lien vers l’article

https://arxiv.org/abs/2508.21141


Génération efficace de jeux d’images par réutilisation du calcul en diffusion texte-image / Reusing Computation in Text-to-Image Diffusion for Efficient Generation of Image Sets

Présentation de l’article

Les modèles de diffusion texte-image sont très efficaces pour générer des images de haute qualité, mais le coût de calcul élevé de ce processus reste un défi majeur. Les travaux existants se sont surtout concentrés sur l’amélioration de l’efficacité lors de la génération d’images individuelles, tandis que cette étude propose une nouvelle approche pour réduire la redondance entre des prompts corrélés. La méthode proposée exploite la nature coarse-to-fine des modèles de diffusion afin de capturer les structures partagées entre prompts similaires lors des premières étapes de débruitage.

Cette recherche adopte une approche sans entraînement qui regroupe les prompts selon leur similarité sémantique et partage le calcul durant les premières étapes de diffusion. Les résultats expérimentaux montrent que, pour des modèles conditionnés sur des embeddings d’image, cette méthode peut réduire le coût de calcul d’au moins 50 % tout en maintenant ou en améliorant la qualité des images. En outre, l’exploitation des informations a priori texte-image de UnClip a permis d’optimiser l’allocation des étapes de diffusion et d’accroître encore l’efficacité.

La méthode proposée peut s’intégrer de manière fluide aux pipelines existants de génération texte-image, et elle est extensible à de grands ensembles de prompts, ce qui peut contribuer à réduire les coûts environnementaux et financiers. Cette étude fournit des éclairages importants sur la dynamique de génération des modèles de diffusion et devrait servir de base précieuse pour explorer à l’avenir des stratégies d’optimisation plus durables.

Résumé(Abstract)

Les modèles de diffusion texte-image permettent de générer des images de haute qualité, mais ils sont coûteux en calcul. Alors que les travaux précédents se sont concentrés sur l’optimisation de l’efficacité par inférence, nous explorons une approche orthogonale visant à réduire la redondance entre prompts corrélés. Notre méthode exploite la nature coarse-to-fine des modèles de diffusion, où les premières étapes de débruitage capturent des structures communes entre prompts similaires. Nous proposons une approche sans apprentissage qui regroupe les prompts en fonction de leur similarité sémantique et partage le calcul lors des premières étapes de diffusion. Les expériences montrent que, pour les modèles entraînés avec conditionnement sur des embeddings d’image, notre approche réduit fortement le coût de calcul tout en améliorant la qualité des images. En exploitant l’a priori texte-image de UnClip, nous améliorons l’allocation des étapes de diffusion pour obtenir une efficacité accrue. Notre méthode s’intègre de manière fluide aux pipelines existants, passe à l’échelle avec les ensembles de prompts et réduit les coûts environnementaux et financiers de la génération texte-image à grande échelle. Page du projet : https://ddecatur.github.io/hierarchical-diffusion/

Text-to-image diffusion models enable high-quality image generation but are computationally expensive. While prior work optimizes per-inference efficiency, we explore an orthogonal approach: reducing redundancy across correlated prompts. Our method leverages the coarse-to-fine nature of diffusion models, where early denoising steps capture shared structures among similar prompts. We propose a training-free approach that clusters prompts based on semantic similarity and shares computation in early diffusion steps. Experiments show that for models trained conditioned on image embeddings, our approach significantly reduces compute cost while improving image quality. By leveraging UnClip's text-to-image prior, we enhance diffusion step allocation for greater efficiency. Our method seamlessly integrates with existing pipelines, scales with prompt sets, and reduces the environmental and financial burden of large-scale text-to-image generation. Project page: https://ddecatur.github.io/hierarchical-diffusion/

Lien vers l’article

https://arxiv.org/abs/2508.21032

Pour aller plus loin

https://ddecatur.github.io/hierarchical-diffusion/


L’attention est une spline cubique lissée / Attention is a smoothed cubic spline

Présentation de l’article

Dans l’architecture des transformeurs, le module d’attention, malgré son importance, reste encore largement méconnu. Cette étude propose un nouvel éclairage en interprétant ce module d’attention comme une spline cubique lissée, apportant ainsi de nouvelles intuitions depuis la perspective de la théorie classique de l’approximation. Les auteurs montrent qu’avec la fonction d’activation ReLU, l’attention, l’attention masquée et l’attention encodeur-décodeur peuvent toutes être représentées comme des splines cubiques. Cette approche est particulièrement importante dans la mesure où tous les composants du transformeur sont constitués de combinaisons de différents modules d’attention et de réseaux neuronaux feed forward.

L’étude souligne, sur la base de la conjecture de Pierce-Birkhoff, que toute spline peut être représentée par un encodeur à activation ReLU. Cela permet de clarifier la nature mathématique du module d’attention et d’approfondir la compréhension structurelle du transformeur à travers le cadre des splines cubiques. Les auteurs indiquent également qu’en remplaçant ReLU par une fonction d’activation lisse comme SoftMax afin d’obtenir une version lisse de classe $C^\infty$, on peut retrouver les modèles de transformeurs existants.

Cette recherche approfondit la compréhension des modèles de machine learning existants grâce à une interprétation mathématique du mécanisme d’attention, et explique l’essence de l’architecture des transformeurs à travers l’objet mathématique bien connu qu’est la spline. Les résultats expérimentaux montrent que le modèle de spline cubique proposé surpasse les modèles existants, démontrant que l’interprétation mathématique du module d’attention a un impact positif sur les performances réelles. Ces résultats devraient contribuer à l’évolution future des mécanismes d’attention. Cette étude propose une nouvelle manière d’envisager le module d’attention des transformeurs et constituera une base importante pour les chercheurs du domaine.

Résumé de l’article (Abstract)

Nous mettons en avant une intuition peut-être importante mais jusqu’ici inaperçue : le module d’attention dans un transformeur est une spline cubique lissée. Vue sous cet angle, cette composante à la fois mystérieuse et essentielle du transformeur devient un développement naturel d’une vieille notion profondément enracinée dans la théorie classique de l’approximation. Plus précisément, nous montrons qu’avec une activation ReLU, l’attention, l’attention masquée et l’attention encodeur-décodeur sont toutes des splines cubiques. Comme tous les composants d’un transformeur sont construits à partir de compositions de divers modules d’attention (= splines cubiques) et de réseaux neuronaux feed forward (= splines linéaires), tous ses composants — blocs encodeur, décodeur et encodeur-décodeur ; encodeurs et décodeurs multicouches ; le transformeur lui-même — sont des splines cubiques ou d’ordre supérieur. Si l’on suppose vraie la conjecture de Pierce-Birkhoff, alors la réciproque est également vraie, c’est-à-dire que toute spline est un encodeur à activation ReLU. Comme une spline est généralement seulement $C^2$, une façon d’obtenir une version lisse de classe $C^\infty$ consiste à remplacer ReLU par une activation lisse ; et si cette activation est choisie comme SoftMax, on retrouve le transformeur original tel que proposé par Vaswani et al. Cette intuition éclaire la nature du transformeur en l’exprimant entièrement en termes de splines, l’un des objets les plus connus et les mieux compris des mathématiques appliquées.

We highlight a perhaps important but hitherto unobserved insight: The attention module in a transformer is a smoothed cubic spline. Viewed in this manner, this mysterious but critical component of a transformer becomes a natural development of an old notion deeply entrenched in classical approximation theory. More precisely, we show that with ReLU-activation, attention, masked attention, encoder-decoder attention are all cubic splines. As every component in a transformer is constructed out of compositions of various attention modules (= cubic splines) and feed forward neural networks (= linear splines), all its components -- encoder, decoder, and encoder-decoder blocks; multilayered encoders and decoders; the transformer itself -- are cubic or higher-order splines. If we assume the Pierce-Birkhoff conjecture, then the converse also holds, i.e., every spline is a ReLU-activated encoder. Since a spline is generally just $C^2$, one way to obtain a smoothed $C^\infty$-version is by replacing ReLU with a smooth activation; and if this activation is chosen to be SoftMax, we recover the original transformer as proposed by Vaswani et al. This insight sheds light on the nature of the transformer by casting it entirely in terms of splines, one of the best known and thoroughly understood objects in applied mathematics.

Lien vers l’article

https://arxiv.org/abs/2408.09624


$Mem^p$ : exploration de la mémoire procédurale des agents / $Mem^p$: Exploring Agent Procedural Memory

Présentation de l’article

Les agents basés sur des grands modèles de langage (LLM) affichent d’excellentes performances sur des tâches variées, mais leur mémoire procédurale existante reste fragile, car elle est soit conçue manuellement, soit dépendante de paramètres statiques. Cette étude propose $Mem^p$, une méthodologie innovante visant à doter les agents d’une mémoire procédurale tout au long de la vie, apprenable et actualisable. $Mem^p$ explore des stratégies de construction (Build), de récupération (Retrieval) et de mise à jour (Update) de la mémoire procédurale en distillant les trajectoires passées des agents sous forme d’instructions détaillées étape par étape et de scripts de haut niveau.

Le cœur de $Mem^p$ réside dans un régime dynamique qui met continuellement à jour, révise et supprime la mémoire procédurale. Les agents peuvent ainsi faire évoluer leur dépôt de mémoire en fonction de nouvelles expériences, et les évaluations empiriques montrent une amélioration progressive du taux de réussite et de l’efficacité sur TravelPlanner et ALFWorld. En particulier, une mémoire procédurale construite à partir d’un modèle plus puissant conserve sa valeur, et son transfert vers un modèle plus faible améliore lui aussi significativement les performances.

Le processus de récupération de la mémoire procédurale est essentiel pour permettre à l’agent de retrouver efficacement les expériences les plus proches face à une nouvelle tâche. Ce processus est mis en œuvre en utilisant des modèles de vector embedding pour mesurer la similarité et récupérer la mémoire la plus adaptée. En outre, le mécanisme de mise à jour de la mémoire procédurale a été conçu pour permettre des ajouts, suppressions et modifications dynamiques à mesure que le nombre de tâches exécutées par l’agent augmente. Cette approche globale contribue à maximiser la capacité d’apprentissage de l’agent et à améliorer ses performances dans des environnements variés.

En améliorant en continu la mémoire procédurale des agents, $Mem^p$ apporte des enseignements importants pour le développement futur des systèmes d’agents et souligne l’importance d’une mémoire procédurale apprenable. Ces résultats devraient constituer une contribution innovante à l’optimisation des performances des agents.

Résumé de l’article (Abstract)

Les agents basés sur les grands modèles de langage (LLM) excellent dans des tâches variées, mais souffrent d’une mémoire procédurale fragile, conçue manuellement ou imbriquée dans des paramètres statiques. Cette étude examine des stratégies visant à doter les agents d’une mémoire procédurale apprenable, actualisable et utilisable tout au long de leur existence. Nous proposons $Mem^p$, qui distille les trajectoires passées des agents à la fois en instructions détaillées étape par étape et en abstractions de plus haut niveau, de type script, et nous explorons l’impact de différentes stratégies de construction (Build), de récupération (Retrieval) et de mise à jour (Update) de la mémoire procédurale. Associé à un régime dynamique qui met continuellement à jour, corrige et déprécie son contenu, ce dépôt évolue au même rythme que les nouvelles expériences. Les évaluations empiriques sur TravelPlanner et ALFWorld montrent qu’à mesure que le dépôt de mémoire s’affine, les agents obtiennent des taux de réussite constamment plus élevés et une meilleure efficacité sur des tâches analogues. De plus, une mémoire procédurale construite à partir d’un modèle plus puissant conserve sa valeur : transférer cette mémoire procédurale vers un modèle plus faible apporte des gains de performance substantiels.

Large Language Models (LLMs) based agents excel at diverse tasks, yet they suffer from brittle procedural memory that is manually engineered or entangled in static parameters. In this work, we investigate strategies to endow agents with a learnable, updatable, and lifelong procedural memory. We propose $Mem^p$ that distills past agent trajectories into both fine-grained, step-by-step instructions and higher-level, script-like abstractions, and explore the impact of different strategies for Build, Retrieval, and Update of procedural memory. Coupled with a dynamic regimen that continuously updates, corrects, and deprecates its contents, this repository evolves in lockstep with new experience. Empirical evaluation on TravelPlanner and ALFWorld shows that as the memory repository is refined, agents achieve steadily higher success rates and greater efficiency on analogous tasks. Moreover, procedural memory built from a stronger model retains its value: migrating the procedural memory to a weaker model yields substantial performance gains.

Lien vers l’article

https://arxiv.org/abs/2508.06433


Le moment AlphaGo pour la découverte d’architectures de modèles / AlphaGo Moment for Model Architecture Discovery

Présentation de l’article

ASI-Arch est un système d’intelligence artificielle générale supérieure (ASI4AI) capable de découvrir de manière entièrement autonome des architectures innovantes dans le domaine de la recherche d’architectures de réseaux de neurones. Dépassant la recherche d’architecture neuronale (NAS) limitée aux espaces de recherche définis par les humains, il fait passer le paradigme de l’optimisation automatique à l’innovation automatique en formulant, implémentant, entraînant et validant de manière indépendante de nouveaux concepts architecturaux. À travers 1773 expériences sur 20000 heures GPU, il a découvert 106 architectures d’attention linéaire (linear attention) de pointe, proposant de nouveaux principes de conception qui surpassent les bases conçues par des humains. Il présente également des lois d’échelle empiriques appliquées à la découverte scientifique elle-même, démontrant que les progrès de la recherche peuvent passer des limites de la cognition humaine à un processus extensible grâce aux ressources de calcul.

Résumé (Abstract)

Alors que les systèmes d’IA affichent des capacités en amélioration exponentielle, le rythme de la recherche en IA elle-même reste linéairement limité par les capacités cognitives humaines, ce qui crée un goulot d’étranglement de développement de plus en plus sévère. Cet article présente ASI-Arch, première démonstration d’une Artificial Superintelligence for AI research (ASI4AI) dans le domaine critique de la découverte d’architectures neuronales. ASI-Arch est un système entièrement autonome qui dépasse cette contrainte fondamentale en permettant à l’IA de mener elle-même l’innovation architecturale. Au-delà du Neural Architecture Search (NAS) traditionnel, fondamentalement limité à l’exploration d’espaces définis par l’humain, il introduit un changement de paradigme, passant de l’optimisation automatisée à l’innovation automatisée. ASI-Arch réalise une recherche scientifique end-to-end dans le domaine de la découverte d’architectures, en formulant de manière autonome de nouveaux concepts architecturaux, en les implémentant sous forme de code exécutable, puis en entraînant et en validant empiriquement leurs performances au moyen d’expériences rigoureuses et de l’expérience accumulée. ASI-Arch a mené 1 773 expériences autonomes sur 20 000 heures GPU, aboutissant à la découverte de 106 architectures de linear attention innovantes et à l’état de l’art (SOTA). À l’image du 37e coup (Move 37) d’AlphaGo, qui avait révélé des intuitions stratégiques inattendues invisibles aux joueurs humains, les architectures découvertes par cette IA mettent en évidence des principes de conception émergents qui surpassent systématiquement les références conçues par l’humain et révèlent des voies jusque-là inconnues pour l’innovation architecturale. Plus important encore, nous établissons la première loi d’échelle empirique appliquée à la découverte scientifique elle-même, en démontrant que les percées architecturales peuvent être mises à l’échelle par le calcul, transformant ainsi le progrès de la recherche d’un processus limité par l’humain en un processus extensible par la puissance de calcul. Cet article fournit une analyse complète des motifs de conception émergents et des capacités de recherche autonome qui ont rendu ces avancées possibles, et propose un plan directeur pour des systèmes d’IA à auto-accélération.

While AI systems demonstrate exponentially improving capabilities, the pace of AI research itself remains linearly bounded by human cognitive capacity, creating an increasingly severe development bottleneck. We present ASI-Arch, the first demonstration of Artificial Superintelligence for AI research (ASI4AI) in the critical domain of neural architecture discovery--a fully autonomous system that shatters this fundamental constraint by enabling AI to conduct its own architectural innovation. Moving beyond traditional Neural Architecture Search (NAS), which is fundamentally limited to exploring human-defined spaces, we introduce a paradigm shift from automated optimization to automated innovation. ASI-Arch can conduct end-to-end scientific research in the domain of architecture discovery, autonomously hypothesizing novel architectural concepts, implementing them as executable code, training and empirically validating their performance through rigorous experimentation and past experience. ASI-Arch conducted 1,773 autonomous experiments over 20,000 GPU hours, culminating in the discovery of 106 innovative, state-of-the-art (SOTA) linear attention architectures. Like AlphaGo's Move 37 that revealed unexpected strategic insights invisible to human players, our AI-discovered architectures demonstrate emergent design principles that systematically surpass human-designed baselines and illuminate previously unknown pathways for architectural innovation. Crucially, we establish the first empirical scaling law for scientific discovery itself--demonstrating that architectural breakthroughs can be scaled computationally, transforming research progress from a human-limited to a computation-scalable process. We provide comprehensive analysis of the emergent design patterns and autonomous research capabilities that enabled these breakthroughs, establishing a blueprint for self-accelerating AI systems.

Lien vers l’article

https://arxiv.org/abs/2507.18074


Élicitation des capacités des modèles de langage par apprentissage non supervisé / Unsupervised Elicitation of Language Models

Présentation de l’article

Lorsqu’on adapte un modèle de langage préentraîné à une tâche spécifique, les méthodes existantes nécessitent une supervision humaine. Mais avec des modèles dotés de capacités surhumaines, obtenir une supervision humaine de haute qualité devient difficile, voire impossible. Pour répondre à ce problème, les auteurs proposent Internal Coherence Maximization (ICM), un algorithme d’apprentissage non supervisé qui affine le modèle à partir de labels générés par le modèle lui-même, sans supervision externe. ICM atteint des performances équivalentes ou supérieures à celles de l’apprentissage fondé sur la supervision humaine sur plusieurs benchmarks, et montre en particulier de meilleurs résultats que l’apprentissage sur labels humains pour des tâches où le modèle possède des capacités surhumaines. En outre, cette méthode a permis d’entraîner des reward models et des systèmes auxiliaires pour des modèles de langage à l’état de l’art, avec des gains de performance démontrés par rapport aux modèles supervisés par des humains.

Résumé (Abstract)

Pour adapter des modèles de langage préentraînés à des tâches aval, le paradigme actuel de post-training s’appuie sur des humains pour spécifier les comportements souhaités. Cependant, pour des modèles aux capacités surhumaines, obtenir une supervision humaine de haute qualité est difficile, voire impossible. Pour répondre à ce défi, nous proposons un nouvel algorithme non supervisé, l’Internal Coherence Maximization (ICM), qui permet d’affiner des modèles de langage préentraînés à partir des labels qu’ils génèrent eux-mêmes, \emph{sans supervision externe}. Sur les tâches GSM8k-verification, TruthfulQA et de reward modeling Alpaca, notre méthode atteint des performances équivalentes à un entraînement avec une supervision de référence et surpasse un entraînement avec une supervision humaine issue du crowdsourcing. Sur les tâches où les capacités des LLM sont nettement surhumaines, notre méthode permet de faire émerger ces capacités de manière significativement plus efficace qu’un entraînement sur des labels humains. Enfin, nous montrons que notre méthode peut améliorer l’entraînement des LLM de pointe : nous l’utilisons pour entraîner un modèle de récompense non supervisé, puis pour entraîner par apprentissage par renforcement un assistant basé sur Claude 3.5 Haiku. Le modèle de récompense comme l’assistant surpassent tous deux leurs équivalents supervisés par des humains.

To steer pretrained language models for downstream tasks, today's post-training paradigm relies on humans to specify desired behaviors. However, for models with superhuman capabilities, it is difficult or impossible to get high-quality human supervision. To address this challenge, we introduce a new unsupervised algorithm, Internal Coherence Maximization (ICM), to fine-tune pretrained language models on their own generated labels, \emph{without external supervision}. On GSM8k-verification, TruthfulQA, and Alpaca reward modeling tasks, our method matches the performance of training on golden supervision and outperforms training on crowdsourced human supervision. On tasks where LMs' capabilities are strongly superhuman, our method can elicit those capabilities significantly better than training on human labels. Finally, we show that our method can improve the training of frontier LMs: we use our method to train an unsupervised reward model and use reinforcement learning to train a Claude 3.5 Haiku-based assistant. Both the reward model and the assistant outperform their human-supervised counterparts.

Lien vers l’article

https://arxiv.org/abs/2506.10139


  • Cet article est basé sur un résumé rédigé avec un modèle GPT ; il peut donc contenir des formulations qui diffèrent du contenu ou de l’intention du texte original. Si le sujet vous intéresse, veuillez également consulter la source d’origine. Si vous remarquez un passage maladroit ou une erreur en lisant, merci de le signaler en commentaire. 🤗

  • ⚠️Publicité⚠️ Avez-vous trouvé utile cet article récapitulé par le groupe d’utilisateurs PyTorch Corée🇰🇷 ? Si vous créez un compte, nous vous enverrons les principaux articles par e-mail💌 ! Le mode par défaut est Weekly, mais vous pouvez aussi passer en Daily.

Aucun commentaire pour le moment.

Aucun commentaire pour le moment.