- Modèle de production qui étend Kimi Linear, publié l’an dernier, de 48B à 2,8T ; c’est actuellement le plus grand modèle à poids ouverts
- Le nouveau LatentMoE compresse les grandes couches linéaires par projection vers le bas, et l’architecture globale remplace le MoE classique et l’attention par des composants axés sur l’efficacité en inférence
- Les résidus d’attention (attention residuals) relient les résidus entre couches avec des poids fondés sur les scores d’attention, améliorant de façon faible mais constante la perte de validation et les performances downstream
- Les résidus d’attention augmentent le coût d’entraînement d’environ 4 % et le coût d’inférence d’environ 2 % ; toutes les couches RoPE sont supprimées et NoPE est appliqué partout
- Ajout de la prise en charge multimodale native, combinant le passage à grande échelle de Kimi Linear avec des améliorations de l’efficacité en inférence et des chemins résiduels
Passage de Kimi Linear à 2,8T
- Kimi K3 est la version de production de Kimi Linear, étendue de 48B à 2,8T, et constitue actuellement le plus grand modèle à poids ouverts
- Le nouveau LatentMoE, ajouté par rapport à Kimi Linear, est essentiellement identique à l’approche de Nemotron 3 Ultra
- Comme l’attention latente multi-tête, il compresse les grandes couches linéaires par projection vers le bas
- Comme dans les tendances observées avec Nemotron 3 et DeepSeek V4, l’accent est mis sur l’amélioration de l’efficacité en inférence
- Le MoE classique est remplacé par LatentMoE
- L’attention classique est remplacée par l’attention latente multi-tête et Kimi Delta Attention
Chemins résiduels et information de position
- Les résidus d’attention sont un composant destiné à améliorer les chemins résiduels, et non à optimiser l’efficacité ; ils étaient déjà appliqués dans Kimi Linear
- Contrairement aux mHC (manifold-constrained Hyper-Connections) de DeepSeek V4, qui élargissent les chemins résiduels, les résidus d’attention relient les résidus entre les couches
- Ils utilisent comme poids de connexion les scores d’attention, qui indiquent l’importance ou la contribution de chaque résidu
- D’après le rapport technique, ils améliorent de façon faible mais constante la perte de validation et les performances downstream, mais augmentent le coût d’entraînement d’environ 4 % et le coût d’inférence d’environ 2 %
- Toutes les couches RoPE sont supprimées et NoPE, c’est-à-dire aucun embedding de position, est appliqué à toutes les couches
- Les architectures récentes avaient tendance à utiliser RoPE pour l’attention locale, comme l’attention à fenêtre glissante, et NoPE pour les couches globales
- Il existe déjà des architectures utilisant uniquement NoPE, mais Kimi K3 est, à notre connaissance, le premier modèle de niveau frontier à l’appliquer intégralement
Prise en charge multimodale native
- Kimi K3 ajoute également une prise en charge multimodale native
1 commentaires
Avis sur Hacker News
Contrairement aux responsables de laboratoires occidentaux qui présentent Kimi comme le simple produit d’une attaque par distillation, il introduit en réalité des approches nouvelles et originales
Sebastian Raschka est un excellent chercheur et auteur sur les grands modèles de langage, et je recommande vivement son Substack
Il est dit que « de manière intéressante, Kimi K3 supprime toutes les couches RoPE et utilise à la place NoPE (No Positional Embeddings) partout »
Le simple fait que cela fonctionne est déjà surprenant. Sans information de position, est-ce qu’on n’obtient pas une soupe de tokens ? Je me demande si l’attention est assez fine pour qu’un deuxième token sache qu’il est le deuxième simplement en apprenant à accumuler quelque chose dans l’espace d’embedding
L’intuition de l’accumulation est aussi pertinente. Si certaines têtes d’attention continuent d’écrire des valeurs dans la même zone du flux résiduel, alors à mesure que le nombre de tokens d’entrée augmente, les valeurs s’accumulent via la sommation de l’attention et peuvent servir d’indice sans encodage de position séparé
Le fait d’utiliser NoPE partout est intéressant. Les autres modèles conservent en général RoPE dans les couches locales, mais ici des couches d’attention linéaire comme Kimi Delta semblent avoir discrètement pris en charge le traitement de la position, ce qui a permis de le supprimer. Je me demande si cela tiendra à l’échelle de l’état de l’art
Comme un RNN, il perçoit intrinsèquement l’ordre de X, Y, Z dans XYZ. Un Transformer de base traite au contraire un ensemble sans ordre, donc il faut lui indiquer séparément la position entre les éléments
Il y a 3 couches KDA pour chaque couche d’attention, et aussi 3 avant la première couche d’attention, donc tous les tokens peuvent apprendre leur information de position avant même d’atteindre la première véritable couche d’attention
RoPE dégrade une partie de l’information, donc pouvoir le supprimer de cette façon est avantageux. Gemma-4 adopte aussi une structure similaire en 5:1, avec cinq couches de sliding window attention (SWA) pour chaque couche d’attention globale. La SWA est peu coûteuse et moins performante, mais elle traite l’information locale et comble les intervalles entre les puissantes couches globales ; dans ce modèle, KDA joue le même rôle
Dans Gemma, seul le SWA, qui est une vraie attention, a besoin de RoPE, et il est omis dans l’attention globale. KDA n’étant pas de l’attention, il n’a pas besoin d’embeddings de position
Je ne sais pas à partir de quelle taille ce serait encore plus à l’état de l’art, mais il n’y a pas de raison que cela ne fonctionne pas à plus grande échelle. Plus il y a de paramètres, plus il devient facile pour les couches KDA de transmettre l’information de position