Moonshot AI a publié le plus grand modèle d’IA ouvert Kimi K3 - ForkLog

AI-agents ИИ агенты 3# Moonshot AI publie le plus grand modèle IA open source Kimi K3

Le start-up chinois d’IA Moonshot AI a présenté Kimi K3 — le premier modèle open source de catégorie 3T au monde avec 2,8 billions de paramètres, une vision native et un contexte sur 1 million de tokens. D’après ses propres estimations, au classement général, il n’a devancé que les modèles propriétaires Claude Fable 5 et GPT 5.6 Sol.

Kimi K3 repose sur une nouvelle architecture, Kimi Delta Attention (KDA) et Attention Residuals (AttnRes). La KDA permet de traiter plus efficacement de longues séquences de données, tandis que l’AttnRes extrait l’information requise non pas de tous les niveaux de manière identique, mais de façon sélective. Le modèle comprend ainsi plus profondément le contexte et conserve le sens même lors du traitement de textes complexes.

La sparsité est assurée par le framework Stable LatentMoE : sur 896 experts, seuls 16 travaillent simultanément. Combiné à de nouvelles données et à des réglages d’entraînement, cela a entraîné une hausse d’efficacité d’environ 2,5 fois par rapport à K2.

D’après les développeurs, neuf des 12 derniers mois, les modèles Kimi ont conservé le record de taille parmi les modèles open source.

Source : blog Kimi. Le nouveau modèle de Moonshot AI est déjà disponible sur le site, dans Kimi Work, Code et API. Par défaut, le mode de raisonnement maximal est activé, d’autres options apparaîtront plus tard. Les poids complets et le rapport seront publiés le 27 juillet.

Résultats sur les benchmarks

Sur certaines épreuves, K3 a obtenu des résultats supérieurs à Fable 5 et GPT-5.6 Sol, mais a nettement décroché sur d’autres. Elle mène sur SWE Marathon (42 contre 35 et 39), BrowseComp (91,2 contre 88 et 90,4) et Program Bench (77,8 contre 76,8 et 77,6). Sur Terminal Bench 2.1, K3 affiche 88,3 points : c’est mieux que Fable 5 (84,6) et seulement 0,5 point de moins que Sol (88,8).

En revanche, sur FrontierSWE, K3 a obtenu 81,2 contre 86,6 pour Fable 5, et sur HLE-Full — 43,5 contre 53,3. Les méthodologies de test différaient : une partie des modèles a été évaluée via Claude Code, l’autre via Codex ou le KimiCode propriétaire.

Programmation et tâches d’agents

K3 sait mener de longues sessions d’ingénierie avec presque aucune intervention humaine, s’orienter dans de grands dépôts et piloter des outils côté terminal.

Lors d’un test d’optimisation des cœurs GPU du modèle, quatre tâches — y compris les cœurs AttnRes, KDA et MLA avec une dimension de tête de 512 — ont été exécutées en parallèle jusqu’à 24 heures, sur NVIDIA H200 et sur des GPU d’un autre fabricant. K3 a obtenu un résultat au niveau de Fable 5 et a dépassé nettement Opus 4,8, GPT-5.6 Sol et GPT-5.5. Dans les étapes tardives du développement, une version précoce de K3 a réalisé seule la majeure partie de cette optimisation au sein de l’équipe Moonshot.

Source : blog Kimi. En plus, la modèle a écrit à partir de zéro MiniTriton — un compilateur compact pour les cœurs GPU avec un propre niveau IR au-dessus de MLIR et une génération de code PTX.

Conception de puces et développement de jeux

En guise de démonstration, K3 a conçu seule une puce pour un réseau neuronal sur sa propre architecture.

Le lancement autonome a pris 48 heures : le modèle a utilisé des outils EDA open source et la bibliothèque Nangate 45 nm. La puce tient dans 4 mm², affiche une fréquence de 100 MHz et produit plus de 8700 tokens par seconde en simulation. Elle inclut 1,46 million de cellules standard, 0,277 MB de SRAM et une matrice INT4 MAC avec décquantification intégrée.

K3 combine aussi un raisonnement 3D, du code et la vision pour créer des prototypes de jeux et interactifs à partir de concepts, d’images et de vidéos.

Travail avec les connaissances et la vidéo

Dans l’un des cas, K3 a reproduit des relations universelles I-Love-Q issues de l’astrophysique computationnelle. Cela a pris environ deux heures, au lieu d’une à deux semaines de travail pour un chercheur expérimenté. Le modèle a vérifié plus de 20 articles scientifiques, évalué plus de 300 équations d’état, repéré des incohérences dans des formules publiées et écrit plus de 3000 lignes de code Python, en publiant le résultat sous forme de tableau de bord HTML interactif.

Dans un autre cas, K3 a préparé un rapport interactif sur 42 ans d’histoire de l’industrie des puces ASIC, à travers 120 cycles de récursivité d’auto-amélioration, en traitant plus de 11 000 pages issues de 87 rapports trimestriels et 99 PDF originaux.

Source : blog Kimi. Grâce au traitement natif de la vidéo, K3 sait monter des vidéos : dans un exemple, le modèle a réalisé une animation explicative de sa propre architecture dans le style de 3Blue1Brown ; dans un autre, il a monté seul une bande-annonce de son lancement à partir de 56 clips sources, incluant la sélection des plans, la synchronisation avec la musique et le traitement du son. D’après Moonshot, ce travail prendrait un à deux jours à un monteur expérimenté, et trois à cinq jours à un débutant.

Limites

L’équipe du projet a souligné que K3 est sensible à la perte de l’historique de raisonnement lors du changement d’environnement d’agent au milieu d’une session, et qu’elle peut faire preuve d’un excès d’initiative dans des situations ambiguës. En termes de facilité d’utilisation, le modèle est pour l’instant nettement en dessous de Fable 5 et GPT-5.6 Sol.

Rappelons qu’en juillet 2025, Moonshot AI a publié Kimi K2 — le premier modèle de la gamme avec 1 billion de paramètres, qui s’est rapidement imposé comme l’un des systèmes open source leaders pour des tâches d’agents.

NVDA1,01%
Voir l'original
Cette page peut inclure du contenu de tiers fourni à des fins d'information uniquement. Gate ne garantit ni l'exactitude ni la validité de ces contenus, n’endosse pas les opinions exprimées, et ne fournit aucun conseil financier ou professionnel à travers ces informations. Voir la section Avertissement pour plus de détails.
  • Récompense
  • Commentaire
  • Reposter
  • Partager
Commentaire
Ajouter un commentaire
Ajouter un commentaire
Aucun commentaire
  • Épinglé