AWS publie un guide pour déployer Kimi K3, le plus grand modèle d’IA open-weight

kimi k3 open-weight

Moonshot AI franchit une nouvelle étape dans la course mondiale à l’intelligence artificielle. L’entreprise chinoise a publié les poids de Kimi K3, un modèle Mixture of Experts de 2,8 billions de paramètres, présenté comme le premier système open-weight de cette catégorie à atteindre une telle échelle. Quelques jours plus tard, Amazon Web Services a dévoilé un guide technique destiné aux entreprises souhaitant déployer ce modèle, confirmant l’intérêt grandissant des grands fournisseurs de cloud pour les modèles d’IA ouverts de très grande taille.

Initialement lancé le 16 juillet sous forme d’API, Kimi K3 est devenu librement téléchargeable le 27 juillet. Les poids sont disponibles sur Hugging Face au format MXFP4, une représentation en virgule flottante sur 4 bits optimisée pour limiter les besoins en mémoire, sous une licence MIT modifiée. Avec cette publication, Moonshot AI dépasse notamment DeepSeek V4 Pro et revendique désormais le plus vaste modèle open-weight accessible au public.

L’architecture de Kimi K3 repose sur une approche Mixture of Experts qui répartit 2 800 milliards de paramètres entre 896 experts spécialisés. Lors de chaque génération de texte, seuls 16 experts sont activés, ce qui représente environ 104 milliards de paramètres réellement utilisés à chaque inférence. Cette stratégie permet d’améliorer les performances tout en réduisant les ressources mobilisées par rapport à un modèle dense de taille équivalente.

Le modèle dispose également d’une fenêtre de contexte pouvant atteindre un million de tokens. Cette capacité lui permet d’analyser des documents particulièrement volumineux, des bases de connaissances étendues ou des conversations complexes sans perdre le fil des informations. Kimi K3 prend aussi en charge des capacités multimodales natives combinant le traitement du texte et de l’image.

Moonshot AI met en avant deux innovations techniques majeures. La première, baptisée Kimi Delta Attention, introduit un mécanisme hybride d’attention linéaire qui accélère le décodage jusqu’à 6,3 fois sur les très longues séquences. La seconde, Stable LatentMoE, améliore le routage entre les experts et offrirait une efficacité de montée en charge environ 2,5 fois supérieure à celle de Kimi K2, selon les données communiquées par l’entreprise.

Malgré son caractère ouvert, Kimi K3 reste extrêmement exigeant sur le plan matériel. Le téléchargement des poids nécessite environ 1,4 téraoctet d’espace de stockage, tandis que l’exécution complète du modèle impose une infrastructure GPU de dernière génération. Pour répondre à cette contrainte, Amazon Web Services a publié le 30 juillet un guide de déploiement détaillant deux architectures utilisant les instances p6-b300, équipées chacune de huit GPU NVIDIA Blackwell Ultra B300.

AWS précise les différentes méthodes de parallélisation permettant de répartir efficacement la charge de calcul entre plusieurs GPU afin d’exploiter pleinement les capacités du modèle. Cette documentation vise principalement les centres de recherche, les grands laboratoires d’IA et les entreprises disposant d’infrastructures cloud de très haute performance.

Moonshot AI ne s’est pas limité à publier les poids du modèle. L’entreprise a également rendu open source MoonEP, une bibliothèque de communication dédiée au parallélisme des experts, conçue pour maintenir un équilibrage optimal entre les GPU même lorsque la répartition des tâches est inégale. Elle a aussi présenté AgentEnv, un environnement destiné au développement d’agents d’intelligence artificielle capables d’exécuter des flux de travail complexes.

Cette stratégie traduit une volonté d’encourager un écosystème ouvert autour de Kimi K3. En mettant à disposition non seulement le modèle, mais aussi les outils nécessaires à son exploitation, Moonshot AI cherche à faciliter l’adoption par les chercheurs, les développeurs et les entreprises souhaitant créer leurs propres applications d’IA.

Selon Bloomberg, le fondateur de Moonshot AI, Yang Zhilin, considère cette politique d’ouverture comme un levier essentiel pour élargir rapidement la communauté d’utilisateurs face aux plateformes propriétaires. Dans le même temps, l’entreprise adopte une stratégie commerciale plus ambitieuse avec une API facturée 3 dollars par million de tokens en entrée et 15 dollars par million de tokens en sortie, des tarifs qui positionnent clairement Kimi K3 parmi les modèles d’intelligence artificielle les plus avancés du marché.

L’arrivée de Kimi K3 illustre une évolution majeure du secteur. Les modèles open-weight atteignent désormais des niveaux de performance autrefois réservés aux systèmes entièrement fermés. Si les exigences matérielles limitent encore leur déploiement à grande échelle, le soutien de fournisseurs cloud comme AWS pourrait accélérer leur adoption dans les domaines de la recherche, du développement logiciel et des applications professionnelles.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *