Qu'est-ce que Kimi K3 ? Benchmarks, prix, fenêtre de contexte et plans de poids ouverts
Kimi K3 est le nouveau modèle phare de Moonshot AI pour le codage à long terme, le travail de connaissance agentique, la compréhension visuelle et le raisonnement profond. Annoncé le 16 juillet 2026, il combine une architecture de mélange d'experts de 2,8 billions de paramètres avec une fenêtre de contexte d'un million de jetons et une conception de routage inhabituellement éparse.
Les spécifications principales sont impressionnantes, mais les détails comptent. Les résultats de benchmark les plus solides proviennent actuellement de la propre évaluation de lancement de Moonshot, la sortie de l'API est considérablement plus chère que les modèles Kimi précédents, et les poids téléchargeables promis n'étaient pas encore disponibles lors de la publication de cet article le 23 juillet 2026. Ce guide sépare ce qui est déjà utilisable de ce qui reste un plan de publication.
Points clés à retenir
- Kimi K3 est un modèle multimodal MoE de 2,8 milliards de paramètres qui active 16 des 896 experts routés pour chaque jeton.
- La fenêtre de contexte est de 1 048 576 jetons , avec mise en cache automatique des préfixes et aucun niveau de prix API supérieur pour les invites plus longues.
- Les prix officiels de l'API sont de 0,30 $ par million de jetons d'entrée avec cache, 3,00 $ par million de jetons d'entrée sans cache et 15,00 $ par million de jetons de sortie.
- Moonshot rapporte des résultats de pointe ou quasi-de pointe sur plusieurs benchmarks de codage, de navigation, de feuille de calcul, d'automatisation et d'agents visuels, bien que les configurations d'évaluation ne soient pas identiques d'un modèle à l'autre.
- Les poids devaient être publiés d'ici le 27 juillet 2026. Au 23 juillet, le point de contrôle, la licence finale, les tailles de fichiers et les instructions pratiques de déploiement communautaire n'étaient pas encore disponibles pour inspection.
Qu'est-ce que Kimi K3 ?
Kimi K3 est le successeur de la génération Kimi K2 de Moonshot AI et le plus grand modèle de la société à ce jour. Moonshot le décrit comme le premier modèle ouvert de la classe des trois billions de paramètres. Il est conçu moins comme un modèle de chat léger et plus comme un agent toujours en mode de raisonnement qui peut maintenir l'état sur de longs flux de travail d'ingénierie, de recherche, de documents et d'utilisation d'outils.
Le modèle est nativement multimodal. Il accepte le texte, les images et la vidéo via les produits Kimi pris en charge et les formats d'entrée de l'API, puis produit du texte et des appels d'outils. Moonshot positionne K3 autour de trois charges de travail principales : ingénierie logicielle à long terme, travail de connaissance de bout en bout et tâches combinant des retours visuels avec du code ou des outils structurés.
Kimi K3 est disponible via Kimi.com, les applications mobiles Kimi, Kimi Work, Kimi Code et l'API Kimi. Les développeurs utilisent l'ID de modèle API kimi-k3. La documentation de l'API indique que l'accès phare est débloqué après un rechargement de compte réussi d'au moins 1 $, les limites de débit étant déterminées par le niveau du compte.
Les lecteurs qui ont besoin d'informations plus générales sur la famille de produits peuvent commencer par Zerlo's guide sur Kimi AI et Moonshot AI. . K3 est la version du modèle ; Kimi est l'assistant, l'application et l'écosystème de développeurs plus larges.
Architecture Kimi K3 : pourquoi 2,8 billions de paramètres ne signifient pas 2,8 billions de paramètres actifs
Kimi K3 utilise une conception de mélange d'experts (MoE) éparse. Le réseau contient 896 experts routés, mais seulement 16 sont sélectionnés pour chaque jeton. Cela permet au modèle de stocker une très grande quantité de capacité spécialisée sans exécuter chaque expert à chaque passage vers l'avant. Le point de contrôle complet doit toujours être stocké et distribué sur un cluster d'inférence, de sorte que l'activation éparse réduit le calcul plus qu'elle ne réduit le défi de stockage.
Moonshot met en évidence quatre composants architecturaux :
- Kimi Delta Attention (KDA) : un mécanisme d'attention linéaire utilisé dans trois des quatre couches d'attention pour rendre le traitement de séquences longues plus efficace.
- Attention latente multi-têtes à porte : la quatrième couche du cycle conserve une attention globale complète pour une récupération d'informations précise.
- Résidus d'attention : les blocs peuvent récupérer sélectivement des représentations à des profondeurs antérieures au lieu de ne compter que sur un seul flux résiduel accumulé en continu.
- Stable LatentMoE : le cadre de routage des experts qui prend en charge la configuration d'experts extrêmement éparse de 16 sur 896.
La société affirme que ces changements, combinés à des méthodes de formation et des recettes de données mises à jour, offrent environ 2,5 fois l'efficacité globale de mise à l'échelle de Kimi K2. Ce chiffre est une affirmation de Moonshot plutôt qu'une mesure reproduite de manière indépendante. K3 utilise également une formation consciente de la quantification avec des poids MXFP4 et des activations MXFP8, et Moonshot recommande des déploiements de supernodes avec au moins 64 accélérateurs.
Un simple calcul de stockage illustre l'échelle. À quatre bits par paramètre, 2,8 billions de paramètres représentent environ 1,4 téraoctet de données de poids brutes avant les métadonnées, les structures de routage, les tampons d'exécution, le cache KV, la redondance et les frais généraux du framework. C'est pourquoi une éventuelle version à poids ouvert sera précieuse pour les chercheurs et les sociétés d'hébergement, mais ne fera pas de Kimi K3 un modèle de bureau normal.
Benchmarks Kimi K3
Les documents de lancement de Moonshot comparent Kimi K3 à GPT-5.6 Sol, GPT-5.5, Claude Fable 5, Claude Opus 4.8 et GLM-5.2. Le propre résumé de la société est relativement modéré : K3 est toujours en retard par rapport aux systèmes propriétaires les plus performants dans l'ensemble, mais il atteint des performances de pointe et domine de nombreuses tâches individuelles.
| Benchmark | Score Kimi K3 | Position dans le tableau de lancement de Moonshot |
|---|---|---|
| DeepSWE | 67.5 | Derrière GPT-5.6 Sol et Claude Fable 5 |
| Terminal Bench 2.1 | 88.3 | Deuxième, à 0,5 point derrière GPT-5.6 Sol |
| Program Bench | 77.8 | Score le plus élevé reporté dans le tableau |
| SWE Marathon | 42.0 | Score le plus élevé reporté dans le tableau |
| FrontierSWE | 81.2 | Deuxième derrière Claude Fable 5 |
| BrowseComp | 91.2 | Score le plus élevé reporté dans le tableau |
| SpreadsheetBench 2 | 34.8 | Le plus élevé de 0,1 point sur Claude Fable 5 |
| AutomationBench | 30.8 | Score le plus élevé reporté dans le tableau |

Source: kimi.com
Moonshot rapporte des résultats particulièrement solides en matière d'agents de codage. K3 est en tête de Program Bench et SWE Marathon dans le tableau de lancement, tout en se classant près du sommet sur Terminal Bench 2.1 et FrontierSWE.
Comment lire les affirmations des benchmarks
Ces chiffres ne doivent pas être traités comme un tableau de classement parfaitement contrôlé. Moonshot a utilisé les harnais Kimi Code, Claude Code ou Codex selon le benchmark. Certains résultats de concurrents provenaient de classements officiels ou de publications de versions, tandis que d'autres modèles ont été réexécutés par Moonshot. Le tableau de lancement note également un comportement de repli possible pour Claude Fable 5 et des interruptions de garde-fou pour GPT-5.6 Sol sur certaines tâches.
Tous les résultats phares de K3 ont été obtenus avec un effort de raisonnement maximal. Ce réglage peut améliorer la qualité mais peut également augmenter la latence et la consommation de jetons de sortie. Plusieurs évaluations sont internes, y compris Kimi Code Bench 2.0 et certaines parties de l'évaluation du travail de connaissance. Tant que les poids et les outils d'évaluation ne sont pas publics, les tiers ne peuvent pas reproduire entièrement l'ensemble complet des résultats.
La lecture la plus utile n'est donc pas « K3 bat tous les modèles fermés ». Une meilleure conclusion est que K3 semble très compétitif pour les flux de travail de codage et d'agents à long terme, avec des résultats de première partie exceptionnels en ingénierie logicielle, navigation, automatisation, feuilles de calcul et tâches de documents visuels. La qualité réelle du produit dépendra toujours du respect des instructions, de la latence, de l'intégration des outils, du comportement de sécurité et de la stabilité sur de longues sessions.

Source: kimi.com
K3 affiche également de solides résultats le jour du lancement en dehors du codage pur, y compris la première place dans les comparaisons BrowseComp, AutomationBench et SpreadsheetBench 2 présentées.
Tarification Kimi K3
L'API officielle de Kimi utilise trois tarifs de jetons. Les prix excluent les taxes et utilisent un million de jetons décimaux comme unité de facturation.
| Catégorie de jeton | Prix par 1 million de jetons | Quand cela s'applique |
|---|---|---|
| Entrée avec cache | $0.30 | Un préfixe d'invite répété est servi à partir du cache de contexte automatique de Kimi |
| Entrée sans cache | $3.00 | Entrée nouvelle ou modifiée qui doit être traitée normalement |
| Sortie | $15.00 | Jetons de raisonnement et de réponse générés facturés comme sortie |
K3 a une tarification forfaitaire par jeton sur toute sa plage de contexte. Il n'y a pas de surtaxe séparée une fois qu'une requête dépasse un seuil de 200 000 ou similaire. Cependant, les invites longues peuvent toujours être coûteuses en termes absolus, et un modèle qui pense constamment peut produire une sortie substantielle. Une requête avec un million de jetons d'entrée non mis en cache coûterait 3 $ avant la sortie ; le même préfixe mis en cache coûterait 0,30 $.
La mise en cache automatique ne nécessite pas d'ID de cache ou de paramètre API séparé. La documentation indique que l'invite précédente doit dépasser 256 jetons, et les requêtes ultérieures doivent préserver le long préfixe inchangé pour avoir une chance d'atteindre le cache. Cela rend K3 plus économique pour l'analyse répétée du même référentiel, de la même collection de documents ou de la même base de connaissances que pour les invites ponctuelles en constante évolution.
Quelle est la taille de la fenêtre de contexte de Kimi K3 ?
Kimi K3 prend en charge 1 048 576 jetons de contexte. En pratique, cela peut contenir de très grandes bases de code, de vastes collections de documents, de longs historiques d'agents ou des combinaisons de textes et d'entrées visuelles. Le nombre exact de mots, de pages ou de fichiers varie car la tokenisation dépend de la langue, du formatage, du code source et des données intégrées.
La documentation de l'API indique une valeur par défaut de max_completion_tokens de 131 072 et permet de l'augmenter jusqu'à 1 048 576. Cette limite supérieure ne doit pas être interprétée comme une recommandation de générer des réponses d'un million de jetons. Il s'agit principalement d'un plafond architectural pour les flux de travail exceptionnellement longs.
Une grande fenêtre de contexte ne garantit pas non plus un rappel parfait. Moonshot avertit explicitement que K3 a été entraîné à préserver son historique de pensée. Les frameworks d'agents doivent transmettre le message complet de l'assistant aux tours suivants. Supprimer l'historique de raisonnement, changer de modèles au milieu d'une session ou utiliser un harnais incompatible peut rendre la qualité de génération instable.
Kimi K3 est-il open source ou à poids ouverts ?
Moonshot appelle Kimi K3 un modèle « ouvert » et « open source » de la classe des trois billions, mais le timing est crucial. La société a annoncé que les poids complets seraient publiés d'ici le 27 juillet 2026, ainsi que d'autres détails techniques. Cet article a été publié quatre jours avant cette date limite.
Au 23 juillet, K3 était utilisable via les produits Kimi et l'API officielle, mais le point de contrôle complet n'était pas encore répertorié sur la page publique de l'organisation Hugging Face de Moonshot. La licence finale du modèle, les fragments de poids, les sommes de contrôle, l'empreinte de stockage exacte, les moteurs d'inférence pris en charge et les procédures de déploiement testées par la communauté n'ont donc pas encore pu être vérifiés.
La description précise au moment de la publication est un modèle hébergé propriétaire avec une publication promise de poids ouverts. Une fois le point de contrôle apparu, la licence déterminera si l'utilisation commerciale, la modification, la redistribution et les services hébergés sont autorisés. Les poids ouverts ne signifient pas automatiquement que les données d'entraînement, le code d'entraînement complet ou le pipeline d'entraînement reproductible seront également publiés.
Cette distinction est couverte plus en détail dans l'aperçu de Zerlo sur écosystème IA à poids ouverts de la Chine. . K3 est également une comparaison d'échelle utile avec GLM-5 et son approche de codage agentique à poids ouvert.
Où pouvez-vous utiliser Kimi K3 ?
- Kimi.com et applications mobiles : accès consommateur via le web et les applications iOS, Android et HarmonyOS actuelles.
- Kimi Work : l'environnement de travail de connaissance de bureau, avec prise en charge de K3 dans la version 3.1.0 ou ultérieure pour Windows et les Mac à puce Apple.
- Kimi Code : accès au codage basé sur le terminal, où les utilisateurs sélectionnent K3 via le menu du modèle.
- API Kimi : accès développeur compatible OpenAI utilisant l'identifiant de modèle kimi-k3.
- Kimi Enterprise : comptes d'organisation avec des fonctionnalités de confidentialité et de gestion des membres d'entreprise.
- Auto-hébergement : prévu après la publication des poids, mais le déploiement réaliste nécessitera une grande infrastructure multi-accélérateur.
Qui devrait envisager Kimi K3 ?
K3 est le plus attrayant pour les équipes qui ont besoin d'un agent pour opérer sur des ensembles de travail exceptionnellement volumineux : des référentiels complexes, de longs historiques techniques, de grandes collections de PDF, des recherches gourmandes en données, des flux de travail logiciels visuels ou des requêtes répétées sur une base de connaissances stable. Sa tarification de cache est conçue pour récompenser ce modèle de préfixe répété.
Il est moins évidemment adapté aux complétions de chat courtes et peu coûteuses. Le modèle raisonne toujours, le coût de sortie est de 15 $ par million de jetons, et l'exécution à effort maximal peut être plus lente qu'un modèle léger sans raisonnement. Les équipes devraient comparer le coût total de la tâche plutôt que le prix d'entrée seul : les reprises, les longues traces de raisonnement, les appels d'outils et le temps d'exécution de l'agent peuvent être plus importants que le taux de jetons annoncé.
Les organisations principalement intéressées par un déploiement ouvert devraient attendre la publication effective des poids et de la licence avant de prendre des décisions en matière d'infrastructure ou de conformité. Même si le point de contrôle est sous licence permissive, un modèle de 2,8T sera probablement consommé via des fournisseurs d'inférence spécialisés plutôt que téléchargé sur des postes de travail ordinaires.
Limitations et questions ouvertes
- La vérification indépendante est incomplète : le point de contrôle complet n'était pas public à la date de publication.
- Les configurations de benchmark varient : différents harnais et scores tiers cités limitent la comparabilité directe.
- Le raisonnement permanent peut augmenter les coûts et la latence : un effort moindre peut aider, mais ce n'est pas l'équivalent d'un mode non pensant.
- La stabilité des sessions longues dépend de la gestion de l'historique : Moonshot déconseille de supprimer l'historique de pensée ou de changer de modèle en cours de session.
- Le modèle peut être trop proactif : la documentation de lancement recommande des limites comportementales explicites pour les applications qui ne doivent pas improviser au-delà de limites étroites.
- L'auto-hébergement est un projet à l'échelle du cluster : l'activation éparse n'élimine pas la nécessité de stocker et de distribuer l'énorme point de contrôle.
FAQ
Qu'est-ce que Kimi K3 ?
Kimi K3 est le modèle multimodal phare de 2,8 billions de paramètres de Moonshot AI. Il est conçu pour le codage à long terme, la recherche, l'utilisation d'outils, le raisonnement visuel et le travail de connaissance, avec une fenêtre de contexte d'un million de jetons.
Combien coûte l'API Kimi K3 ?
Le tarif officiel est de 0,30 $ par million de jetons d'entrée avec cache, 3,00 $ par million de jetons d'entrée sans cache et 15,00 $ par million de jetons de sortie, taxes applicables exclues.
Quelle est la fenêtre de contexte de Kimi K3 ?
Kimi K3 prend en charge 1 048 576 jetons de contexte. L'API utilise par défaut une limite de complétion maximale de 131 072 jetons, qui peut être augmentée à 1 048 576 pour des charges de travail spécialisées.
Kimi K3 est-il disponible sur Hugging Face ?
Pas encore au moment de la publication, le 23 juillet 2026. Moonshot a déclaré que les poids complets seraient publiés d'ici le 27 juillet. La page officielle de l'organisation Hugging Face devra être vérifiée à nouveau après cette date.
Kimi K3 peut-il fonctionner localement ?
Ce n'est pas un modèle local pratique pour le matériel grand public. Un calcul approximatif de poids à quatre bits représente à lui seul environ 1,4 To avant le temps d'exécution, et Moonshot recommande des configurations de déploiement avec au moins 64 accélérateurs.
Kimi K3 est-il meilleur que GPT ou Claude ?
Aucun gagnant universel ne peut être établi à partir des données de lancement. K3 est en tête de plusieurs benchmarks de codage et d'agents rapportés, tandis que Moonshot lui-même affirme que le modèle est toujours à la traîne des systèmes propriétaires les plus puissants dans l'ensemble. Les tests indépendants après la publication des poids seront plus informatifs.
Kimi K3 prend-il en charge les images et les vidéos ?
Oui. K3 a une compréhension visuelle native et prend en charge l'entrée d'images et de vidéos via les produits Kimi documentés et les formats d'API. L'API nécessite des formats d'entrée de fichier téléchargé ou encodé pris en charge plutôt que des URL d'images publiques arbitraires.
En résumé
Kimi K3 est l'un des lancements de modèles d'IA les plus ambitieux de 2026 : un MoE éparse de 2,8T avec vision native, une fenêtre de contexte d'un million de jetons, de solides benchmarks de codage et d'agents de première partie, et une tarification compétitive des entrées mises en cache. Il est déjà disponible en tant que modèle hébergé, mais l'histoire des poids ouverts était encore une promesse le 23 juillet plutôt qu'un point de contrôle téléchargeable et sous licence.
Les développeurs peuvent évaluer l'API dès maintenant, en particulier pour les flux de travail de contexte long répétés qui bénéficient de la mise en cache automatique. Les chercheurs et les équipes d'infrastructure devraient attendre la publication des poids du 27 juillet, puis vérifier la licence, les fichiers du modèle, les piles de service prises en charge et les résultats de benchmark indépendants avant de considérer K3 comme un déploiement à poids ouverts prêt pour la production.