¿Qué es Kimi K3? Benchmarks, Precios, Ventana de Contexto y Planes de Código Abierto
Kimi K3 es el nuevo modelo insignia de Moonshot AI para codificación de largo alcance, trabajo de conocimiento agencial, comprensión visual y razonamiento profundo. Anunciado el 16 de julio de 2026, combina una arquitectura de Mezcla de Expertos de 2.8 billones de parámetros con una ventana de contexto de un millón de tokens y un diseño de enrutamiento inusualmente disperso.
Las especificaciones principales son impresionantes, pero los detalles importan. Los resultados de benchmark más sólidos provienen actualmente de la evaluación de lanzamiento de Moonshot, la salida de la API es significativamente más cara que los modelos Kimi anteriores, y los pesos descargables prometidos aún no estaban disponibles cuando se publicó este artículo el 23 de julio de 2026. Esta guía separa lo que ya es utilizable de lo que sigue siendo un plan de lanzamiento.
Puntos clave
- Kimi K3 es un modelo multimodal MoE de 2.8T parámetros que activa 16 de 896 expertos enrutados para cada token.
- La ventana de contexto es de 1,048,576 tokens , con caché de prefijo automático y sin un nivel de precio de API más alto para prompts más largos.
- El precio oficial de la API es $0.30 por millón de tokens de entrada con acierto de caché, $3.00 por millón de tokens de entrada sin caché y $15.00 por millón de tokens de salida.
- Moonshot informa resultados líderes o casi líderes en varios benchmarks de codificación, navegación, hojas de cálculo, automatización y agentes visuales, aunque las configuraciones de evaluación no son idénticas en todos los modelos.
- Los pesos estaban programados para ser liberados el 27 de julio de 2026. A partir del 23 de julio, el checkpoint, la licencia final, los tamaños de archivo y las instrucciones prácticas de implementación comunitaria aún no estaban disponibles para su inspección.
¿Qué es Kimi K3?
Kimi K3 es el sucesor de la generación Kimi K2 de Moonshot AI y el modelo más grande de la compañía hasta ahora. Moonshot lo describe como el primer modelo abierto en la clase de tres billones de parámetros. Está diseñado menos como un modelo de chat ligero y más como un agente siempre razonador que puede mantener el estado a través de extensos flujos de trabajo de ingeniería, investigación, documentos y uso de herramientas.
El modelo es nativamente multimodal. Acepta texto, imágenes y video a través de los productos Kimi compatibles y los formatos de entrada de la API, luego produce texto y llamadas a herramientas. Moonshot posiciona K3 en torno a tres cargas de trabajo principales: ingeniería de software de largo alcance, trabajo de conocimiento de principio a fin y tareas que combinan retroalimentación visual con código o herramientas estructuradas.
Kimi K3 está disponible a través de Kimi.com, las aplicaciones móviles de Kimi, Kimi Work, Kimi Code y la API de Kimi. Los desarrolladores usan el ID de modelo de la API kimi-k3. La documentación de la API establece que el acceso de flagship se desbloquea después de una recarga de cuenta exitosa de al menos $1, con límites de tasa determinados por el nivel de la cuenta.
Los lectores que necesiten una base más amplia sobre la familia de productos pueden comenzar con la guía de Zerlo sobre Kimi AI y Moonshot AI. . K3 es el lanzamiento del modelo; Kimi es el ecosistema más amplio de asistentes, aplicaciones y desarrolladores.
Arquitectura de Kimi K3: por qué 2.8 billones de parámetros no significan 2.8 billones de parámetros activos
Kimi K3 utiliza un diseño disperso de Mezcla de Expertos. La red contiene 896 expertos enrutados, pero solo se seleccionan 16 para cada token. Esto permite que el modelo almacene una cantidad muy grande de capacidad especializada sin ejecutar cada experto en cada paso hacia adelante. El checkpoint completo aún debe almacenarse y distribuirse a través de un clúster de inferencia, por lo que la activación dispersa reduce la computación más de lo que reduce el desafío de almacenamiento.
Moonshot destaca cuatro componentes arquitectónicos:
- Atención Kimi Delta (KDA): un mecanismo de atención lineal utilizado en tres de cada cuatro capas de atención para hacer más eficiente el procesamiento de secuencias largas.
- Atención Latente Multicabezal Con Puerta: la cuarta capa del ciclo retiene la atención global completa para una recuperación precisa de la información.
- Residuos de Atención: los bloques pueden recuperar selectivamente representaciones de profundidades anteriores en lugar de depender solo de una única corriente residual continuamente acumulada.
- LatentMoE Estable: el marco de enrutamiento de expertos que soporta la configuración de expertos extremadamente dispersa de 16 de 896.
La compañía dice que estos cambios, combinados con métodos de entrenamiento y recetas de datos actualizados, proporcionan aproximadamente 2.5 veces la eficiencia de escalado general de Kimi K2. Esa cifra es una afirmación de Moonshot en lugar de una medición reproducida de forma independiente. K3 también utiliza entrenamiento consciente de la cuantificación con pesos MXFP4 y activaciones MXFP8, y Moonshot recomienda implementaciones de supernodos con al menos 64 aceleradores.
Un simple cálculo de almacenamiento ilustra la escala. Con cuatro bits por parámetro, 2.8 billones de parámetros representan aproximadamente 1.4 terabytes de datos de peso brutos antes de metadatos, estructuras de enrutamiento, búferes de tiempo de ejecución, caché KV, redundancia y sobrecarga del framework. Por eso, un eventual lanzamiento de código abierto será valioso para investigadores y empresas de alojamiento, pero no hará de Kimi K3 un modelo de escritorio normal.
Benchmarks de Kimi K3
Los materiales de lanzamiento de Moonshot comparan Kimi K3 con GPT-5.6 Sol, GPT-5.5, Claude Fable 5, Claude Opus 4.8 y GLM-5.2. El propio resumen de la compañía es relativamente moderado: K3 aún está por detrás de los sistemas propietarios más capaces en general, pero alcanza un rendimiento de nivel de frontera y lidera muchas tareas individuales.
| Benchmark | Puntuación de Kimi K3 | Posición en la tabla de lanzamiento de Moonshot |
|---|---|---|
| DeepSWE | 67.5 | Detrás de GPT-5.6 Sol y Claude Fable 5 |
| Terminal Bench 2.1 | 88.3 | Segundo, 0.5 puntos detrás de GPT-5.6 Sol |
| Program Bench | 77.8 | Puntuación más alta reportada en la tabla |
| SWE Marathon | 42.0 | Puntuación más alta reportada en la tabla |
| FrontierSWE | 81.2 | Segundo detrás de Claude Fable 5 |
| BrowseComp | 91.2 | Puntuación más alta reportada en la tabla |
| SpreadsheetBench 2 | 34.8 | Más alta por 0.1 puntos sobre Claude Fable 5 |
| AutomationBench | 30.8 | Puntuación más alta reportada en la tabla |

Fuente: kimi.com
Moonshot informa resultados particularmente sólidos en agentes de codificación. K3 lidera Program Bench y SWE Marathon en la tabla de lanzamiento, mientras que se sitúa cerca de la cima en Terminal Bench 2.1 y FrontierSWE.
Cómo interpretar las afirmaciones de los benchmarks
Estos números no deben tratarse como una tabla de clasificación perfectamente controlada. Moonshot utilizó Kimi Code, Claude Code o entornos Codex dependiendo del benchmark. Algunos resultados de la competencia provenían de tablas de clasificación oficiales o publicaciones de lanzamiento, mientras que otros modelos fueron ejecutados nuevamente por Moonshot. La tabla de lanzamiento también señala un posible comportamiento de retroceso para Claude Fable 5 y las interrupciones de seguridad para GPT-5.6 Sol en algunas tareas.
Todos los resultados principales de K3 se obtuvieron con el máximo esfuerzo de razonamiento. Esa configuración puede mejorar la calidad, pero también puede aumentar la latencia y el consumo de tokens de salida. Varias evaluaciones son internas, incluyendo Kimi Code Bench 2.0 y partes de la evaluación del trabajo de conocimiento. Hasta que los pesos y las herramientas de evaluación sean públicas, terceros no pueden reproducir completamente el conjunto completo de resultados.
La lectura más útil, por lo tanto, no es “K3 vence a todos los modelos cerrados”. Una mejor conclusión es que K3 parece altamente competitivo para flujos de trabajo de codificación y agentes de larga duración, con resultados destacados de primera parte en ingeniería de software, navegación, automatización, hojas de cálculo y tareas de documentos visuales. La calidad real del producto seguirá dependiendo de la atención a las instrucciones, la latencia, la integración de herramientas, el comportamiento de seguridad y la estabilidad en sesiones largas.

Fuente: kimi.com
K3 también publica sólidos resultados el día del lanzamiento fuera de la codificación pura, incluyendo el primer lugar en las comparaciones mostradas de BrowseComp, AutomationBench y SpreadsheetBench 2.
Precios de Kimi K3
La API oficial de Kimi utiliza tres tarifas de tokens. Los precios excluyen impuestos y utilizan un millón de tokens decimales como unidad de facturación.
| Categoría de token | Precio por 1M de tokens | Cuando aplica |
|---|---|---|
| Entrada con acierto de caché | $0.30 | Un prefijo de prompt repetido se sirve desde la caché de contexto automática de Kimi |
| Entrada sin acierto de caché | $3.00 | Entrada nueva o modificada que debe procesarse normalmente |
| Salida | $15.00 | Tokens de razonamiento y respuesta generados facturados como salida |
K3 tiene precios fijos por token en todo su rango de contexto. No hay un recargo separado una vez que una solicitud supera un umbral de 200K o similar. Sin embargo, los prompts largos aún pueden ser costosos en términos absolutos, y un modelo que siempre está pensando puede producir una salida sustancial. Una solicitud con un millón de tokens de entrada sin caché costaría $3 antes de la salida; el mismo prefijo en caché costaría $0.30.
El almacenamiento en caché automático no requiere un ID de caché o una configuración de API separada. La documentación dice que el prompt anterior debe exceder los 256 tokens, y las solicitudes posteriores deben conservar el prefijo largo sin cambios para tener la posibilidad de acceder a la caché. Esto hace que K3 sea más económico para el análisis repetido del mismo repositorio, colección de documentos o base de conocimientos que para prompts únicos que cambian constantemente.
¿Qué tan grande es la ventana de contexto de Kimi K3?
Kimi K3 admite 1,048,576 tokens de contexto. En términos prácticos, eso puede contener bases de código muy grandes, extensas colecciones de documentos, largos historiales de agentes o combinaciones de entradas de texto y visuales. El número exacto de palabras, páginas o archivos varía porque la tokenización depende del lenguaje, el formato, el código fuente y los datos incrustados.
La documentación de la API enumera un valor predeterminado de max_completion_tokens de 131,072 y permite que se eleve hasta 1,048,576. Ese límite superior no debe interpretarse como una recomendación para generar respuestas de un millón de tokens. Es principalmente un techo arquitectónico para flujos de trabajo inusualmente largos.
Una ventana de contexto grande tampoco garantiza un recuerdo perfecto. Moonshot advierte explícitamente que K3 fue entrenado para preservar su historial de pensamiento. Los frameworks de agentes deben devolver el mensaje completo del asistente en los turnos subsiguientes. Omitir el historial de razonamiento, cambiar de modelos en medio de una sesión o usar un arnés incompatible puede hacer que la calidad de la generación sea inestable.
¿Es Kimi K3 de código abierto o de código abierto?
Moonshot llama a Kimi K3 un modelo “abierto” y “de código abierto” de clase de tres billones, pero el momento es crucial. La compañía anunció que los pesos completos se lanzarían antes del 27 de julio de 2026, junto con más detalles técnicos. Este artículo se publicó cuatro días antes de esa fecha límite.
Al 23 de julio, K3 era utilizable a través de los productos Kimi y la API oficial, pero el checkpoint completo aún no figuraba en la página de la organización pública Hugging Face de Moonshot. Por lo tanto, la licencia final del modelo, los shards de peso, las sumas de verificación, el espacio de almacenamiento exacto, los motores de inferencia compatibles y los procedimientos de implementación probados por la comunidad aún no podían verificarse.
La descripción precisa en el momento de la publicación es un modelo propietario alojado con una promesa de lanzamiento de pesos abiertos. Después de que aparezca el punto de control, la licencia determinará si se permite el uso comercial, la modificación, la redistribución y los servicios alojados. Los pesos abiertos no significan automáticamente que también se publicarán los datos de entrenamiento, el código de entrenamiento completo o el pipeline de entrenamiento reproducible.
Esta distinción se cubre con más detalle en la descripción general de Zerlo sobre el ecosistema de IA de código abierto de China. . K3 también es una comparación de escala útil con GLM-5 y su enfoque de codificación agencial de código abierto.
¿Dónde puedes usar Kimi K3?
- Kimi.com y aplicaciones móviles: acceso para el consumidor a través de la web y las aplicaciones actuales de iOS, Android y HarmonyOS.
- Kimi Work: el entorno de trabajo del conocimiento de escritorio, con soporte K3 en la versión 3.1.0 o posterior para Windows y Macs con Apple silicon.
- Kimi Code: acceso de codificación basado en terminal, donde los usuarios seleccionan K3 a través del menú del modelo.
- Kimi API: acceso de desarrollador compatible con OpenAI utilizando el identificador de modelo kimi-k3.
- Kimi Enterprise: cuentas de organización con características de privacidad empresarial y gestión de miembros.
- Autoalojamiento: planeado después del lanzamiento de los pesos, pero la implementación realista requerirá una gran infraestructura multi-acelerador.
¿Quién debería considerar Kimi K3?
K3 es más atractivo para equipos que necesitan un agente para operar en conjuntos de trabajo inusualmente grandes: repositorios complejos, historiales técnicos extensos, grandes colecciones de PDF, investigaciones intensivas en datos, flujos de trabajo de software visual o consultas repetidas sobre una base de conocimientos estable. Su precio de caché está diseñado para recompensar ese patrón de prefijo repetido.
Es menos adecuado para completar chats cortos y económicos. El modelo siempre razona, la salida cuesta $15 por millón de tokens, y la ejecución con el máximo esfuerzo puede ser más lenta que un modelo ligero que no razona. Los equipos deben comparar el costo total de la tarea en lugar de solo el precio de entrada: las repeticiones, los rastros de razonamiento largos, las llamadas a herramientas y el tiempo de ejecución del agente pueden importar más que la tarifa de token principal.
Las organizaciones interesadas principalmente en la implementación abierta deben esperar el lanzamiento real de los pesos y la licencia antes de tomar decisiones de infraestructura o cumplimiento. Incluso si el punto de control tiene una licencia permisiva, es probable que un modelo de 2.8T se consuma a través de proveedores de inferencia especializados en lugar de descargarse en estaciones de trabajo ordinarias.
Limitaciones e interrogantes
- La verificación independiente está incompleta: el punto de control completo no era público en la fecha de publicación.
- Las configuraciones de los benchmarks varían: diferentes entornos y puntuaciones de terceros citadas limitan la comparabilidad directa.
- El razonamiento constante puede aumentar el costo y la latencia: un menor esfuerzo puede ayudar, pero no es equivalente a un modo de no pensamiento.
- La estabilidad de la sesión larga depende del manejo del historial: Moonshot advierte contra la pérdida del historial de pensamiento o el cambio de modelos a mitad de la sesión.
- El modelo puede ser excesivamente proactivo: la documentación de lanzamiento recomienda límites de comportamiento explícitos para aplicaciones que no deben improvisar más allá de límites estrechos.
- El autoalojamiento es un proyecto a escala de clúster: la activación dispersa no elimina la necesidad de almacenar y distribuir el enorme punto de control.
Preguntas frecuentes
¿Qué es Kimi K3?
Kimi K3 es el modelo multimodal insignia de 2.8 billones de parámetros de Moonshot AI. Está diseñado para codificación de largo alcance, investigación, uso de herramientas, razonamiento visual y trabajo de conocimiento, con una ventana de contexto de un millón de tokens.
¿Cuánto cuesta la API de Kimi K3?
La tarifa oficial es de $0.30 por millón de tokens de entrada con acierto de caché, $3.00 por millón de tokens de entrada sin caché y $15.00 por millón de tokens de salida, excluyendo impuestos aplicables.
¿Cuál es la ventana de contexto de Kimi K3?
Kimi K3 admite 1,048,576 tokens de contexto. La API tiene un límite de finalización máximo predeterminado de 131,072 tokens, que puede aumentarse a 1,048,576 para cargas de trabajo especializadas.
¿Está Kimi K3 disponible en Hugging Face?
Todavía no en el momento de la publicación, el 23 de julio de 2026. Moonshot dijo que los pesos completos se lanzarían antes del 27 de julio. La página oficial de la organización Hugging Face debería revisarse nuevamente después de esa fecha.
¿Puede Kimi K3 ejecutarse localmente?
No es un modelo local práctico para hardware de consumo. Un cálculo aproximado de pesos de cuatro bits solo es de aproximadamente 1.4 TB antes de la sobrecarga de tiempo de ejecución, y Moonshot recomienda configuraciones de implementación con al menos 64 aceleradores.
¿Es Kimi K3 mejor que GPT o Claude?
No se puede establecer un ganador universal a partir de los datos de lanzamiento. K3 lidera varios benchmarks reportados de codificación y agentes, mientras que Moonshot mismo dice que el modelo aún está por detrás de los sistemas propietarios más fuertes en general. Las pruebas independientes después del lanzamiento de los pesos serán más informativas.
¿Kimi K3 soporta imágenes y video?
Sí. K3 tiene una comprensión visual nativa y admite entradas de imagen y video a través de productos Kimi documentados y formatos de API. La API requiere formatos de entrada de archivo cargado o codificado compatibles en lugar de URL de imágenes públicas arbitrarias.
En resumen
Kimi K3 es uno de los lanzamientos de modelos de IA más ambiciosos de 2026: un MoE disperso de 2.8T con visión nativa, una ventana de contexto de un millón de tokens, sólidos benchmarks de codificación y agentes de primera parte, y precios competitivos para la entrada en caché. Ya está disponible como un modelo alojado, pero la historia de código abierto seguía siendo una promesa el 23 de julio en lugar de un checkpoint descargable y licenciado.
Los desarrolladores pueden evaluar la API ahora, especialmente para flujos de trabajo de contexto largo repetidos que se benefician del almacenamiento en caché automático. Los investigadores y los equipos de infraestructura deben esperar el lanzamiento del peso el 27 de julio, luego verificar la licencia, los archivos del modelo, las pilas de servicio compatibles y los resultados de benchmarks independientes antes de tratar K3 como una implementación de peso abierto lista para producción.