Was ist Kimi K3? Benchmarks, Preise, Kontextfenster und Pläne für offene Gewichte

Avatar
Lisa Ernst · 23.07.2026 · Künstliche Intelligenz · 9 Min

Kimi K3 ist das neue Flaggschiffmodell von Moonshot AI für langfristiges Coding, agentenbasiertes Wissensmanagement, visuelles Verständnis und tiefgehendes Schlussfolgern. Angekündigt am 16. Juli 2026, kombiniert es eine Mixture-of-Experts-Architektur mit 2,8 Billionen Parametern mit einem Kontextfenster von einer Million Tokens und einem ungewöhnlich spärlichen Routing-Design.

Die wichtigsten Spezifikationen sind beeindruckend, aber die Details zählen. Die stärksten Benchmark-Ergebnisse stammen derzeit aus der eigenen Startbewertung von Moonshot, die API-Ausgabe ist deutlich teurer als bei früheren Kimi-Modellen, und die versprochenen herunterladbaren Gewichte waren zum Zeitpunkt der Veröffentlichung dieses Artikels am 23. Juli 2026 noch nicht verfügbar. Dieser Leitfaden trennt, was bereits nutzbar ist, von dem, was noch ein Veröffentlichungsplan ist.

Wichtige Ergebnisse

Was ist Kimi K3?

Kimi K3 ist der Nachfolger der Kimi K2-Generation von Moonshot AI und das bisher größte Modell des Unternehmens. Moonshot beschreibt es als das erste offene Modell in der Klasse der drei Billionen Parameter. Es ist weniger als leichtgewichtiges Chat-Modell konzipiert und mehr als ein immer denkender Agent, der Zustände über lange Engineering-, Forschungs-, Dokumenten- und Tool-Nutzungsabläufe hinweg aufrechterhalten kann.

Das Modell ist nativ multimodal. Es akzeptiert Text, Bilder und Video über unterstützte Kimi-Produkte und API-Eingabeformate und erzeugt dann Text und Tool-Aufrufe. Moonshot positioniert K3 um drei Hauptarbeitslasten: langfristiges Software-Engineering, End-to-End-Wissensarbeit und Aufgaben, die visuelles Feedback mit Code oder strukturierten Tools kombinieren.

Kimi K3 ist über Kimi.com, die Kimi-Mobilanwendungen, Kimi Work, Kimi Code und die Kimi API verfügbar. Entwickler verwenden die API-Modell-ID kimi-k3. Die API-Dokumentation besagt, dass der Zugang zum Flaggschiffmodell nach einer erfolgreichen Kontoauffüllung von mindestens 1 USD freigeschaltet wird, wobei die Ratenbegrenzungen durch die Kontostufe bestimmt werden.

Leser, die einen breiteren Hintergrund über die Produktfamilie benötigen, können mit Zerlos Leitfaden zu Kimi AI und Moonshot AI. beginnen. K3 ist die Modellveröffentlichung; Kimi ist der umfassendere Assistent, die Anwendung und das Entwickler-Ökosystem.

Kimi K3-Architektur: Warum 2,8 Billionen Parameter nicht 2,8 Billionen aktive Parameter bedeuten

Kimi K3 verwendet ein spärliches Mixture-of-Experts-Design. Das Netzwerk enthält 896 geroutete Experten, aber nur 16 werden für jedes Token ausgewählt. Dies ermöglicht es dem Modell, eine sehr große Menge an spezialisierter Kapazität zu speichern, ohne jeden Experten bei jedem Forward Pass auszuführen. Der vollständige Checkpoint muss immer noch gespeichert und über einen Inferenz-Cluster verteilt werden, daher reduziert die spärliche Aktivierung die Berechnung mehr, als sie die Speicherherausforderung reduziert.

Moonshot hebt vier Architekturkomponenten hervor:

Das Unternehmen gibt an, dass diese Änderungen in Kombination mit aktualisierten Trainingsmethoden und Datenrezepten eine um etwa das 2,5-fache höhere Gesamtskalierungseffizienz als Kimi K2 erzielen. Diese Zahl ist eine Behauptung von Moonshot und keine unabhängig reproduzierte Messung. K3 verwendet auch quantisierungsbewusstes Training mit MXFP4-Gewichten und MXFP8-Aktivierungen, und Moonshot empfiehlt Superknoten-Bereitstellungen mit mindestens 64 Beschleunigern.

Eine einfache Speicherberechnung veranschaulicht die Größenordnung. Bei vier Bits pro Parameter repräsentieren 2,8 Billionen Parameter etwa 1,4 Terabyte an rohen Gewichtsdaten vor Metadaten, Routing-Strukturen, Laufzeit-Puffern, KV-Cache, Redundanz und Framework-Overhead. Deshalb wird eine zukünftige Veröffentlichung von offenen Gewichten für Forscher und Hosting-Unternehmen wertvoll sein, aber Kimi K3 nicht zu einem normalen Desktop-Modell machen.

Kimi K3 Benchmarks

Die Startmaterialien von Moonshot vergleichen Kimi K3 mit GPT-5.6 Sol, GPT-5.5, Claude Fable 5, Claude Opus 4.8 und GLM-5.2. Die eigene Zusammenfassung des Unternehmens ist relativ zurückhaltend: K3 liegt insgesamt noch hinter den leistungsfähigsten proprietären Systemen zurück, erreicht aber Spitzenleistungen und führt viele Einzelaufgaben an.

Benchmark Kimi K3-Score Position in der Starttabelle von Moonshot
DeepSWE 67.5 Hinter GPT-5.6 Sol und Claude Fable 5
Terminal Bench 2.1 88.3 Zweiter, 0,5 Punkte hinter GPT-5.6 Sol
Program Bench 77.8 Höchster berichteter Score in der Tabelle
SWE Marathon 42.0 Höchster berichteter Score in der Tabelle
FrontierSWE 81.2 Zweiter hinter Claude Fable 5
BrowseComp 91.2 Höchster berichteter Score in der Tabelle
SpreadsheetBench 2 34.8 Höchster mit 0,1 Punkten vor Claude Fable 5
AutomationBench 30.8 Höchster berichteter Score in der Tabelle
Offizielle Kimi K3 Coding-Benchmark-Tabelle mit DeepSWE, Terminal Bench, FrontierSWE, Program Bench, Kimi Code Bench und SWE Marathon

Quelle: kimi.com

Moonshot meldet besonders starke Ergebnisse bei Coding-Agenten. K3 führt die Program Bench und SWE Marathon in der Starttabelle an und liegt auf der Terminal Bench 2.1 und FrontierSWE nahe der Spitze.

Wie sind die Benchmark-Angaben zu lesen?

Diese Zahlen sollten nicht als eine perfekt kontrollierte Rangliste behandelt werden. Moonshot verwendete je nach Benchmark Kimi Code, Claude Code oder Codex-Harnesses. Einige Konkurrenzergebnisse stammten von offiziellen Bestenlisten oder Veröffentlichungen, während andere Modelle von Moonshot neu ausgeführt wurden. Die Starttabelle nennt auch mögliche Fallback-Verhalten von Claude Fable 5 und Unterbrechungen der Leitplanken für GPT-5.6 Sol bei einigen Aufgaben.

Alle K3-Headline-Ergebnisse wurden mit maximaler Denkaufwand erzielt. Diese Einstellung kann die Qualität verbessern, aber auch die Latenz und den Verbrauch von Ausgabetokens erhöhen. Mehrere Auswertungen sind intern, darunter Kimi Code Bench 2.0 und Teile der Wissensarbeitsbewertung. Bis die Gewichte und Auswertungswerkzeuge öffentlich sind, können Dritte das vollständige Ergebnis nicht vollständig reproduzieren.

Die nützlichste Lesart ist daher nicht „K3 schlägt jedes geschlossene Modell“. Eine bessere Schlussfolgerung ist, dass K3 für langfristige Coding- und Agenten-Workflows sehr wettbewerbsfähig erscheint, mit herausragenden First-Party-Ergebnissen bei Software-Engineering, Browsing, Automatisierung, Tabellenkalkulation und visuellen Dokumentenaufgaben. Die tatsächliche Produktqualität wird immer noch von der Befolgung von Anweisungen, der Latenz, der Tool-Integration, dem Sicherheitsverhalten und der Stabilität über lange Sitzungen abhängen.

Offizielle Kimi K3 Benchmark-Tabelle für allgemeine Agenten und visuelle Agenten, einschließlich BrowseComp, AutomationBench, SpreadsheetBench 2, CharXiv und Zerobench

Quelle: kimi.com

K3 erzielt auch starke Ergebnisse am Starttag außerhalb des reinen Codings, darunter den ersten Platz in den gezeigten Vergleichen von BrowseComp, AutomationBench und SpreadsheetBench 2.

Kimi K3 Preise

Die offizielle Kimi API verwendet drei Token-Raten. Die Preise beinhalten keine Steuern und verwenden eine Million Dezimal-Tokens als Abrechnungseinheit.

Token-Kategorie Preis pro 1 Mio. Tokens Wann es zur Anwendung kommt
Cache-Hit-Eingabe $0.30 Ein wiederholter Prompt-Präfix wird aus dem automatischen Kontext-Cache von Kimi abgerufen
Cache-Miss-Eingabe $3.00 Neue oder geänderte Eingabe, die normal verarbeitet werden muss
Ausgabe $15.00 Generierte Denk- und Antwort-Tokens, die als Ausgabe abgerechnet werden

K3 hat eine flache pro-Token-Preisgestaltung über seinen gesamten Kontextbereich. Es gibt keinen separaten Aufschlag, sobald eine Anfrage eine Schwelle von 200K oder ähnlich überschreitet. Lange Prompts können jedoch immer noch teuer im absoluten Wert sein, und ein immer denkendes Modell kann erhebliche Ausgaben produzieren. Eine Anfrage mit einer Million nicht gecachten Eingabetokens würde vor der Ausgabe 3 USD kosten; dasselbe gecachte Präfix würde 0,30 USD kosten.

Automatisches Caching erfordert keine Cache-ID oder eine separate API-Einstellung. Die Dokumentation besagt, dass der vorherige Prompt 256 Tokens überschreiten muss und spätere Anfragen den langen Präfix unverändert beibehalten sollten, um eine Chance auf Cache-Hits zu haben. Dies macht K3 für wiederholte Analysen desselben Repositories, Dokumentensammlungen oder Wissensdatenbanken wirtschaftlicher als für ständig wechselnde Einzelanfragen.

Wie groß ist das Kimi K3-Kontextfenster?

Kimi K3 unterstützt 1.048.576 Tokens Kontext. Praktisch kann dies sehr große Codebasen, umfangreiche Dokumentensammlungen, lange Agentenhistorien oder Kombinationen von Text- und visuellen Eingaben aufnehmen. Die genaue Anzahl der Wörter, Seiten oder Dateien variiert, da die Tokenisierung von Sprache, Formatierung, Quellcode und eingebetteten Daten abhängt.

Die API-Dokumentation listet einen Standardwert von max_completion_tokens von 131.072 auf und erlaubt es, diesen auf bis zu 1.048.576 zu erhöhen. Diese Obergrenze sollte nicht als Empfehlung zur Generierung von Million-Token-Antworten interpretiert werden. Sie ist in erster Linie eine architektonische Obergrenze für ungewöhnlich lange Arbeitsabläufe.

Ein großes Kontextfenster garantiert auch keine perfekte Erinnerung. Moonshot warnt ausdrücklich, dass K3 darauf trainiert wurde, seine Denkhistorie zu bewahren. Agenten-Frameworks sollten die vollständige Assistentennachricht in nachfolgenden Turns übergeben. Das Weglassen der Denkgeschichte, das Wechseln von Modellen mitten in einer Sitzung oder die Verwendung eines inkompatiblen Harness kann die Qualität der Generierung instabil machen.

Ist Kimi K3 Open Source oder Open Weight?

Moonshot bezeichnet Kimi K3 als ein „offenes“ und „Open-Source“-Modell der Drei-Billionen-Klasse, aber der Zeitpunkt ist entscheidend. Das Unternehmen kündigte an, dass die vollständigen Gewichte bis zum 27. Juli 2026 zusammen mit weiteren technischen Details veröffentlicht würden. Dieser Artikel wurde vier Tage vor dieser Frist veröffentlicht.

Am 23. Juli war K3 über Kimi-Produkte und die offizielle API nutzbar, aber der vollständige Checkpoint war noch nicht auf der öffentlichen Hugging Face Organisationseite von Moonshot gelistet. Die endgültige Modelllizenz, Gewichts-Shards, Prüfsummen, der genaue Speicher-Footprint, unterstützte Inferenz-Engines und von der Community getestete Bereitstellungsverfahren konnten daher noch nicht verifiziert werden.

Die genaue Beschreibung zum Zeitpunkt der Veröffentlichung ist ein proprietäres gehostetes Modell mit einer versprochenen Veröffentlichung von offenen Gewichten. Nachdem die Checkpoint-Datei erscheint, wird die Lizenz bestimmen, ob kommerzielle Nutzung, Modifikation, Weiterverbreitung und gehostete Dienste zulässig sind. Offene Gewichte bedeuten nicht automatisch, dass die Trainingsdaten, der vollständige Trainingscode oder die reproduzierbare Trainingspipeline ebenfalls veröffentlicht werden.

Diese Unterscheidung wird in Zerlos Übersicht über Chinas Open-Weight-KI-Ökosystem. detaillierter behandelt. K3 ist auch ein nützlicher Grössenvergleich mit GLM-5 und seinem Open-Weight-Ansatz für agentenbasiertes Coding.

Wo kann man Kimi K3 verwenden?

Wer sollte Kimi K3 in Betracht ziehen?

K3 ist am überzeugendsten für Teams, die einen Agenten benötigen, der über ungewöhnlich große Arbeitsbereiche operiert: komplexe Repositories, lange technische Verläufe, große PDF-Sammlungen, datenintensive Forschung, visuelle Software-Workflows oder wiederholte Abfragen über eine stabile Wissensbasis. Seine Cache-Preise sind darauf ausgelegt, dieses Muster wiederholter Präfixe zu belohnen.

Es ist weniger offensichtlich für kurze, kostengünstige Chat-Vervollständigungen geeignet. Das Modell denkt immer nach, die Ausgabe kostet 15 USD pro Million Tokens, und die Ausführung mit maximalem Aufwand kann langsamer sein als bei einem leichtgewichtigen Modell ohne Denken. Teams sollten die Gesamtkosten der Aufgabe vergleichen und nicht nur den Eingabepreis: Wiederholungen, lange Denkprozesse, Tool-Aufrufe und die Laufzeit des Agenten können wichtiger sein als die Headline-Tokenrate.

Organisationen, die primär an einer offenen Bereitstellung interessiert sind, sollten mit der eigentlichen Veröffentlichung der Gewichte und Lizenzen warten, bevor sie Infrastruktur- oder Compliance-Entscheidungen treffen. Selbst wenn der Checkpoint permissiv lizenziert ist, wird ein 2,8T-Modell wahrscheinlich über spezialisierte Inferenz-Anbieter genutzt werden, anstatt auf normale Workstations heruntergeladen zu werden.

Einschränkungen und offene Fragen

FAQ

Was ist Kimi K3?

Kimi K3 ist das Flaggschiff-Multimodell von Moonshot AI mit 2,8 Billionen Parametern. Es wurde für langfristiges Coding, Forschung, Tool-Nutzung, visuelles Schlussfolgern und Wissensarbeit entwickelt, mit einem Kontextfenster von einer Million Tokens.

Wie viel kostet die Kimi K3 API?

Die offizielle Rate beträgt 0,30 USD pro Million Cache-Hit-Eingabetokens, 3,00 USD pro Million nicht gecachte Eingabetokens und 15,00 USD pro Million Ausgabetokens, zuzüglich geltender Steuern.

Was ist das Kimi K3-Kontextfenster?

Kimi K3 unterstützt 1.048.576 Tokens Kontext. Die API verwendet standardmäßig ein maximales Abschlusslimit von 131.072 Tokens, das für spezialisierte Workloads auf 1.048.576 erhöht werden kann.

Ist Kimi K3 auf Hugging Face verfügbar?

Zum Zeitpunkt der Veröffentlichung am 23. Juli 2026 noch nicht. Moonshot sagte, dass die vollständigen Gewichte bis zum 27. Juli veröffentlicht würden. Die offizielle Hugging Face Organisationseite sollte nach diesem Datum noch einmal überprüft werden.

Kann Kimi K3 lokal ausgeführt werden?

Es ist kein praktisches lokales Modell für Consumer-Hardware. Allein eine grobe Vier-Bit-Gewichtsberechnung ergibt etwa 1,4 TB vor Laufzeit-Overhead, und Moonshot empfiehlt Bereitstellungskonfigurationen mit mindestens 64 Beschleunigern.

Ist Kimi K3 besser als GPT oder Claude?

Aus den Startdaten kann kein universeller Gewinner ermittelt werden. K3 führt mehrere berichtete Coding- und Agenten-Benchmarks an, während Moonshot selbst sagt, dass das Modell insgesamt noch hinter den stärksten proprietären Systemen zurückbleibt. Unabhängige Tests nach der Veröffentlichung der Gewichte werden aufschlussreicher sein.

Unterstützt Kimi K3 Bilder und Video?

Ja. K3 verfügt über natives visuelles Verständnis und unterstützt Bild- und Videoeingaben über dokumentierte Kimi-Produkte und API-Formate. Die API erfordert unterstützte hochgeladene Dateien oder kodierte Eingabeformate anstelle von beliebigen öffentlichen Bild-URLs.

Fazit

Kimi K3 ist eine der ambitioniertesten KI-Modell-Launches von 2026: ein 2,8T-Sparse-MoE mit nativer Vision, einem Kontextfenster von einer Million Tokens, starken First-Party-Coding- und Agenten-Benchmarks und wettbewerbsfähigen Cached-Input-Preisen. Es ist bereits als gehostetes Modell verfügbar, aber die Geschichte der offenen Gewichte war am 23. Juli noch ein Versprechen und kein herunterladbarer, lizenzierter Checkpoint.

Entwickler können die API jetzt bewerten, insbesondere für wiederholte Langkontext-Workflows, die von automatischem Caching profitieren. Forscher und Infrastrukturteams sollten auf die Gewichtsveröffentlichung vom 27. Juli warten und dann die Lizenz, Modelldateien, unterstützte Serving-Stacks und unabhängige Benchmark-Ergebnisse überprüfen, bevor sie K3 als produktionsreife Open-Weight-Bereitstellung betrachten.

Teilen Sie doch unseren Beitrag!
Quellen