Startseite
Blog
KI-Modell-Vergleich 2026: Das Duell an der Spitze

KI-Modell-Vergleich 2026: Das Duell an der Spitze

KI
Marcel Engesser
Marcel Engesser
·
July 16, 2026
·
6 Minuten
Artikelbild

Grok 4.6 kam am 12. August und misst 61 Punkte, so viel wie GPT-5.6 Sol, kostet gemischt aber $1,35 statt $4,35. Kimi K3 fällt damit aus der Preis-Leistungs-Front. Am selben Tag hat Alibaba die Gewichte von Qwen3.8-Max offengelegt, unter eigener Lizenz mit Umsatzstaffel. An der Spitze steht weiter Claude Opus 5 mit 63. Unser KI-Modell-Vergleich zeigt mit echten Messdaten, wer bei Preis und Leistung vorne liegt. Stand: 13. August 2026.

„Welches KI-Modell ist gerade das beste?" Die kurze Antwort: Claude Opus 5. Es führt seit dem 24. Juli die unabhängige Messung an und kostet pro Token halb so viel wie Fable 5, das bis dahin vorne lag. Die längere Antwort ist die interessantere, denn an der Spitze liegen fünf Modelle innerhalb von drei Punkten. Wer dir hier einen Dauersieger verkauft, hat entweder nicht nachgerechnet oder will dir etwas verkaufen.

Wir arbeiten täglich mit diesen Modellen und halten diesen Vergleich aktuell, mit unabhängigen Messdaten statt Marketing-Folien. Stand: 13. August 2026 (Update-Log am Ende).

Intelligenz gegen Preis: 15 Modelle auf einen Blick.

Die meisten Vergleiche zerlegen die Frage in zehn Disziplinen mit zehn Siegern. Am Ende bist du so schlau wie vorher. Wir stellen nur zwei Dinge gegenüber: was ein Modell kann und was es kostet. Die Intelligenzwerte kommen von der unabhängigen Plattform Artificial Analysis, die Preise von den Anbietern.

__wf_reserved_inherit
Vergleich Intelligenz und Preis KI-Modelle

Hinweis: Das Chart wird interaktiv geladen und steht auf dem Stand vom 13. August. Ohne JavaScript siehst du die statische Fassung vom 30. Juli; maßgeblich sind dann die Datenpunkte unten.

Der Preis ist der gemischte Preis pro 1 Million Token nach der Methodik von Artificial Analysis: 7 Teile Cache-Treffer, 2 Teile Input, 1 Teil Output. Das liegt näher an echten Rechnungen als reine Output-Preise. Eine Million Token sind je nach Sprache grob 500.000 bis 750.000 Wörter. Für Terra und Luna hatten wir den gemischten Preis nach genau dieser Methodik zunächst selbst gerechnet, weil Artificial Analysis dort noch die alten Werte führte. Inzwischen stehen $1,74 und $0,17 auch dort, identisch mit unserer Rechnung.

  • Claude Opus 5 (Anthropic): Intelligenz 63, gemischt $3,85. Liste $5 / $25
  • Claude Fable 5 (Anthropic): Intelligenz 62, gemischt $7,70. Liste $10 / $50
  • Grok 4.6 (xAI): Intelligenz 61, gemischt $1,35. Liste $2 / $6
  • GPT-5.6 Sol (OpenAI): Intelligenz 61, gemischt $4,35. Liste $5 / $30
  • Kimi K3 (Moonshot AI): Intelligenz 60, gemischt $2,31. Liste $3 / $15
  • Qwen3.8-Max (Alibaba): Intelligenz 58, gemischt $1,18. Liste $2 / $6
  • Muse Spark 1.2 (Meta): Intelligenz 57, gemischt $0,78. Liste $1,25 / $4,25
  • GPT-5.6 Terra (OpenAI): Intelligenz 57, gemischt $1,74. Liste $2 / $12
  • Claude Opus 4.8 (Anthropic): Intelligenz 57, gemischt $3,85. Liste $5 / $25
  • Grok 4.5 (xAI): Intelligenz 56, gemischt $1,21. Liste $2 / $6
  • Claude Sonnet 5 (Anthropic): Intelligenz 55, gemischt $1,54. Liste $2 / $10
  • DeepSeek V4-Flash-0731: Intelligenz 52, gemischt $0,06. Liste $0,14 / $0,28
  • GPT-5.6 Luna (OpenAI): Intelligenz 52, gemischt $0,17. Liste $0,20 / $1,20
  • Gemini 3.6 Flash (Google): Intelligenz 52, gemischt $1,16. Liste $1,50 / $7,50
  • DeepSeek V4 Pro: Intelligenz 45, gemischt $0,18

Was daran auffällt: Bisher waren die letzten Intelligenzpunkte immer die teuersten. Opus 5 bricht das Muster, es steht oben und kostet trotzdem nur die Hälfte von Fable 5. Seit dem 12. August bricht Grok 4.6 es noch deutlicher: derselbe Messwert wie GPT-5.6 Sol, aber gemischt $1,35 gegen $4,35. Die Faustregel „mehr Intelligenz kostet exponentiell mehr" gilt an der Spitze gerade nicht mehr.

Der zweite Bruch kam von unten und hat gerade einen Dämpfer bekommen. Kimi K3 steht auf Intelligenz 60 zu gemischt $2,31, Qwen3.8-Max auf 58 zu $1,18. Bis vorgestern war Kimi K3 damit das günstigste Modell seiner Klasse. Grok 4.6 misst jetzt einen Punkt höher und kostet gut 40 % weniger. Kimi K3 fällt damit aus der Preis-Leistungs-Front, Qwen3.8-Max bleibt drin.

Der dritte Bruch kam am 30. Juli von OpenAI: Preissenkung für die beiden kleineren Stufen, Luna um 80 %. Damit war ausgerechnet ein Modell aus einem US-Frontier-Labor das günstigste im Vergleich. Für genau einen Tag. Am 31. Juli hat DeepSeek nachgelegt, mit V4-Flash-0731 zu einem gemischten Preis von $0,06. Das ist gut ein Drittel von Luna.

Warum alle Zahlen oben gestiegen sind.

Am 6. August hat Artificial Analysis den Intelligenz-Index auf Version 4.1.1 gehoben. Geändert haben sich nicht die Modelle, sondern die Messung: τ³-Banking läuft jetzt in Version 1.0.1, und HLE, AA-LCR sowie AA-Omniscience werden nicht mehr von drei verschiedenen Modellen bewertet, sondern einheitlich von GPT-5.6 Luna. Ein Patch, kein neuer Index.

Die Tabelle bewegt sich trotzdem. Artificial Analysis selbst schreibt, die meisten Modelle verschieben sich um weniger als einen Punkt; in unserer Liste liegen die Sprünge zwischen einem und drei Punkten nach oben. Stärkster Gewinner ist Muse Spark 1.2 mit plus 2,7 Punkten, von 54 auf 57. Kimi K3 geht von 57 auf 60, Opus 5 von 61 auf 63. An der Reihenfolge der Spitze ändert das nichts.

Der Punkt, auf den es dabei ankommt: Klüger geworden ist über Nacht kein Modell. Wer alte und neue Werte nebeneinanderlegt, vergleicht zwei verschiedene Messungen. Alle Zahlen in diesem Artikel stehen deshalb geschlossen auf v4.1.1.

Inhaltlich folgt daraus genau eine Verschiebung. DeepSeek V4-Flash-0731 und GPT-5.6 Luna liegen jetzt beide auf 52, vorher trennte sie ein Punkt zugunsten von Luna. Bei gleichem Messwert entscheidet der Preis, und der steht bei $0,06 gegen $0,17. Luna fällt damit aus der Preis-Leistungs-Front, DeepSeek bleibt drin.

Grok 4.6 drückt den Preis an der Spitze.

Am 12. August hat xAI Grok 4.6 veröffentlicht. Artificial Analysis misst 61 Intelligenzpunkte, denselben Wert wie GPT-5.6 Sol. Die Listenpreise liegen bei $2 im Input und $6 im Output, ein Cache-Treffer kostet $0,50. Nach der 7:2:1-Methodik ergibt das einen gemischten Preis von $1,35, gut ein Drittel von Sol. Das Kontextfenster liegt bei 500.000 Token, oberhalb von 200.000 Prompt-Token verdoppelt xAI die Preise auf $4 im Input, $1 im Cache und $12 im Output. Der Messwert oben gilt für die Effort-Stufe „high", xAI bietet daneben low, medium und xhigh.

Für die Rangliste heißt das zweierlei. Erstens ist Grok 4.6 das einzige Modell im Vergleich, das über 60 Punkte misst und dabei unter $2 kostet. Zweitens verschiebt sich die Preis-Leistungs-Front: Sie läuft jetzt über DeepSeek V4-Flash, Muse Spark 1.2, Qwen3.8-Max, Grok 4.6 und Opus 5. Kimi K3 fällt heraus, weil Grok 4.6 einen Punkt höher misst und gut 40 % weniger kostet.

Zwei Einschränkungen gehören dazu. Erstens ist das kein Allrounder. xAI selbst nennt 69,9 % auf CursorBench v3.2 und 26 % auf Terminal-Bench v3.0. Das sind Anbieter-Zahlen und keine neutralen Messwerte, aber der Abstand zwischen beiden ist der ehrlichste Hinweis in der Ankündigung: Für Agenten-Arbeit an der Kommandozeile ist das Modell erkennbar schwächer als in der IDE. Zweitens sind die Gewichte zu, und die Release Notes sagen nichts zur Verfügbarkeit in der EU. Prüf den Zugang, bevor du darauf baust.

Der Preiskampf hat die unteren Stufen erreicht.

OpenAI hat am 30. Juli die API-Preise für GPT-5.6 Luna und GPT-5.6 Terra gesenkt, sofort wirksam:

  • Luna: $0,20 statt $1 pro Million Input-Token, $1,20 statt $6 im Output. Das sind 80 % weniger.
  • Terra: $2 statt $2,50 im Input, $12 statt $15 im Output. Das sind 20 % weniger.
  • Sol bleibt bei $5 und $30, bekommt aber einen Fast-Modus mit bis zu 2,5-facher Geschwindigkeit zum doppelten Preis. Er ersetzt die bisherige Priority-Verarbeitung.

Die Abo-Preise für ChatGPT und Codex ändern sich nicht. Luna und Terra ziehen dort ab sofort nur weniger Kontingent. Begründet hat OpenAI den Schritt mit gesunkenen eigenen Kosten, unter anderem durch optimierte Inferenz. Der ehrlichere Blick auf die Lage: Der Druck kommt von den günstigen chinesischen Modellen, deren Rückstand auf die US-Spitze zuletzt spürbar geschrumpft ist.

Auf der kostenlosen Stufe hat OpenAI am 6. August nachgelegt: GPT-5.6 Luna ist dort jetzt das Standardmodell, Textchats sind unbegrenzt, und ein Think-Button schaltet für schwierigere Fragen mehr Denkzeit dazu. Datei-Uploads, Bilder und Werkzeuge bleiben begrenzt. An den API-Preisen ändert das nichts, an der Zahl der Leute, die täglich mit einem Frontier-Modell arbeiten, schon.

Für dich zählt vor allem eine Zahl. Ein Workflow, der bisher mit Luna 100 Euro im Monat gekostet hat, kostet jetzt rund 20. Bei identischem Modell und identischem Ergebnis.

Wie schnell dieser Druck zurückkommt, hat der Tag danach gezeigt. Am 31. Juli hat DeepSeek V4-Flash-0731 als öffentliche Beta gestartet: gleiche Architektur wie im April, gleicher Preis, nur neu nachtrainiert. Der Messwert sprang damals um zehn Punkte nach oben, heute misst Artificial Analysis 52 und damit sieben Punkte mehr als beim größeren V4 Pro. Bei $0,14 im Input, $0,28 im Output und einem Cache-Rabatt von 98 % liegt der gemischte Preis bei $0,06. Artificial Analysis rechnet pro Aufgabe rund 60 % unter Luna, und zwar nach der OpenAI-Senkung. Derselbe Workflow, der eben noch von 100 auf 20 Euro gefallen ist, landet damit grob bei 8 Euro. Nach der aktuellen Messung bei gleichem Intelligenzwert.

Am 10. August kam die Gegenbewegung von Anthropic, und zwar nach unten. Der Einführungspreis von Claude Sonnet 5 ist jetzt dauerhaft: $2 im Input und $10 im Output bleiben, die zum 1. September geplante Erhöhung auf $3 und $15 entfällt. Geplant war ein Aufschlag von 50 %, er kommt nicht. Der gemischte Preis bleibt damit bei $1,54. Wer mit Sonnet 5 kalkuliert hat, muss zum 1. September nichts umbauen.

Meta ist zurück in der Liste, mit geschlossenen Gewichten.

Am 5. August hat Meta Muse Spark 1.2 veröffentlicht, zusammen mit dem Coding-Agenten Muse Code. Artificial Analysis misst 57 Intelligenzpunkte. Die Listenpreise liegen bei $1,25 im Input und $4,25 im Output, ein Cache-Treffer kostet $0,15. Nach der 7:2:1-Methodik ergibt das einen gemischten Preis von $0,78. Das Kontextfenster liegt bei 1 Million Token.

Interessant ist nicht der Messwert allein, sondern die Kombination. Grok 4.5 liegt einen Punkt tiefer und kostet gemischt $1,21, gut die Hälfte mehr. Damit steht Grok 4.5 nicht auf der Preis-Leistungs-Front, die heute über DeepSeek V4-Flash, Muse Spark 1.2, Qwen3.8-Max, Grok 4.6 und Opus 5 läuft.

Zwei Einschränkungen gehören dazu. Erstens sind die Gewichte dieses Modells zu. Meta liefert seine Frontier-Reihe seit Muse Spark proprietär aus, selbst betreiben ist bei Muse Spark 1.2 also keine Option. Daran ändert auch Muse Glimmer nichts, das Meta am 10. August unter Apache 2.0 veröffentlicht hat: eine andere, deutlich kleinere Klasse, dazu unten im DSGVO-Teil mehr. Zweitens sind die Zahlen, die Meta zu Muse Code nennt, Anbieter-Zahlen aus eigenen Benchmarks. Der Wert oben ist der unabhängig gemessene. Und bevor du das Modell einplanst: Meta schreibt in der Ankündigung von „expanded global access", nennt die EU aber nicht ausdrücklich. Prüf die Verfügbarkeit, bevor du darauf baust.

Was ist mit Kimi K3, DeepSeek und den offenen Modellen?

Moonshot AI hat Kimi K3 am 16. Juli veröffentlicht, seit dem 27. Juli liegen die Gewichte offen auf Hugging Face. Mit Intelligenz 60 spielt erstmals ein chinesisches Modell messbar in der Spitzengruppe mit. Seit dem 12. August ist es dort allerdings nicht mehr das günstigste: Grok 4.6 misst einen Punkt mehr und kostet gemischt $1,35 statt $2,31.

Nur heißt „offene Gewichte" nicht „läuft bei dir im Serverschrank". Der Download umfasst rund 1,56 Terabyte. Acht Karten der 80-GB-Klasse ergeben zusammen 640 GB Speicher, das Modell passt da nicht annähernd hinein. Moonshots eigene Empfehlung nennt acht Beschleuniger der B300-Klasse oder 32 H100. Das ist eine Hardware-Rechnung im hohen sechsstelligen Bereich.

Dazu kommen zwei ehrliche Dämpfer: K3 ist langsam und geschwätzig, rund 39 Token pro Sekunde, und die Halluzinationsrate ist gegenüber dem Vorgänger von 39 % auf 51 % gestiegen. Für Recherche-Workflows ist das ein Warnsignal. Die Lizenz ist übrigens keine MIT-Lizenz, sondern eine eigene mit Umsatzstaffel: für interne Nutzung unkritisch, für Wiederverkauf ab 20 Millionen Dollar Umsatz vertragspflichtig. Neue Abos nimmt Moonshot seit dem 20. Juli nicht mehr an. Am Geld liegt das nicht, es fehlen Karten, nicht Kapital.

DeepSeek liefert dazu die Gegenprobe. V4-Flash-0731 liegt seit dem 31. Juli offen auf Hugging Face, unter MIT-Lizenz, also ohne Umsatzstaffel und ohne Rückfragen. Artificial Analysis führt es damit unter den drei stärksten offenen Modellen. Und es ist klein: 284 Milliarden Parameter insgesamt, 13 Milliarden aktiv pro Token, rund 284 GB in FP8. Vier H100 reichen dafür. Das ist kein Rechenzentrum, das ist ein Server.

Zwei Dämpfer gehören auch hier dazu. Erstens die Halluzinationen: Auf AA-Omniscience liegt die Rate bei 84 %, die Trefferquote bei 37 %. Das Modell rät lieber, als zu schweigen. Zweitens die Prüfbarkeit: DeepSeeks eigenes Benchmark-Harness ist nicht veröffentlicht, die Hausnummern des Anbieters lassen sich nicht unabhängig nachstellen. Die Zahlen oben stammen deshalb durchgehend von Artificial Analysis, nicht von DeepSeek.

Seit dem 3. August liegt ein dritter Kandidat auf dem Tisch: Alibaba hat Qwen3.8-Max allgemein verfügbar gemacht. 2,4 Billionen Parameter als Mixture of Experts, 1 Million Token Kontext, $2 im Input und $6 im Output, Cache-Treffer bei $0,25. Nach der 7:2:1-Methodik ergibt das einen gemischten Preis von $1,18. Die offenen Gewichte sind seit dem 12. August da, angekündigt war zusammen damit ein kleines Qwen3.8-27B. Es ist damit das erste offene Modell der Max-Klasse.

Seit dem 6. August gibt es dazu den unabhängigen Messwert, nach dem Index-Update auf v4.1.1 steht er bei Intelligenz 58. Damit liegt Qwen3.8-Max einen Punkt über Claude Opus 4.8 und kostet nicht einmal ein Drittel davon. Nur Opus 5, Fable 5, Grok 4.6, Sol und Kimi K3 messen höher. Für die Preis-Leistungs-Front heißt das: Qwen steht drin, GPT-5.6 Terra nicht. Terra liegt einen Punkt tiefer und kostet gemischt $1,74, knapp die Hälfte mehr.

Zwei Einordnungen gehören dazu, bevor du dein Setup umbaust. Erstens ist der Preis pro Token nicht der Preis pro Aufgabe. Artificial Analysis rechnet für den Index $1,13 je Aufgabe bei Qwen3.8-Max und $0,84 bei Kimi K3. Pro Token ist Qwen billiger, pro erledigter Aufgabe nicht, weil es für agentische Arbeit mehr Runden braucht. Zweitens lässt sich das Flaggschiff bei dieser Größe nicht selbst betreiben, dafür wäre das angekündigte 27B-Modell gedacht gewesen. Das ist bis heute nicht da, offen liegt nur das große. Was in der Lizenz steht, liest du besser vorher, dazu unten im DSGVO-Teil mehr.

Was das für dein Unternehmen heißt.

  • An der Spitze: Opus 5. Gemessen das klügste Modell, halber Fable-5-Preis, und der Effort-Regler ist der eigentliche Kostenhebel.
  • Nah an der Spitze, aber zum Bruchteil: Grok 4.6. Seit dem 12. August misst kein anderes Modell 61 Punkte für gemischt $1,35. Dieselbe Intelligenz kostet mit GPT-5.6 Sol gut das Dreifache.
  • Für die Breite: die GPT-5.6-Reihe. Nicht das klügste Modell, aber verlässlich verfügbar, schnell und mit zwei günstigen Stufen für 90 % der Aufgaben, die seit dem 30. Juli noch einmal deutlich billiger sind.
  • Bei hohem Volumen zählt der Preis pro Aufgabe, nicht pro Token. Ein Workflow, der 500-mal am Tag läuft, rechnet sich mit DeepSeek V4-Flash, Luna, Muse Spark 1.2 oder Gemini 3.6 Flash oft um ein Vielfaches besser, bei identischem Ergebnis. Qwen3.8-Max zeigt die Kehrseite derselben Rechnung: pro Token günstig, pro Aufgabe teurer als Kimi K3.
  • Bei offenen Gewichten zuerst die Lizenz lesen, dann die Hardware rechnen. Kimi K3 scheitert an 1,56 Terabyte, MiniMax H3 an einer Lizenz, die die EU ausdrücklich ausschließt, Qwen3.8-Max seit dem 12. August an beidem ein bisschen: 2,4 Billionen Parameter und eine Lizenz mit Umsatzstaffel. DeepSeek V4-Flash kann beides: MIT-Lizenz und vier H100. Seit dem 10. August geht es noch eine Nummer kleiner: Metas Muse Glimmer läuft unter Apache 2.0 auf einer Karte mit 24 GB, misst dafür aber nur 35 Punkte.
  • Seit dem 2. August ist Kennzeichnung Pflicht. Artikel 50 des AI Act gilt, und die Behörden dürfen sanktionieren. Das trifft nicht die Modellwahl, sondern deinen Prozess. Mehr dazu weiter unten.
  • Diese Einordnung hat ein Haltbarkeitsdatum. Vier der fünfzehn Modelle oben gab es vor zwei Wochen noch nicht, und das klügste Modell unter $2 ist seit gestern ein anderes. Deshalb steht oben ein Datum dran.

DSGVO: der Punkt, den fast alle Vergleiche unterschlagen.

Für deutsche Unternehmen entscheidet nicht nur der Benchmark, sondern die Architektur dahinter. US-Modelle lassen sich über EU-Endpoints mit Datenresidenz und einen sauberen Auftragsverarbeitungsvertrag DSGVO-konform betreiben. Für wirklich sensible Daten wie Personalakten, Patientendaten oder Vertragsunterlagen sind offen lizenzierte Modelle auf eigener Infrastruktur die sauberste Lösung, dann verlassen die Daten deinen Server nie.

Kimi K3 zeigt die Grenze dieser Idee. An der Lizenz liegt es nicht, interne Nutzung ist ausdrücklich erlaubt. Es liegt an der Hardware. „Offen" und „selbst betreibbar" sind zwei verschiedene Dinge.

Seit dem 31. Juli gibt es dafür allerdings ein deutlich besseres Beispiel. DeepSeek V4-Flash-0731 kommt unter MIT-Lizenz, misst 52 Intelligenzpunkte und passt in FP8 auf vier H100. Das lässt sich in Deutschland hosten, und die Daten verlassen deinen Server nie. Der Haken ist inhaltlich, nicht technisch: Mit 84 % Halluzinationsrate gehört das Modell in Workflows mit Quellenzwang und Prüfschritt, nicht in die freie Auskunft.

Seit dem 10. August geht es noch eine Nummer kleiner. Meta hat Muse Glimmer veröffentlicht: 30 Milliarden Parameter, Apache 2.0, 128K Kontext, Gewichte auf Hugging Face. In 4-bit-Quantisierung reichen 24 GB VRAM, also eine einzelne Consumer-Karte; in BF16 läuft das Modell mit vollem Kontext auf einer H100. Eine eigene API betreibt Meta dafür nicht, den Zugang liefern Dritte. In der Liste oben steht Glimmer trotzdem nicht, und das ist der ehrliche Teil: Artificial Analysis misst 35 Punkte, zehn unter dem schwächsten Modell im Vergleich. Fünf Punkte über Gemma 4 31B, drei unter Qwen3.6 27B. Dazu eine Halluzinationsrate von 82 % auf AA-Omniscience, gegen 49 % bei Qwen3.6 27B. Interessant ist Glimmer deshalb nicht als bestes Modell, sondern als das erste, für das du keinen Serverschrank brauchst.

Seit dem 12. August liegt am anderen Ende der Skala das größte offene Modell, das es bisher gab. Alibaba hat die Gewichte von Qwen3.8-Max auf Hugging Face gelegt, als Qwen3.8-2.4T-A95B: 2,4 Billionen Parameter insgesamt, 95 Milliarden aktiv pro Token, 512 Experten, BF16. Damit ist erstmals ein Modell der Max-Klasse offen. Selbst betreiben kannst du es trotzdem nicht, dafür ist es zu groß, und das angekündigte kleine Qwen3.8-27B ist bis heute nicht da.

Zwei Punkte gehören dazu, und beide stehen im Lizenztext. Erstens ist das weder Apache noch MIT, sondern eine eigene Qwen-Lizenz mit Umsatzstaffel: Wer ein Model-as-a-Service- oder AI-Work-Assistant-Geschäft betreibt und in zwölf zusammenhängenden Monaten über 50 Millionen Dollar Umsatz kommt, braucht eine gesonderte Lizenz von Qwen. Ab 100 Millionen monatlich aktiven Nutzern oder 20 Millionen Dollar Monatsumsatz musst du den Modellnamen in deiner Oberfläche nennen. Eine Gebietsbeschränkung wie bei MiniMax gibt es nicht, für interne Nutzung im Mittelstand ist das also unkritisch. Zweitens ist die offene Fassung nicht das, was über die API läuft: kein Bild-Input, kein Non-Thinking-Modus, und der Kontext liegt nativ bei 262.144 Token statt bei einer Million.

Seit dem 3. August gibt es dazu eine weitere Variante, und die ist eine Warnung. MiniMax hat die Gewichte seines Videomodells H3 auf Hugging Face gelegt, 33 Milliarden Parameter, ab 42,5 GB Download, technisch also gut selbst betreibbar. Nur darfst du das hier nicht. Die zugehörige Community-Lizenz ist auf den 2. August datiert und definiert ein „Applicable Territory": weltweit, ausgenommen die Europäische Union, Großbritannien, Südkorea und die USA. Wer in Deutschland sitzt, darf die Gewichte lokal weder betreiben noch die Ergebnisse daraus nutzen. Über die gehostete API bleibt das Modell erreichbar, denn das ist eine Kundenbeziehung und keine Lizenz.

H3 steht deshalb nicht in der Liste oben: Es ist ein Videomodell und wird im Intelligenz-Index für Textmodelle gar nicht gemessen. Der Punkt daran gilt trotzdem für deine Planung. „Offene Gewichte" ist kein Gütesiegel, sondern ein Lizenztext. Bei Kimi K3 steht die Hardware im Weg, bei H3 die Landkarte, bei Qwen3.8-Max die Größe und eine Umsatzstaffel, und bei Metas Muse Spark 1.2 gibt es gar keine Gewichte. Lies das Dokument, bevor du Karten bestellst.

Seit dem 2. August greift der AI Act im Alltag.

Seit dem 2. August 2026 gelten die Transparenzpflichten aus Artikel 50, und Kommission wie nationale Behörden können Verstöße sanktionieren. Drei Punkte treffen fast jeden:

  • Ein Chatbot muss als Maschine erkennbar sein, nicht erst auf Nachfrage.
  • KI-generierte Inhalte müssen gekennzeichnet werden, Deepfakes ausdrücklich.
  • Emotionserkennung und biometrische Kategorisierung müssen offengelegt werden.

Auf die Modellwahl hat das keinen Einfluss, auf deinen Workflow schon: Du brauchst eine Stelle im Prozess, an der die Kennzeichnung entsteht, und eine Dokumentation, die zeigt, wo der Inhalt herkommt. Ein weiteres Argument dafür, das Modell austauschbar zu halten und die Regeln im Prozess zu verankern.

Welche Pflicht ab wann greift, wer als Anbieter und wer als Betreiber gilt und was der KI-Omnibus auf 2027 verschoben hat, steht in unserem Artikel dazu: EU AI Act ab 2. August 2026: Was wirklich Pflicht ist.

Du willst KI im Unternehmen einsetzen, aber sauber, technisch wie rechtlich? Genau solche Systeme bauen wir, vom n8n-Workflow bis zum Hosting auf deutschen Servern. Wie das konkret aussieht, zeigen wir dir hier: KI-Automatisierung.

Fazit: Das Modell soll austauschbar sein.

Die unbequeme Wahrheit hinter dem ganzen Modell-Rennen: Die Modellwahl ist selten das eigentliche Problem. Ob ein KI-Projekt etwas bringt, entscheidet sich an deinem Prozess. Welche Daten fließen wo, was wird geprüft, wo bleibt der Mensch in der Schleife? Das Modell dahinter sollte austauschbar sein. Als am 24. Juli die Rangliste neu sortiert wurde, war das für sauber gebaute Workflows eine Konfigurationszeile, kein Projekt. Für Preissenkungen gilt dasselbe: Wer sauber gebaut hat, nimmt sie einfach mit. Zweimal in zwei Tagen. Und wer gestern gemerkt hat, dass dieselbe Intelligenz bei Grok 4.6 ein Drittel kostet, ändert dafür eine Zeile. Für die neuen Kennzeichnungspflichten gilt es auch: Wer eine Stelle im Prozess hat, an der Ausgaben markiert werden, hat am 2. August nichts umbauen müssen.

Welcher Prozess in deinem Unternehmen wäre der erste Kandidat? Lass uns in 30 Minuten drüber schauen. Wir sagen dir ehrlich, was sich automatisieren lässt, welches Modell dafür reicht und was es kostet.

Update-Log.

  • 13.08.2026: xAI hat am 12. August Grok 4.6 veröffentlicht: Intelligenz 61 bei gemischt $1,35, Liste $2 / $6, Cache-Treffer $0,50, 500.000 Token Kontext, oberhalb von 200.000 Prompt-Token doppelter Preis. Damit misst Grok 4.6 so viel wie GPT-5.6 Sol und kostet gut ein Drittel davon. Die Preis-Leistungs-Front läuft jetzt über DeepSeek V4-Flash, Muse Spark 1.2, Qwen3.8-Max, Grok 4.6 und Opus 5; Kimi K3 fällt heraus, weil Grok 4.6 einen Punkt höher misst und gut 40 % weniger kostet. Erweitert auf fünfzehn Modelle, Chart auf den Stand vom 13. August gebracht. Zweitens hat Alibaba am 12. August die Gewichte von Qwen3.8-Max auf Hugging Face gelegt, als Qwen3.8-2.4T-A95B: 2,4 Billionen Parameter insgesamt, 95 Milliarden aktiv, 512 Experten, BF16, 262.144 Token nativer Kontext, kein Bild-Input. Die Lizenz ist weder Apache noch MIT, sondern eine eigene mit Umsatzstaffel: gesonderte Lizenz ab 50 Millionen Dollar Umsatz im MaaS- oder AI-Work-Assistant-Geschäft, Namensnennung in der Oberfläche ab 100 Millionen monatlich aktiven Nutzern oder 20 Millionen Dollar Monatsumsatz, keine Gebietsbeschränkung. Damit ist die Aussage korrigiert, die Qwen-Gewichte seien noch nicht da; das angekündigte kleine Qwen3.8-27B fehlt weiter. Die übrigen vierzehn Messwerte und alle Preise sind heute erneut gegen Artificial Analysis geprüft und unverändert.
  • 11.08.2026: Meta hat am 10. August Muse Glimmer veröffentlicht: 30 Milliarden Parameter, Apache 2.0, 128K Kontext, Gewichte auf Hugging Face. Artificial Analysis misst 35 Punkte, fünf über Gemma 4 31B und drei unter Qwen3.6 27B, die Halluzinationsrate liegt bei 82 % gegen 49 % bei Qwen3.6 27B. In die Modell-Liste kommt es nicht, 35 liegt zehn Punkte unter dem schwächsten gelisteten Modell und damit unter allem, was hier verglichen wird. In den DSGVO-Teil dagegen schon: 4-bit quantisiert reichen 24 GB VRAM, das ist eine einzelne Consumer-Karte. Damit ist die Aussage im Meta-Abschnitt korrigiert, von Meta liege auf Hugging Face nichts; die Frontier-Reihe um Muse Spark 1.2 bleibt proprietär. Zweitens hat Anthropic am 10. August den Einführungspreis von Claude Sonnet 5 dauerhaft gemacht: $2 / $10 bleiben, die zum 1. September geplante Erhöhung auf $3 / $15 entfällt. Der gemischte Preis bleibt bei $1,54. Die vierzehn Messwerte und alle Preise sind heute erneut gegen Artificial Analysis geprüft und unverändert, das Chart bleibt deshalb auf dem Stand vom 8. August. Nachgezogen: die Kosten pro Aufgabe im Index, $1,13 bei Qwen3.8-Max und $0,84 bei Kimi K3. Die offenen Qwen-Gewichte sind auch in der angekündigten Woche bis heute nicht da.
  • 08.08.2026: Artificial Analysis hat den Intelligenz-Index am 6. August auf v4.1.1 gepatcht: τ³-Banking in Version 1.0.1, und HLE, AA-LCR sowie AA-Omniscience werden jetzt einheitlich von GPT-5.6 Luna bewertet. Alle vierzehn Werte neu gezogen, sie steigen um einen bis drei Punkte: Opus 5 63, Fable 5 62, Sol 61, Kimi K3 60, Qwen3.8-Max 58, Muse Spark 1.2 57 (stärkster Gewinner mit plus 2,7), Terra 57, Opus 4.8 57, Grok 4.5 56, Sonnet 5 55, DeepSeek V4-Flash, Luna und Gemini 3.6 Flash je 52, V4 Pro 45. Klüger geworden ist dabei kein Modell, nur die Messung ist eine andere. Inhaltlich folgt daraus eine Verschiebung: Luna und DeepSeek V4-Flash stehen jetzt gleichauf, damit fällt Luna aus der Preis-Leistungs-Front. Die Preise sind unverändert, das Chart steht auf dem Stand vom 8. August. Nachgezogen: OpenAI hat am 6. August GPT-5.6 Luna zum Standardmodell der kostenlosen ChatGPT-Stufe gemacht, mit unbegrenzten Textchats und Think-Button; an den API-Preisen ändert das nichts. Kimi-K3-Durchsatz auf den aktuellen AA-Wert gezogen, 39 statt 34 Token pro Sekunde. Die offenen Qwen-Gewichte sind weiter nicht da, angekündigt für die Woche ab dem 10. August.
  • 07.08.2026: Artificial Analysis hat Qwen3.8-Max gemessen: Intelligenz 56 bei gemischt $1,18, Liste $2 / $6, Cache-Treffer $0,25. Damit steht Alibabas Flaggschiff gleichauf mit Claude Opus 4.8 zu weniger als einem Drittel des Preises und rückt in die Preis-Leistungs-Front, GPT-5.6 Terra fällt heraus. Pro Aufgabe im Index kostet Qwen $1,14, Kimi K3 dagegen $0,86, pro Token ist es umgekehrt. Erweitert auf vierzehn Modelle, Chart auf den Stand vom 7. August gebracht. Die offenen Gewichte sind weiter nur angekündigt. Die übrigen dreizehn Messwerte sind heute erneut gegen Artificial Analysis geprüft und unverändert.
  • 06.08.2026: Meta ist zurück in der Liste. Muse Spark 1.2 kam am 5. August zusammen mit dem Coding-Agenten Muse Code: Intelligenz 54 bei gemischt $0,78, Liste $1,25 / $4,25, Cache-Treffer $0,15, 1 Million Token Kontext. Die Gewichte sind zu. Grok 4.5 kommt auf denselben Messwert und kostet gemischt $1,21, fällt damit aus der Preis-Leistungs-Front. Dabei auch der Grok-Preis korrigiert: $1,21 statt bisher $1,35, die Listenpreise bei xAI sind mit $2 / $6 unverändert, der Cache-Treffer liegt bei $0,30. Erweitert auf dreizehn Modelle, Chart auf den Stand vom 6. August gebracht. Die übrigen elf Messwerte sind heute erneut gegen Artificial Analysis geprüft und unverändert, Qwen3.8-Max ist dort weiterhin nicht gemessen.
  • 05.08.2026: Neuer Absatz im DSGVO-Teil: MiniMax hat am 3. August die Gewichte seines Videomodells H3 auf Hugging Face gelegt, 33 Milliarden Parameter, ab 42,5 GB. Die Lizenz vom 2. August schließt die EU, Großbritannien, Südkorea und die USA vom lokalen Betrieb aus, die gehostete API bleibt erreichbar. Für deutsche Unternehmen heißt das: offen ist nicht gleich nutzbar. H3 kommt nicht in die Modell-Liste und nicht ins Chart, es ist ein Videomodell und steht nicht im Intelligenz-Index für Textmodelle. Die zwölf Messwerte oben sind heute erneut gegen Artificial Analysis geprüft und unverändert, Qwen3.8-Max ist dort weiterhin nicht gemessen.
  • 04.08.2026: Neuer Abschnitt zum AI Act: Seit dem 2. August gelten die Transparenzpflichten aus Artikel 50, und die Behörden können sanktionieren. Die Fristen und Details stehen in unserem eigenen AI-Act-Artikel, hier nur die Einordnung und der Link dorthin. Korrektur am selben Tag: In einer früheren Fassung dieses Eintrags stand, die Verschiebung der Hochrisiko-Fristen sei nicht beschlossen. Das war falsch, der KI-Omnibus ist Verordnung (EU) 2026/1744 und seit dem 27. Juli in Kraft. Außerdem hat Alibaba am 3. August Qwen3.8-Max allgemein verfügbar gemacht, $2 / $6 und damit gemischt $1,18 nach unserer Rechnung, offene Gewichte angekündigt. Artificial Analysis hat das Modell noch nicht gemessen, deshalb steht es nicht in der Modell-Liste und nicht im Chart. Die zwölf Messwerte oben sind heute erneut gegen Artificial Analysis geprüft und unverändert.
  • 03.08.2026: Chart auf den Stand vom 1. August gebracht: DeepSeek V4-Flash-0731 ergänzt, die gesenkten Preise für Luna ($0,17) und Terra ($1,74) korrigiert. Die Preis-Leistungs-Front läuft jetzt über V4-Flash, Luna, Grok 4.5, Terra, Kimi K3 und Opus 5. Inhaltlich hat sich seit dem 1. August nichts bewegt.
  • 01.08.2026: DeepSeek V4-Flash-0731 aufgenommen. Seit dem 31. Juli in der öffentlichen Beta und offen unter MIT-Lizenz, Intelligenz 50 bei gemischt $0,06. Damit ist Luna nach genau einem Tag nicht mehr das günstigste Modell im Vergleich. Erweitert auf zwölf Modelle, DSGVO-Abschnitt um ein realistisch selbst betreibbares Beispiel ergänzt.
  • 31.07.2026: OpenAI hat am 30. Juli die API-Preise gesenkt: Luna 80 % runter auf $0,20 / $1,20, Terra 20 % runter auf $2 / $12. Gemischte Preise neu gerechnet, Luna ist damit das günstigste Modell im Vergleich. Neuer Abschnitt zum Preiskampf.
  • 30.07.2026: Artikel gestrafft und neu sortiert. Kimi K3 kam am 16. Juli, nicht am 17. Korrigiert. Neues interaktives Chart.
  • 29.07.2026: Hardware-Angaben zu Kimi K3 korrigiert: 1,56 Terabyte Modellgewichte, und acht 80-GB-Karten reichen dafür nicht.
  • 28.07.2026: Kimi K3 hat keine MIT-Lizenz, sondern eine eigene mit Umsatzstaffel.
  • 27.07.2026: Preise neu gerechnet. Artificial Analysis mischt 7:2:1, nicht 3:1. Kimi K3 ist damit das günstigste Modell der Spitzengruppe, nicht das teuerste.
  • 26.07.2026: Claude Opus 5 ist die neue Nummer 1, durchgehend eingearbeitet.
  • 24.07.2026: Anthropic-Zugang geklärt, Gemini 3.6 Flash ergänzt.
  • 22.07.2026: Erste echte Messdaten zu Kimi K3 statt Leaks.
  • 16.07.2026: Erstveröffentlichung.

Inhalt

Jetzt Projekt anfragen

Lass uns in 30 Minuten über dein Onlineauftritt sprechen.

Wir haben die Antworten!

Oranger Marker-Akzent von Hochkonzept

Häufig gestellte Fragen

Welches KI-Modell sollen wir im Unternehmen nehmen?

+

Wer an der Spitze arbeitet, nimmt Claude Opus 5. Es ist seit dem 24. Juli gemessen die Nr. 1 und mit $5 Input und $25 Output pro Million Token halb so teuer wie Fable 5. Wer nah an die Spitze will, ohne den Spitzenpreis zu zahlen, schaut seit dem 12. August auf Grok 4.6: Intelligenz 61 wie GPT-5.6 Sol, gemischt aber $1,35 statt $4,35. Für die Breite bleibt die GPT-5.6-Reihe der pragmatische Standard, weil du verlässlich rankommst und mit Terra und Luna zwei günstige Stufen hast, die seit dem 30. Juli noch einmal deutlich billiger sind, Luna um 80 %. Wer rein auf den Preis schaut, schaut seit dem 31. Juli auf DeepSeek V4-Flash-0731: nach dem Index-Update auf v4.1.1 gleichauf mit Luna bei Intelligenz 52, aber zu gut einem Drittel des Preises. Entscheidender als das Modell ist aber, dass dein Workflow so gebaut ist, dass du es später ohne Umbau tauschen kannst.

Können wir US-Modelle wie GPT-5.6 oder Claude DSGVO-konform einsetzen?

+

Ja. Über EU-Endpoints mit Datenresidenz und einen Auftragsverarbeitungsvertrag ist das sauber machbar. Für besonders sensible Daten empfehlen wir offen lizenzierte Modelle auf eigener Infrastruktur, dann verlassen die Daten deinen Server gar nicht erst. Wichtig: Offene Gewichte heißen nicht automatisch selbst betreibbar. Kimi K3 ist mit rund 1,56 Terabyte für die meisten Unternehmen nicht realistisch, und Qwen3.8-Max liegt seit dem 12. August zwar offen auf Hugging Face, ist mit 2,4 Billionen Parametern aber jenseits von allem, was ein Mittelständler selbst betreibt, dazu unter einer eigenen Lizenz mit Umsatzstaffel statt unter Apache oder MIT. DeepSeek V4-Flash-0731 dagegen passt: MIT-Lizenz, rund 284 GB in FP8, vier H100 reichen. Seit dem 10. August gibt es dazu eine sehr kleine Variante: Metas Muse Glimmer läuft unter Apache 2.0 in 4-bit-Quantisierung auf einer Karte mit 24 GB, misst mit 35 Punkten aber deutlich weniger als alles in der Liste oben. Und lies vor der Hardware-Bestellung den Lizenztext: MiniMax schließt in der H3-Lizenz vom 2. August die EU vom lokalen Betrieb ausdrücklich aus.