senn-tech
KI-News
KI-News2026-08-04· Von Franz Senn

KI-Modelle im Vergleich 2026: Welches Modell für welche Aufgabe

Das Feld ist unübersichtlich geworden. Zwanzig ernstzunehmende Modelle, drei Preisklassen, wöchentlich eine neue Ankündigung — und die meisten Vergleiche beantworten die falsche Frage. „Welches Modell ist das beste" ist deshalb nutzlos, weil die Spitze im Intelligenz-Index eng beieinanderliegt, während der Preis um den Faktor siebzig auseinandergeht.

Diese Übersicht ordnet das Feld nach Aufgabe. Zu jedem Modell gibt es eine ausführliche Einzelanalyse, verlinkt an Ort und Stelle.

Intelligenz-Index und Kosten je AufgabeClaude Opus 5 (max)61 · $2,34GPT-5.6 Sol (max)59 · $1,23Kimi K3 (max)57 · $0,86GLM-5.2 (max)51 · $0,59DeepSeek V4 Flash50 · $0,03Qwen3.6 27B37 · $0,29065
Elf Indexpunkte trennen die Spitze vom günstigsten Modell — der Preis unterscheidet sich um den Faktor 78. (Quelle: Artificial Analysis — Modell-Leaderboard)

Nach Aufgabe sortiert

Coding-Agenten

Die anspruchsvollste Kategorie, weil es nicht um einzelne Antworten geht, sondern um lange Werkzeugketten ohne Aufsicht.

AufgabeEmpfehlungWarum
Tägliche EntwicklungsarbeitClaude Opus 5bestes Verhältnis aus Zuverlässigkeit und Preis
Mehrtägige autonome LäufeClaude Fable 5hält Kontext und Richtung länger durch
Coding auf eigener HardwareKimi K2.7 Code, GLM-5.2offene Gewichte mit Coding-Schwerpunkt
Grosses Volumen, knappes BudgetDeepSeek V4 FlashBruchteil der Kosten bei brauchbarer Qualität

Ausführlich: Claude 5. Generation · Kimi K3 gegen Claude Code und Codex · GLM 5.2 · Kimi K2.7 Code

Fragen an eigene Dokumente

Hier entscheidet nicht die Modellgrösse, sondern die Qualität der Vektorsuche davor. Ein mittelgrosses offenes Modell reicht — und kann im Haus laufen.

AufgabeEmpfehlung
Vertrags- und AngebotsanalyseQwen 3.6 27B oder Mistral Small 4, on-premise
Sehr lange DokumenteMiniMax M3 (Millionen-Kontext)
MehrsprachigMistral Small 4

Ausführlich: Qwen 3.6 · Mistral Small 4 und Voxtral · MiniMax M3 · RAG-Umgebungen aufbauen

Bild- und Dokumentverständnis

Gescannte Lieferscheine, Konstruktionszeichnungen, PDF-Tabellen. Hier liegen die geschlossenen Modelle noch vorn, aber der Abstand schrumpft.

Ausführlich: Gemini 3.5 Flash und Gemma 4 · PDF-Workflows im ERP

Sprache und Telefonie

Für Telefon-Agenten zählt Latenz mehr als Intelligenz. Ein schnelles mittleres Modell schlägt ein langsames Spitzenmodell, weil eine Pause von zwei Sekunden im Gespräch tödlich ist.

Ausführlich: KI-Telefon-Agenten · Mistral Voxtral

Massenverarbeitung

Klassifizierung, Extraktion, Zusammenfassung in grosser Zahl. Hier gewinnt fast immer das günstigste Modell, das die Aufgabe noch schafft.

Ausführlich: Der KI-Preisverfall · Was KI pro Aufgabe kostet

Nach Anbieter

AnbieterStärkeSchwächeEinzelanalyse
AnthropicZuverlässigkeit in langen Agenten-LäufenteuerClaude 5
OpenAIBreite, ÖkosystemPreis, ModellwechselGPT-5
GoogleMultimodal, Preis-LeistungVerfügbarkeit in der EUGemini
DeepSeekKosten, offene GewichteGovernance-FragenDeepSeek V4
Alibaba (Qwen)läuft auf einer KarteSpitzenleistungQwen 3.6
Moonshot (Kimi)Coding, offene GewichteGrösse, HardwarebedarfKimi K3
MistralEuropa, Lizenz, Sprachekleinere ModelleMistral Small 4
xAIGeschwindigkeitgeschlossen, an X gebundenGrok 4.3
Metaoffene Gewichte, VerbreitungLizenz-KleingedrucktesLlama 4
NVIDIAfür eigene Hardware optimiertTrainingsdaten verschlossenNemotron 3
z.aiCoding-Spezialist, günstigjungGLM 5.2
MiniMaxKontextlängeBekanntheitMiniMax

Drei Regeln, die länger halten als jedes Modell

Baue gegen eine Schnittstelle, nicht gegen ein Modell. Das Feld ändert sich alle sechs bis acht Wochen spürbar. Wer eine Anwendung um das Verhalten eines bestimmten Modells herum baut, baut auf Sand. Ein Gateway davor macht den Wechsel zu einer Konfigurationszeile.

Miss, bevor du entscheidest. Der Intelligenz-Index eines Herstellers sagt nichts über deine Aufgabe. Zwanzig echte Fälle aus dem eigenen Betrieb, gegen drei Kandidaten laufen gelassen, beantworten die Frage besser als jedes Leaderboard.

Das teuerste Modell ist selten das richtige. Für die überwiegende Mehrheit betrieblicher Aufgaben — Extraktion, Klassifizierung, Fragen an Dokumente — zahlt man beim Spitzenmodell für Fähigkeiten, die die Aufgabe nicht braucht.

Weiterführend

Fragen?
Welches KI-Modell ist 2026 das beste?+

Die Frage führt in die Irre, weil die Spitzenmodelle im Intelligenz-Index nur wenige Punkte auseinanderliegen, sich im Preis aber um den Faktor 70 unterscheiden. Sinnvoller ist die Frage nach der Aufgabe: für Coding-Agenten, für Fragen an eigene Dokumente und für Massenverarbeitung gewinnen jeweils andere Modelle.

Lohnt sich das teuerste Modell?+

Nur bei Aufgaben, die daran scheitern, dass das Modell zu schwach ist. Das sind mehrtägige autonome Agenten-Läufe und schwierige Reasoning-Ketten. Für Klassifizierung, Extraktion und Fragen an eigene Dokumente zahlt man beim Spitzenmodell für Fähigkeiten, die die Aufgabe nicht braucht.

Was ist der Unterschied zwischen offenen Gewichten und Open Source?+

Offene Gewichte heisst: du kannst das Modell herunterladen und selbst betreiben. Open Source im strengen Sinn verlangt zusätzlich offengelegte Trainingsdaten und eine Lizenz ohne Nutzungseinschränkungen. Fast alle sogenannten offenen Modelle sind offene Gewichte mit Lizenzauflagen — der Unterschied ist juristisch relevant.

Wie oft ändert sich das Feld?+

Spürbar alle sechs bis acht Wochen. Deshalb ist es sinnvoller, eine Anwendung gegen eine austauschbare Schnittstelle zu bauen als gegen ein bestimmtes Modell. Ein Gateway davor macht den Wechsel zu einer Konfigurationszeile.