senn-tech
KI-News
KI-News2026-06-29· Von Franz Senn

KI-Radar: Gemini 3.5 Flash & Gemma 4 — schnell gehostet, offen daheim

Google bedient gerade beide Lager auf einmal: ein schnelles geschlossenes Modell für die Cloud und ein offenes für das eigene Haus. Genau dieser Spagat macht die jüngsten Releases interessant.

Logo von Google Gemini
Gemini 3.5 gehostet, Gemma 4 mit offenen Gewichten: Google bedient beide Betriebsmodelle aus derselben Familie. (Quelle: Google / Wikimedia, gemeinfrei)
Intelligenz-Index und Kosten je AufgabeGemini 3.5 Flash50 · $0,69Gemma 4 31B29 · $0,00Gemma 4 12B22 · $0,08Mistral Small 420 · $0,10Qwen3.6 27B37 · $0,29065
Gemma 4 ist der offene kleine Bruder: deutlich unter Gemini 3.5 Flash, dafür im Eigenbetrieb ohne Token-Rechnung. (Quelle: Artificial Analysis — Modell-Leaderboard)

Zwei Modelle, zwei Welten

  • Gemini 3.5 Flash: auf agentische Workflows und Coding optimiert, deutlich schnellere Ausgabe als die Vorgänger und stark in werkzeugorientierten Benchmarks. Geschlossen, läuft in Googles Cloud.
  • Gemma 4 (12B): die offene Linie, frei auf Hugging Face verfügbar und damit selbst hostbar — der Gegenpol zur geschlossenen Flash-Variante.
  • Tempo vs. Hoheit: Flash punktet mit Geschwindigkeit und Reichweite, Gemma mit Kontrolle und Eigenbetrieb. Beides aus demselben Haus.

Die Gabelung der Datenhoheit

Das ist der Kern der Entscheidung, und Google beantwortet die Frage bewusst doppelt, je nach Schutzbedarf der Daten. Gemini 3.5 Flash sitzt am einen Ende: hohe Leistung, direkte Anbindung an agentische Pipelines und ein sehr großes Kontextfenster — aber jeder Prompt verlässt das eigene Netz und wird in Googles Rechenzentren verarbeitet. Gemma 4 steht am anderen Ende: kleinere 12-Milliarden-Parameter-Architektur, dafür mit herunterladbaren Gewichten unter Googles eigener, permissiver Gemma-Lizenz. Wer Gemma einsetzt, behält die Eingaben auf der eigenen Hardware — im eigenen Rechenzentrum, unter eigener Zugriffskontrolle und ohne Transfer in ein Drittland.

Praktisch heißt das: für eine schnelle Klassifizierung öffentlicher Daten, einen ersten Coding-Prototyp am Morgen oder eine Recherche in öffentlichen Quellen ist Flash oft die schnellere und bequemere Wahl. Sobald es jedoch um Kundendaten, Verträge, Personalakten oder internes Wissen geht, dreht sich die Rechnung — dann ist Gemma 4 auf eigener Hardware der sauberere und rechtlich unbedenklichere Pfad, weil kein Byte das Haus verlässt.

Der Vorbehalt

Gemini 3.5 Flash ist schnell und günstig — aber die Eingaben laufen über Googles Cloud. Für personenbezogene oder vertrauliche Daten bleibt das ein DSGVO-Thema. Gemma 4 löst genau das, kostet dafür eigene Hardware und Betrieb. Die Wahl ist keine technische, sondern eine über Datenhoheit.

Was der Eigenbetrieb kostet

Gemma 4 ist mit zwölf Milliarden Parametern bewusst klein gehalten — das ist kein Zufall, sondern die Voraussetzung für den Eigenbetrieb auf Mittelstands-Hardware. Quantisiert auf vier Bit oder FP8 lässt sich das Modell auf einer einzelnen Workstation-GPU laden; der VRAM-Bedarf bleibt überschaubar. Wer den vollen Precision-Vorteil will, braucht entsprechend mehr Speicher. Der Preis für die Hoheit ist also real, aber kalkulierbar: eine GPU, Strom, Wartung — und das Personal, das das Modell betreut. Im Vergleich zu monatlichen API-Kosten und der ständigen Abhängigkeit von einem US-Anbieter ist das für viele DACH-Unternehmen die ehrlichere Rechnung.

Unsere Sicht

Dass Google beide Wege parallel bedient, ist ehrlicher als es klingt: Wer Tempo für unkritische Aufgaben braucht, nimmt Flash; wer Hoheit über die Daten will, hostet Gemma selbst. Wir bewerten das pro Aufgabe — und im Mittelstand fällt die Antwort öfter auf die offene Seite, als viele erwarten.

Weiterführende Quellen

Fragen?
Wann wählt man Gemini 3.5 Flash statt Gemma 4?+

Dann, wenn Tempo und ein riesiges Kontextfenster zählen und die Eingaben unkritisch sind — eine Klassifizierung öffentlicher Daten, ein Coding-Prototyp am Morgen oder eine Recherche. Flash läuft in Googles Cloud und ist schnell und günstig, doch jeder Prompt verlässt das eigene Netz. Sobald Kunden-, Vertrags- oder Personaldaten ins Spiel kommen, ist die Rechnung anders: Dann hostet man Gemma 4 lieber selbst.

Lässt sich Gemma 4 auf eigener Hardware sinnvoll betreiben?+

Ja, das ist genau der Punkt der zwölf Milliarden Parameter. Quantisiert auf vier Bit oder FP8 passt das Modell auf eine einzelne Workstation-GPU, der VRAM-Bedarf bleibt überschaubar. Der Preis für die Datenhoheit ist real — eine GPU, Strom, Wartung und das Personal, das das Modell betreut —, aber gegenüber monatlichen API-Kosten und der Abhängigkeit von einem US-Anbieter ist das für viele DACH-Unternehmen die ehrlichere Rechnung.

Welche DSGVO-Frage stellt sich bei Gemini 3.5 Flash?+

Die gleiche wie bei jedem Cloud-Modell: Die Eingaben laufen über Googles Rechenzentren, es findet ein Drittland-Transfer statt. Für personenbezogene oder vertrauliche Daten bleibt das ein DSGVO-Thema, das Enterprise-Verträge mildern, aber nicht lösen. Genau hier setzt Gemma 4 an — wer die Gewichte selbst hostet, behält jede Eingabe im eigenen Netz.