Google, das in der KI-Infrastruktur stets auf eine eigene Chippolitik gesetzt hat, geht einen radikalen neuen Weg. Der Internetkonzern entwickelt einen Server-Chip, der die Architektur des hauseigenen Gemini-Modells direkt in die Hardware einbrennt. Das Projekt trägt den internen Codenamen „Frozen v2″ – eine Anspielung auf die eingefrorenen Modellgewichte – und könnte bereits 2028 in den Rechenzentren zum Einsatz kommen. Es geht nicht um eine Weiterentwicklung der bekannten TPU-Serie, sondern um ein völlig neues Paradigma: ein Chip, der speziell für Gemini optimiert ist und damit Generalisten wie Nvidias GPUs oder Googles eigene Tensor Processing Units in einer entscheidenden Disziplin übertrumpfen soll – der Effizienz pro Inferenz.
Der Unterschied zur TPU: Von der Universalmaschine zum Spezialisten
Bisher setzte Google bei der KI-Beschleunigung auf seine Tensor Processing Units (TPUs). Diese Chips sind, ähnlich wie Nvidiaa-GPUs, als universelle KI-Beschleuniger konzipiert. Sie können eine Vielzahl von Modellen und Workloads ausführen, müssen dabei aber jedes Mal die Modellparameter aus dem Speicher laden, die Berechnungen durchführen und die Ergebnisse zurückschreiben. Dieser ständige Datenverkehr zwischen Speicher und Recheneinheit ist nicht nur zeitaufwendig, sondern auch extrem energieintensiv.
Genau hier setzt Frozen v2 an. Der Chip integriert wesentliche Teile der Entscheidungslogik und der Modellgewichte von Gemini direkt in die Siliziumschaltung selbst. Indem kritische Parameter quasi in die Hardware „einprogrammiert“ werden, entfällt ein Großteil der Datenbewegung. Die Folge ist eine drastische Reduktion der Latenz und des Energieverbrauchs. Das Portal The Information berichtet unter Berufung auf zwei mit dem Projekt vertraute Personen, dass die Entwickler davon ausgehen, mit Frozen v2 eine sechs- bis zehnfach höhere Effizienz im Vergleich zu den aktuellen TPUs zu erreichen. Es ist wichtig zu betonen, dass Frozen v2 die TPU-Reihe nicht ablösen, sondern als paralleles System für hochvolumige Inferenzaufgaben dienen soll. Erst im April hatte Google die neuen TPU-Modelle 8t (für Training) und 8i (für Inferenz) vorgestellt – die Evolution der Universalchips geht also weiter.
Ein Trend, der von Startups vorgelebt wird: Taalas als Blaupause
Die Idee, ein KI-Modell in Silizium zu „brennen“, ist nicht neu. Das kanadische Startup Taalas hat im Februar 2026 mit dem Chip „HC1″ genau diesen Ansatz als Machbarkeitsstudie präsentiert. Taalas brannte das komplette Modell Llama 3.1 8B von Meta physisch in einen Chip, der in einem 6-nm-Prozess von TSMC gefertigt wurde. Das Ergebnis war atemberaubend: Eine Inferenzgeschwindigkeit von 17.000 Tokens pro Sekunde pro Nutzer. Zum Vergleich: Nvidias H200 erreicht mit dem gleichen Modell etwa 230 Tokens pro Sekunde. Taalas selbst bezeichnet den HC1 als Technologiedemonstrator, nicht als fertiges Produkt. Das Unternehmen hat über 200 Millionen Dollar eingesammelt und gibt einen Entwicklungszyklus von etwa einer Woche für das Chip-Design bis zur Fertigung in rund zwei Monaten an. Dies zeigt, wie schnell sich der Ansatz des „Hardcoding“ von Modellen weiterentwickeln lässt.
Wie genau Googles Frozen v2 im Vergleich zu Taalas technisch umgesetzt wird, ist nicht bekannt. Der renommierte Halbleiteranalyst Jukan hat die verfügbaren Informationen ausgewertet und sieht das Frozen-Projekt klar als eine von den TPUs unabhängige Neuentwicklung: ein Chip, der die Entscheidungslogik von Gemini fest integriert, um Datenbewegungen zu minimieren. Google geht damit den gleichen Weg wie das Startup, nur im großen Maßstab und für das eigene Flaggschiff-Modell.
Der Preis der Erstarrung: Warum dieser Chip ein riskantes Wetten ist
Die größte Stärke von Frozen v2 ist gleichzeitig seine größte Schwäche: die mangelnde Flexibilität. Da die Modellarchitektur fest im Chip verankert ist, ist dieser vollständig auf die zum Zeitpunkt des Designs aktuelle Gemini-Version optimiert. Zwar lassen sich die Gewichte des Modells (die sogenannten „Weights“) noch anpassen, um etwa die Antwortcharakteristik zu verändern. Ändert sich jedoch die grundlegende Netzwerkarchitektur – etwa die Anzahl der Layer oder die Attention-Mechanismen – wird der Chip unbrauchbar.
Google geht mit dieser Entwicklung eine enorme Wette ein. Das Unternehmen signalisiert damit, dass es davon ausgeht, dass die grundlegende Architektur von Gemini über mehrere Jahre hinweg stabil bleibt. Sollte sich das Modell bis 2028 jedoch fundamental wandeln – was in der aktuellen Hochgeschwindigkeitsentwicklung von Foundation Models durchaus wahrscheinlich ist – wäre der speziell dafür entwickelte Chip schlagartig veraltet. In den sozialen Netzwerken wird diese Risikostrategie intensiv diskutiert. Ein Analyst brachte es auf den Punkt: „Für stabile, skalierte Modelle ist dieser Ansatz optimal. Sollten sich die Frontend-Modelle jedoch alle paar Monate ändern, wird es gefährlich.“
Google muss also entweder sicherstellen, dass die Gemini-Architektur über Jahre hinweg eingefroren bleibt, oder einen schnellen und kostengünstigen Redesign-Prozess etablieren, um den Chip an neue Architekturen anzupassen. Ohne eine dieser beiden Voraussetzungen lässt sich diese milliardenschwere Investition nicht rechtfertigen.
Drei Giganten, ein Ziel: Der Kampf um die Inferenzökonomie
Man würde die strategische Bedeutung von Frozen v2 verkennen, sähe man sie isoliert. Gleichzeitig arbeiten die beiden anderen großen KI-Labore an ähnlichen Projekten: OpenAI hat im Juni gemeinsam mit Broadcom den Inferenz-Chip „Jalapeño“ vorgestellt, der in nur neun Monaten designt wurde. Anthropic soll sich im Juli in ersten Verhandlungen mit Samsung über die Fertigung eines eigenen Chips befinden. Der Treiber für alle drei ist identisch: die explodierenden Kosten der Inferenz. Während das Training eines Modells eine einmalige Investition darstellt, fallen die Inferenzkosten bei jeder einzelnen Nutzeranfrage an. Mit jedem neuen User wachsen die Kosten. Solange man auf universelle GPUs oder TPUs setzt, ist diese Kostenstruktur festgeschrieben.
Für OpenAI ist die Loslösung von Nvidia daher nicht nur eine technologische, sondern eine wirtschaftliche Notwendigkeit. Anthropic steht unter demselben Druck. Und selbst Google stößt mit seinen TPUs an die physikalischen und ökonomischen Grenzen der Inferenz-Effizienz – weshalb Frozen v2 überhaupt erst entwickelt wird. Was einst wie eine exotische Spielerei eines Startups wirkte, ist heute zum zentralen Entwicklungsfeld der gesamten Industrie geworden.
Bis 2028 wird sich zeigen, ob der Preis der Erstarrung geringer ist als der Nutzen der Effizienz. Die Antwort darauf ist in Chips wie dem Frozen v2 buchstäblich eingebrannt.