14nm-Chip übertrifft NVIDIA-Speicherbandbreite, Rechenleistung ein Sechstel

Chinesisches Start-up DFSX fordert NVIDIA mit innovativem 14nm-Chip und überlegener Speicherbandbreite heraus.

Der DFSX DF1000 übertrifft NVIDIAs Speicherbandbreite mit 6,4 TB/s bei 14nm.
Highlights
  • DFSX nutzt 3D-Hybrid-Bonding, um Speicher über dem Rechenkern zu stapeln und die Bandbreite zu erhöhen.
  • Die TY64 SuperNode mit 64 DF2000-Chips erreicht eine Speicherbandbreite von 960 TB/s, weit über NVIDIAs GB200 NVL72.
  • Trotz geringerer Rechenleistung zeigt DFSX, dass Speicherbandbreite in KI-Workloads oft der entscheidende Faktor ist.

Der Wettlauf um die dominierende KI-Hardware bekommt einen unerwarteten Herausforderer. Ein chinesisches Start-up tritt mit einem 14-Nanometer-Chip gegen die Branchenkrone NVIDIA an – und übertrumpft sie in einer entscheidenden Disziplin: der Speicherbandbreite. Während die Rechenleistung jedoch deutlich niedriger ausfällt, stellt sich die Frage, ob die Branche vielleicht jahrelang die falsche Kennzahl optimiert hat.

14nm besiegt 4nm: Wie ein Start-up die Speicher-Architektur neu denkt

Die Shanghaier Firma Dongfang Suanxin (DFSX) hat im Vorfeld der Weltkonferenz für Künstliche Intelligenz (WAIC 2026) den KI-Beschleuniger DF1000 vorgestellt. Das Blatt spricht von einem Prozessor, der auf dem „ausgereiften“ 14-nm-Knoten gefertigt wird und dennoch eine Speicherbandbreite von 6,4 TB/s sowie eine BF16-Rechenleistung von 520 TFLOPS bietet. Dies ist eine bemerkenswerte Leistung, wenn man bedenkt, dass NVIDIAs Flaggschiff-GPUs auf dem fortschrittlichen 4-nm-Verfahren basieren.

Der Clou liegt in der Physik. DFSX hat sich gegen den Trend der immer feineren Strukturen entschieden und setzt stattdessen auf eine radikale Verkürzung der Datenwege. Während herkömmliche KI-Chips den HBM-Speicher (High Bandwidth Memory) neben dem Logik-Die anordnen, stapelt DFSX bei seinem DF1000 die DRAM-Chips senkrecht über dem Rechenkern. Die Verbindung erfolgt mittels 3D-Hybrid-Bonding, einer Technologie, bei der die Kupferbahnen der Chips direkt miteinander verschweißt werden. Dadurch entfallen Mikrokontakte und Drähte, die den Datenfluss verlangsamen. Die physische Distanz zwischen Speicher und Rechenwerk schrumpft drastisch, was die Latenz reduziert und die Bandbreite erhöht.

Der Supernode im Vergleich: DFSX TY64 gegen NVIDIA GB200 NVL72

Das ambitionierte Ziel von DFSX wird mit dem Nachfolger DF2000 sichtbar, der für das vierte Quartal 2026 angekündigt ist. Auch dieser Chip bleibt bei 14 nm, führt aber das Konzept der vertikalen Integration fort. Die Architektur „3.5D Infinity Chiplet“ kombiniert mehrere dieser Speicher-Rechner-Türme und soll die Bandbreite auf 15 TB/s pro Chip steigern, bei einer BF16-Leistung von 1.000 TFLOPS.

Der eigentliche Showdown findet auf Systemebene statt. DFSX skaliert seine Chips zu einer Einheit namens TY64 SuperNode, in der 64 DF2000-Chips zusammengeschaltet werden. Die aggregierte Speicherbandbreite erreicht damit 960 TB/s. NVIDIAs hochgehandelter GB200 NVL72, ein System mit 72 B200-GPUs (Blackwell-Architektur), kommt offiziell auf eine Gesamtbandbreite von 576 TB/s.

Hier zeigt sich der spezifische Vorteil des chinesischen Ansatzes. Bezogen auf die reine Speicherbandbreite liegt die DFSX-Lösung mit einem Faktor von etwa 1,7 vor NVIDIA. Das entspricht einer Differenz von fast 400 TB/s. Allerdings offenbart die Rechenleistung die andere Seite der Medaille. Die TY64 SuperNode erreicht im BF16-Format 64 PFLOPS. Das NVIDIA-System liefert mit 360 PFLOPS eine etwa 5,6-fach höhere Rohleistung.

Die verborgene These: Ist die Rechenleistung die falsche Währung?

Diese Diskrepanz ist der Kern des Arguments von DFSX und einer Reihe von Branchenbeobachtern. Die These lautet, dass die reine Rechenleistung (FLOPS) in modernen KI-Workloads zunehmend irrelevant wird. Der Flaschenhals ist nicht die Fähigkeit des Chips zu rechnen, sondern seine Fähigkeit, die massiven Gewichtsdaten großer Sprachmodelle (LLMs) schnell genug zu den Recheneinheiten zu transportieren. Sobald das Modell nicht mehr in den Cache eines einzelnen Prozessors passt, wird die Geschwindigkeit des Datenimports aus dem Speicher zum limitierenden Faktor.

Die von DFSX veröffentlichten Diagramme, die zeigen, wie der DF2000 bei Aufgaben, die speicherintensiv sind, die Effizienz von NVIDIAs H200 oder B300 übertrifft, illustrieren genau dieses Prinzip. Es geht nicht darum, ob ein Chip maximal flott multiplizieren kann, sondern darum, wie viele Parameter pro Sekunde durch den Chip geschleust werden können.

Die nächste Generation: DF3000 und der Showdown mit Vera Rubin

Der Blick in die Zukunft zeigt, dass DFSX seine Strategie nicht als einmaligen Ausreißer betrachtet. Für den DF3000, der für Ende 2027 bis 2028 erwartet wird, wird eine Bandbreite von 20 TB/s pro Chip und für die TY64-Konfiguration ein Wert von 1.280 TB/s prognostiziert. Damit würde das System NVIDIAs nächster Architektur „Vera Rubin“ (NVL72) mit einer geschätzten HBM4-Gesamtbandbreite von knapp 1.580 TB/s bis auf eine Differenz von etwa 23 % nahekommen – ein beeindruckender Wert für einen Hersteller, der auf einen Nischenprozess angewiesen ist.

Skeptische Einordnung: Die große Unbekannte der Praxis

Trotz der beeindruckenden Zahlen ist eine fundamentale Skepsis geboten. Alle genannten Daten sind Selbstauskünfte von DFSX. Ein unabhängiger Drittanbieter-Benchmark, der die Leistung unter realen Bedingungen bestätigt, liegt nicht vor. Das Unternehmen hat zudem zentrale Spezifikationen wie die Speicherkapazität, die thermische Verlustleistung (TDP) sowie die Auftragsfertiger und Speicherlieferanten nicht öffentlich gemacht. Auch fehlen Nachweise über konkrete Auslieferungen oder Installationszahlen. Gründer Wei Shaojun selbst räumte Probleme bei der Ausbeute (Yield) der 3D-Stapelung ein – bei zwei übereinanderliegenden Chips sinkt die Trefferquote prozessbedingt deutlich.

Der Wert des Ansatzes liegt daher weniger in der sofortigen Marktreife als in der strategischen Notwendigkeit. Die US-Exportkontrollen schneiden chinesische Halbleiterfirmen von den modernsten Fertigungsverfahren und dem Zugang zu High-Bandwidth-Memory (HBM) ab. DFSX zeigt einen Weg, wie man mit den verfügbaren Mitteln – dem ausgereiften 14-nm-Knoten und einer radikalen 3D-Integration – eine Nische besetzen kann. Ob dieser Weg breit genug für den Massenmarkt oder nur ein technologischer Lichtblick in einer ansonsten blockierten Branche ist, wird sich mit der Auslieferung des DF2000 und erster echter Kundenprojekte im nächsten Jahr zeigen. Die Branche sollte diese Entwicklung jedoch keinesfalls ignorieren, denn sie zwingt die gesamte Industrie, die Gewichtung von Speicherbandbreite gegenüber reiner Rechenleistung zu überdenken.

Diesen Artikel teilen