{"id":48513,"date":"2026-08-03T08:40:48","date_gmt":"2026-08-03T06:40:48","guid":{"rendered":"https:\/\/overcentral.com\/de\/?p=48513"},"modified":"2026-08-03T08:40:48","modified_gmt":"2026-08-03T06:40:48","slug":"dfsx-df1000-14nm-chip","status":"publish","type":"post","link":"https:\/\/overcentral.com\/de\/dfsx-df1000-14nm-chip\/","title":{"rendered":"14nm-Chip \u00fcbertrifft NVIDIA-Speicherbandbreite, Rechenleistung ein Sechstel"},"content":{"rendered":"<p>Der Wettlauf um die dominierende KI-Hardware bekommt einen unerwarteten Herausforderer. Ein chinesisches Start-up tritt mit einem 14-Nanometer-Chip gegen die Branchenkrone <a href=\"https:\/\/www.nvidia.com\/\" target=\"_blank\" rel=\"noopener noreferrer\" data-iacss-external=\"1\">NVIDIA<\/a> an \u2013 und \u00fcbertrumpft sie in einer entscheidenden Disziplin: der Speicherbandbreite. W\u00e4hrend die Rechenleistung jedoch deutlich niedriger ausf\u00e4llt, stellt sich die Frage, ob die Branche vielleicht jahrelang die falsche Kennzahl optimiert hat.<\/p>\n<h2>14nm besiegt 4nm: Wie ein Start-up die Speicher-Architektur neu denkt<\/h2>\n<p>Die Shanghaier Firma <strong>Dongfang Suanxin (DFSX)<\/strong> hat im Vorfeld der Weltkonferenz f\u00fcr K\u00fcnstliche Intelligenz (WAIC 2026) den KI-Beschleuniger <strong>DF1000<\/strong> vorgestellt. Das Blatt spricht von einem Prozessor, der auf dem \u201eausgereiften\u201c 14-nm-Knoten gefertigt wird und dennoch eine Speicherbandbreite von <strong>6,4 TB\/s<\/strong> sowie eine BF16-Rechenleistung von <strong>520 TFLOPS<\/strong> bietet. Dies ist eine bemerkenswerte Leistung, wenn man bedenkt, dass NVIDIAs Flaggschiff-GPUs auf dem fortschrittlichen 4-nm-Verfahren basieren.<\/p>\n<p>Der Clou liegt in der Physik. DFSX hat sich gegen den Trend der immer feineren Strukturen entschieden und setzt stattdessen auf eine radikale Verk\u00fcrzung der Datenwege. W\u00e4hrend herk\u00f6mmliche KI-Chips den HBM-Speicher (High Bandwidth Memory) neben dem Logik-Die anordnen, stapelt DFSX bei seinem <strong>DF1000 die DRAM-Chips senkrecht \u00fcber dem Rechenkern<\/strong>. Die Verbindung erfolgt mittels <strong>3D-Hybrid-Bonding<\/strong>, einer Technologie, bei der die Kupferbahnen der Chips direkt miteinander verschwei\u00dft werden. Dadurch entfallen Mikrokontakte und Dr\u00e4hte, die den Datenfluss verlangsamen. Die physische Distanz zwischen Speicher und Rechenwerk schrumpft drastisch, was die Latenz reduziert und die Bandbreite erh\u00f6ht.<\/p>\n<h2>Der Supernode im Vergleich: DFSX TY64 gegen NVIDIA GB200 NVL72<\/h2>\n<p>Das ambitionierte Ziel von DFSX wird mit dem Nachfolger <strong>DF2000<\/strong> sichtbar, der f\u00fcr das vierte Quartal 2026 angek\u00fcndigt ist. Auch dieser Chip bleibt bei 14 nm, f\u00fchrt aber das Konzept der vertikalen Integration fort. Die Architektur \u201e3.5D Infinity Chiplet\u201c kombiniert mehrere dieser Speicher-Rechner-T\u00fcrme und soll die Bandbreite auf <strong>15 TB\/s<\/strong> pro Chip steigern, bei einer BF16-Leistung von <strong>1.000 TFLOPS<\/strong>.<\/p>\n<p>Der eigentliche Showdown findet auf Systemebene statt. DFSX skaliert seine Chips zu einer Einheit namens <strong>TY64 SuperNode<\/strong>, in der <strong>64 DF2000-Chips<\/strong> zusammengeschaltet werden. Die aggregierte Speicherbandbreite erreicht damit <strong>960 TB\/s<\/strong>. NVIDIAs hochgehandelter <strong>GB200 NVL72<\/strong>, ein System mit 72 B200-GPUs (Blackwell-Architektur), kommt offiziell auf eine Gesamtbandbreite von <strong>576 TB\/s<\/strong>.<\/p>\n<p>Hier zeigt sich der spezifische Vorteil des chinesischen Ansatzes. Bezogen auf die reine Speicherbandbreite liegt die DFSX-L\u00f6sung mit einem Faktor von etwa <strong>1,7<\/strong> vor NVIDIA. Das entspricht einer Differenz von fast 400 TB\/s. Allerdings offenbart die Rechenleistung die andere Seite der Medaille. Die TY64 SuperNode erreicht im BF16-Format <strong>64 PFLOPS<\/strong>. Das NVIDIA-System liefert mit <strong>360 PFLOPS<\/strong> eine etwa 5,6-fach h\u00f6here Rohleistung.<\/p>\n<h3>Die verborgene These: Ist die Rechenleistung die falsche W\u00e4hrung?<\/h3>\n<p>Diese Diskrepanz ist der Kern des Arguments von DFSX und einer Reihe von Branchenbeobachtern. Die These lautet, dass die <strong>reine Rechenleistung (FLOPS) in modernen KI-Workloads zunehmend irrelevant wird<\/strong>. Der Flaschenhals ist nicht die F\u00e4higkeit des Chips zu rechnen, sondern seine F\u00e4higkeit, die massiven Gewichtsdaten gro\u00dfer Sprachmodelle (LLMs) schnell genug zu den Recheneinheiten zu transportieren. Sobald das Modell nicht mehr in den Cache eines einzelnen Prozessors passt, wird die Geschwindigkeit des Datenimports aus dem Speicher zum limitierenden Faktor.<\/p>\n<p>Die von DFSX ver\u00f6ffentlichten Diagramme, die zeigen, wie der DF2000 bei Aufgaben, die speicherintensiv sind, die Effizienz von NVIDIAs H200 oder B300 \u00fcbertrifft, illustrieren genau dieses Prinzip. Es geht nicht darum, ob ein Chip maximal flott multiplizieren kann, sondern darum, wie viele Parameter pro Sekunde durch den Chip geschleust werden k\u00f6nnen.<\/p>\n<h2>Die n\u00e4chste Generation: DF3000 und der Showdown mit Vera Rubin<\/h2>\n<p>Der Blick in die Zukunft zeigt, dass DFSX seine Strategie nicht als einmaligen Ausrei\u00dfer betrachtet. F\u00fcr den <strong>DF3000<\/strong>, der f\u00fcr Ende 2027 bis 2028 erwartet wird, wird eine <strong>Bandbreite von 20 TB\/s pro Chip<\/strong> und f\u00fcr die TY64-Konfiguration ein Wert von <strong>1.280 TB\/s<\/strong> prognostiziert. Damit w\u00fcrde das System NVIDIAs n\u00e4chster Architektur \u201eVera Rubin\u201c (NVL72) mit einer gesch\u00e4tzten HBM4-Gesamtbandbreite von knapp 1.580 TB\/s bis auf eine Differenz von etwa 23 % nahekommen \u2013 ein beeindruckender Wert f\u00fcr einen Hersteller, der auf einen Nischenprozess angewiesen ist.<\/p>\n<h2>Skeptische Einordnung: Die gro\u00dfe Unbekannte der Praxis<\/h2>\n<p>Trotz der beeindruckenden Zahlen ist eine fundamentale Skepsis geboten. Alle genannten Daten sind <strong>Selbstausk\u00fcnfte von DFSX<\/strong>. Ein unabh\u00e4ngiger Drittanbieter-Benchmark, der die Leistung unter realen Bedingungen best\u00e4tigt, liegt nicht vor. Das Unternehmen hat zudem zentrale Spezifikationen wie die Speicherkapazit\u00e4t, die thermische Verlustleistung (TDP) sowie die Auftragsfertiger und Speicherlieferanten nicht \u00f6ffentlich gemacht. Auch fehlen Nachweise \u00fcber konkrete Auslieferungen oder Installationszahlen. Gr\u00fcnder Wei Shaojun selbst r\u00e4umte Probleme bei der Ausbeute (Yield) der 3D-Stapelung ein \u2013 bei zwei \u00fcbereinanderliegenden Chips sinkt die Trefferquote prozessbedingt deutlich.<\/p>\n<p>Der Wert des Ansatzes liegt daher weniger in der sofortigen Marktreife als in der strategischen Notwendigkeit. Die <strong>US-Exportkontrollen<\/strong> schneiden chinesische Halbleiterfirmen von den modernsten Fertigungsverfahren und dem Zugang zu High-Bandwidth-Memory (HBM) ab. DFSX zeigt einen Weg, wie man mit den verf\u00fcgbaren Mitteln \u2013 dem ausgereiften 14-nm-Knoten und einer radikalen 3D-Integration \u2013 eine Nische besetzen kann. Ob dieser Weg breit genug f\u00fcr den Massenmarkt oder nur ein technologischer Lichtblick in einer ansonsten blockierten Branche ist, wird sich mit der Auslieferung des DF2000 und erster echter Kundenprojekte im n\u00e4chsten Jahr zeigen. Die Branche sollte diese Entwicklung jedoch keinesfalls ignorieren, denn sie zwingt die gesamte Industrie, die Gewichtung von Speicherbandbreite gegen\u00fcber reiner Rechenleistung zu \u00fcberdenken.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Der Wettlauf um die dominierende KI-Hardware bekommt einen unerwarteten Herausforderer. Ein chinesisches Start-up tritt mit einem 14-Nanometer-Chip gegen die Branchenkrone NVIDIA an \u2013 und \u00fcbertrumpft sie in einer entscheidenden Disziplin: der Speicherbandbreite. W\u00e4hrend die Rechenleistung jedoch deutlich niedriger ausf\u00e4llt, stellt sich die Frage, ob die Branche vielleicht jahrelang die falsche Kennzahl optimiert hat. 14nm besiegt [&hellip;]<\/p>\n","protected":false},"author":5,"featured_media":48516,"comment_status":"closed","ping_status":"","sticky":false,"template":"","format":"standard","meta":{"fifu_image_url":"https:\/\/www.gsmarena.com.bd\/images\/products\/Google-Pixel-8-Pro-Bay.jpg","fifu_image_alt":"14nm-Chip \u00fcbertrifft NVIDIA-Speicherbandbreite, Rechenleistung ein Sechstel","footnotes":""},"categories":[5],"tags":[],"class_list":["post-48513","post","type-post","status-publish","format-standard","has-post-thumbnail","category-artikel"],"fifu_image_url":"https:\/\/www.gsmarena.com.bd\/images\/products\/Google-Pixel-8-Pro-Bay.jpg","fifu_image_alt":"14nm-Chip \u00fcbertrifft NVIDIA-Speicherbandbreite, Rechenleistung ein Sechstel","_links":{"self":[{"href":"https:\/\/overcentral.com\/de\/wp-json\/wp\/v2\/posts\/48513","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/overcentral.com\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/overcentral.com\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/overcentral.com\/de\/wp-json\/wp\/v2\/users\/5"}],"replies":[{"embeddable":true,"href":"https:\/\/overcentral.com\/de\/wp-json\/wp\/v2\/comments?post=48513"}],"version-history":[{"count":2,"href":"https:\/\/overcentral.com\/de\/wp-json\/wp\/v2\/posts\/48513\/revisions"}],"predecessor-version":[{"id":48515,"href":"https:\/\/overcentral.com\/de\/wp-json\/wp\/v2\/posts\/48513\/revisions\/48515"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/overcentral.com\/de\/wp-json\/wp\/v2\/media\/48516"}],"wp:attachment":[{"href":"https:\/\/overcentral.com\/de\/wp-json\/wp\/v2\/media?parent=48513"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/overcentral.com\/de\/wp-json\/wp\/v2\/categories?post=48513"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/overcentral.com\/de\/wp-json\/wp\/v2\/tags?post=48513"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}