AWS senkt Router-Zahl um 69 Prozent und Stromverbrauch um 40 Prozent

Mit RNG und SIDR revolutioniert AWS die Netzwerkarchitektur seiner Rechenzentren und senkt Kosten drastisch.

Die neue RNG-Architektur reduziert Router um 69 Prozent und den Stromverbrauch um 40 Prozent.
Highlights
  • AWS setzt auf quasi-zufällige Graphen statt Fat-Tree-Topologie für effizientere Netzwerke.
  • Das SIDR-Protokoll ermöglicht dezentrale Routenplanung und zehnmal schnellere Umleitung bei Ausfällen.
  • Die ShuffleBox vereinfacht die Verkabelung der zufälligen Verbindungen in Rechenzentren.

Eine stille Revolution vollzieht sich in den Rechenzentren von Amazon Web Services (AWS). Die neue Netzwerkarchitektur mit der Bezeichnung RNG (Resilient Network Graphs) hat die Anzahl der benötigten Router um 69 Prozent reduziert und den Stromverbrauch der Netzwerkhardware um 40 Prozent gesenkt. Seit April 2026 ist diese Technologie zur Standardkonfiguration für praktisch alle neuen Rechenzentren geworden. Während die beeindruckenden Zahlen in der Fachwelt für Aufsehen sorgten, blieb ein entscheidendes Detail lange im Verborgenen: Der Schlüssel zum Erfolg liegt in einem weiteren, nur im Zusammenhang mit RNG verständlichen Protokoll namens SIDR. Niemand außerhalb von AWS hatte diese beiden Puzzleteile zuvor zusammengesetzt.

Vom Fat Tree zum quasi-zufälligen Graphen

Der Kern der Innovation ist der Wechsel von der traditionellen Fat-Tree-Netzwerktopologie hin zu einem flachen, quasi-zufälligen Graphen. Im alten Modell werden Server in Racks gesteckt, mehrere Racks bilden eine Gruppe, und die Datenkommunikation zwischen Servern muss über Switches auf dem Rack aufwärts in höhere Hierarchieebenen und dann wieder abwärts zum Ziel rack navigieren. Diese Struktur ist einfach zu entwerfen, aber sie leidet unter einem gravierenden Nachteil: Die Last konzentriert sich auf die Switches der oberen Ebenen. Fällt ein solcher zentraler Switch aus, sind alle darunterliegenden Racks betroffen.

Bereits in den frühen 1990er Jahren bewiesen Mathematiker, dass ein Netzwerk am effizientesten und ausfallsichersten ist, wenn Router zufällig miteinander verbunden werden. Zwischen zwei beliebigen Knoten existieren dann viele unabhängige Pfade, und der Ausfall eines einzelnen Knotens wirkt sich nur proportional aus – bei 1 Prozent ausgefallener Router reduziert sich die Bandbreite um gerade einmal 1 Prozent. Die Theorie war klar und alt. Was fehlte, war eine praktikable Methode, sie in einer realen Umgebung mit Tausenden von Knoten umzusetzen.

AWS gelang dies mit RNG. Zwei Hauptherausforderungen mussten dafür gelöst werden. Die erste war die Verkabelung. Zufällige Verbindungen in einem Rechenzentrum physikalisch herzustellen, ist nahezu unmöglich. AWS entwickelte dafür ein passives optisches Gerät namens ShuffleBox. Diese Box hat auf einer Seite Ports für die Router und auf der anderen Seite Ports für weitere ShuffleBoxen. Im Inneren werden die Glasfaserkabel nach einem bestimmten Muster vertauscht. Ein Techniker muss einen neuen Router daher nur noch in einen freien Port der lokalen ShuffleBox stecken – der Verkabelungsaufwand bleibt vergleichbar mit dem eines Fat Tree.

SIDR und Spraypoint: Das fehlende Puzzlestück

Die zweite Herausforderung betraf das Routing selbst. In einer Fat Tree ist der Pfad durch die Hierarchie vorgegeben. In einem quasi-zufälligen Graphen mit Tausenden gleichwertigen Pfaden zwischen zwei Punkten verliert das Konzept des kürzesten Weges seine Bedeutung. Klassische Protokolle wie BGP oder OSPF, die stets den kürzesten Weg berechnen, sind hierfür ungeeignet.

AWS löste dieses Problem mit SIDR (Scalable Intent-Driven Routing, ausgesprochen „Saider“). SIDR übernimmt die zentrale Steuerungsebene der Netzwerkplanung, kombiniert dies aber mit einer dezentralen Ausführung. Fällt ein Knoten aus, erfolgt die Umleitung in weniger als einer Sekunde – etwa zehnmal schneller als bei herkömmlichen Verfahren. Die eigentliche Paketübertragung übernimmt ein weiteres Protokoll namens Spraypoint. Der sendende Router sprüht die Pakete wie ein Nebel an benachbarte Knoten und leitet sie über speziell eingerichtete Wegpunkte zum Ziel. Dies sichert nahezu die doppelte Anzahl unabhängiger Pfade im Vergleich zur Standard-Routing-Methode und macht das Netzwerk extrem widerstandsfähig gegen Ausfälle und Überlastungen.

SIDR wurde von Stephen Callaghan auf der re:Invent 2023 vorgestellt und tauchte 2024 auch in einer Keynote von Peter DeSantis auf. Die bahnbrechende RNG-Arbeit wurde dagegen im April 2026 auf arXiv veröffentlicht. Interessanterweise enthielt das RNG-Papier keinen einzigen Verweis auf SIDR. Corey Quinn von der Duckbill Group, der die AWS-Ingenieure für The Register interviewte, stellte fest, dass niemand außerhalb von AWS diese Verbindung zuvor hergestellt hatte. Es war kein Geheimnis – es war nur nie jemandem aufgefallen, die beiden Puzzleteile zusammenzufügen.

Wohin fließen die Kosteneinsparungen?

Die Ergebnisse von RNG sind beeindruckend und klar beziffert: 69 Prozent weniger Router, eine Steigerung des Datendurchsatzes um bis zu 33 Prozent, und eine Reduzierung des Stromverbrauchs der Netzwerkgeräte um 40 Prozent. Das Forschungspapier gibt Kosteneinsparungen zwischen 9 und 45 Prozent im Vergleich zur Fat-Tree-Architektur an, bei gleichwertiger oder besserer Leistung. Der erste Produktionseinsatz begann Ende 2024 in der Nähe von Dublin, gefolgt von Tests in Deutschland und Spanien. Seit April 2026 ist RNG der Standard für fast alle neuen Rechenzentren, mit Ausnahme von GPU-Clustern.

Die zentrale Frage, die Quinn den AWS-Verantwortlichen stellte, war direkt: „Kann ich sagen, dass Sie die Kostensenkungen als Gewinn einbehalten und nicht an die Kunden weitergeben?“ Die Antwort war eindeutig:

„From a cost perspective? Effectively, yes.“

Man mag dies kritisieren, doch der Kontext ist wichtig. Anders als viele Wettbewerber hat AWS die Preise für bestehende SKUs nicht erhöht. Eine EC2-Instanz mit 64 GB RAM, die 2020 verfügbar war, kostet heute noch denselben Preis – ohne Berücksichtigung der Inflation. Einzig bei Generationenwechseln wie von Graviton4 (c8g.2xlarge) auf Graviton5 (c9g.2xlarge) gab es eine Preiserhöhung von 9 Prozent. Diese Erhöhung ist jedoch gemessen an den gestiegenen Komponentenkosten eher moderat, wie Quinn betont. Ein Upgrade ist zudem nicht erzwungen; ältere Instanzen bleiben weiterhin nutzbar.

Der Trend zur Flatrate

Parallel zu diesen internen Kostensenkungen verändert AWS auch die Preismodelle für Netzwerkprodukte. Datenübertragungen innerhalb einer Availability Zone (AZ) waren schon immer kostenlos. Der Traffic zwischen AZs kostet 2 Cent pro GB (1 Cent rein, 1 Cent raus). Dass eine AZ aus mehreren Rechenzentren besteht und ständig wächst, macht diese kostenlose interne Datenübertragung zu einem erheblichen, von AWS absorbierten Kostenfaktor, der leicht übersehen wird.

Ein weiterer Schritt war die Einführung von AWS Interconnect – multicloud im April 2026. Statt nach übertragenen Gigabyte abzurechnen, wird nur noch ein zeitbasierter Portpreis fällig. Der Dienst ist für Google Cloud und Oracle Cloud Infrastructure verfügbar, Microsoft Azure soll 2026 folgen. Seit Mai 2026 gibt es pro Account und Region zudem einen kostenlosen 500-Mbps-Tarif. Bei voller Auslastung dieses Ports über einen Monat hätte die gleiche Datenmenge über das offene Internet etwa 12.000 Dollar gekostet.

AWS begründet den Schritt mit den Wünschen der Kunden. Wörtlich hieß es: „We know customers do not like rate-based network charges because it‘s hard to predict their cost, which is why we are moving towards flat-rate pricing for new network products.“ In einer Zeit, in der Cloud-Preise tendenziell steigen, setzt AWS bei neuen Produkten also bewusst auf feste, planbare Kosten. Dies ist ein starkes Signal an den Markt.

Der stille Gigant, der nicht spricht

AWS‘ Netzwerktechnologie ist gerade deshalb so erfolgreich, weil sie sich im Hintergrund abspielt. Die Kommunikation zwischen zwei beliebigen Punkten auf AWS erreicht nahezu die volle Leitungsgeschwindigkeit – und das wird von den Nutzern als selbstverständlich angesehen. Wer ein eigenes Rechenzentrum betreibt, kennt die Begrenzungen: Die Bandbreite der oberen Switches ist ein Flaschenhals, nicht alle Knoten können immer mit voller Geschwindigkeit kommunizieren. Auf AWS gibt es diese Einschränkung nicht, wie Quinn betont.

Die Wahrnehmung im Markt geht jedoch in eine andere Richtung. Neo-Cloud-Anbieter oder Nvidias Referenzdesigns gelten vielerorts als überlegen. Quinn, der selbst jahrelang in der Netzwerkadministration tätig war, widerspricht dieser Einschätzung entschieden. Er warnt davor, dass Unternehmen Rechenzentren bauen, ohne die Tiefe des AWS-Netzwerks wirklich zu verstehen. Die Qualität des Netzwerks fällt den meisten Kunden erst auf, wenn es einmal ausfällt. Solange es funktioniert, bleibt es unsichtbar.

Die technische Führerschaft von AWS in diesem Bereich wird daher oft unterschätzt. Der von Quinn beschriebene Anekdoten-Schluss – dass AWS die Switches jedes Jahr in der Pantone-Farbe „Color of the Year“ lackiert – mag als Running Gag erzählt sein, unterstreicht aber die Pointe: Was hier im Verborgenen geleistet wird, ist eine ingenieurstechnische Meisterleistung, deren Bedeutung für die gesamte Cloud-Infrastruktur kaum zu überschätzen ist. Die Diskrepanz zwischen der öffentlichen Wahrnehmung und der realen Leistungsfähigkeit des AWS-Netzwerks könnte sich eines Tages schmerzhaft korrigieren – für all jene, die meinen, man könne das Rad einfach neu erfinden.

Diesen Artikel teilen