GPUThor-Angriff umgeht Nvidias ECC-Schutz für Root-Zugriff

Eine kürzlich veröffentlichte Sicherheitsforschung der University of Toronto enthüllt eine neue Generation des Rowhammer-Angriffs namens GPUThor. Diese Methode umgeht den integrierten ECC-Schutz (Error-Correcting Code) von Nvidia-GPUs und ermöglicht nicht nur Denial-of-Service (DoS), sondern auch eine vollständige Rechteausweitung bis zur Root-Ebene des Hostsystems.

GPUThor übertrifft frühere Rowhammer-Ansätze bei weitem

Rowhammer-Angriffe nutzen einen physikalischen Effekt in DRAM-Speichern: Durch wiederholtes, schnelles Zugreifen auf bestimmte Speicherzeilen („Hammern“) können benachbarte Zeilen beeinflusst werden, was zu sogenannten Bit-Flips führt – dem ungewollten Kippen von Speicherzuständen von Eins auf Null oder umgekehrt. Für KI-Workloads, die massiv auf GPU-Rechenleistung angewiesen sind, kann dies katastrophale Folgen haben, etwa die Korruption von Modellgewichten oder das Einschleusen von Schadcode.

Nvidia setzt zur Absicherung unter anderem auf SECDED-ECC (Single Error Correction, Double Error Detection). Dieses Verfahren korrigiert einzelne Bit-Fehler und erkennt doppelte Bit-Fehler in überwachten Speicherblöcken – ein Schutz, der frühere Angriffe wie GPUHammer oder GPUBreach weitgehend obsolet machte. GPUThor durchbricht diese Barriere jedoch grundlegend. Die Forscher passten das Hammering so an, dass es einem nicht-uniformen Muster folgt. Ziel war es, die Aktivierung des Target Row Refresh (TRR) zu vermeiden, eine hardwaregestützte Gegenmaßnahme in GDDR6-Speichern.

Dies gelang durch die Analyse zweier bislang undokumentierter Verhaltensweisen von Nvidia-GPUs: der Art und Weise, wie wiederholte Speicheranfragen zusammengefasst (Coalescing) werden, und der genauen Frequenz, mit der TRR ausgelöst wird. Ergebnis: GPUThor erzeugt im Vergleich zu GPUHammer bis zu 6,6 Mal mehr Aktivierungen in den sogenannten Aggressor-Zeilen und erreicht auf den getesteten GPUs ohne ECC bis zu 377.000 Bit-Flips pro Gigabyte. Diese Raten sind 4.548- bis 23.597-mal höher als beim Vorgängerangriff und nähern sich der Effektivität leistungsstarker CPU-basierter Rowhammer-Exploits wie Blacksmith an.

Angriffsszenarien: Vom GPU-Resett bis zum Root-Shell-Zugriff

Denial-of-Service auf ECC-geschützten GPUs

Die Forscher demonstrierten, dass GPUThor auch dann wirkt, wenn ECC aktiviert ist. Auf einer Nvidia RTX A6000 mit aktiviertem ECC-Schutz erzeugte der Angriff 387 doppelte Bit-Fehler. ECC erkennt diese zwar, kann sie aber nicht korrigieren. Zudem entstanden zwei dreifache Bit-Fehler, die vom ECC fälschlicherweise „repariert“ wurden, was zu einer Datenkorruption führte. Die Folge war ein erzwungener GPU-Reset alle zwei Stunden, der sämtliche laufenden Workloads abrupt beendete. Bei wiederholter Durchführung des Angriffs markiert sich das Gerät schließlich selbst als austauschbedürftig – ein Szenario, das für Rechenzentren und Cloud-Anbieter erhebliche Betriebsrisiken birgt.

Privilege Escalation zur Root-Ebene

Das weitaus schwerwiegendere Szenario ist die Rechteausweitung. Die Forscher zeigten, dass GPUThor genutzt werden kann, um die GPU-Seitentabellen zu korrumpieren. Dadurch erhält ein unprivilegierter CUDA-Programmcode vollständigen, willkürlichen Speicherzugriff. In der Demonstration gelang es, eine Root-Shell auf dem Host-Betriebssystem zu öffnen. Dies ermöglicht einem Angreifer die vollständige Kontrolle über das System, ohne dass traditionelle Sicherheitsmechanismen auf Betriebssystemebene dies verhindern könnten.

Welche GPUs sind betroffen und wie verteidigt man sich?

Die Angriffe wurden auf Nvidia-Workstation-GPUs der Ampere-Klasse mit GDDR6-Speicher demonstriert, darunter die Modelle RTX A4000, A4500, A5000 und A6000 – allesamt weit verbreitet in KI- und Cloud-Infrastrukturen. Die Forscher betonen, dass die Verwundbarkeit nicht auf diese Modelle beschränkt ist. Auch auf Server-GPUs wie der A100, die ebenfalls auf SECDED-ECC setzt, ist eine Rechteausweitung prinzipiell möglich. Selbst neuere Blackwell-GPUs mit RAS-Repair-Funktionen bieten keinen vollständigen Schutz; sie erschweren den Angriff lediglich zeitlich.

Die Forscher meldeten ihre Erkenntnisse am 29. April an Nvidia. Der Konzern veröffentlichte am 21. August ein Advisory mit konkreten Schutzmaßnahmen. Dazu gehören die Aktivierung von SYS-ECC und IOMMU/DMA-Isolation, die Überwachung von GPU-Fehlertelemetrie sowie die Einschränkung oder Unterbindung der Ausführung nicht vertrauenswürdiger CUDA-Workloads. Nvidia weist darauf hin, dass das tatsächliche Risiko stark von der DRAM-Bauart, der Speichertechnologie, dem Plattformdesign sowie den systemseitigen Konfigurationen abhängt. Auf getesteten GDDR6X- und HBM2e-GPUs wurden mit den gleichen Angriffsmustern keine Bit-Flips beobachtet.

Die Forscher selbst empfehlen, wo möglich auf Cross-Tenant-GPU-Sharing zu verzichten, ECC-Fehlermeldungen kontinuierlich zu überwachen und nicht vertrauenswürdige CUDA-Arbeitslasten zu blockieren. Ein vollständiger Schutz, so die Autoren, werde jedoch erst durch leistungsfähigere Multi-Bit-ECC-Verfahren und hardwarebasierte Sicherheitsmaßnahmen in zukünftigen GPU-Generationen erreicht werden können. Die Entwicklung von GPUThor zeigt, dass softwarebasierte Gegenmaßnahmen allein nicht ausreichen, um gegen deterministische, hardwarenahe Angriffe dieser Art zu bestehen.

Diesen Artikel teilen