Live Meta Connect 2026: Drei Brillen und ein Schlüsselanhänger für Muse

NVIDIA optimiert TensorRT LLM für Confidential Computing auf Blackwell

Hersteller verspricht bis zu 98 Prozent native Leistung, unabhängige Messungen zeigen variable Overheads je nach Stack und Workload

· Veröffentlicht: 23.09.2026 ·2 Min Lesezeit
NVIDIA optimiert TensorRT LLM für Confidential Computing auf BlackwellMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • NVIDIA hat im TensorRT LLM Inference-Framework Optimierungen für Confidential Computing auf Blackwell eingeführt, um Performance-Overhead zu reduzieren.
  • Die Optimierungen umfassen einen software-verwalteten verschlüsselten Bounce-Buffer für Host-zu-Device-Transfers, die Stabilisierung des Kernel-Autotuners (da CUDA-Events in sicheren Umgebungen instabile Zeitstempel liefern) und die Anpassung der Multi-GPU-Kommunikation ohne NVLink SHARP Multicast.
  • NVIDIA gibt an, dass die Inference-Performance mit Confidential Computing bis zu 98 % der Performance ohne CC erreicht.
  • Unabhängige Benchmarks zeigen, dass bei korrekt konfiguriertem Stack der Overhead 1–3 % beträgt, während Standard-Inference-Stacks 30–40 % Overhead aufweisen.
  • Eine unabhängige Studie zeigt, dass trotz nahezu keinem GPU-Compute-Overhead (0,998x) LLM Serving unter Intel TDX plus GPU-CC 13–27 % Durchsatzverlust hat, verursacht durch die VM-GPU-Bridge.
  • NVIDIA Confidential Computing auf Blackwell unterstützt bis zu 8 GPUs mit NVLink-Verschlüsselung; die GPUs besitzen einen bei der Herstellung eingebrannten privaten Schlüssel, und die Remote Attestation erfolgt über den NVIDIA Remote Attestation Service (NRAS).

TensorRT LLM erhält CC-Optimierungen für Blackwell

NVIDIA hat im TensorRT LLM Inference-Framework gezielte Optimierungen für Confidential Computing (CC) auf der Blackwell-Architektur eingeführt, um den Performance-Overhead zu reduzieren. Die Anpassungen betreffen drei Hauptbereiche: einen verschlüsselten Bounce-Buffer für Host-zu-Device-Transfers, die Stabilisierung des Kernel-Autotuners sowie die Multi-GPU-Kommunikation ohne NVLink SHARP Multicast. Ziel ist es, die durch sichere Ausführung veränderten Laufzeitbedingungen auszugleichen und nahezu native Inferenzleistung zu erreichen.

Verschlüsselter Bounce-Buffer und stabiler Autotuner

Da vertrauliche GPUs nicht direkt auf den Speicher der geschützten virtuellen Maschine zugreifen können, leitet TensorRT LLM Host-zu-Device-Transfers über einen software-verwalteten verschlüsselten Bounce-Buffer. Der Kernel-Autotuner wurde stabilisiert, weil CUDA-Events in sicheren Umgebungen instabile Zeitstempel liefern und so zu suboptimalen Tactic-Entscheidungen führen. Zudem wurde die Multi-GPU-Kommunikation angepasst, um ohne NVLink SHARP Multicast effizient zu arbeiten, indem kollektive Operationen unnötige Speicherregistrierung und Cross-Rank-Synchronisation vermeiden.

NVIDIA verspricht 98 Prozent der nativen Leistung

Nach Angaben von NVIDIA erreicht die Inference-Performance mit Confidential Computing bis zu 98 Prozent der Leistung ohne CC. Diese Angabe gilt unter optimierten Bedingungen mit dem angepassten TensorRT LLM-Framework. Der Hersteller betont, dass die Sicherheitsarchitektur nahezu identische Leistung ermöglicht, ohne auf Datenschutz zu verzichten.

Unabhängige Messungen: Overhead stark abhängig vom Stack

Unabhängige Benchmarks auf NVIDIA B200-GPUs zeigen, dass der Overhead bei korrekt konfiguriertem Stack nur 1 bis 3 Prozent beträgt. Standard-Inference-Stacks weisen dagegen 30 bis 40 Prozent Overhead auf – verursacht durch vermeidbare Konfigurationsfehler. Der Unterschied verdeutlicht, dass die Stack-Konfiguration entscheidend ist: Die Kosten setzen sich aus einem fixen Anteil pro Host-Operation und einem Anteil pro NVLink-Traffic zusammen, deren Dominanz vom Workload abhängt.

LLM Serving unter TDX: 13 bis 27 Prozent Durchsatzverlust

Eine unabhängige Studie zu LLM Serving unter Intel TDX plus GPU-CC auf Blackwell misst trotz nahezu keinem GPU-Compute-Overhead (0,998x) einen Durchsatzverlust von 13 bis 27 Prozent. Ursache ist die VM-GPU-Bridge, die Host/Device-Transfers serialisiert und hohe Setup-Kosten verursacht. Dies steht im Widerspruch zur NVIDIA-Angabe von 98 Prozent: Die Studie verwendet Standard-vLLM/SGLang ohne spezifische Patches und misst LLM Serving mit KV-Cache, wo die Bridge zum Engpass wird, während NVIDIA die optimierte TensorRT-LLM-Integration referenziert.

Sicherheitsarchitektur und unabhängige Prüfungen

NVIDIA Confidential Computing auf Blackwell unterstützt bis zu 8 GPUs mit NVLink-Verschlüsselung. Jede GPU besitzt einen bei der Herstellung eingebrannten privaten Schlüssel, der nie Software, Firmware oder dem Host zugänglich ist. Die Remote Attestation erfolgt über den NVIDIA Remote Attestation Service (NRAS). Unabhängige Sicherheitsanalysen haben Schwachstellen in der GPU-CC-Architektur identifiziert und verantwortungsvoll an das NVIDIA Product Security Incident Response Team (PSIRT) gemeldet.

Dritte Generation: Von Hopper bis Rubin

NVIDIA Confidential Computing befindet sich in der dritten Generation und wird mit der Rubin-Architektur weiterentwickelt. Die Technologie unterstützt neben Rubin auch Blackwell- und Hopper-GPUs. Damit sollen vertrauliche KI-Workloads über verschiedene Hardware-Generationen hinweg mit vergleichbarer Sicherheit und Leistung betrieben werden können.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Quellen

  1. hyper.ai ↗

Ähnliche Artikel