Live Trackunit stellt Datenplattform IrisX auf Databricks-Basis vor

NVIDIA startet Public Preview für TensorRT Model Connect

Open-Source-Tool konvertiert Hugging-Face-Modelle mit zwei Befehlen in deploybare C++-Bundles

· Veröffentlicht: 28.08.2026 ·2 Min Lesezeit
NVIDIA startet Public Preview für TensorRT Model ConnectMit KI erstellt
Inhalt
◆ Fakten auf einen Blick
  • TensorRT Model Connect ist ein Open-Source-Projekt unter Apache-2.0 Lizenz und befindet sich in der Public Preview.
  • Es ermöglicht das Deployment von unterstützten Hugging Face Modellen oder lokalen Checkpoints in zwei Befehlen: trtmc build und trtmc run.
  • Der Befehl trtmc build erzeugt ein .bundle, das TensorRT Engines und modellspezifische Assets enthält.
  • Das .bundle kann in nativen C++ Anwendungen über eine Task-API geladen werden, z.B. trtmc::load und pipeline->generate.
  • Es gibt C++ Task APIs für generate, transcribe, generate_image, embed und solve.
  • Die Laufzeit ist PyTorch-frei.

NVIDIA startet Public Preview für TensorRT Model Connect

NVIDIA hat TensorRT Model Connect als Public Preview veröffentlicht. Das Open-Source-Projekt steht unter der Apache-2.0-Lizenz und soll den Weg von Hugging-Face-Modellen in native C++-Anwendungen vereinfachen. Statt modellspezifischen Konvertierungs-, Vorverarbeitungs- und Laufzeitcode zu schreiben, liefert das Projekt eine Sammlung von Referenzimplementierungen, die sich ansehen, ändern und erweitern lassen. Die Ankündigung erfolgte am 18. August 2026, ein begleitender Blogbeitrag erschien am 23. August. Nach Angaben von NVIDIA wurde das Projekt mit einem agentischen Workflow unter Verwendung von OpenAI-Codex-Agenten und menschlicher Überprüfung entwickelt. Es richtet sich an Entwickler, die offene Modelle ohne tiefe Compiler-Kenntnisse in Produktion bringen wollen.

Zwei Befehle vom Modell zum deploybaren C++-Bundle

Der Arbeitsablauf besteht aus zwei Phasen. Mit dem Befehl trtmc build wird aus einer Hugging-Face-Modell-ID oder einem lokalen Checkpoint ein .bundle erzeugt, das die TensorRT-Engines und alle modellspezifischen Assets enthält. Ein Beispiel: trtmc build Qwen/Qwen3-0.6B -o qwen3-0.6B.bundle. Anschließend lässt sich das Bundle mit trtmc run direkt ausführen oder in eine native C++-Anwendung laden. Dort steht eine Task-API zur Verfügung: auto pipeline = trtmc::load("qwen3-0.6b.bundle"); auto result = pipeline->generate("..."). Die Laufzeit ist PyTorch-frei; ein Umweg über ONNX ist nicht nötig. Neben generate gibt es Task-APIs für transcribe, generate_image, embed und solve.

Aktuelle Einschränkungen: Nur aarch64-Wheels, breite Modellunterstützung

Derzeit veröffentlicht NVIDIA ausschließlich Linux-aarch64-Wheels; Nutzer von x86_64-Systemen müssen den Source-Build-Weg wählen. Die unterstützte Modellvielfalt ist dennoch breit: Laut Support-Matrix (Stand Juli 2026) gibt es 105 Profile über 76 Modellfamilien, darunter Qwen3-0.6B. Auf einer GB300-Snapshot-Performance-Matrix schlagen 102 der 105 Profile die jeweilige Referenz um mehr als fünf Prozent. Da es sich um eine Public Preview handelt, können sich APIs, Umfang und Richtung noch ändern.

J
Jasmin Freitag
Redaktion · KI-Anwendungen & Tools

Jasmin Freitag beobachtet für KI Spotlight die praktische Seite der künstlichen Intelligenz: neue Anwendungen, generative Werkzeuge, kreative KI und den Einsatz von Tools im Alltag und in Unternehmen. Sie erklärt praxisnah, was ein Werkzeug wirklich taugt.

Ähnliche Artikel