Live Align Then Reason: Neues Modell prüft Lippensynchronität ohne Ton
↘

DIN Deploy: Neue C++-Samples für lokale KI-Inferenz mit ONNX Runtime und TensorRT RTX

Open-Source-Sammlung für hardwarebeschleunigte Inferenz auf Windows und Linux

· Veröffentlicht: 02.10.2026 ·2 Min Lesezeit
DIN Deploy: Neue C++-Samples für lokale KI-Inferenz mit ONNX Runtime und TensorRT RTXMit KI erstellt
◆ Fakten auf einen Blick
  • DIN Deploy ist eine Open-Source-Sammlung praktischer C++-Samples.
  • Es kombiniert ONNX Runtime mit dem NVIDIA TensorRT RTX Execution Provider.
  • Es hilft Entwicklern, von einem Modell-Checkpoint zu einer nativen, hardwarebeschleunigten Anwendung auf Windows und Linux zu gelangen.
  • Dieselbe ONNX Runtime API kann auch über WinML 2.0 genutzt werden.
  • Jedes Sample beginnt mit einem Python-Exporter, der einen Modell-Checkpoint von Hugging Face herunterlädt und in ein ONNX-Artefakt konvertiert.
  • Die Anwendungsseite ist eine native C++-CLI, die auf ONNX Runtime (ORT) aufbaut.

DIN Deploy: Neue C++-Samples für lokale KI-Inferenz mit ONNX Runtime und TensorRT RTX

DIN Deploy ist eine Open-Source-Sammlung praktischer C++-Samples, die ONNX Runtime mit dem NVIDIA TensorRT RTX Execution Provider kombiniert. Die Kombination hilft Entwicklern, von einem Modell-Checkpoint zu einer nativen, hardwarebeschleunigten Anwendung auf Windows und Linux zu gelangen. Die Kombination aus ONNX Runtime und dem NVIDIA TensorRT RTX Execution Provider ermöglicht hardwarebeschleunigte Inferenz auf NVIDIA RTX GPUs. Der gemeinsame Code nutzt die Session- und Tensor-APIs der ONNX Runtime in C++. Der Großteil des Codes ist herstellerunabhängig; herstellerspezifischer Code erscheint nur in optionalen beschleunigten Pfaden. Die gleiche ONNX Runtime API kann auch über WinML 2.0 genutzt werden. Jedes Sample beginnt mit einem Python-Exporter, der einen Modell-Checkpoint von Hugging Face herunterlädt und in ein ONNX-Artefakt konvertiert. Die Anwendungsseite ist eine native C++-CLI auf Basis von ONNX Runtime. ONNX wird als portables Modellformat verwendet.

Python-Export und C++-Deployment getrennt: So funktioniert das Sample-Set

Jedes Sample beginnt mit einem Python-Exporter, der einen Modell-Checkpoint von Hugging Face herunterlädt und in ein ONNX-Artefakt konvertiert. Die Anwendungsseite ist eine native C++-CLI auf Basis von ONNX Runtime. Die Trennung hält Modellkonvertierung und Deployment-Logik getrennt; Entwickler können ein exportiertes Modell ohne modellspezifische Laufzeit in eine lokale Anwendung übernehmen. Der gemeinsame Code nutzt die Session- und Tensor-APIs der ONNX Runtime in C++. Herstellerspezifischer Code, einschließlich CUDA-APIs und Kernels, erscheint nur in optionalen beschleunigten Pfaden. Execution Provider, die die erforderlichen ONNX Runtime Tensor-APIs unterstützen, können den gemeinsamen Code ausführen. Die Copy-Tensor-API der ONNX Runtime hält die Datenlokalität handhabbar, ohne dass im gemeinsamen Code eine dedizierte Vendor-API verwendet wird. Für Vor- und Nachbearbeitung um die exportierte Modellinferenz nutzt das FLUX.2-Sample die Grafik-Interop-Fähigkeit der ONNX Runtime (eingeführt in Version 1.25) mit Vulkan und DirectX für das Sampling.

J
Jasmin Freitag
Redaktion · KI-Anwendungen & Tools

Jasmin Freitag beobachtet für KI Spotlight die praktische Seite der künstlichen Intelligenz: neue Anwendungen, generative Werkzeuge, kreative KI und den Einsatz von Tools im Alltag und in Unternehmen. Sie erklärt praxisnah, was ein Werkzeug wirklich taugt.

Ähnliche Artikel