Roboflow veröffentlicht RF-DETR: NAS-optimiertes Echtzeit-Transformer-Modell
Erstes Echtzeit-Modell über 60 AP auf COCO – Code auf GitHub veröffentlicht
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- RF-DETR ist eine Echtzeit-Transformer-Architektur für Objekterkennung, Instanzsegmentierung und Keypoint-Erkennung (Preview), entwickelt von Roboflow.
- RF-DETR nutzt ein DINOv2 Vision Transformer Backbone.
- RF-DETR wurde mit weight-sharing Neural Architecture Search (NAS) entwickelt, die Accuracy-Latenz-Pareto-Kurven für Ziel-Datensätze ohne erneutes Training entdeckt.
- RF-DETR (nano) erreicht 48.0 AP auf COCO und schlägt D-FINE (nano) um 5.3 AP bei ähnlicher Latenz.
- RF-DETR (2x-large) übertrifft GroundingDINO (tiny) um 1.2 AP auf Roboflow100-VL bei gleicher Geschwindigkeit.
- RF-DETR-2XL erreicht 60.1 AP50:95 auf COCO und ist damit das erste Echtzeit-Modell, das 60 AP auf COCO überschreitet.
RF-DETR: NAS-basiertes Echtzeit-Transformer-Modell von Roboflow veröffentlicht
Roboflow hat RF-DETR veröffentlicht, eine Echtzeit-Transformer-Architektur für Objekterkennung, Instanzsegmentierung und Keypoint-Erkennung (Preview). Das Modell nutzt ein DINOv2 Vision Transformer Backbone und wurde mit weight-sharing Neural Architecture Search (NAS) entwickelt. Bei diesem Ansatz wird ein vortrainiertes Basisnetzwerk auf den Zieldatensatz feinabgestimmt und anschließend werden tausende Netzwerkkonfigurationen mit unterschiedlichen Accuracy-Latenz-Tradeoffs evaluiert, ohne dass ein erneutes Training erforderlich ist. So entstehen Pareto-Kurven, die für jeden Datensatz die optimale Balance zwischen Genauigkeit und Geschwindigkeit abbilden. Die NAS-Methode ist auch auf der Roboflow-Plattform verfügbar. Das zugehörige Paper ist auf arXiv unter der Nummer 2511.09554 erschienen und wurde bei der ICLR 2026 angenommen. Zu den Autoren gehören Isaac Robinson, Peter Robicheaux, Matvei Popov sowie Deva Ramanan und Neehar Peri von der Carnegie Mellon University (CMU).
Benchmarks: RF-DETR-2XL erstes Echtzeit-Modell über 60 AP auf COCO
Die zentralen Benchmark-Ergebnisse zeigen: RF-DETR-2XL erreicht 60.1 AP50:95 auf COCO bei 17.2 ms Latenz (NVIDIA T4, TensorRT FP16) und ist damit das erste Echtzeit-Modell, das die 60-AP-Marke überschreitet. RF-DETR-L erreicht 56.5 AP bei 6.8 ms und übertrifft YOLOv11x (50.9 AP, 10.5 ms) deutlich. RF-DETR (nano) erzielt 48.0 AP und schlägt D-FINE (nano) um 5.3 AP bei ähnlicher Latenz. Auf RF100-VL übertrifft RF-DETR (2x-large) GroundingDINO (tiny) um 1.2 AP bei gleicher Geschwindigkeit. Die Segmentierungsmodelle reichen von 40.3 AP (Nano, 3.4 ms) bis 49.9 AP (2XL, 21.8 ms). Das Keypoint-Preview erreicht 71.8 AP50:95 auf COCO Person Keypoints bei 9.7 ms.
Alle Latenzwerte wurden unter einheitlichen Bedingungen gemessen: NVIDIA T4 mit TensorRT 10.4, CUDA 12.4, FP16 und Batch Size 1. Um Varianz durch GPU-Throttling und thermische Effekte zu reduzieren, wird zwischen aufeinanderfolgenden Forward-Pässen ein 200-ms-Puffer eingefügt. Accuracy und Latenz werden stets mit demselben Modellartefakt und derselben numerischen Präzision (FP16) gemessen, um irreführende Vergleiche zu vermeiden. Die Auswertung erfolgt mit pycocotools auf dem vollständigen COCO-val2017-Split (5.000 Bilder). Auch Drittanbieter-Modelle werden in-house unter demselben Protokoll neu evaluiert, sodass alle Zeilen direkt vergleichbar sind. Die RF100-VL-Ergebnisse mitteln über 100 diverse Datensätze und belegen die starke Generalisierung bei Domain-Shift.
Code auf GitHub: Apache 2.0 für Kernmodelle, PML 1.0 für XL/2XL
Der Code ist auf GitHub unter github.com/roboflow/rf-detr verfügbar. Die Installation erfolgt via pip install rfdetr in einer Python>=3.10-Umgebung. Die Kernmodelle (Nano bis Large) und der gesamte Code sind unter der Apache-2.0-Lizenz veröffentlicht – einer permissiven Open-Source-Lizenz, die kommerzielle Nutzung, Modifikation und Weitergabe erlaubt. Die XL- und 2XL-Modelle erfordern dagegen das Zusatzpaket rfdetr[plus] und stehen unter der PML 1.0-Lizenz. Diese proprietäre Lizenz muss vor der Nutzung explizit akzeptiert werden und kann zusätzliche Bedingungen für die kommerzielle Verwendung der großen Modelle enthalten. Für die Nutzung mit Autodistill gibt es das Paket autodistill-rfdetr (Apache 2.0). Das Repository verzeichnet 6.311 Sterne und 762 Forks.



