Open-Source-Backbone VisionHOPE übertrifft Vision Transformers
Lineare Komplexität, fünf gekoppelte Speicher und stabile Updates ermöglichen bessere COCO- und ADE20K-Ergebnisse
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- VisionHOPE ist ein Open-Source-Vision-Backbone.
- Es basiert auf Self-Referential Nested Learning (SRNL).
- Es verwendet fünf gekoppelte Speicher: content, key, value, learning rate, retention.
- Die Speicher aktualisieren sich Token für Token während eines Vorwärtsdurchlaufs.
- Es erreicht Top-1-Genauigkeiten von 84.1%, 85.2%, 85.6% auf ImageNet-1K für Tiny, Small, Base.
- Es hat lineare Rechen- und Speicherkomplexität in der Token-Anzahl.
Open-Source-Backbone VisionHOPE übertrifft Vision Transformers
Mininglamp Technology und das Institute of Automation der Chinese Academy of Sciences haben VisionHOPE vorgestellt, ein Open-Source-Vision-Backbone auf Basis von Self-Referential Nested Learning (SRNL). Bei ImageNet-1K erreicht das Modell Top-1-Genauigkeiten von 84,1 Prozent (Tiny), 85,2 Prozent (Small) und 85,6 Prozent (Base). Auf COCO und ADE20K werden Ergebnisse für Objekterkennung, Instanzsegmentierung und semantische Segmentierung berichtet; die Autoren geben an, dass diese besser als bei Vision Transformers ausfallen. Die Überlegenheit resultiert aus mehreren architektonischen Eigenschaften: Erstens wachsen Rechen- und Speicheraufwand linear mit der Token-Anzahl, sodass hochauflösende Bilder ohne den quadratischen Aufwand von ViTs verarbeitet werden können – das ist besonders bei dichten Vorhersageaufgaben wie COCO und ADE20K vorteilhaft. Zweitens aktualisieren fünf gekoppelte Speicher (content, key, value, learning rate, retention) ihre Zustände Token für Token, wodurch das Modell eine eingabespezifische Repräsentation aufbaut, statt nur statische Merkmale zu verwenden. Drittens sorgen Soft-Cap und Spectral-Clamp dafür, dass diese selbstreferenziellen Updates nicht-expansiv bleiben, was Stabilität garantiert und die Vorteile des selbstmodifizierenden Lernens zuverlässig nutzbar macht. Die Autoren berichten, dass VisionHOPE bei hoher Auflösung auf einer A100-GPU DeiT und Vim übertrifft; konkrete Durchsatz- oder FLOPs-Zahlen sind im Preprint dokumentiert.
Fünf gekoppelte Speicher aktualisieren sich Token für Token
VisionHOPE verwendet fünf gekoppelte Speicher: content, key, value, learning rate und retention. Anders als bei ConvNets, Vision Transformers oder State-Space-Modellen bleiben diese Speicher während eines Vorwärtsdurchlaufs nicht statisch, sondern werden Token für Token aktualisiert, während das Modell das Bild verarbeitet. Dadurch entsteht ein eingabespezifischer Lernprozess innerhalb eines einzigen Durchlaufs. Direkte unkontrollierte selbstreferenzielle Updates führen jedoch zu Instabilität. Deshalb kombiniert VisionHOPE eine weiche Obergrenze (soft cap) für die selbstreferenzielle Injektion mit einer spektralen Begrenzung (spectral clamp) für den Übergang des gespeicherten Gedächtnisses. Der Soft-Cap begrenzt die Schrittgröße der Selbst-Injektion, der Spectral-Clamp beschränkt die Spektralnorm der Übergangsmatrix des Retentionsspeichers. Die Autoren beweisen, dass die resultierenden Speicherdynamiken dadurch nicht-expansiv sind – Updates können sich nicht aufschaukeln, was Stabilität sichert.
MIT-Lizenz und Checkpoints für ImageNet, COCO und ADE20K
Code und Gewichte stehen unter der MIT-Lizenz. Das Repository enthält eine PyTorch-Implementierung mit eigenständigen SRNL- und VisionHOPE-Operator-Modulen sowie Trainings- und Evaluationscode. Vortrainierte Checkpoints für ImageNet-1K-Klassifikation, COCO-Objekterkennung und Instanzsegmentierung sowie ADE20K-Semantiksegmentierung sind in den Größen Tiny, Small und Base verfügbar – über GitHub Releases, Hugging Face und Baidu Netdisk. Die Checkpoints wurden Ende September veröffentlicht, das Paper ist als arXiv-Preprint erhältlich.



