Forschung
Neue Modelle, Papers und Durchbrüche aus der KI-Forschung.
Mit KI erstelltGünstige und teure LLMs kombiniert: Neues Verfahren mit Genauigkeitsgarantie
Ein Blogbeitrag auf dev.to beschreibt ein Verfahren namens Model Cascade, das Klassifizierungsaufgaben mit großen Sprachmodellen kostengünstiger machen soll, indem ein günstiges Proxy-Modell und ein teures Oracle-Modell kombiniert werden. Eine konkrete Implementierung mit ähnlichem Konzept namens BA
Mit KI erstelltNVIDIA-Agent AVO erreicht perfekten ARC-AGI-3-Score
Unternehmen meldet 100 Prozent im interaktiven Reasoning-Benchmark – Architektur statt nur Modell im Fokus
Mit KI erstelltAggregierte Sicherheits-Scores für KI-Sprachmodelle sind irreführend
Studie zeigt: Pauschales Blockieren verzerrt Bewertungen, kurze Tests reichen aus
Mit KI erstelltR-Tuning: Fehlendes 'I don't know' als Halluzinationsursache – Widerspruch zu OpenAI
Ein Paper sieht fehlendes 'I don't know' als Ursache, OpenAI beansprucht die Fähigkeit bereits.
Mit KI erstelltEinfache Muster, Orchestrator-Worker und Benchmarks: Drei Wege zu zuverlässigen Multi-Agenten-Systemen
Produktionserprobte Muster, Anthropics Orchestrator-Worker-Architektur und ein Benchmark zu vier Orchestrierungsansätzen – mit einer Debatte über Einfachheit versus Frameworks.
Mit KI erstelltChatGPT: Prompt-Navigator und Conversation-Search weiterhin fehlerhaft
Nutzer melden zwei getrennte Probleme in ChatGPT und ChatGPT Business.
Mit KI erstelltNARU: Neues japanisches Langform-Video-Benchmark für narrative Entwicklung und kulturelles Reasoning
Hierarchische Annotations-Pipeline und Muttersprachler-Verifikation sollen Modelle testen
Mit KI erstelltWorking Draft 'SELF-ANALYZE' für ChatGPT vorgestellt
Fallbasierte Zuverlässigkeitsbewertung als Alternative zu Raten oder Blockieren
Mit KI erstelltNutzer melden wiederkehrendes Zellmuster in GPT-Image-2-Bildern
Community-Berichte deuten auf ein systematisches Artefakt hin, das nicht von allen Nutzern wahrgenommen wird.
Mit KI erstelltAdaPop: Unlearning-Methode passt Gradientendruck an Faktenpopularität an
Neue Methode soll beliebte Fakten besser vergessen und die Forget-Retain-Balance automatisieren; Code ist öffentlich verfügbar.
Mit KI erstelltSkillGate: Neues Verfahren für In-Policy-Skill-Auswahl in Langzeithorizont-Agenten
Getrennte Kreditvergabe für Skill-Namens- und Ausführungs-Token behebt selector credit starvation und verbessert Erfolgsraten
Mit KI erstellt150M-Modell erreicht neue Kosten-Genauigkeitswerte auf ARC-AGI-1
Laut Papers with Code: 150M-Parameter-Modell mit rekurrentem latentem Reasoning und In-Context-Learning erreicht neue Kosten-Genauigkeits-Frontier; LLM-as-a-Verifier führt probabilistische Verifikation ein.