NoLiMa
Long-Context-Benchmark mit reduzierter lexikalischer Überlappung zwischen Frage und Evidenz.
Long-Context-Benchmark mit reduzierter lexikalischer Überlappung zwischen Frage und Evidenz.
Ausführlich im Dossier: Wie große Sprachmodelle wirklich funktionieren