RULER
Long-Context-Benchmark mit mehreren synthetischen Abruf-, Tracking- und Aggregationsaufgaben.
Long-Context-Benchmark mit mehreren synthetischen Abruf-, Tracking- und Aggregationsaufgaben.
Ausführlich im Dossier: Wie große Sprachmodelle wirklich funktionieren