Live Meta Connect 2026: Drei Brillen und ein Schlüsselanhänger für Muse

Offene Tierlaut-Datensätze und Audio-Sprachmodell veröffentlicht

iNaturalist Sounds Dataset und NatureLM-audio sind offen verfügbar – doch eine Studie warnt vor der Gleichsetzung von Klangähnlichkeit und Bedeutung.

· Veröffentlicht: 23.09.2026 ·1 Min Lesezeit
Offene Tierlaut-Datensätze und Audio-Sprachmodell veröffentlichtMit KI erstellt
◆ Fakten auf einen Blick
  • Der iNaturalist Sounds Dataset (iNatSounds) umfasst 230.000 Audiodateien von über 5.500 Arten, beigetragen von mehr als 27.000 Aufnehmenden weltweit, und ist als frei zugängliches Archiv verfügbar.
  • Das Earth Species Project hat nach eigener Angabe NatureLM-audio als erstes großes Audio-Sprachmodell zur Analyse von Tierlauten als Open Source veröffentlicht.
  • Eine Studie der Tel Aviv University zeigt, dass KI-Modelle sich auf physikalische Eigenschaften von Lauten konzentrieren und akustisch ähnliche Laute nicht zwingend ähnliche Bedeutungen haben.
  • Forschende um Rytis Maskeliūnas von der Kaunas University of Technology haben maschinelles Lernen genutzt, um anhand von Frequenz- und Zeitkomponenten von Hundegebell emotionale Zustände zu unterscheiden, wobei wütendes Bellen mit hoher Genauigkeit erkannt wurde.
  • Das Earth Species Project hat 2025 14 neue Papers veröffentlicht, darunter Arbeiten, die bei ICLR und NeurIPS angenommen wurden, und hat den ersten AI for Non-Human Animal Communication Workshop bei NeurIPS mitorganisiert.

Der iNaturalist Sounds Dataset (iNatSounds) ist als frei zugängliches Archiv verfügbar: 230.000 Audiodateien von über 5.500 Arten, beigetragen von mehr als 27.000 Aufnehmenden weltweit. Das Earth Species Project hat zudem NatureLM-audio als erstes großes Audio-Sprachmodell zur Analyse von Tierlauten als Open Source veröffentlicht.

Für die Artklassifikation können Forschende ein Modell wie einen Convolutional Neural Network (CNN) oder einen Transformer auf iNatSounds vortrainieren: Jede Aufnahme ist mit einer Artannotation versehen, sodass das Modell lernt, akustische Merkmale einer Art zuzuordnen. Die Autor:innen des Datensatzes haben mehrere Backbone-Architekturen verglichen und zeigen, dass ein solches Vortraining die Leistung auf nachgelagerten, stark annotierten Evaluationsdatensätzen verbessert – trotz der schwachen Labelung, bei der pro Aufnahme nur eine Art angegeben ist, obwohl weitere Arten im Hintergrund vorkommen können.

Eine echte Bedeutungsentschlüsselung bleibt jedoch umstritten: Eine Studie der Tel Aviv University zeigt, dass KI-Modelle sich auf physikalische Eigenschaften von Lauten wie Frequenz oder Dauer konzentrieren. Die Forscher testeten Modelle mit Vokalisationen von Kleinkindern und fanden, dass akustisch ähnliche Laute unterschiedliche kommunikative Funktionen haben können, während unterschiedlich klingende Laute dieselbe Bedeutung tragen können. Da die Modelle nur messbare akustische Parameter verarbeiten, ordnen sie Laute nach Klangähnlichkeit, nicht nach der Bedeutung, die der Empfänger ihnen zuschreibt. Mustererkennung ist daher nicht gleichbedeutend mit semantischem Verstehen.

A
Andreas Rüdiger
Herausgeber & Redaktionsleitung · KI-Modelle, Technik & Business

Andreas Rüdiger ist Gründer der Agentur INREMA und verantwortet KI Spotlight redaktionell. Sein Schwerpunkt liegt auf KI-Modellen, Recheninfrastruktur, technischen Entwicklungen und der wirtschaftlichen Einordnung. Er sorgt dafür, dass komplexe KI-Themen verständlich und nachvollziehbar aufbereitet werden. Mehr zu ihm auf inrema.de und andiger.de.

Quellen

  1. hyper.ai ↗

Ähnliche Artikel