Qwen-Music: Neues KI-Modell generiert Musik aus Text und covert Songs
Ein neues KI-Musikgenerierungsmodell namens Qwen-Music wird in einem Technical Report vorgestellt. Es kann Musik aus Text generieren und Cover-Songs neu interpretieren.
Mit KI erstelltQwen-Music: Text-zu-Musik und Cover-Neuinterpretation
Qwen-Music ist ein leistungsstarkes KI-Musikmodell, das laut Herstellerangaben hochmusikalische und klangtreue Lieder mit vollständigem Gesang erzeugen kann. Das Modell beherrscht zwei Kernaufgaben: die Text-zu-Musik-Generierung und die Cover-Song-Generierung. Bei der Text-zu-Musik-Generierung erstellt Qwen-Music vollständig neue Songs auf Basis von Textbeschreibungen, Liedtexten und musikalischen Attributen. Nutzer können so beispielsweise Genre, Stimmung oder Instrumentierung vorgeben und erhalten einen entsprechenden Song mit Gesang. Die Cover-Song-Generierung hingegen ermöglicht es, existierende Musikstücke neu zu interpretieren. Dabei werden Stil, Gesangseigenschaften oder andere klangliche Merkmale des Originals verändert, sodass ein bekanntes Lied in einer völlig neuen klanglichen Gestalt erscheint. Der Hersteller betont, dass beide Aufgaben mit hoher musikalischer Qualität und Wiedergabetreue umgesetzt werden.
Drei-Komponenten-Architektur für hohe Wiedergabetreue
Die Architektur von Qwen-Music integriert drei Kernkomponenten: den Qwen-Music-Tokenizer, das Qwen-Music-LLM und den Qwen-Music-Render. Der Tokenizer ist für die Umwandlung zwischen Audiosignalen und diskreten Tokens zuständig. Das LLM verarbeitet textuelle Eingaben und generiert daraus autoregressiv eine Sequenz von Musiktokens. Der Render decodiert diese Tokens und erzeugt die finale Audiowellenform. Die drei Komponenten arbeiten eng zusammen: Der Tokenizer komprimiert Musik in eine effiziente symbolische Repräsentation, das LLM lernt, aus Textbeschreibungen musikalisch sinnvolle Tokenfolgen zu erzeugen, und der Render stellt die finale Audioqualität sicher. Laut Herstellerangaben resultiert daraus eine Leistungsstärke, die hochmusikalische und klangtreue Lieder mit vollständigem Gesang hervorbringt. Weitere Details zur Architektur oder Evaluierung liegen derzeit nicht vor.


