HKGAI, das Hongkonger Generative KI Forschungszentrum für KI (HKGAI), gab am 18. September 2026 die Einführung der offenen Musik-Größenmodell YuE2 bekannt. Das Team behauptet, es sei das erste offene Musik-Größenmodell weltweit, das mit „Symbol Planning“ einheitlich kreatiert, covert und bearbeitet wird; am selben Tag stand es auf Platz 4 im Hugging Face Trending (Trending Score 595), das einzige Musikmodell in den Top 5. Innerhalb von 9 Tagen wurden offizielle Hauptmodelle 11.626 Mal heruntergeladen; inklusive ComfyUI-Verpackung, Community-GGUF/quantisierte Versionen und Tools erreichte die Ökosystem-Download-Zahl etwa 179.000 Mal.
HKGAI wurde im Oktober 2023 gegründet und wird von AIR@InnoHK, einer Plattform, die sich auf KI und Roboter-Technologien spezialisiert hat, finanziert und von der Hongkong University of Science and Technology geleitet. Die Forschung umfasst Sprache, visuelle und auditive Richtungen. YuE2 wird als ein wichtiger Meilenstein in der audio-basierten Generierung von HKGAI angesehen; der Pressebericht verglich das offene Modell mit dem „DeepSeek Moment“ in der Musikbranche und bezeichnete den Trend, dass das offene Modell aufholen oder sogar einige kommerzielle geschlossene Systeme übertreffen könnte.
WildSongBench: best-of-8-Composit-Test über mehrere kommerzielle Modelle
Der Bewertungsstandard WildSongBench wurde am 12. September 2026 mit 192 prompts automatisch bewertet. Die Tabelle zeigt YuE2 (best-of-8) mit einer SongBench Avg von 6.9632, momentan an der Spitze; eine Einzelleistung von YuE2 beträgt 6.7316. Im Vergleich zu Mureka 9 (6.9377), Suno v5 (6.8721), Suno v5.5 (6.7150), Suno v6 (6.5562) und der vorherigen Version YuE 1 (4.9165) steht YuE2 an der Spitze. Andere Indikatoren sind nicht immer bestanden: beispielsweise hat Suno v5 das höchste MuLan (0.5428), LeVo 2 hat das höchste AudioBox PQ (8.3966) und Suno v4.5 hat das niedrigste PER (5.80%).
| System | SongBench Avg ↑ | AudioBox PQ ↑ | MuLan ↑ | PER ↓ |
|---|---|---|---|---|
| YuE2 (best-of-8) | 6.9632 | 8.2714 | 0.5051 | 9.79% |
| Mureka 9 | 6.9377 | 8.0226 | 0.4394 | 11.69% |
| Suno v5 | 6.8721 | 8.1698 | 0.5428 | 8.10% |
| YuE2 | 6.7316 | 8.2598 | 0.5068 | 8.44% |
| Suno v6 | 6.5562 | 8.1296 | 0.4916 | 7.58% |
| YuE 1 | 4.9165 | 7.8683 | 0.2623 | 36.38% |


White-box Control: Symbol Planning und Akustische Rendering getrennt
YuE2 trennt „symbolisches Planen“ und „akustische Rendering“ voneinander, um durch die Anwendung von Mixed-Expert-Modellen (MoE) die Kontrollierbarkeit zu erhöhen: AR-Experten nutzen kausale Selbst-Attention, um ABC-Melodien und semantische Skelette vorzhsagen; NAR-Experten schätzen akustische Latent-Werte mithilfe von Flow-Matching, und die Ergebnisse werden anschließend durch einen VAE zur Ausgabe von 48 kHz Stereoband decodiert. Im Gegensatz zum „Prompt-und-Play“-Modell, bei dem die Audio-Generierung als Blackbox erfolgt, können Kreative während der einzelnen Schritte eingreifen – beispielsweise können sie einzelne Noten feinjustieren, ohne das gesamte Lied neu zu erstellen, oder den Stil wechseln und dabei die ursprüngliche Melodie beibehalten.

Im offiziellen Demo wurde die chinesische Volksmusik „Letzte Bus“ in neun Runden dialogbasierte Bearbeitung durchgeführt, einschließlich der Neuvertonung, der Umgestaltung der Melodie, der Integration der Melodie von „Twinkle Twinkle Little Star“, der Entwicklung von Variationen und der Überarbeitung der Texte, wodurch schließlich eine vollständig strukturierte englische Jazz-Arrangement entstand; bei jedem Schritt können die Noten und Audio-Belege miteinander abgeglichen werden, anstatt eine unabhängige zufällige Generierung durchzuführen.
Sechs Sprachen, 60 Stilrichtungen, lokales Open-Source Ökosystem
Im Hinblick auf die Fähigkeiten unterstützt YuE2 sechs Sprachen: Chinesisch, Englisch, Japanisch, Koreanisch, Russisch und Spanisch, und deckt über 60 Stilrichtungen ab (einschließlich City Pop, Heavy Metal, Jazz und Flamenco). Die Gewichte sind open source und können kostenlos heruntergeladen werden (nur für nichtkommerzielle Zwecke), und es ist möglich, sie lokal auf einem Einzelkarten-System auszuführen; kommerzielle Lizenzierung muss separat beantragt werden. Das Team veröffentlichte gleichzeitig die Open-Source-Tools für Notenübersetzung, Musikverständnis-Modelle und Bewertungsstandards, um eine „Notenübersetzung – Erstellung – Bearbeitung – Bewertung“-Toolsuite zu bilden. Projekt-Einstieg: GitHub multimodal-art-projection/YuE.
- Open-Source-Gewichte (nur für nichtkommerzielle Zwecke) + Ausführung auf lokaler Einzelkarte möglich
- Erstellung, Coverversion und Bearbeitung im Rahmen des „symbolischen Planungs“-Prozesses
- Open-Source-Tools für Notenübersetzung, Musikverständnis-Modelle und Bewertungsstandards gleichzeitig
TechRitual 企業科技編輯部(香港)。biz.techritual.com 的外語版本由繁體中文原文翻譯。

