HKGAI presenta YuE2 | El modelo de música de código abierto WildSongBench supera a Suno

·por TechRitual Editorial·IA empresarial
HKGAI 推 YuE2|開源音樂模型 WildSongBench 壓過 Suno
✏️ Contenido original| TechRitual Biz Redacción

HKGAI, el Centro de Investigación y Desarrollo de Inteligencia Artificial Generativa en Hong Kong (HKGAI), anunció el 18 de septiembre de 2026 el lanzamiento del modelo grande de música de código abierto YuE2. El equipo afirmó que es el primer modelo grande de música de código abierto en el mundo que utiliza «planificación de símbolos» para crear, regrabar y editar de manera unificada; el mismo día ocupó el puesto número 4 en la lista de tendencias de Hugging Face (Trending Score 595), siendo el único modelo de tipo música en los primeros cinco puestos. En los primeros 9 días de lanzamiento, la versión principal del modelo oficial registró 11.626 descargas; incluyendo las versiones empaquetadas de ComfyUI, las versiones GGUF/optimizadas y la cadena de herramientas, la ecología completa registró aproximadamente 179.000 descargas.

HKGAI fue establecido en octubre de 2023, patrocinado por la plataforma AIR@InnoHK que se enfoca en tecnologías de inteligencia artificial y robótica, y liderado por la Universidad de Ciencia y Tecnología de Hong Kong, abarcando investigaciones en varias direcciones, incluyendo lenguaje, visión y audio. YuE2 se considera un hito importante en la generación de audio para el centro; el comunicado también utilizó la metáfora «momento DeepSeek en la industria musical» para describir la tendencia del modelo de código abierto que alcanza o supera ciertos sistemas comerciales de código cerrado.

WildSongBench: best-of-8 compara con múltiples modelos comerciales

El estándar de evaluación WildSongBench realizó una evaluación automática con 192 conjuntos de prompts (12 de septiembre de 2026). La tabla muestra que YuE2 (best-of-8) tiene una puntuación promedio de 6.9632 y ocupa temporalmente el primer puesto; la puntuación única de YuE2 es de 6.7316. En comparación con Mureka 9 (6.9377), Suno v5 (6.8721), Suno v5.5 (6.7150), Suno v6 (6.5562), y la versión anterior YuE 1 (4.9165). Otros indicadores no son necesariamente los mejores: por ejemplo, el máximo de MuLan de Suno v5 es de 0.5428, el máximo de AudioBox PQ de LeVo 2 es de 8.3966, y el mínimo de PER de Suno v4.5 es de 5.80%.

Sistema SongBench Avg ↑ AudioBox PQ ↑ MuLan ↑ PER ↓
YuE2 (best-of-8) 6.96328.27140.50519.79%
Mureka 9 6.93778.02260.439411.69%
Suno v5 6.87218.16980.54288.10%
YuE2 6.73168.25980.50688.44%
Suno v6 6.55628.12960.49167.58%
YuE 1 4.91657.86830.262336.38%
Resultados parciales de WildSongBench (2026-09-12); YuE2 best-of-8 ocupa temporalmente el primer lugar en SongBench Avg.
Índice de calidad de la canción versus índice de alineación textual: YuE2/YuE2 (Bo8) entran en la zona de Pareto óptimo, destacando claramente sobre YuE1.

Control en caja blanca: planificación simbólica y renderizado acústico separados

YuE2 separa «planificación simbólica (symbolic planning)» y «renderizado acústico (acoustic rendering)», diseñando con una arquitectura de expertos mixtos (MoE) para mejorar el control: el experto AR predice regresivamente con atención causal la partitura ABC y el esqueleto semántico; el experto NAR predice el latente acústico mediante coincidencia de flujo (flow matching), y luego se decodifica mediante VAE para producir sonido estéreo a 48 kHz. A diferencia del «muestreo en caja negra al emitir una palabra de prompt», los creadores pueden intervenir en cada paso — por ejemplo, ajustar un solo sonido sin tener que reconstruir toda la canción, o cambiar el estilo manteniendo la melodía original.

Arquitectura de YuE2: el experto AR se encarga de la partitura y el esqueleto semántico, el experto NAR realiza el flujo acústico, y finalmente se decodifica mediante VAE a 48 kHz.

El demo oficial utiliza la canción pop china «Últibus» para realizar nueve rondas de edición conversacional, incluyendo la reajuste de acompañamiento armónico, adaptación de la melodía, integración de la melodía de «La estrella pequeña», desarrollo de variaciones y reescritura de letras, convirtiéndose finalmente en una arreglada completa en jazz en inglés; cada paso corresponde a una verificación de la partitura y el sonido, en lugar de una generación aleatoria no relacionada.

Seis idiomas, sesenta estilos, ecosistema abierto local

En términos de capacidades, YuE2 soporta seis idiomas: chino, inglés, japonés, coreano, ruso y español, abarcando más de sesenta estilos (incluyendo City Pop, heavy metal, jazz, flamenco, etc.). Los pesos son abiertos y descargables gratuitamente (solo para uso no comercial), y pueden ejecutarse localmente mediante una tarjeta gráfica de consumo; para uso comercial se debe acordar por separado. El equipo también ha abierto de forma simultánea herramientas de transposición, modelos de comprensión musical y benchmarks de evaluación, integrando la cadena de herramientas «transposición—creación—edición—evaluación». Punto de entrada del proyecto: GitHub multimodal-art-projection/Yu .

  • Pesos abiertos (no comerciales) + ejecución local con una tarjeta gráfica
  • Flujo de planificación simbólica unificado para creación, covers y edición
  • Abiertos simultáneamente herramientas de transposición, modelos de comprensión musical y benchmarks de evaluación
T
Sobre el autor
TechRitual Editorial

TechRitual 企業科技編輯部(香港)。biz.techritual.com 的外語版本由繁體中文原文翻譯。

Publicidad
Fotografía un recibo y tu Excel se rellena — ThatReceipt
Espacio disponible para patrocinio