ศูนย์วิจัยและพัฒนา AI เชิงสร้างสรรค์ของฮ่องกง (HKGAI) ได้ประกาศเปิดตัวโมเดลเพลงโอเพ่นซอร์ส YuE2 ในวันที่ 18 กันยายน 2026 ทีมงานระบุว่าเป็นโมเดลเพลงโอเพ่นซอร์สที่แรกในโลกที่ใช้ "การวางแผนเชิงสัญลักษณ์" เพื่อสร้างสรรค์, คัฟเวอร์ และแก้ไขเพลงอย่างเป็นเอกภาพ; ในวันเดียวกันนั้น YuE2 ได้รับการจัดอันดับที่ 4 ใน Trending ของ Hugging Face (Trending Score 595) ซึ่งเป็นโมเดลเพลงเพียงหนึ่งเดียวในห้าอันดับแรกของรายการนี้ หลังจากเปิดตัวเพียง 9 วัน โมเดลหลักของทางการได้ถูกดาวน์โหลดไปแล้ว 11,626 ครั้ง; รวมถึงแพ็คเกจ ComfyUI, เวอร์ชัน GGUF/Quantized ของชุมชน และเครื่องมืออื่น ๆ ทำให้ยอดดาวน์โหลดในระบบนิเวศทั้งหมดประมาณ 179,000 ครั้ง.
HKGAI ก่อตั้งขึ้นในเดือนตุลาคม 2023 โดยได้รับการสนับสนุนจากแพลตฟอร์ม AIR@InnoHK ที่มุ่งเน้นด้านปัญญาประดิษฐ์และเทคโนโลยีหุ่นยนต์ นำโดยมหาวิทยาลัยเทคโนโลยีฮ่องกง การวิจัยครอบคลุมด้านภาษา, การมองเห็น และเสียงต่าง ๆ YuE2 ถือเป็นก้าวสำคัญในด้านการสร้างเสียงของศูนย์; ข้อความประชาสัมพันธ์ยังเปรียบเทียบโมเดลโอเพ่นซอร์สนี้กับ "ช่วงเวลา DeepSeek ในวงการเพลง" ที่สามารถแข่งขันหรือแม้แต่เกินกว่าระบบเชิงพาณิชย์ที่ปิดซอร์สบางส่วนได้.
WildSongBench: best-of-8 รวมคะแนนจากหลายโมเดลเชิงพาณิชย์
เกณฑ์การทดสอบ WildSongBench ใช้ 192 ชุด prompts สำหรับการประเมินอัตโนมัติ (12 กันยายน 2026) ตารางแสดงให้เห็นว่า YuE2 (best-of-8) มีค่าเฉลี่ย SongBench อยู่ที่ 6.9632 ขึ้นนำเป็นอันดับหนึ่ง; ค่าเฉลี่ยครั้งเดียวของ YuE2 อยู่ที่ 6.7316 โดยมีโมเดลอื่น ๆ เช่น Mureka 9 (6.9377), Suno v5 (6.8721), Suno v5.5 (6.7150), Suno v6 (6.5562) และ YuE 1 รุ่นก่อนหน้าที่ 4.9165 คะแนนอื่น ๆ ไม่ได้ชนะทั้งหมด: เช่น MuLan ของ Suno v5 สูงสุด (0.5428), AudioBox PQ ของ LeVo 2 สูงสุด (8.3966), และ PER ของ Suno v4.5 ต่ำสุด (5.80%).
| ระบบ | SongBench Avg ↑ | AudioBox PQ ↑ | MuLan ↑ | PER ↓ |
|---|---|---|---|---|
| YuE2 (best-of-8) | 6.9632 | 8.2714 | 0.5051 | 9.79% |
| Mureka 9 | 6.9377 | 8.0226 | 0.4394 | 11.69% |
| Suno v5 | 6.8721 | 8.1698 | 0.5428 | 8.10% |
| YuE2 | 6.7316 | 8.2598 | 0.5068 | 8.44% |
| Suno v6 | 6.5562 | 8.1296 | 0.4916 | 7.58% |
| YuE 1 | 4.9165 | 7.8683 | 0.2623 | 36.38% |


กล่องขาวที่ควบคุมได้: การวางแผนสัญลักษณ์และการเรนเดอร์เสียงแยกออก
YuE2 แยก「การวางแผนเชิงสัญลักษณ์ (symbolic planning)」ออกจาก「การเรนเดอร์เสียง (acoustic rendering)」 โดยออกแบบด้วยผู้เชี่ยวชาญผสม (MoE) เพื่อเพิ่มความสามารถในการควบคุม: ผู้เชี่ยวชาญ AR ใช้ความสนใจเชิงสาเหตุในการคาดการณ์โน้ตเพลง ABC และโครงสร้างความหมาย; ผู้เชี่ยวชาญ NAR ใช้การจับคู่การไหล (flow matching) ในการคาดการณ์ latent ทางเสียง; จากนั้นผ่านการถอดรหัส VAE เพื่อส่งออกเสียงสเตอริโอที่ 48 kHz. แตกต่างจากการสุ่มแบบกล่องดำที่「เมื่อมีคำสั่งเสียงออกมา」 ผู้สร้างสามารถเข้าร่วมในแต่ละขั้นตอน—เช่น ปรับแต่งโน้ตเดียวโดยไม่ต้องทำเพลงใหม่ทั้งหมด หรือเปลี่ยนสไตล์ในขณะที่ยังคงเมโลดี้เดิมไว้.

การสาธิตอย่างเป็นทางการใช้เพลงป๊อปภาษาจีน《末班車》ในการแก้ไขแบบสนทนาถึงเก้ารอบ รวมถึงการจัดเสียงใหม่, การปรับเปลี่ยนเพลง, การรวมเมโลดี้จาก《小星星》, การพัฒนาการเปลี่ยนแปลงและการเขียนเนื้อเพลงใหม่ สุดท้ายกลายเป็นการจัดเรียงแจ๊สภาษาอังกฤษที่มีโครงสร้างสมบูรณ์; ทุกขั้นตอนสามารถตรวจสอบโน้ตเพลงและเสียงได้ แทนที่จะเป็นการสร้างแบบสุ่มที่ไม่เกี่ยวข้องกันอีกครั้ง.
หกภาษา, หกสิบแนวเพลง, ระบบเปิดของเครื่อง
ในด้านความสามารถ, YuE2 รองรับหกภาษา ได้แก่ จีน, อังกฤษ, ญี่ปุ่น, เกาหลี, รัสเซีย, สเปน รวมถึงแนวเพลงมากกว่า 60 แนว (รวมถึง City Pop, เมทัล, แจ๊ส, ฟลาเมงโก เป็นต้น). น้ำหนักเปิดให้ดาวน์โหลดฟรี (เฉพาะการใช้งานที่ไม่ใช่เชิงพาณิชย์), สามารถทำงานได้ด้วยการ์ดเดียวในเครื่อง; การอนุญาตเชิงพาณิชย์ต้องติดต่อเพิ่มเติม. ทีมงานได้เปิดเครื่องมือการถอดโน้ต, โมเดลการเข้าใจเพลง และเกณฑ์การประเมินอย่างพร้อมเพรียง เพื่อเชื่อมโยงเครื่องมือ「การถอดโน้ต—การสร้าง—การแก้ไข—การประเมิน」. โครงการเข้าสู่: GitHub multimodal-art-projection/YuE.
- น้ำหนักเปิด (ไม่เชิงพาณิชย์) + การ์ดเดียวในเครื่องสามารถทำงานได้
- การสร้าง/การร้องใหม่/การแก้ไขรวมอยู่ในกระบวนการวางแผนเชิงสัญลักษณ์
- เปิดเครื่องมือการถอดโน้ต, โมเดลการเข้าใจ และเกณฑ์การประเมินอย่างพร้อมเพรียง
TechRitual 企業科技編輯部(香港)。biz.techritual.com 的外語版本由繁體中文原文翻譯。

