arxiv:2608.02023
Yu Zhang
AaronZ345
·
AI & ML interests
Multi-Modal Generative AI (Spatial Audio/Music/Singing/Speech).
Recent Activity
upvoted a paper about 10 hours ago
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks authored a paper about 11 hours ago
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks authored a paper about 11 hours ago
Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding