Junhua Wang, Ouya Zhang, Yuan Jiang. "Multimodal diffusion framework for collaborative text image audio generation and applications." Scientific Reports, 2025. doi:10.1038/s41598-025-05794-4