Junhua Wang, Ouya Zhang, Yuan Jiang. "Multimodal diffusion framework for collaborative text image audio generation and applications." Scientific Reports (2025). https://doi.org/10.1038/s41598-025-05794-4