Wang, J., Zhang, O., Jiang, Y. (2025). Multimodal diffusion framework for collaborative text image audio generation and applications. Scientific Reports. https://doi.org/10.1038/s41598-025-05794-4