Cuiyang Huang, Zihan Hu. "A multimodal transformer-based visual question answering method integrating local and global information." PLoS ONE, 2025. doi:10.1371/journal.pone.0324757