Cuiyang Huang, Zihan Hu. "A multimodal transformer-based visual question answering method integrating local and global information." PLoS ONE (2025). https://doi.org/10.1371/journal.pone.0324757