Publications

Accepted

GSM8K-V: Can Vision Language Models Solve Grade School Math Word Problems in Visual Contexts

Fan Yuan, Yuchen Yan, Yifan Jiang, Haoran Zhao, Tao Feng, Jinyan Chen, Yanwei Lou, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang

EMNLP 2026 Main Conference

Presents a purely visual, multi-image benchmark for grade-school mathematical reasoning.

Best Demo Paper

VidBot: Intelligent Video Learning Tool for Content Mining and Playback Traffic Statistics

Qinhua Xie, Weicong Liu, Fan Yuan, Jifan Shi, Ziyu Liu, Yanbing Zhang

2024 IEEE International Conference on Multimedia and Expo Workshops (ICMEW)

Describes an LLM-based video-learning system with content mining, knowledge organization, intelligent tutoring, and playback analytics.