PDF-Wukong. 【ArXiv】PDF-Wukong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling
132VisuRiddles. VisuRiddles: Fine-grained Perception is a important thing for Multimodal Large Models in Riddles Solving
19DocSeeker. [CVPR 2026 Highlight] DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding
18