Ph.D. Student @ Hong Kong Polytechnic University (PolyU). Multimodality
CoSDA-ML. CoSDA-ML: Multi-Lingual Code-Switching Data Augmentation for Zero-Shot Cross-Lingual NLP
53NUWA-LIP. NÜWA-LIP: Language Guided Image Inpainting with Defect-free VQGAN
40ImaginaryNet. ImaginaryNet: Learning Object Detectors without Real Images and Annotations
26Ref-Diff. Ref-Diff: Zero-shot Referring Image Segmentation with Generative Models
21Responsible-Robotic-Manipulation. Responsible Robotic Manipulation
16Responsible-Visual-Editing. Responsible Visual Editing
15ORES. ORES: Open-vocabulary Responsible Visual Synthesis
14Point-RFT. Point-RFT: Improving Multimodal Visual Reasoning with Visually Grounded Thoughts in Reinforcement Learning
6Visual-O1. Python
4TechImage-Bench. Python
2