Member of Technical Staff @ xAI, Omni Model Pretrain, Visual (Image / Video) Generation | ex-NVIDIA, Ph.D. @ MMLab-CUHK
HumanGaussian. [CVPR 2024 Highlight] Code for "HumanGaussian: Text-Driven 3D Human Generation with Gaussian Splatting"
492SSP-NeRF. [ECCV 2022 Oral] Code for "Semantic-Aware Implicit Neural Audio-Driven Video Portrait Generation"
228HA2G. [CVPR 2022] Code for "Learning Hierarchical Cross-Modal Association for Co-Speech Gesture Generation"
144ANGIE. Code for "Audio-Driven Co-Speech Gesture Video Generation" (NeurIPS 2022, Spotlight Presentation).
88Visual-Sound-Localization-in-the-Wild. Code for Visual Sound Localization in the Wild by Cross-Modal Interference Erasing (AAAI 2022).
29vfms. Python
2alvinliu0.github.io. HTML
1cosmos-predict2. Cosmos-Predict2 is a collection of general-purpose world foundation models for Physical AI that can be fine-tuned into customized world models for downstream applications.
13dv_tutorial. An Invitation to 3D Vision: A Tutorial for Everyone
1