Yiming Wang
- ConViS-Bench: Estimating Video Similarity Through Semantic Concepts
- Learning Efficient Fuse-and-Refine for Feed-Forward 3D Gaussian Splatting
- Learning from Disjoint Views: A Contrastive Prototype Matching Network for Fully Incomplete Multi-View Clustering
- PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts
- Sampling-Efficient Test-Time Scaling: Self-Estimating the Best-of-N Sampling in Early Decoding
- Training-free Online Video Step Grounding