benchmark results
- ORBIT - Open Recommendation Benchmark for Reproducible Research with Hidden Tests
- OmniGen-AR: AutoRegressive Any-to-Image Generation
- PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models
- Repurposing AlphaFold3-like Protein Folding Models for Antibody Sequence and Structure Co-design
- UniHG: A Large-scale Universal Heterogeneous Graph Dataset and Benchmark for Representation Learning and Cross-Domain Transferring