visual inputs
- MMCSBench: A Fine-Grained Benchmark for Large Vision-Language Models in Camouflage Scenes
- Memo: Training Memory-Efficient Embodied Agents with Reinforcement Learning
- Pixel Reasoner: Incentivizing Pixel Space Reasoning via Curiosity-Driven Reinforcement Learning
- Too Late to Recall: Explaining the Two-Hop Problem in Multimodal Knowledge Retrieval