test-time computation
- Can LLMs Reason Over Non-Text Modalities in a Training-Free Manner? A Case Study with In-Context Representation Learning
- OpenCUA: Open Foundations for Computer-Use Agents
- Safety Depth in Large Language Models: A Markov Chain Perspective
- Scalable Best-of-N Selection for Large Language Models via Self-Certainty