Juan Rodriguez
- AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding
- ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
- Parameterized Synthetic Text Generation with SimpleStories
- Rendering-Aware Reinforcement Learning for Vector Graphics Generation
- The Promise of RL for Autoregressive Image Editing