visual hallucinations
Visual hallucinations in AI arise when generative models produce artifacts or nonsensical images that are not grounded in the training data. These can occur in applications such as deep learning-based images synthesis or style transfer.
- CF-VLM:CounterFactual Vision-Language Fine-tuning
- Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling
- Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
- Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning
- VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction-Editing Data and Long Captions
- VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning