vision-language tasks

Tasks that require the integration of visual and linguistic information, such as visual question answering or image captioning. These tasks assess the capability of models to understand and generate language based on visual context.

5 papers