vision-language models

AI systems that integrate visual and linguistic data to perform tasks that require an understanding of both modalities, such as image captioning or visual question answering.

173 papers