DeepMind revela debilidad de modelos multimodales: dificultad para entender verbos
Google DeepMind ha publicado SVO-Probes, un conjunto de datos de 48.000 pares imagen-oración para evaluar la comprensión de verbos en transformers multimodales…
Por qué importaLa comprensión de verbos es crítica para sistemas reales como recuperación de imágenes, generación de descripciones y respuesta a preguntas visuales…
Impacto medio
Fiabilidad fuente primaria
Google DeepMind