Hugging Face facilita ajuste de embeddings multimodales
Resumen En qué punto está
Hugging Face lanzó en Sentence Transformers v5.4 soporte para modelos de embeddings y reranking multimodales, combinando texto, imagen, audio y vídeo en un mismo espacio vectorial. Poco después publicó una guía para ajustar (finetuning) estos modelos, mostrando que un Qwen3-VL-Embedding-2B afinado para recuperación visual de documentos superó a modelos base y a otros más grandes en la métrica NDCG@10. La guía introduce herramientas como Router y MatryoshkaLoss para optimizar codificadores por modalidad y dimensionalidad. El desarrollo apunta a abaratar la construcción de sistemas de búsqueda y RAG multimodal sin depender de APIs externas ni modelos de gran tamaño.
Resumen generado mediante IA a partir de las 2 noticias de la historia. Última actualización: hace 1 h.
Enviar esta historia por correo
Línea temporal
-
Hugging Face añade herramientas para ajustar modelos multimodales de embeddings
Hugging Face ha publicado una guía práctica sobre cómo ajustar (finetuning) modelos multimodales de embeddings con Sentence Transformers. En un caso concreto, el modelo Qwen3-VL-Embedding-2B ajustado para recuperación…
-
Hugging Face integra modelos multimodales en Sentence Transformers v5.4
Hugging Face ha lanzado soporte para modelos de embeddings y reranking multimodales en Sentence Transformers v5.4. Estos modelos permiten mapear texto, imágenes, audio y vídeo en un espacio de embeddings compartido…