H Company lanza NeoMME, encoder multimodal eficiente para recuperación de documentos visuales

Hecho Qué ha ocurrido
H Company presenta NeoMME, familia de encoders multimodales y multilingües de 260M y 800M parámetros entrenados desde cero con un objetivo de difusión discreta enmascarada, sin torre de visión ni decodificador causal separados. Fine-tuned como NeoMME-Retriever para recuperación de documentos visuales al estilo ColPali, alcanza 0.523 y 0.556 nDCG@10 en ViDoRe v3, situándose en la frontera de Pareto tamaño-rendimiento. El modelo de 260M codifica unas 51 páginas por segundo en una GPU L40S, el doble que ColModernVBERT, y técnicas de compresión reducen el almacenamiento de índices de 1.5MB a 6kB por página conservando más del 95% del rendimiento. Los checkpoints se publican bajo licencia Apache 2.0 en Hugging Face Transformers.
Resumen generado mediante IA a partir de Hugging Face (original en inglés). Naturaleza de la información: declaración de parte interesada.
Análisis Por qué importa
Ofrece una alternativa más eficiente en coste y velocidad a los modelos de recuperación basados en VLMs generativos, relevante para empresas que gestionan grandes volúmenes de documentos escaneados o con contenido visual complejo.
- Quién se ve afectado
- Equipos de IT, desarrolladores de sistemas de búsqueda documental y empresas con grandes archivos de documentos en PDF o imagen.
- Qué puede cambiar
- Permite construir sistemas de recuperación de documentos visuales (RAG sobre PDFs, informes, facturas) con menor coste computacional y de almacenamiento que las soluciones basadas en VLM completos.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Vigilar adopción en la comunidad open source, integraciones con vector stores como Qdrant o Milvus, y si aparecen comparativas independientes frente a modelos comerciales de retrieval.
Recomendación Qué debería hacer una empresa
Equipos técnicos que trabajen en RAG sobre documentos con mucho contenido visual pueden evaluar NeoMME-Retriever en pruebas piloto durante los próximos 3-6 meses por su relación rendimiento/coste.
Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.
Fuente original: Hugging Face (fuente primaria). La referencia es siempre el artículo original.
Ver fuente original ↗multimodalRAGembeddingslate-interaction H CompanyHugging FaceNeoMMEretrievalViDoRe
Relacionadas
Lenovo apuesta por IA híbrida local con su asistente Qira en IFA 2026
En IFA de Berlín, Lenovo presentó su visión de IA centrada en Qira, un asistente personal que funciona a través de PC, móviles, tablets y el Moto Watch Ultra…
Por qué importaLa estrategia de Lenovo refleja una tendencia hacia modelos de IA local que priorizan privacidad y reducción de dependencia de la nube, algo…
Google y Cathay Pacific amplían pruebas de IA para evitar estelas de condensación
Google Research está ampliando con Cathay Pacific un programa piloto que usa IA, imágenes satelitales y datos meteorológicos para ajustar ligeramente la…
Por qué importaEs un ejemplo de aplicación de IA a un problema climático concreto en un sector con difícil descarbonización, usando infraestructura existente sin…
Gemini Spark de Google ya puede gestionar bibliotecas de Google Photos
Google anunció que su agente personal Gemini Spark puede ejecutar tareas en Google Photos, como editar imágenes, curar álbumes, crear álbumes compartidos…
Por qué importaEs un ejemplo más de cómo las grandes tecnológicas integran agentes de IA en servicios de consumo masivo, buscando justificar el valor de las…
Instagram etiqueta erróneamente fotos reales como contenido generado por IA
Usuarios de Instagram reportan que Meta está aplicando la etiqueta 'AI Content' a imágenes que no fueron creadas ni editadas con IA generativa, mientras…
Por qué importaEl fallo erosiona la confianza en los sistemas de etiquetado de IA de las grandes plataformas justo cuando la detección de contenido sintético se…



