Ir al contenido
IA para hoy
Herramientas y productos Lanzamiento

H Company lanza NeoMME, encoder multimodal eficiente para recuperación de documentos visuales

Imagen: Hugging Face

Hecho Qué ha ocurrido

H Company presenta NeoMME, familia de encoders multimodales y multilingües de 260M y 800M parámetros entrenados desde cero con un objetivo de difusión discreta enmascarada, sin torre de visión ni decodificador causal separados. Fine-tuned como NeoMME-Retriever para recuperación de documentos visuales al estilo ColPali, alcanza 0.523 y 0.556 nDCG@10 en ViDoRe v3, situándose en la frontera de Pareto tamaño-rendimiento. El modelo de 260M codifica unas 51 páginas por segundo en una GPU L40S, el doble que ColModernVBERT, y técnicas de compresión reducen el almacenamiento de índices de 1.5MB a 6kB por página conservando más del 95% del rendimiento. Los checkpoints se publican bajo licencia Apache 2.0 en Hugging Face Transformers.

Resumen generado mediante IA a partir de Hugging Face (original en inglés). Naturaleza de la información: declaración de parte interesada.

Análisis Por qué importa

Ofrece una alternativa más eficiente en coste y velocidad a los modelos de recuperación basados en VLMs generativos, relevante para empresas que gestionan grandes volúmenes de documentos escaneados o con contenido visual complejo.

Quién se ve afectado
Equipos de IT, desarrolladores de sistemas de búsqueda documental y empresas con grandes archivos de documentos en PDF o imagen.
Qué puede cambiar
Permite construir sistemas de recuperación de documentos visuales (RAG sobre PDFs, informes, facturas) con menor coste computacional y de almacenamiento que las soluciones basadas en VLM completos.

Análisis generado a partir de la información disponible; no procede de la fuente.

Predicción Qué observar a continuación

Vigilar adopción en la comunidad open source, integraciones con vector stores como Qdrant o Milvus, y si aparecen comparativas independientes frente a modelos comerciales de retrieval.

Recomendación Qué debería hacer una empresa

Equipos técnicos que trabajen en RAG sobre documentos con mucho contenido visual pueden evaluar NeoMME-Retriever en pruebas piloto durante los próximos 3-6 meses por su relación rendimiento/coste.

Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.

Fuente original: Hugging Face (fuente primaria). La referencia es siempre el artículo original.

Ver fuente original ↗

multimodalRAGembeddingslate-interaction H CompanyHugging FaceNeoMMEretrievalViDoRe

Relacionadas

Lenovo apuesta por IA híbrida local con su asistente Qira en IFA 2026

En IFA de Berlín, Lenovo presentó su visión de IA centrada en Qira, un asistente personal que funciona a través de PC, móviles, tablets y el Moto Watch Ultra…

Por qué importaLa estrategia de Lenovo refleja una tendencia hacia modelos de IA local que priorizan privacidad y reducción de dependencia de la nube, algo…

Impacto bajo Fiabilidad una fuente fiable Xataka

Google y Cathay Pacific amplían pruebas de IA para evitar estelas de condensación

Google Research está ampliando con Cathay Pacific un programa piloto que usa IA, imágenes satelitales y datos meteorológicos para ajustar ligeramente la…

Por qué importaEs un ejemplo de aplicación de IA a un problema climático concreto en un sector con difícil descarbonización, usando infraestructura existente sin…

Impacto bajo Fiabilidad una fuente fiable Google AI

Gemini Spark de Google ya puede gestionar bibliotecas de Google Photos

Google anunció que su agente personal Gemini Spark puede ejecutar tareas en Google Photos, como editar imágenes, curar álbumes, crear álbumes compartidos…

Por qué importaEs un ejemplo más de cómo las grandes tecnológicas integran agentes de IA en servicios de consumo masivo, buscando justificar el valor de las…

Impacto muy bajo Fiabilidad una fuente fiable TechCrunch AI