DeepSeek lanza V4.1-Flash: reduce memoria caché para agentes de IA más baratos

Hecho Qué ha ocurrido
DeepSeek publicó V4.1-Flash, un modelo multimodal de 552.000 millones de parámetros que reduce la memoria caché KV a una cuarta parte respecto a su predecesor, con solo 16.000 millones de parámetros activos por token. En el benchmark DeepSWE v1.1 supera por poco a Opus 5 de Anthropic y GPT-5.6 Sol de OpenAI (74,2%), aunque queda por detrás en ProgramBench y en lectura de imágenes complejas. El modelo se distribuye bajo licencia MIT en Hugging Face y mantiene los mismos precios de API que V4-Flash.
Resumen generado mediante IA a partir de The Decoder (original en inglés). Naturaleza de la información: declaración de parte interesada.
Análisis Por qué importa
La reducción drástica de memoria caché abarata significativamente el despliegue de agentes de IA que operan en contextos largos y con múltiples llamadas a herramientas, un cuello de botella clave para la adopción empresarial de agentes autónomos.
- Quién se ve afectado
- Empresas que desarrollan o despliegan agentes de IA, proveedores de infraestructura cloud y equipos técnicos que gestionan costes de inferencia.
- Qué puede cambiar
- Los agentes de IA con contextos largos podrían volverse más viables económicamente al reducirse drásticamente los requisitos de memoria GPU y almacenamiento, y al ser open source bajo MIT, abre la puerta a que otros actores construyan sobre esta arquitectura.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Vigilar la adopción real de V4.1-Flash por parte de desarrolladores de agentes, si otros laboratorios adoptan técnicas similares de compresión de caché KV, y el desarrollo del IPO de DeepSeek en China tras su ronda de financiación de 7.400 millones de dólares.
Recomendación Qué debería hacer una empresa
Equipos técnicos que desarrollan agentes de IA con contextos largos deberían evaluar V4.1-Flash en pruebas piloto en los próximos 3-6 meses para comparar costes de inferencia frente a alternativas cerradas.
Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.
Enviar esta noticia por correo
Fuente original: The Decoder. La referencia es siempre el artículo original.
Ver fuente original ↗LLMagentesmultimodalcoding DeepSeekAnthropicOpenAI agentes de IAChinacódigo abiertoDeepSeekV4.1-Flash
Tu opinión
0 comentarios
Relacionadas
IBM y Red Hat lanzan Lightwell para acelerar la corrección de vulnerabilidades open source con IA
Según CETaS del Alan Turing Institute, más del 45% de las vulnerabilidades en grandes organizaciones tardan casi un año en corregirse. IBM y Red Hat…
Por qué importaLa IA acelera la detección de vulnerabilidades pero no la remediación, generando una brecha de riesgo que las empresas deben gestionar como prioridad…
Apple presenta 'Reference Image' en iPhone 18 Pro para verificar fotos frente a imágenes generadas por IA
Apple anunció la función Apple Reference Image para el iPhone 18 Pro y Pro Max, que captura datos firmados del sensor y usa Private Cloud Compute para generar…
Por qué importaEs un intento de una gran fabricante de establecer un estándar de autenticidad fotográfica verificable por hardware, relevante en un contexto de…
Meta lanza Muse, agente de IA que compra, negocia y gestiona tareas vía WhatsApp
Meta presenta Muse, un agente de IA que opera en una máquina virtual propia y se controla a través de WhatsApp, capaz de reservar viajes, redactar correos…
Por qué importaMeta se adelanta a OpenAI, que retiró su función de pago directo en ChatGPT, situando a Muse como el primer agente de IA con protección de compra…
Nvidia y Palantir se alían para gestionar cadenas de suministro con IA
Nvidia y Palantir anunciaron una colaboración para aplicar IA a la gestión de cadenas de suministro, comenzando por la propia cadena de Nvidia, que abarca…
Por qué importaEs un ejemplo concreto de aplicación de IA generativa y modelos abiertos a operaciones críticas de cadena de suministro, un área con fuerte potencial…

