Gemini 4 Argon lidera benchmarks pero empleados de Google cuestionan su rendimiento real en código

Hecho Qué ha ocurrido
Google presenta Gemini 4 Argon, que según Artificial Analysis obtiene 53 puntos en su Intelligence Index, igualando a GPT-6 Astra, y supera a Opus 5.5 y Fable 5.1 en pruebas internas. El modelo solo está disponible para un grupo limitado de 'probadores de confianza' mediante el programa Fairwind y está siendo revisado por el Gobierno de EEUU. Bloomberg reporta que empleados de Google señalan un rendimiento inferior al esperado en tareas reales de programación, algo que Google niega. Su tasa de alucinaciones en AA-Omniscience es del 15%, frente al 50% de GPT-6 Astra, y tendrá un precio promocional de 2/10 dólares por millón de tokens, que luego subirá a 4/20.
Resumen generado mediante IA a partir de Xataka. Naturaleza de la información: declaración de parte interesada.
Análisis Por qué importa
Muestra que los benchmarks no siempre reflejan el rendimiento práctico de un modelo, algo clave para empresas que deciden qué modelo adoptar basándose en esas métricas.
- Quién se ve afectado
- Equipos de desarrollo de software, empresas que evalúan modelos frontera para tareas agénticas y responsables de compras tecnológicas.
- Qué puede cambiar
- Si se confirma el precio competitivo y la baja tasa de alucinaciones, Gemini 4 podría ganar cuota en tareas agénticas intensivas, aunque la discrepancia interna sobre su calidad en código genera incertidumbre.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Vigilar la disponibilidad pública del modelo, pruebas independientes de código real más allá de benchmarks, y la evolución de precios tras la fase promocional.
Recomendación Qué debería hacer una empresa
Esperar pruebas independientes y de uso real antes de migrar flujos de trabajo críticos de programación a Gemini 4 Argon, evaluando en paralelo su coste tras la subida de precios en los próximos 3-6 meses.
Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.
Enviar esta noticia por correo
Fuente original: Xataka. La referencia es siempre el artículo original.
Ver fuente original ↗LLMbenchmarkscoding GoogleOpenAIAnthropicArtificial Analysis benchmarksciberseguridadGemini 4 ArgonGoogle DeepMindGPT-6 Astra
Forma parte de la historia Google DeepMind lanza Gemini 4 Argon, modelo frontera para código y ciberdefensa (12 noticias, estado: alto impacto).
Tu opinión
0 comentarios
Relacionadas
Google lanza Gemini 4 'Argon', modelo centrado en ciberdefensa autónoma
Google ha presentado Gemini 4 'Argon', su nueva familia de modelos de IA, entrenada especialmente para tareas de ciberseguridad defensiva. El acceso inicial se…
Por qué importaEs un paso relevante en el uso de IA frontera para encontrar y corregir vulnerabilidades de forma autónoma, en un contexto de aumento de ataques…
Google lanza Gemini 4 Argon, modelo frontera para ciberdefensa y código a precio competitivo
Google ha anunciado Gemini 4 Argon, su nuevo modelo de frontera, que se despliega inicialmente para defensores cibernéticos a través del programa Fairwind…
Por qué importaUn modelo de frontera con precio notablemente más bajo que la competencia puede acelerar la adopción empresarial y presionar a Anthropic y OpenAI a…
Google lanza Gemini 4 Argon, modelo frontera orientado a ciberseguridad con despliegue progresivo
Google presentó Gemini 4 Argon, desarrollado por DeepMind, descrito como su modelo más avanzado hasta la fecha. El acceso inicial se limita a socios de…
Por qué importaEl despliegue priorizado hacia defensa cibernética antes que al público general marca una estrategia distinta de lanzamiento y anticipa una carrera…
Google lanza Gemini 4 Argon en fases, primero a equipos de ciberseguridad y al gobierno de EEUU
Google anunció Gemini 4 Argon, su modelo de IA más potente, que puede encontrar, verificar y reparar fallas de software por su cuenta. El acceso inicial es…
Por qué importaEl modo de lanzamiento escalonado, con el gobierno y defensores primero, marca un precedente que ya siguió OpenAI con GPT-5.6, y sugiere que los…



