Ir al contenido
IA para hoy
Investigación Investigación

Google Research halla que el fallo factual de los LLM es de recuperación, no de conocimiento

Google Research halla que el fallo factual de los LLM es de recuperación, no de conocimiento
Imagen: Google Research

Hecho Qué ha ocurrido

Investigadores de Google Research presentan un marco de 'perfilado de conocimiento' y el benchmark WikiProfile (2.150 hechos de Wikipedia) para distinguir si un LLM falla por no tener codificado un hecho o por no poder recuperarlo. Evaluaron 13 modelos, incluidos Gemini-3-Pro y GPT-5, generando unas 4,5 millones de respuestas. Encontraron que en modelos frontera el 95-98% de los hechos están codificados, pero fallan en recuperar directamente entre el 26-34% de ellos, y aún con razonamiento fallan un 11-12%. También reinterpretan la 'maldición de la reversión' como un problema de recuperación, no de conocimiento ausente.

Resumen generado mediante IA a partir de Google Research (original en inglés). Naturaleza de la información: hecho documentado.

Análisis Por qué importa

El hallazgo sugiere que mejorar la factualidad de los LLM ya no depende tanto de escalar tamaño o datos, sino de técnicas de post-entrenamiento e inferencia que ayuden a acceder al conocimiento ya almacenado. Esto redefine dónde deben invertir esfuerzos los equipos que buscan reducir alucinaciones en sistemas de IA empresariales.

Quién se ve afectado
Equipos de IA, desarrolladores de LLM y empresas que dependen de la precisión factual en aplicaciones de búsqueda, asistentes y RAG.
Qué puede cambiar
Las estrategias para reducir errores factuales podrían orientarse más hacia prompting, chain-of-thought y técnicas de recuperación en tiempo de inferencia que hacia el simple escalado de modelos.

Análisis generado a partir de la información disponible; no procede de la fuente.

Predicción Qué observar a continuación

Habrá que ver si laboratorios como OpenAI o Anthropic adoptan marcos similares de diagnóstico y si surgen nuevas técnicas de post-entrenamiento centradas específicamente en mejorar el 'recall' factual.

Recomendación Qué debería hacer una empresa

Los equipos que desarrollan sistemas basados en LLM deberían evaluar en los próximos 6-12 meses técnicas de prompting y recuperación aumentada (RAG) como mitigación prioritaria frente a errores factuales, antes de invertir en escalar modelos.

Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.

Compartir WhatsApp LinkedIn X Bluesky Telegram Correo

Fuente original: Google Research (fuente primaria). La referencia es siempre el artículo original.

Ver fuente original ↗

LLMRAGchain-of-thought benchmarkfactualidadGoogle ResearchLLMWikiProfile

Tu opinión

0 comentarios

Sin registro. La primera vez te pediremos confirmar el correo y el comentario pasará por moderación; después se publican al momento si cumplen las normas. Se guarda un resumen de tu IP para evitar abusos.

Relacionadas

Investigación 2 fuentes

Google Research explica por qué el razonamiento mejora el recuerdo factual en LLMs

Investigadores de Google Research publicaron un estudio, a presentarse en COLM 2026, que analiza por qué activar el razonamiento (chain-of-thought) mejora la…

Por qué importaEntender estos mecanismos ayuda a diseñar mejor los prompts y arquitecturas de razonamiento para mejorar la precisión factual de los LLMs en…

Impacto bajo Fiabilidad confirmado por varias fuentes Google Research
Investigación 4 fuentes

DeepMind lanza AlphaGenome Atlas con predicciones para 9.000 millones de variantes genéticas

Google DeepMind presentó AlphaGenome Atlas, una plataforma con predicciones precomputadas del efecto molecular de 9.000 millones de posibles variantes de una…

Por qué importaEs un ejemplo de cómo la IA puede acelerar drásticamente la investigación biomédica al hacer computacionalmente accesible algo antes inviable…

Impacto medio Fiabilidad confirmado por varias fuentes Relevancia 8/10 Google DeepMind
Investigación 4 fuentes

DeepMind lanza el Atlas AlphaGenome con predicciones de 9.000 millones de variantes de ADN

Google DeepMind anunció el 8 de septiembre el AlphaGenome Atlas, un repositorio público con predicciones precalculadas para las 9.000 millones de posibles…

Por qué importaReduce drásticamente la barrera técnica y computacional para investigar el efecto de variantes genéticas en la regulación génica, acelerando…

Impacto medio Fiabilidad confirmado por varias fuentes Relevancia 7/10 IEEE Spectrum AI
Investigación

Google DeepMind presenta AlphaGenome Atlas, base de datos con predicciones de 9 mil millones de variantes genéticas

Google DeepMind ha lanzado AlphaGenome Atlas, una base de datos que predice los efectos de todas las posibles variaciones de un único nucleótido en el genoma…

Por qué importaAcelera dramáticamente el descubrimiento científico en genómica y medicina personalizada al proporcionar acceso inmediato a predicciones sobre el 98%…

Impacto alto Fiabilidad fuente primaria Relevancia 8/10 Google AI