Ir al contenido
IA para hoy

Tecnología

razonamiento

Relacionadas

LLM ×4agentes ×1multimodal ×1aprendizaje por refuerzo ×1

Historias

Noticias

Investigación repasa los tipos de acertijos que aún desafían a los modelos de IA

MIT Technology Review recopila una serie de pruebas y benchmarks (rotación mental, Knights and Knaves, SimpleBench, ARC-AGI, Torre de Hanói, logic grids) donde…

Por qué importaIlustra que el progreso de la IA en benchmarks no es uniforme: sobresale en tareas memorísticas o de patrones conocidos pero falla en razonamiento…

Impacto bajo Fiabilidad una fuente fiable MIT Technology Review
Modelos y avances 3 fuentes

OpenAI mejora GPT-5.6 en benchmark ARC-AGI-3 con dos configuraciones de API

OpenAI ha publicado que ajustes en dos configuraciones de su API han triplicado el rendimiento de GPT-5.6 en el benchmark ARC-AGI-3. Los cambios implican…

Por qué importaLas mejoras en benchmarks de razonamiento como ARC-AGI-3 indican progreso en capacidades fundamentales de resolución de problemas. Para empresas…

Impacto medio Fiabilidad una fuente fiable OpenAI
Modelos y avances 2 fuentes

Gemini con Deep Think logra nivel de medalla de oro en la Olimpiada Internacional de Matemáticas

Google DeepMind anunció que una versión avanzada de Gemini con Deep Think resolvió 5 de 6 problemas de la Olimpiada Internacional de Matemáticas (IMO) 2025…

Por qué importaEste hito demuestra que los modelos de IA han alcanzado razonamiento matemático de nivel élite, comparable al de los mejores matemáticos humanos del…

Impacto alto Fiabilidad confirmado por varias fuentes Google DeepMind
Investigación 2 fuentes

Gemini Deep Think resuelve problemas de investigación en matemática, física e informática

Google DeepMind ha presentado avances de Gemini Deep Think en investigación científica de nivel profesional. El sistema, que en julio de 2025 logró medalla de…

Por qué importaDemuestra que IA de razonamiento profundo puede actuar como colaborador científico autónomo en investigación de frontera, no solo en problemas…

Impacto alto Fiabilidad confirmado por varias fuentes Google DeepMind