Ir al contenido
IA para hoy

Resultados para «benchmark»

25 noticias

¿Prefieres una respuesta redactada? Pregunta a IA para hoy.

Herramientas y productos 8 fuentes

OpenAI lanza Astra, su modelo más potente y polémico por su opacidad

OpenAI lanzó el jueves Astra, su modelo más avanzado hasta la fecha, disponible primero para clientes de su programa de ciberseguridad Daybreak y, en una…

Por qué importaUn modelo con capacidades ofensivas de ciberseguridad y menor transparencia en su razonamiento plantea riesgos de seguridad y gobernanza justo cuando…

Impacto alto Fiabilidad confirmado por varias fuentes TechCrunch AI

Investigación repasa los tipos de acertijos que aún desafían a los modelos de IA

MIT Technology Review recopila una serie de pruebas y benchmarks (rotación mental, Knights and Knaves, SimpleBench, ARC-AGI, Torre de Hanói, logic grids) donde…

Por qué importaIlustra que el progreso de la IA en benchmarks no es uniforme: sobresale en tareas memorísticas o de patrones conocidos pero falla en razonamiento…

Impacto bajo Fiabilidad una fuente fiable MIT Technology Review

Google DeepMind lanza SL2T, modelo de traducción lengua de signos a texto

Google DeepMind ha presentado SL2T (sign-language-to-text), un modelo de traducción de lenguaje de signos a texto entrenado con más de 100.000 horas de datos…

Por qué importaRepresenta el primer despliegue a escala de consumidor de IA aplicada a lenguas de signos, eliminando una brecha tecnológica histórica entre usuarios…

Impacto alto Fiabilidad fuente primaria Google DeepMind
Modelos y avances 3 fuentes

OpenAI mejora GPT-5.6 en benchmark ARC-AGI-3 con dos configuraciones de API

OpenAI ha publicado que ajustes en dos configuraciones de su API han triplicado el rendimiento de GPT-5.6 en el benchmark ARC-AGI-3. Los cambios implican…

Por qué importaLas mejoras en benchmarks de razonamiento como ARC-AGI-3 indican progreso en capacidades fundamentales de resolución de problemas. Para empresas…

Impacto medio Fiabilidad una fuente fiable OpenAI

Google DeepMind resume los avances de 2023: Bard, PaLM 2, Gemini y mejoras en código

Google DeepMind publica un resumen de 2023 destacando el lanzamiento de Bard (febrero), PaLM 2 (mayo), Gemini (diciembre) en tres tamaños (Nano, Pro, Ultra) y…

Por qué importaDocumenta los hitos técnicos más relevantes de Google DeepMind en un año de consolidación de IA generativa, con métricas verificables sobre desempeño…

Impacto alto Fiabilidad fuente primaria Google DeepMind
Investigación 2 fuentes

Google DeepMind lanza FACTS Benchmark Suite para evaluar factualidad en LLMs

Google DeepMind y Kaggle han presentado el FACTS Benchmark Suite, un conjunto sistemático de evaluación de la factualidad en modelos de lenguaje grandes. El…

Por qué importaLa factualidad es un problema crítico en LLMs usados para entrega de información. Un benchmark sistemático y público, gestionado por una plataforma…

Impacto alto Fiabilidad confirmado por varias fuentes Google DeepMind

DeepMind presenta BYOL-Explore para exploración autónoma en entornos visuales complejos

Google DeepMind ha publicado BYOL-Explore, un método de exploración impulsado por curiosidad que entrena agentes de IA usando predicción en el espacio latente…

Por qué importaEste avance demuestra cómo la exploración autónoma puede mejorar significativamente sin ingeniería de objetivos complicada, lo que es crítico para…

Impacto medio Fiabilidad fuente primaria Google DeepMind

DeepMind publica StreamingQA: benchmark para adaptar modelos a conocimiento dinámico

Google DeepMind ha publicado StreamingQA, un nuevo benchmark a gran escala para evaluar cómo los modelos de pregunta-respuesta se adaptan a información nueva y…

Por qué importaLa capacidad de adaptar modelos de IA a conocimiento evolutivo es crítica para sistemas en producción que deben responder sobre eventos actuales sin…

Impacto medio Fiabilidad fuente primaria Google DeepMind

DeepMind presenta el Compressive Transformer, modelo de memoria a largo plazo

Google DeepMind ha publicado el Compressive Transformer, una nueva arquitectura de red neuronal diseñada para mantener memoria a largo plazo, junto con un…

Por qué importaLos modelos de lenguaje que pueden comprender y retener contexto a lo largo de documentos muy largos (libros completos) tienen aplicaciones…

Impacto medio Fiabilidad fuente primaria Google DeepMind

Google DeepMind presenta AlphaGenome, modelo de IA para predecir variantes genéticas en el 98% del genoma

Google DeepMind ha lanzado AlphaGenome, un modelo de IA que predice cómo las variantes o mutaciones en secuencias de ADN humano afectan procesos biológicos…

Por qué importaAlphaGenome acelera significativamente la capacidad científica para interpretar variantes genéticas en regiones no codificantes (el 98% del genoma)…

Impacto alto Fiabilidad fuente primaria Google DeepMind
Investigación 2 fuentes

Google DeepMind lanza FACTS Grounding, benchmark para evaluar precisión factual en LLMs

Google DeepMind e Google Research presentaron FACTS Grounding, un benchmark integral para medir la capacidad de los grandes modelos de lenguaje de fundamentar…

Por qué importaLa capacidad de los LLMs para generar respuestas precisas y fundamentadas es crítica para su adopción en aplicaciones empresariales de alto riesgo…

Impacto alto Fiabilidad confirmado por varias fuentes Google DeepMind

AlphaGeometry resuelve problemas de geometría al nivel de medallistas de las Olimpiadas Matemáticas

Google DeepMind ha presentado AlphaGeometry, un sistema de IA que resuelve problemas de geometría de nivel Olimpiada Internacional de Matemáticas (IMO) con…

Por qué importaEste resultado demuestra un avance fundamental en razonamiento matemático riguroso de la IA mediante combinación de intuición (red neuronal) y lógica…

Impacto alto Fiabilidad fuente primaria Google DeepMind
Herramientas y productos 4 fuentes

Google DeepMind lanza Gemini Robotics 1.5 con agentes IA para tareas complejas multipasos

Google DeepMind ha presentado Gemini Robotics 1.5, una familia de dos modelos especializados para robotística: Gemini Robotics-ER 1.5 (razonamiento…

Por qué importaEstos modelos representan un avance fundamental hacia robots de propósito general capaces de razonar, planificar y usar herramientas en el mundo…

Impacto muy alto Fiabilidad confirmado por varias fuentes Google DeepMind

DeepMind publica Melting Pot, benchmark para evaluación de aprendizaje multiagente

Google DeepMind ha presentado Melting Pot, una suite de evaluación para aprendizaje por refuerzo multiagente (MARL). La herramienta incluye 21 "substratos"…

Por qué importaLa evaluación sistemática de la generalización social en sistemas multiagente es crítica para desplegar tecnología autónoma segura en el mundo real…

Impacto medio Fiabilidad fuente primaria Google DeepMind

DeepMind presenta RGB-Stacking, benchmark para robots que aprenden a manipular objetos diversos

Google DeepMind ha publicado RGB-Stacking, un nuevo benchmark para la manipulación robótica basada en visión, donde un robot debe aprender a apilar objetos de…

Por qué importaDemuestra un progreso importante hacia robots más generalizables, capaces de aprender comportamientos complejos de multi-objeto más allá de tareas…

Impacto medio Fiabilidad fuente primaria Google DeepMind
Modelos y avances 2 fuentes

Google DeepMind publica RETRO: modelos de lenguaje mejorados con búsqueda en billones de tokens

Google DeepMind presenta RETRO (Retrieval Enhanced TRansfOrmers), un método que aumenta transformers con búsqueda sobre una base de datos de pasajes de texto…

Por qué importaDemuestra un camino alternativo a simplemente escalar parámetros: arquitecturas más eficientes que combinan modelos menores con recuperación masiva…

Impacto alto Fiabilidad confirmado por varias fuentes Google DeepMind

Google DeepMind aprende a identificar objetos por su sonido sin etiquetas

Google DeepMind presenta una investigación sobre aprendizaje audio-visual que permite a redes neuronales entrenar conjuntamente a partir de vídeos sin…

Por qué importaEl aprendizaje multimodal sin supervisión es una dirección clave para entrenar sistemas más eficientes: permite aprovechar el enorme volumen de…

Impacto bajo Fiabilidad fuente primaria Google DeepMind
Investigación 2 fuentes

DeepMind publica Gopher y RETRO: avances en modelos de lenguaje y seguridad

DeepMind ha publicado tres papers sobre modelos de lenguaje: uno detallado sobre Gopher, un modelo de 280 mil millones de parámetros; otro que presenta una…

Por qué importaEstos trabajos establecen un estándar importante en la evaluación responsable de LLMs grandes, documentando tanto capacidades como riesgos. La…

Impacto alto Fiabilidad confirmado por varias fuentes Google DeepMind