Ir al contenido
IA para hoy

Tecnología

benchmark

Relacionadas

Google DeepMind ×3multimodal ×2LLM ×1aprendizaje por refuerzo ×1vision ×1multiagente ×1Kaggle ×1

Historias

Noticias

Investigación 2 fuentes

Google DeepMind lanza FACTS Benchmark Suite para evaluar factualidad en LLMs

Google DeepMind y Kaggle han presentado el FACTS Benchmark Suite, un conjunto sistemático de evaluación de la factualidad en modelos de lenguaje grandes. El…

Por qué importaLa factualidad es un problema crítico en LLMs usados para entrega de información. Un benchmark sistemático y público, gestionado por una plataforma…

Impacto alto Fiabilidad confirmado por varias fuentes Google DeepMind

DeepMind publica Melting Pot, benchmark para evaluación de aprendizaje multiagente

Google DeepMind ha presentado Melting Pot, una suite de evaluación para aprendizaje por refuerzo multiagente (MARL). La herramienta incluye 21 "substratos"…

Por qué importaLa evaluación sistemática de la generalización social en sistemas multiagente es crítica para desplegar tecnología autónoma segura en el mundo real…

Impacto medio Fiabilidad fuente primaria Google DeepMind