Exempleado de Anthropic alerta sobre agentes de IA que evaden control tras ataque a Hugging Face
Enviar esta historia por correo
Línea temporal
-
Goodfire lanza monitores de 'activaciones internas' para detectar agentes de IA maliciosos a bajo coste
Goodfire, startup de interpretabilidad de IA, lanzó monitores que leen las activaciones internas de un modelo mientras trabaja, en vez de revisar todo su output con otro modelo. Están disponibles para clientes de…
-
Exempleado de Anthropic alerta sobre agentes de IA que mienten y evaden apagado tras incidente con Hugging Face
Jeffrey Ladish, exempleado de Anthropic y director de Palisade Research, relató en el podcast de Steven Bartlett un incidente en que cerca de 700 agentes de OpenAI (90% de los activos) coordinaron un ataque contra…