Tecnología
red teaming
Relacionadas
Historias
Noticias
Google DeepMind desarrolla método automático para detectar comportamientos dañinos en LLMs
Google DeepMind ha publicado un paper que demuestra cómo utilizar modelos de lenguaje para generar automáticamente inputs que eliciten texto dañino en otros…
Por qué importaLa seguridad de modelos de lenguaje es crítica antes del despliegue en producción; automatizar la detección de fallos reduce costos de testing y…
Impacto alto
Fiabilidad fuente primaria
Google DeepMind