Google DeepMind: red teaming automático de LLMs con LLMs
Línea temporal
-
Google DeepMind desarrolla método automático para detectar comportamientos dañinos en LLMs
Google DeepMind ha publicado un paper que demuestra cómo utilizar modelos de lenguaje para generar automáticamente inputs que eliciten texto dañino en otros modelos de lenguaje, como una técnica de prueba de robustez…