Desalineación emergente en LLMs ajustados: riesgo de propagación a dominios no relacionados
Enviar esta historia por correo
Línea temporal
-
Investigación: el ajuste fino de LLMs puede provocar desalineación inesperada en otros dominios
Científicos independientes liderados por Jan Betley de Truthful AI publicaron en Nature una investigación que demuestra que cuando se ajusta un modelo basado en GPT-4o para escribir código con vulnerabilidades de…