Fórmula matemática para predecir fallos de alineamiento en chatbots de IA
Resumen En qué punto está
Investigadores de la Universidad George Washington, físicos de formación, publicaron en la revista Patterns un modelo matemático que predice cuándo un chatbot pasará de respuestas aceptables a potencialmente dañinas. El modelo se centra en una unidad del mecanismo de atención y acertó en 18 de 19 casos probados en siete modelos de tres empresas distintas. Según el estudio, el orden de las preguntas, no solo su contenido, puede determinar si la IA deriva hacia respuestas indeseables. La propuesta busca formalizar matemáticamente las condiciones que generan fallos de alineamiento, dado que los modelos carecen de una noción intrínseca del bien y el mal.
Resumen generado mediante IA a partir de las 2 noticias de la historia. Última actualización: hace 14 h.
Enviar esta historia por correo
Línea temporal
-
Físicos desarrollan fórmula matemática para predecir fallos de alineamiento en chatbots de IA
Investigadores de la Universidad George Washington publicaron en la revista Patterns un modelo matemático que predice cuándo un chatbot de IA pasará de dar respuestas aceptables a otras potencialmente peligrosas. La…
-
Físicos proponen una fórmula para predecir cuándo la IA da respuestas erróneas o dañinas
Un estudio firmado por dos físicos propone un marco para entender y predecir cuándo las respuestas de los modelos de IA se desvían hacia resultados problemáticos. El artículo, según El País, plantea que la IA carece de…