Una sola respuesta de la IA puede cambiar el rumbo de una conversación con un usuario psicológicamente vulnerable
Los resultados mostraron que los comportamientos potencialmente preocupantes estaban ampliamente presentes en los chatbots analizados
Un equipo de investigadores británicos ha desarrollado un modelo para poner a prueba la inteligencia artificial cuando mantiene conversaciones con personas vulnerables. Los expertos han realizado pruebas de estrés para analizar cómo responden los chatbots de IA a usuarios en situaciones de vulnerabilidad, lo que permite identificar debilidades en estos sistemas y ensayar nuevas formas de hacer más seguras las interacciones relacionadas con la salud mental.
Publicado en Nature Medicine, el estudio presenta SIM-VAIL, un marco de trabajo validado clínicamente para auditar chatbots de inteligencia artificial en conversaciones sobre salud mental. El trabajo es fruto de la colaboración entre investigadores de la Universidad de Oxford, el University College London (UCL) y el Instituto de Seguridad de IA del Reino Unido.
SIM-VAIL es capaz de simular las preguntas que, de forma virtual, podrían plantear usuarios con vulnerabilidades psicológicas específicas, como depresión, manía, psicosis, trastorno obsesivo-compulsivo o apego inseguro, y con una amplia variedad de intenciones. Entre ellas, intentar que el chatbot les dé la razón, minimice sus dificultades o respalde conductas de riesgo. A continuación, el sistema involucra a los chatbots en conversaciones de varios turnos y califica cada intercambio a partir de dimensiones de riesgo clínicamente fundamentadas.
ChatGPT, Gemini y otros
Los investigadores utilizaron este esquema para analizar un total de 810 conversaciones con nueve modelos de IA, entre ellos Claude, ChatGPT, Gemini, Grok y Llama. El estudio abarcó 30 perfiles de usuarios simulados y más de 90.000 evaluaciones clínicas.
Los resultados mostraron que los comportamientos potencialmente preocupantes estaban ampliamente presentes en los chatbots analizados, aunque se redujeron de forma significativa en los modelos más recientes. La seguridad dependía, en gran medida, del contexto psicológico del usuario y de la forma en que se desarrollaba la conversación.
Una espiral peligrosa que se puede controlar
Los riesgos surgían a menudo de manera gradual. Respuestas aparentemente orientadas a apoyar a la persona podían acabar reforzando, sin darse cuenta, los procesos psicológicos que se encontraban detrás de su vulnerabilidad. Los investigadores denominaron a este patrón «Bucle de Interacción Amplificador de Vulnerabilidad» o VAIL, por sus siglas en inglés.
El estudio también identificó una posible vía de mejora: sustituir una única respuesta preocupante en las primeras fases de una interacción condujo a conversaciones posteriores más seguras. Esto sugiere que intervenir en los momentos iniciales de escalada podría mejorar el desarrollo de toda la conversación.
Las evaluaciones automatizadas realizadas mediante SIM-VAIL mostraron un elevado grado de coincidencia con las efectuadas por los médicos que analizaron las conversaciones con la IA, por lo que los investigadores consideran que podría convertirse en una herramienta útil para realizar este tipo de auditorías a gran escala.
El autor principal del trabajo, Matthew Nour, investigador clínico sénior de la Universidad de Oxford, ha explicado que desarrollaron SIM-VAIL para cubrir «una brecha» en la forma en que actualmente se evalúan los riesgos relacionados con la salud mental en los chatbots.
Según ha señalado, muchos de los sistemas de evaluación existentes analizan cómo responde un chatbot a un único mensaje, cuando algunos de los riesgos más importantes pueden aparecer gradualmente a lo largo de una conversación. «SIM-VAIL nos permite examinar estas trayectorias de múltiples turnos de manera sistemática y a escala, y proporciona una base para mejoras de seguridad específicas y sensibles al contexto», ha explicado.
En lugar de clasificar simplemente a un chatbot como «seguro» o «inseguro» en el ámbito de la salud mental, SIM-VAIL permite identificar debilidades concretas y comprobar si las nuevas medidas de seguridad son suficientes para corregirlas.
Además, los investigadores han lanzado SIM-VAIL Explorer, una herramienta que permite a investigadores, desarrolladores de inteligencia artificial y al público examinar las conversaciones analizadas, seguir la evolución de los riesgos turno a turno y comparar los resultados entre distintos modelos, vulnerabilidades psicológicas y objetivos conversacionales.
Lo último en OkSalud
-
El postre de la abuela era más saludable que los modernos: los dietistas señalan el factor clave que influye directamente en la salud
-
Dra. María Vitale: «Hay que estar en alerta, el 60% de la radiación solar se recibe fuera de los meses de verano»
-
Dejar el alcohol también cambia el cerebro: así es la pista que puede explicar algunas recaídas
-
El primer entrenamiento del bebé empieza en el embarazo: sus beneficios llegan hasta el año
-
La enfermedad que sacude a los jóvenes españoles: el 70% la padece frente al 36% de las personas mayores
Últimas noticias
-
El 10 de julio de 1946 los nazis enviaron un mensaje encriptado a través de la máquina Enigma: 85 años después, ChatGPT lo ha descifrado en solo 48 horas
-
Predicción del horóscopo para Sagitario hoy, domingo 11 de octubre de 2026
-
Un ataque de los hutíes deja 12 muertos y más de 300 heridos en el aeropuerto de Riad
-
Así sonó el himno de España en Mandalika en honor al campeón Máximo Quiles
-
Europa lanza una advertencia ante un posible invierno complicado y plantea apagar parte del alumbrado público durante la noche para ahorrar energía