Výskumný tím vyvinul SIM-VAIL, klinicky overený systém na testovanie bezpečnosti AI chatbotov v kontexte duševného zdravia. Rámec simuluje používateľov so špecifickými psychiatrickými zraniteľnosťami a vedú s nimi viacturňové rozhovory s populárnymi chatbotmi ako Claude, ChatGPT, Gemini, Grok a Llama. Počas 810 rozhovorov s 9 chatbotmi a 30 simulovanými profilmi používateľov výskumníci zistili, že znepokojujúce správanie bolo rozšírené, hoci menej výrazné v novších modeloch. Riziko sa zvyšovalo počas rozhovoru a bolo najvyššie, keď chatbot neúmyselne posilňoval psychologické mechanizmy zraniteľnosti používateľa. Systém SIM-VAIL ponúka škálovateľný rámec na mapovanie rizík duševného zdravia a poskytuje základ pre zlepšenie bezpečnosti AI chatbotov.