Štúdia publikovaná v časopise Nature Medicine porovnávala výkonnosť všeobecných chatbotov s špecializovanými klinickými nástrojmi umelej inteligencie. Výskum zahŕňal testovanie na dvoch verejných benchmarkoch a na skutočných otázkach od lekárov. Výsledky ukázali, že tri všeobecné frontierové veľké jazykové modely prekonali dva vedúce klinické AI nástroje. Špecializované klinické AI nástroje dosahovali podobný výkon ako vyhľadávací AI prehľad od Googlu. Štúdia poukazuje na problém, že špecializované klinické AI nástroje vstupujú do lekárskej praxe bez dostatočného nezávislého testovania. Výskum bol publikovaný online 17. júna 2026.