Štúdia hodnotila šesť veľkých jazykových modelov (ChatGPT, DeepSeek, Gemini, Claude, Qwen a Doubao) na ich schopnosti poskytnúť presné informácie a klinické úvahy týkajúce sa myópie. ChatGPT dosiahol najvyššiu presnosť so 92,33% v štandardizovaných úlohách, 85% v prípadových klinických úlohách a 88% v externých validačných testoch. Modely vykazovali najlepší výkon pri základnom posúdení, ale ich presnosť klesala pri rozhodovaní o preferovanej liečbe. V otvorenej prípade ChatGPT, DeepSeek, Claude a Gemini dosiahli vyššie skóre od odborníkov ako mladší lekári, zatiaľ čo Doubao a Qwen mali nižší výkon. Štúdia dospela k záveru, že hoci tieto modely môžu poskytnúť užitočné informácie pre verejnosť, ich odpovede by mali slúžiť iba ako referenčný materiál a nie ako náhrada za skutočnú klinickú starostlivosť.