MediNjuzMediNjuz Návrat na zoznam správ

Hodnotenie veľkých jazykových modelov v špecializovaných znalostiach o myópii a klinickej úvahe

Zdroj: Frontiers Medicine

Originál: https://www.frontiersin.org/articles/10.3389/fmed.2026.1886498...

Publikované: 2026-08-06T00:00:00Z

Štúdia hodnotila šesť veľkých jazykových modelov (ChatGPT, DeepSeek, Gemini, Claude, Qwen a Doubao) na ich schopnosti poskytnúť presné informácie a klinické úvahy týkajúce sa myópie. ChatGPT dosiahol najvyššiu presnosť so 92,33% v štandardizovaných úlohách, 85% v prípadových klinických úlohách a 88% v externých validačných testoch. Modely vykazovali najlepší výkon pri základnom posúdení, ale ich presnosť klesala pri rozhodovaní o preferovanej liečbe. V otvorenej prípade ChatGPT, DeepSeek, Claude a Gemini dosiahli vyššie skóre od odborníkov ako mladší lekári, zatiaľ čo Doubao a Qwen mali nižší výkon. Štúdia dospela k záveru, že hoci tieto modely môžu poskytnúť užitočné informácie pre verejnosť, ich odpovede by mali slúžiť iba ako referenčný materiál a nie ako náhrada za skutočnú klinickú starostlivosť.