MediNjuzMediNjuz Návrat na zoznam správ

Stabilita výkonu napriek iteráciám: hodnotenie DeepSeek a ChatGPT na čínskych medicínskych licenčných skúškach

Zdroj: Frontiers Medicine

Originál: https://www.frontiersin.org/articles/10.3389/fmed.2026.1874194...

Publikované: 2026-06-24T00:00:00Z

Štúdia porovnávala výkon najnovších verzií veľkých jazykových modelov DeepSeek-V3.2 a ChatGPT-5.2 na čínskej národnej medicínskej licenčnej skúške (CNMLE). Na teste s 600 otázkami z roku 2024 dosiahla séria DeepSeek presnosť 91,0% a ChatGPT 89,3%, bez štatisticky významných rozdielov v porovnaní s predchádzajúcimi verziami (DeepSeek-R1 92,0% a ChatGPT-4o 87,2%). Rozdiel medzi oboma sériami sa zúžil z 4,8% na 1,7%. Na teste z roku 2025 však DeepSeek-V3.2 dosiahol výrazne vyšší výkon (94,7%) ako ChatGPT-5.2 (89,3%). Analýza chýb neukázala významné rozdiely medzi verziami modelov v klasifikácii typov chýb. Výsledky naznačujú, že iteračné aktualizácie v roku 2024 nepriniesli významné zlepšenia výkonu.