Štúdia porovnávala výkon najnovších verzií veľkých jazykových modelov DeepSeek-V3.2 a ChatGPT-5.2 na čínskej národnej medicínskej licenčnej skúške (CNMLE). Na teste s 600 otázkami z roku 2024 dosiahla séria DeepSeek presnosť 91,0% a ChatGPT 89,3%, bez štatisticky významných rozdielov v porovnaní s predchádzajúcimi verziami (DeepSeek-R1 92,0% a ChatGPT-4o 87,2%). Rozdiel medzi oboma sériami sa zúžil z 4,8% na 1,7%. Na teste z roku 2025 však DeepSeek-V3.2 dosiahol výrazne vyšší výkon (94,7%) ako ChatGPT-5.2 (89,3%). Analýza chýb neukázala významné rozdiely medzi verziami modelov v klasifikácii typov chýb. Výsledky naznačujú, že iteračné aktualizácie v roku 2024 nepriniesli významné zlepšenia výkonu.