Štúdia porovnávala výkon dvoch aktuálnych generácií veľkých jazykových modelov (Claude Opus 5 a GPT-5.6) na 1 001 otázkach z anestéziologickej skúšky. Claude Opus 5 správne odpovedal na 947 otázok (94,6 %) a GPT-5.6 na 946 otázok (94,5 %), pričom rozdiel bol štatisticky nevýznamný. Oba modely dosiahli približne 95 % presnosť, čo ich zaraďuje do najvyššej kategórie normalizačného rámca skúšky, zodpovedajúcej približne 99. percentilu. Keď boli k dispozícii obrázky, presnosť na otázkach závislých od obrázkov bola 94,4 % pre Claude a 83,3 % pre GPT-5.6, ale bez obrázkov sa presnosť znížila na 52,8 %. Modely sa zhodli na 957 z 1 001 otázok (95,6 %). Výsledky naznačujú, že súčasné jazykové modely majú potenciál slúžiť ako dostupné vzdelávacie nástroje pre študentov anestéziológie, ak sú k dispozícii úplné zdrojové materiály.