Štúdia porovnávala rozhodnutia troch komerčných multimodálnych jazykových modelov (GPT 5.5, Claude Sonnet 4.6, Gemini 3.1 Pro) s rozhodnutiami lekárov-rezidentov a skúsených chirurgov pri liečbe degeneratívnych ochorení lumbálnej chrbtice u 147 pacientov. Každý prípad obsahoval klinickú dokumentáciu a MRI snímky. Jazykové modely dosiahli vyššiu presnosť pri rozhodovaní o chirurgickej liečbe (66,0%-68,0%) v porovnaní s rezidentmi (54,4%), avšak nadmerne odporúčali operáciu. Pri určovaní presnej úrovne operácie boli rezidenti presnejší (71,4%) ako jazykové modely (33,3%-41,1%). Výsledky ukazujú, že komerčne dostupné jazykové modely sa približujú výkonu človeka pri základnom rozhodovaní o chirurgickej indikácii, ale zostávajú menej presné pri určovaní presnej lokalizácie operácie.