Výskumný tím vytvoril špecializovaný benchmark dataset obsahujúci 295 oftalmologických prípadov s potvrdenou diagnózou na testovanie schopností multimodálnych veľkých jazykových modelov (MLLM) v oftalmológii. Vyhodnotili deväť vedúcich MLLM modelov, vrátane open-source a proprietárnych verzií. Modely ako HAIBU-ReMUD a ChatGPT-4o dosiahli porovnateľne silnú diagnostickú presnosť a konzistentnosť, pričom ich výkon v niektorých prípadoch sa približoval výkonu ľudských odborníkov. Výsledky naznačujú, že súčasné MLLM modely vykazujú sľubný potenciál pre klinické aplikácie v oftalmológii. Štúdia poskytuje základ pre ďalšie skúmanie integrácie týchto modelov do oftalmologickej praxe.