Výskum hodnotil tri komerčné multimodálne veľké jazykové modely (Claude Sonnet 4.6, Gemini 2.5 Pro, GPT-5.5) na 427 prípadoch invazívneho karcinómu prsníka pomocou histologických snímok. Cieľom bolo zistiť, či tieto modely dosahujú presnosť potrebnú na určenie liečby na základe histopatologických znakov. Claude dosiahol najvyššiu zhodu v klasifikácii histologického typu, ale najnižšiu hodnotu kappa, pričom všetky 23 lobulárne a sedem mikropapilárnych karcinómov klasifikoval ako invazívny karcinóm bez špecifického typu. Žiadny z modelov spoľahlivo neidentifikoval HER2-pozitívne ochorenie. Každý predajca zlyhával iným spôsobom: Claude a GPT-5.5 podhodnocovali, zatiaľ čo Gemini nadhodnocoval. Ani 12 variantov výziev (4 056 volaní) nezvýšilo citlivosť. Autori záveru, že žiadny z týchto modelov nie je pripravený na samostatnú klinickú aplikáciu a ich hodnota je iba pomocná pri cene 0,20-0,50 USD za prípad.