Štúdia skúmala, či videojazykové modely (VLM) vykazujú podobný jav ako ľudia – neúmyselnú slepotu voči objektom, ktoré sa nachádzajú v zornom poli. Výskumníci testovali modely s úlohou nájsť gorilu v obrazoch a videách CT snímkov pľúc. Zistili, že VLM sú schopné gorilu identifikovať, avšak vykazujú neúmyselnú slepotu, ktorá sa líši podľa typu modelu a typu stimulu. Model Gemini-3.1-Pro dosahoval lepšie výsledky ako väčšina ostatných modelov. V segmentačnom experimente sa ukázalo, že špecializovaný medicínsky model BiomedParse nesprávne označil gorilu na 82% snímkov v kontrolných videách bez gorily. Výskum poukazuje na to, že tvrdenia o tom, či model videl konkrétny objekt, vyžadujú analýzu s kontrolnými skupinami na vylúčenie falošných pozitív.