MediNjuzMediNjuz Návrat na zoznam správ

Pozoroval, ale nevidel: neúmyselná slepota a áno-predpätie konfabulácia vo videojazykových modeloch

Zdroj: medRxiv

Originál: https://www.medrxiv.org/content/10.64898/2026.06.16.26355792v1?rss=1...

Publikované: 2026-06-18

Štúdia skúmala, či videojazykové modely (VLM) vykazujú podobný jav ako ľudia – neúmyselnú slepotu voči objektom, ktoré sa nachádzajú v zornom poli. Výskumníci testovali modely s úlohou nájsť gorilu v obrazoch a videách CT snímkov pľúc. Zistili, že VLM sú schopné gorilu identifikovať, avšak vykazujú neúmyselnú slepotu, ktorá sa líši podľa typu modelu a typu stimulu. Model Gemini-3.1-Pro dosahoval lepšie výsledky ako väčšina ostatných modelov. V segmentačnom experimente sa ukázalo, že špecializovaný medicínsky model BiomedParse nesprávne označil gorilu na 82% snímkov v kontrolných videách bez gorily. Výskum poukazuje na to, že tvrdenia o tom, či model videl konkrétny objekt, vyžadujú analýzu s kontrolnými skupinami na vylúčenie falošných pozitív.