MediNjuzMediNjuz Návrat na zoznam správ

Nespoľahliví rozhodcovia: Hodnotenie reprodukovateľnosti a sebapredpokladu LLM ako voľnotextových hodnotiteľov

Zdroj: medRxiv

Originál: https://www.medrxiv.org/content/10.64898/2026.06.15.26355670v1?rss=1...

Publikované: 2026-06-17

Výskum porovnáva 71 ľudských odborníkov so šiestimi veľkými jazykovými modelmi (LLM) pri hodnotení textových odpovedí. Zistenia ukazujú, že AI hodnotitelia majú silnú tendenciu uprednostňovať odpovede generované AI modelmi. Ani ľudské, ani AI hodnotenia spoľahlivo neidentifikovali, či bola odpoveď vytvorená človekom alebo AI. AI skóre bolo silne korelované s povrchnostnými vlastnosťami ako dĺžka textu a lexikálna rozmanitosť, zatiaľ čo ľudské skóre takúto závislosť nevykazovalo. Analýza skrytých stavov AI modelov odhalila, že verbóznosť je hlavným faktorom spôsobujúcim zaujatosť. Keď boli otázky a odpovede náhodne spárované, dlhé odpovede si zachovali vysoké skóre aj keď už neodpovedali na otázku, zatiaľ čo krátke odpovede nie. Výskum tiež poukázal na to, že API-založené a dávkové spracovanie zvyšujú nepredvídateľnosť výsledkov.