MediNjuzMediNjuz Návrat na zoznam správ

LitBench: Benchmark na hodnotenie vyhľadávania a syntézy dôkazov z viacerých článkov v epileptológii

Zdroj: medRxiv

Originál: https://www.medrxiv.org/content/10.64898/2026.09.17.26363288v1?rss=1...

Publikované: 2026-09-23

LitBench je benchmark pozostávajúci z 1 980 open-access článkov (1 000 článkov o epilepsii obsahujúcich odpovede a 980 odvracajúcich článkov z iných oblastí) a 9 472 ľudsky overených faktov. Benchmark obsahuje 2 188 otázok vyžadujúcich informácie z jedného článku a 170 otázok vyžadujúcich informácie z dvoch článkov. Testovalo sa päť AI systémov: Gemma-4B, Gemma-12B, Sonnet-5 a DeepSeek-V4-Flash. Presnosť jednotlivých článkov sa pohybovala od 55,9 % do 91,3 % v závislosti od modelu, zatiaľ čo presnosť pri dvoch článkoch bola výrazne nižšia (5,7 % až 37,8 %). Žiadny systém nebol spoľahlivý vo všetkých testovaných aspektoch. Benchmark hodnotí štyri dimenzie: faktické údaje verzus údaje vyžadujúce interpretáciu, počet konkurenčných článkov, jednoartiklové verzus dvojartiklové dôkazy a schopnosť odmietnuť odpoveď pri absentencii dôkazov.