MediNjuzMediNjuz Návrat na zoznam správ

Môžu vidieť modely videnia a jazyka vitálne znaky? Benchmarking a jemné ladenie pri čítaní intraoperačných monitorov

Zdroj: medRxiv

Originál: https://www.medrxiv.org/content/10.64898/2026.06.10.26355351v1?rss=1...

Publikované: 2026-06-18

Článok sa zaoberá automatizáciou čítania vitálnych znakov z intraoperačných monitorov pomocou modelov videnia a jazyka (VLM). Výskumný tím vytvoril benchmark pozostávajúci z 200 fotografií intraoperačných monitorov s anotáciami osem vitálnych parametrov: srdcová frekvencia, SpO2, ETCO2, dychová frekvencia, systolický/diastolický/stredný krvný tlak a teplota. Testovali OCR pipeline, deväť VLM modelov a kompaktný model Qwen3.5-9B upravený pomocou LoRA fine-tuningu. Výsledky ukázali, že najlepšie komerčné modely dosiahli presnosť 0,98-0,997 bez trénovania, zatiaľ čo OCR pipeline a menšie modely skórovali približne o 0,20 nižšie. Po fine-tuningu na 80-120 obrázkoch sa presnosť Qwen3.5-9B zvýšila z 0,953 na 0,994 a kritická chybovosť sa znížila päťnásobne. Záver naznačuje, že čítanie monitorov je vyriešený problém pre VLM modely väčšie ako 9 miliárd parametrov.