Článok sa zaoberá automatizáciou čítania vitálnych znakov z intraoperačných monitorov pomocou modelov videnia a jazyka (VLM). Výskumný tím vytvoril benchmark pozostávajúci z 200 fotografií intraoperačných monitorov s anotáciami osem vitálnych parametrov: srdcová frekvencia, SpO2, ETCO2, dychová frekvencia, systolický/diastolický/stredný krvný tlak a teplota. Testovali OCR pipeline, deväť VLM modelov a kompaktný model Qwen3.5-9B upravený pomocou LoRA fine-tuningu. Výsledky ukázali, že najlepšie komerčné modely dosiahli presnosť 0,98-0,997 bez trénovania, zatiaľ čo OCR pipeline a menšie modely skórovali približne o 0,20 nižšie. Po fine-tuningu na 80-120 obrázkoch sa presnosť Qwen3.5-9B zvýšila z 0,953 na 0,994 a kritická chybovosť sa znížila päťnásobne. Záver naznačuje, že čítanie monitorov je vyriešený problém pre VLM modely väčšie ako 9 miliárd parametrov.