Zriedkavé choroby postihujú približne 300 miliónov ľudí na celom svete, ale výskum potrebný na diagnostiku a liečbu je často rozptýlený v neštrukturovaných zdrojoch. Štúdie prirodzeného priebehu chorôb sú kľúčovým zdrojom týchto informácií, ale ich manuálna extrakcia je časovo náročná a neškálovateľná. Výskumný tím vyvinul systém na automatickú extrakciu informácií pomocou troch open-source jazykových modelov (Athena-v3-AWQ, Google Gemma3-27B a Meta Llama-3.1-70B-Instruct) z abstraktov v PubMede. Všetky tri modely spracovali abstrakty s úspešnosťou vyššou ako 99 percent. Model Gemma dosiahol najlepší výkon s presnosťou 68 percent podľa odborného hodnotenia a najrýchlejším časom spustenia (približne 16 minút pre 3 547 abstraktov). Výsledky ukazujú, že lokálne nasadené open-source jazykové modely môžu efektívne extrahovať štruktúrované informácie zo štúdií v mierke, čím urýchľujú syntézu dôkazov vo výskume zriedkavých chorôb.