Výskumný tím vyvinul metódu strojového učenia pomocou Random Forest klasifikátorov na automatickú identifikáciu piatich typov rodinných vzťahov z elektronických zdravotných záznamov: matka-dieťa, otec-dieťa, súrodenci, dvojčatá a partneri. Štúdia využila dva veľké datasety z Indiany s približne 15 miliónmi jednotlivých osôb a 45 miliónmi zdravotných záznamov. Modely dosiahli vysokú presnosť od 0,92 do 1,00 a F1 skóre od 0,94 do 1,00 pre všetky typy vzťahov. Iteratívny proces zdokonaľovania modelu zahŕňal odstránenie multikolinearity a inžinierstvo vlastností na riešenie systematických chýb. Vek bol primárnym prediktorom pre vzťahy rodič-dieťa a dvojčatá, zatiaľ čo podobnosť telefónneho čísla bola najdôležitejšia pre identifikáciu súrodencov. Metodológia je pripravená na testovanie vo výskume a môže byť adaptovaná na iné zdravotnícke systémy.