Klinické skúšky v Nemecku sú registrované v niekoľkých registroch, ktoré používajú rôzne klasifikačné systémy (ICD-10-GM, MeSH, MedDRA a voľný text), čo sťažuje analýzu údajov. Výskumný tím vyvinul štvorfázovú pipeline na harmonizáciu popisu zdravotných stavov do WHO ICD-10 a porovnal jej výkon s veľkým jazykovým modelom GPT-4o a ľudským kódovaním. Pipeline bola aplikovaná na 23 061 klinických skúšok a identifikovala 39 512 stavov mapovateľných na ICD. Baseline pipeline dosiahla 49,0% presnosť na úrovni troch znakov ICD-10 (kappa = 0,487), čo sa zvýšilo na 58,7% na úrovni kapitoly. GPT-4o výrazne prekonal obe varianty pipeline s 96,7% presnosťou a takmer dokonalou zhodu s expertným kódovaním (kappa = 0,966). Výsledky ukazujú, že automatizovaná harmonizácia údajov o chorobách v klinických skúškach je realizovateľná a veľké jazykové modely sú sľubným nástrojom pre klasifikáciu neštandardizovaných charakteristík skúšok.