Poruchy reči predstavujú výzvu pri diagnostike kvôli zložitým akustickým charakteristikám v signáloch reči. Štúdia navrhuje nový systém na detekciu patologických porúch reči, ktorý spracováva surové zvukové signály a rozlišuje medzi poruchou reči a zdravou rečou. Metóda kombinuje jednorozmerné konvolučné neurónové siete s transformátorom a mechanizmom sebaúvahy. Model dosahuje presnosť 97,50% na dvoch referenčných súboroch údajov (SVD a PD) a 95,80% na súbore VOICED, pričom má ľahký dizajn s 5,2 milióna parametrov. Systém umožňuje vizualizáciu a interpretáciu rozhodnutí modelu, čo pomáha klinikom a logopédom identifikovať diagnosticky významné časové intervaly. Výsledky boli overené štatistickou analýzou a testované na viacerých nezávislých súboroch údajov.