Štúdia predstavuje novú dvojstupňovú architektúru hlbokého učenia na analýzu CT snímkov obličiek. V prvej fáze sa používa DINO framework s DeiT-Tiny transformátorom na učenie sa užitočných vlastností z CT snímkov bez označených údajov. V druhej fáze sa predtrénovaný model doladí na klasifikáciu abnormalít obličiek. Na zabezpečenie transparentnosti modelu sa aplikujú dve techniky vysvetľovateľnej AI: Grad-CAM++ na zvýraznenie dôležitých oblastí a analýza mechanizmu multi-head self-attention. Navrhovaný framework dosiahol testovaciu presnosť 99,16%, AUC-ROC 99,99%, F1 skóre 98,97%, presnosť 98,90% a citlivosť 99,05%. Externá validácia na irackom CT datasete potvrdila presnosť 97,03%, čo podporuje všeobecnú použiteľnosť systému.