REPOZITORIJ > REZULTATI

Doktorska disertacija

Rangiranje značilk za napovedovanje strukturiranih vrednosti

Avtor(ji): Matej Petković (Avtor), Sašo Džeroski (Mentor), Dragi Kocev (Somentor)

Datum zagovora: 16.10.2020

Organizacija: MPŠ - Mednarodna podiplomska šola Jožefa Stefana

PID: 20.500.12556/ReVIS-14228

Ogledi: 77 | Prenosi: 67

Povzetek

V disertaciji razvijemo metode za rangiranje značilk, namenjene različnim učnim scenarijem.
S tem premostimo razkorak med vse kompleksnejšimi podatki in mankom metod za
rangiranje značilk, ki bi pojasnile modele, naučene na takih podatkih. Razvite metode naslavljajo
kompleksne naloge strojnega učenja s področja nadzorovanega, polnadzorovanega
in nenadzorovanega učenja: večtarčno regresijo, večoznačno klasifikacijo in hierarhično večoznačno
klasifikacijo. Metode za rangiranje značilk razširimo tudi na področje relacijskega
učenja, kjer je predstavitev podatkov še bogatejša in kompleksnejša. V vseh naštetih učnih
scenarijih je rangiranje značilk, dobljeno z razvitimi metodami, med najboljšimi v primerjavi
z drugimi sodobnimi metodami, kar pokažemo z obsežnimi empiričnimi študijami.
Razvite metode za rangiranja značilk obvladujejo različne učne scenarije elegantno in
poenoteno. Razvijemo dve skupini metod. V prvi, ki vsebuje metode, temelječe na ansamblih
dreves, so kazalci imen Symbolic, Genie3 in Naključni gozd. Te kazalce izračunamo
iz različnih ansamblov dreves za napovedno razvrščanje (DNR-jev): naključnih gozdov,
vrečenja in ansamblov skrajno naključnih DNR-jev. V drugi skupini so metode, temelječe
na računanju razdalj, ki sledijo pristopu algoritma Relief za rangiranje značilk.
V disertaciji najprej predstavimo potrebno ozadje in podamo zamisli, ki pripeljejo do
razvitih metod za rangiranje značilk. Temu sledi predstavitev obsežnih empiričnih študij,
ki ovrednotijo razvite metode v vseh učnih scenarijih. Iz teh študij sledi, da predlagane
metode za rangiranje značilk proizvedejo smiselna rangiranja in nadvladajo obstoječe metode.
Rangiranja, izračunana iz ansamblov DNR-jev, so boljša kot rangiranja, ki temeljijo
na računanju razdalj, še posebej pri podatkovjih z visokim številom značilk. Obe skupini
metod sta primerni tudi za velika podatkovja, saj nista niti kvadratni, kar se tiče števila
značilk, hkrati pa je njune člane tudi lahko paralelizirati.
V disertaciji pokažemo tudi, da so razviti algoritmi za rangiranje značilk v kontekstu
večtarčne regresije uporabni tudi v praksi, saj z njimi pojasnimo modele za napovedovanje
toplotne energije na satelitu Mars Express Evropske vesoljske agencije. Disertacijo zaključimo
z izčrpno debato o doprinosih disertacije ter začrtanimi smernicami za nadaljnje delo.

Priloge

Citiraj to delo