<?xml version="1.0" encoding="utf-8"?>
<Gradivo ID="12750" NadgradivoID="0" NRID="988501" OceID="0" DomainUrl="https://dk.um.si/" IzpisPolniUrl="https://dk.um.si/IzpisGradiva.php?lang=slv&amp;id=12750" StOgledov="3450" StPrenosov="344" StOcen="0" VsotaOcen="0" DatumIzvoza="2026-09-30 22:23:40" OcenaSkupna="0" StPodgradiv="0" StudijskiProgramEvsID="" JeIndeksirano="0" JeVecAvtorjev="0" DovoliZahtevkeZaDostop="0">
  <PID Url="http://hdl.handle.net/20.500.12556/DKUM-12750">20.500.12556/DKUM-12750</PID>
  <Naslov>NADOMEŠČANJE MANJKAJOČIH VREDNOSTI S POMOČJO ROTACIJSKEGA REGRESIJSKEGA GOZDA</Naslov>
  <Podnaslov></Podnaslov>
  <TujJezik_Naslov>Missing values imputation using a rotation regression forest </TujJezik_Naslov>
  <TujJezik_Podnaslov></TujJezik_Podnaslov>
  <Opis>Manjkajoče vrednosti predstavljajo pogosto težavo, ki spremlja ustvarjanje podatkovnih baz, bodisi če se podatki zbirajo s pomočjo anket bodisi če so pridobljeni iz načrtovanih eksperimentov. Ne glede na to, koliko truda je vloženo za zagotavljanje popolne izpolnjenosti vprašalnikov ali v skrbno načrtovanje znanstvenega poskusa, se manjkajočim vrednostim pogosto ni možno izogniti. Nepopolni podatki so, odvisno od razmerja v katerem se pojavljajo manjkajoče vrednosti, lahko neustrezni za nadaljnjo analizo, medtem ko je brisanje vzorcev z manjkajočimi vrednostmi, posebno ko njihov odstotek ni dovolj majhen in ti vzorci predstavljajo pomembne informacije, lahko zelo neustrezno. Za reševanje tega problema se tako na področju statistične analize uporabljajo različne metode za nadomeščanje manjkajočih vrednosti.
Z namenom zapolnitve vrzeli, ki obstaja med obstoječimi metodami enkratnega vstavljanja manjkajočih vrednosti in modeli, ki temeljijo na večkratnem vstavljanju in pri katerih je za vsak cikel vstavljanja potrebna ločena statistična analiza, smo v okviru disertacije razvili nov postopek nadomeščanja manjkajočih vrednosti, ki temelji na ansambelskem pristopu nadzorovanega strojnega učenja. Uporabili smo ansambel, imenovan rotacijski regresijski gozd, ki predstavlja varianto rotacijskega gozda (Rotation forest), kot so ga razvili RodrÃ­guez, Kuncheva in Alonso (RodrÃ­guez, Kuncheva, &amp; Alonso, 2006), pri katerem smo namesto osnovne metode, namenjene reševanju klasifikacijskih problemov, uporabili modelno regresijsko drevo.
Našo metodo za nadomeščanje manjkajočih vrednosti smo primerjali z 9 drugimi popularnimi metodami, pri čemer smo merili natančnost metod in njihovo sposobnost ohranjanja variance po vstavljanju različnih deležev manjkajočih vrednosti. Meritve smo izvedli na 14 javno dostopnih podatkovnih množicah in eni umetno ustvarjeni množici, tako da smo obravnavali vse mehanizme nastanka manjkajočih vrednosti, kot jih je definiral Rubin (Rubin, 1976).
Na podlagi poizkusov smo ugotovili, da naša metoda v povprečju natančneje napoveduje manjkajoče vrednosti v izbranih podatkovnih množicah, ne glede na mehanizem nastanka manjkajočih vrednosti. Prav tako smo pokazali, da z uvedbo dodatne stohastične metode za ohranjanje variance naš rotacijski regresijski gozd bolje ohranja varianco od vseh preostalih metod, ki izvajajo enkratno vstavljanje, pri čemer po svoji natančnosti še vedno prekaša vse metode.
V disertaciji smo v uvodnih, teoretičnih poglavjih podrobneje opisali problematiko manjkajočih vrednosti ter obstoječe metode, ki se najpogosteje uporabljajo za njihovo nadomeščanje. Predstavili smo rotacijski regresijski gozd in stohastično metodo za ohranjanje variance. Največjo pozornost smo posvetili rezultatom poizkusov, na podlagi katerih smo v zaključku izoblikovali priporočila za uporabo rotacijskega regresijskega gozda za nadomeščanje manjkajočih vrednosti ter predstavili izhodišča za nadaljnje delo.</Opis>
  <TujJezik_Opis>Missing values represent a common problem, plaguing many databases; either based on surveys and questionnaires or designed experiments. No matter how carefully the surveys are taken, or how well the experiments are designed, missing values can occur. Incomplete data can, depending on the amount of missing values, be unsuitable for further statistical analysis, while case deletion, especially when dealing with considerable amounts of missing values, can be very inappropriate. Therefore different methods were developed which can be used to impute missing data.  
The main goal of this dissertation was to develop a new imputation method, which would narrow the gap between single-impute methods and multiple-imputation models, which require standard statistical analysis to be carried out on multiple imputed data sets. For this purpose we used an ensemble-based approach to supervised machine learning. We relied on a variation of rotation forest ensemble, developed by Rodríguez, Kuncheva and Alonso (Rodríguez, Kuncheva, &amp; Alonso, 2006) which we named “rotation regression forest”, since we used a model regression tree as a base method instead of a method used for classification purposes. 
We selected 9 other popular imputation methods for comparison with our ensemble where we measured their accuracy as well as their ability to preserve the variance structure within data when dealing with different amounts of missing values. Measurements were carried out on 14 different public access datasets and one artificial dataset to account for each of the three missingness mechanisms, as described by Rubin (Rubin, 1976).
Based on results of these tests we concluded that, on average, our method is the most accurate among the selected methods, no matter which misingness mechanism is responsible for missing values. When an additional stochastic method for preservation of variance was used, our rotation regression forest was able to preserve the variance structure within data better than any other single-impute method, while still besting them all in accuracy. 
The introductory, more theoretical chapters of this dissertation deal with supervised machine learning, missing values and commonly used imputation methods. Rotation regression forest ensemble was introduced, as well as our stochastic method for preservation of variance. The bulk of our work is focused on results, gained through empirical experiments, which were used to model our recommendations concerning the use of rotation regression forest ensemble for imputation of missing values and to form starting points for possible future work.</TujJezik_Opis>
  <KljucneBesede>
    <Beseda>strojno učenje</Beseda>
    <Beseda>rotacijski gozd</Beseda>
    <Beseda>nadomeščanje manjkajočih vrednosti</Beseda>
    <Beseda>regresijsko drevo</Beseda>
    <Beseda>ansambel regresorjev</Beseda>
  </KljucneBesede>
  <TujJezik_KljucneBesede>
    <Beseda>machine learning</Beseda>
    <Beseda>rotation forest</Beseda>
    <Beseda>missing value imputation</Beseda>
    <Beseda>regression tree</Beseda>
    <Beseda>ensemble of regressors</Beseda>
  </TujJezik_KljucneBesede>
  <Potrjeno>true</Potrjeno>
  <JeZaklenjeno>true</JeZaklenjeno>
  <JeRecenzirano>false</JeRecenzirano>
  <Zaloznik>[M. Palfy]</Zaloznik>
  <Izvor></Izvor>
  <Jezik ID="1060" ISO639-3="slv">Slovenski jezik</Jezik>
  <TujJezik ID="1033" ISO639-3="eng">Angleški jezik</TujJezik>
  <Povezave></Povezave>
  <Pokrivanje></Pokrivanje>
  <CasovnoPokritje></CasovnoPokritje>
  <AvtorskePravice></AvtorskePravice>
  <VrstaGradiva ID="m" DRIVER="info:eu-repo/semantics/doctoralThesis">Doktorska disertacija</VrstaGradiva>
  <DatumVstavljanja>2009-12-18 17:11:24</DatumVstavljanja>
  <DatumObjave>2009-12-21 13:01:06</DatumObjave>
  <DatumSpremembe>2022-04-12 07:46:10</DatumSpremembe>
  <DatumTrajnegaHranjenja>2022-04-20 03:13:59</DatumTrajnegaHranjenja>
  <LetoIzida>2009</LetoIzida>
  <LetoIzidaDo>0</LetoIzidaDo>
  <KrajIzida>Maribor</KrajIzida>
  <LetoIzvedbe>0</LetoIzvedbe>
  <KrajIzvedbe></KrajIzvedbe>
  <Opomba></Opomba>
  <StStrani></StStrani>
  <StevilcenjeNivo1></StevilcenjeNivo1>
  <StevilcenjeNivo2></StevilcenjeNivo2>
  <Kronologija></Kronologija>
  <Patent_Stevilka></Patent_Stevilka>
  <Patent_DatumVeljavnosti>0000-00-00</Patent_DatumVeljavnosti>
  <VerzijaDokumenta>NiDoloceno</VerzijaDokumenta>
  <StatusObjaveDrugje>NiDoloceno</StatusObjaveDrugje>
  <VrstaStroskaObjave>NiDoloceno</VrstaStroskaObjave>
  <DatumPoslanoVRecenzijo>0000-00-00</DatumPoslanoVRecenzijo>
  <DatumSprejetjaClanka>0000-00-00</DatumSprejetjaClanka>
  <DatumObjaveClanka>0000-00-00</DatumObjaveClanka>
  <EmbargoDo></EmbargoDo>
  <VrstaEmbarga ID="1" Naziv="Takojšnja javna objava" OpenAIREDostop="openAccess"></VrstaEmbarga>
  <Osebe>
    <Oseba ID="2306" Ime="Miroslav" Priimek="Palfy" AltIme="M Palfy; M. Palfy; Miro Palfy" VlogaID="70" VlogaNaziv="Avtor" ConorID="21039971" Afiliacija="" ArrsID="26526" ORCID=""></Oseba>
    <Oseba ID="965" Ime="Peter" Priimek="Kokol" AltIme="P. Kokol; P. Kokolj; P Kokol; K. Peter" VlogaID="991" VlogaNaziv="Mentor" ConorID="2135907" Afiliacija="" ArrsID="03782" ORCID=""></Oseba>
    <Oseba ID="1030" Ime="Milan" Priimek="Zorman" AltIme="M. Zorman" VlogaID="994" VlogaNaziv="Komentor" ConorID="4547683" Afiliacija="" ArrsID="17876" ORCID=""></Oseba>
  </Osebe>
  <Identifikatorji>
    <Identifikator ID="4" Sifra="UDK" Naziv="UDK" URL="">004.89:004.9(043.3)</Identifikator>
    <Identifikator ID="3" Sifra="CobissID" Naziv="COBISS_ID" URL="https://plus.cobiss.net/cobiss/si/sl/bib/13737238">13737238</Identifikator>
    <Identifikator ID="18" Sifra="URN-NUK" Naziv="NUK URN" URL="">URN:SI:UM:DK:W7KUO4I8</Identifikator>
  </Identifikatorji>
  <Relacije>
  </Relacije>
  <VerzijeGradiva>
  </VerzijeGradiva>
  <Datoteke>
    <Datoteka ID="12468" DatotekaNRID="839440" NamenDatotekeID="2" NamenDatoteke="Predstavitvena datoteka" FormatDatotekeID="2" FormatDatoteke=".pdf" MIME="application/pdf" IkonaFormata="pdf.gif" IkonaFormataPolniUrl="https://dk.um.si/teme/dkumDev2/img/fileTypes/pdf.gif" VelikostDatoteke="5898588" VelikostDatotekeKratko="5,63 MB" DatumVstavljanja="2009-12-22 12:03:28" JeZbrisana="false" JeJavnoVidna="true" JeIndeksirana="true" JeVidno="true" VidnoOd="01.01.1970" Zaporedje="0">
      <Naziv>DR_Palfy_Miroslav_2009.pdf</Naziv>
      <OrgNaziv>DR_Palfy_Miroslav_2009.pdf</OrgNaziv>
      <URL></URL>
      <Opis></Opis>
      <OpisTujJezik></OpisTujJezik>
      <UrlObdelave></UrlObdelave>
      <FrekvencaAzuriranjaID>1</FrekvencaAzuriranjaID>
      <Verzija></Verzija>
      <MD5>20A3BDA8D38A37AC77F873348F19D2A8</MD5>
      <SHA256>609ec8700820c7c53a165e47350f2eecf43521842a0be9010663a5411548c3bb</SHA256>
      <UUID>bd7d1b6f-7c03-11eb-bb7a-00155d0001ca</UUID>
      <PID>20.500.12556/dkum/a9109e16-6935-4770-bc9b-3e099cd14940</PID>
      <PrenosPolniUrl>https://dk.um.si/Dokument.php?lang=slv&amp;id=12468</PrenosPolniUrl>
      <Vsebine>
        <Vsebina TipVsebine="GoloBesedilo" JezikID="1060" Oznaka="" Dolzina="342600"></Vsebina>
      </Vsebine>
    </Datoteka>
  </Datoteke>
  <Organizacije>
    <Organizacija OrganizacijaID="3" Kratica="FERI" ZavodEvsID="0000080" Logo="FERI_logo.gif" LogoPolniUrl="https://dk.um.si/teme/dkumDev2/img/logo/FERI_logo.gif">Fakulteta za elektrotehniko, računalništvo in informatiko</Organizacija>
  </Organizacije>
  <OrganizacijeVira>
  </OrganizacijeVira>
  <MetodeZbiranjaPodatkov>
  </MetodeZbiranjaPodatkov>
  <TipologijaDela ID="0" Koda="0" Naziv="Ni določena" SchemaOrg="CreativeWork"></TipologijaDela>
  <Ostalo>
    <StIrodsDatotek>0</StIrodsDatotek>
    <StDatotekPodTrajnimEmbargom>0</StDatotekPodTrajnimEmbargom>
    <StDatotekZOmejenimDostopom>0</StDatotekZOmejenimDostopom>
  </Ostalo>
</Gradivo>
