<?xml version="1.0" encoding="utf-8"?>
<Gradivo ID="94160" NadgradivoID="0" NRID="26956966" OceID="0" DomainUrl="https://dk.um.si/" IzpisPolniUrl="https://dk.um.si/IzpisGradiva.php?lang=slv&amp;id=94160" StOgledov="165" StPrenosov="111" StOcen="0" VsotaOcen="0" DatumIzvoza="2026-10-01 18:09:03" OcenaSkupna="0" StPodgradiv="0" StudijskiProgramEvsID="" JeIndeksirano="0" JeVecAvtorjev="0" DovoliZahtevkeZaDostop="0">
  <PID Url="http://hdl.handle.net/20.500.12556/DKUM-94160">20.500.12556/DKUM-94160</PID>
  <Naslov>Metoda hierarhične večznačne klasifikacije na osnovi ekstrakcije značilnic s tekstovno analizo mikrobiotskih podatkov</Naslov>
  <Podnaslov>doktorska disertacija</Podnaslov>
  <TujJezik_Naslov>Hierarchical multilabel classification method with feature extraction based on textual analysis of microbial data</TujJezik_Naslov>
  <TujJezik_Podnaslov></TujJezik_Podnaslov>
  <Opis>Zanesljiva identifikacija kompleksnih vsebinskih struktur v primerih, kjer posamezni primerki podatkovnega nabora niso homogeni, pač pa združujejo informacije več virov, predstavlja enega izmed ključnih metodoloških izzivov sodobne podatkovne analitike. Relativno enostavna je namreč naloga, kjer je določen primerek homogen in ga z uporabo večrazredne klasifikacije znamo relativno preprosto razvrstiti v enega izmed ponujenih razredov. Kompleksnost pa se drastično poveča, ko se v istem primerku skriva več virov. V tem primeru osnovne metode analize ne zadostujejo več in potrebujemo naprednejše pristope, ki so sposobni razbrati soobstoj več razredov oziroma oznak, kar je tudi domena večznačne klasifikacije. V predloženi doktorski disertaciji obravnavamo omenjeni problem na področju metagenomike, ki med drugim omogoča raziskovanje mikrobiote, raznolike skupnosti bakterij in drugih mikroorganizmov v določenem okolju. Z naprednimi tehnikami sekvenciranja iz njih pridobimo zaporedja DNK celotne mikrobne združbe, ki jih lahko opišemo kot izjemno dolga besedila, zapisana z abecedo štirih nukleotidov: A, T, G in C. Naš cilj je v teh besedilih poiskati t. i. označevalne gene, ki so izključno ali močno povezani z gostiteljem. V ta namen smo na podlagi optimizacijskih pristopov in domenskih pravil predlagali metodo ekstrakcije značilnic, temelječo na osnovi k-merov, tj. krajših delov DNK. Pristop na osnovi k-merov se je izkazal za zelo učinkovitega, zato smo ga uporabili tudi pri sintetičnem generiranju vzorcev mikrobnih oziroma mikrobiotskih podatkov. Metoda temelji na pripravi profilov k-merov in na nanje osnovanih grafih prehodov. Ker smo v doktorski disertaciji analizirali lokacijsko specifične vzorce, smo morali njihov manjši nabor čistih vzorcev ustrezno razširiti. Še več, sintetično smo razširili tudi nabor mešanih vzorcev, kar predstavlja še večji izziv v realnih okoljih. Obe predlagani metodi sta se združili v konceptualno najzahtevnejšem delu doktorske naloge, predlagani metodi hierarhične večznačne klasifikacije na osnovi ekstrakcije značilnic, imenovani MLB. Z njo smo na osnovi vhodnih podatkov, tj. čistih ali sintetično ustvarjenih vzorcev, napovedovali deleže gostiteljev v mešanih mikrobnih vzorcih. Rezultate metode MLB smo primerjali s tistimi, pridobljenimi z orodjem SourceTracker, vodilnim orodjem za natančno identifikacijo in kvantifikacijo gostiteljev mikrobov v mešanih vzorcih. Metodi smo ovrednotili z uveljavljenimi metrikami na področju večznačne klasifikacije, ki razkrivajo, da metoda MLB učinkovito rešuje problem določitve gostiteljev in njihovih deležev ter poda primerljive, večinoma pa boljše rezultate kot orodje SourceTracker.</Opis>
  <TujJezik_Opis>Reliable identification of complex content structures in cases where individual dataset instances are not homogeneous, but consist of information from multiple sources, represents one of the key methodological challenges in modern data analytics. The task is relatively straightforward when an instance is homogeneous, and can be easily classified into one of the available classes using multiclass classification. However, the complexity increases drastically when multiple sources are present within the same instance. In such cases, basic analytical methods are no longer sufficient, and advanced approaches capable of determining the coexistence of multiple classes or labels are required, which is the domain of multilabel classification. In the presented doctoral dissertation, we address this challenge within the field of metagenomics, which enables the exploration of the microbiome, a diverse community of bacteria and other microorganisms in a given environment. Using advanced sequencing techniques, we obtain DNA sequences of the entire microbial community, which can be described as extremely long texts written with the alphabet of four nucleotides: A, T, G, and C. Our goal is to identify so-called marker genes in these texts that are exclusively or strongly associated with a specific host. Hence, we proposed a feature extraction method based on optimization approaches and domain rules, relying on k-mers, i.e., shorter segments of DNA. The k-mer-based approach proved to be very effective, and we therefore applied it to the synthetic generation of microbial data samples. The method relies on creating k-mer profiles and corresponding transition graphs. Since we analyzed location-specific samples, we needed to expand their smaller set of pure samples accordingly. Furthermore, we synthetically expanded the set of mixed samples, which poses an even greater challenge in real-world settings. Both proposed methods were combined in the conceptually most demanding part of the dissertation: a proposed hierarchical multilabel classification method with feature extraction, named MLB. This method predicts the proportions of hosts in mixed microbial samples based on input data, i.e., pure or synthetically generated samples. The results of the MLB method were compared with those obtained by the SourceTracker, a leading tool for predicting and quantifying microbial hosts in mixed samples. Both methods were evaluated using established metrics, revealing that the MLB method effectively addresses the problem of identifying hosts and their proportions, delivering comparable, and in most cases, superior results to SourceTracker.</TujJezik_Opis>
  <KljucneBesede>
    <Beseda>strojno učenje</Beseda>
    <Beseda>večznačna klasifikacija</Beseda>
    <Beseda>ekstrakcija značilnic</Beseda>
    <Beseda>obdelava naravnega jezika</Beseda>
    <Beseda>mikrobiotski podatki</Beseda>
  </KljucneBesede>
  <TujJezik_KljucneBesede>
    <Beseda>Machine Learning</Beseda>
    <Beseda>Multilabel Classification</Beseda>
    <Beseda>Feature Extraction</Beseda>
    <Beseda>Natural Language Processing</Beseda>
    <Beseda>Microbial data</Beseda>
  </TujJezik_KljucneBesede>
  <Potrjeno>true</Potrjeno>
  <JeZaklenjeno>true</JeZaklenjeno>
  <JeRecenzirano>false</JeRecenzirano>
  <Zaloznik>[L. Brezočnik]</Zaloznik>
  <Izvor></Izvor>
  <Jezik ID="1060" ISO639-3="slv">Slovenski jezik</Jezik>
  <TujJezik ID="1033" ISO639-3="eng">Angleški jezik</TujJezik>
  <Povezave></Povezave>
  <Pokrivanje></Pokrivanje>
  <CasovnoPokritje></CasovnoPokritje>
  <AvtorskePravice></AvtorskePravice>
  <VrstaGradiva ID="mb31" DRIVER="info:eu-repo/semantics/doctoralThesis">Doktorsko delo/naloga</VrstaGradiva>
  <DatumVstavljanja>2025-08-06 07:28:53</DatumVstavljanja>
  <DatumObjave>2025-10-20 13:07:19</DatumObjave>
  <DatumSpremembe>2025-10-22 03:08:22</DatumSpremembe>
  <DatumTrajnegaHranjenja>0000-00-00 00:00:00</DatumTrajnegaHranjenja>
  <LetoIzida>2025</LetoIzida>
  <LetoIzidaDo>0</LetoIzidaDo>
  <KrajIzida>Maribor</KrajIzida>
  <LetoIzvedbe>0</LetoIzvedbe>
  <KrajIzvedbe>Maribor</KrajIzvedbe>
  <Opomba></Opomba>
  <StStrani>XV, 157 str.</StStrani>
  <StevilcenjeNivo1></StevilcenjeNivo1>
  <StevilcenjeNivo2></StevilcenjeNivo2>
  <Kronologija></Kronologija>
  <Patent_Stevilka></Patent_Stevilka>
  <Patent_DatumVeljavnosti>0000-00-00</Patent_DatumVeljavnosti>
  <VerzijaDokumenta>NiDoloceno</VerzijaDokumenta>
  <StatusObjaveDrugje>NiDoloceno</StatusObjaveDrugje>
  <VrstaStroskaObjave>NiDoloceno</VrstaStroskaObjave>
  <DatumPoslanoVRecenzijo>0000-00-00</DatumPoslanoVRecenzijo>
  <DatumSprejetjaClanka>0000-00-00</DatumSprejetjaClanka>
  <DatumObjaveClanka>0000-00-00</DatumObjaveClanka>
  <Licence>
    <Licenca ID="1" Kratica="CC BY-NC-ND 4.0" Naziv="Creative Commons Priznanje avtorstva-Nekomercialno-Brez predelav 4.0 Mednarodna" URL="http://creativecommons.org/licenses/by-nc-nd/4.0/deed.sl" Logo="by-nc-nd.eu.png" LogoPolniUrl="https://dk.um.si/teme/dkumDev2/img/licence/by-nc-nd.eu.png" DatumZacetkaLicenciranja="2025-08-06" VezanoNa="" VezanoNaAng="" Besedilo="" BesediloAng=""></Licenca>
  </Licence>
  <EmbargoDo></EmbargoDo>
  <VrstaEmbarga ID="1" Naziv="Takojšnja javna objava" OpenAIREDostop="openAccess"></VrstaEmbarga>
  <Osebe>
    <Oseba ID="71637" Ime="Lucija" Priimek="Brezočnik" AltIme="" VlogaID="70" VlogaNaziv="Avtor" ConorID="222951267" Afiliacija="" ArrsID="39760" ORCID=""></Oseba>
    <Oseba ID="365" Ime="Vili" Priimek="Podgorelec" AltIme="V. Podgorelec" VlogaID="991" VlogaNaziv="Mentor" ConorID="4402787" Afiliacija="" ArrsID="16304" ORCID=""></Oseba>
  </Osebe>
  <Identifikatorji>
    <Identifikator ID="4" Sifra="UDK" Naziv="UDK" URL="">004.5:004.8(043.3)</Identifikator>
    <Identifikator ID="3" Sifra="CobissID" Naziv="COBISS_ID" URL="https://plus.cobiss.net/cobiss/si/sl/bib/253974787">253974787</Identifikator>
  </Identifikatorji>
  <Relacije>
  </Relacije>
  <VerzijeGradiva>
  </VerzijeGradiva>
  <Datoteke>
    <Datoteka ID="199800" DatotekaNRID="14443159" NamenDatotekeID="2" NamenDatoteke="Predstavitvena datoteka" FormatDatotekeID="2" FormatDatoteke=".pdf" MIME="application/pdf" IkonaFormata="pdf.gif" IkonaFormataPolniUrl="https://dk.um.si/teme/dkumDev2/img/fileTypes/pdf.gif" VelikostDatoteke="23693270" VelikostDatotekeKratko="22,60 MB" DatumVstavljanja="2025-10-12 23:23:11" JeZbrisana="false" JeJavnoVidna="true" JeIndeksirana="true" JeVidno="true" VidnoOd="01.01.1970" Zaporedje="0">
      <Naziv>DOK_Brezocnik_Lucija_2025.pdf</Naziv>
      <OrgNaziv>DOK_Brezocnik_Lucija_2025.pdf</OrgNaziv>
      <URL></URL>
      <Opis></Opis>
      <OpisTujJezik></OpisTujJezik>
      <UrlObdelave></UrlObdelave>
      <FrekvencaAzuriranjaID>1</FrekvencaAzuriranjaID>
      <Verzija></Verzija>
      <MD5>E053B64C51AD54343E42B6AAB8BE3645</MD5>
      <SHA256>709338160dfba01dde66c541519a18370a9289abe2120ab1c5674cea47bd9ac6</SHA256>
      <UUID>a72d0177-a7b1-11f0-8d75-00155d000105</UUID>
      <PID></PID>
      <PrenosPolniUrl>https://dk.um.si/Dokument.php?lang=slv&amp;id=199800</PrenosPolniUrl>
      <Vsebine>
        <Vsebina TipVsebine="GoloBesedilo" JezikID="1060" Oznaka="" Dolzina="283383"></Vsebina>
      </Vsebine>
    </Datoteka>
  </Datoteke>
  <Organizacije>
    <Organizacija OrganizacijaID="3" Kratica="FERI" ZavodEvsID="0000080" Logo="FERI_logo.gif" LogoPolniUrl="https://dk.um.si/teme/dkumDev2/img/logo/FERI_logo.gif">Fakulteta za elektrotehniko, računalništvo in informatiko</Organizacija>
  </Organizacije>
  <OrganizacijeVira>
  </OrganizacijeVira>
  <MetodeZbiranjaPodatkov>
  </MetodeZbiranjaPodatkov>
  <TipologijaDela ID="2.08" Koda="2.08" Naziv="Doktorska disertacija" SchemaOrg="Thesis"></TipologijaDela>
  <Ostalo>
    <StIrodsDatotek>0</StIrodsDatotek>
    <StDatotekPodTrajnimEmbargom>0</StDatotekPodTrajnimEmbargom>
    <StDatotekZOmejenimDostopom>0</StDatotekZOmejenimDostopom>
  </Ostalo>
</Gradivo>
