| | SLO | ENG | Piškotki in zasebnost

Večja pisava | Manjša pisava

Izpis gradiva Pomoč

Naslov:Metoda hierarhične večznačne klasifikacije na osnovi ekstrakcije značilnic s tekstovno analizo mikrobiotskih podatkov : doktorska disertacija
Avtorji:ID Brezočnik, Lucija (Avtor)
ID Podgorelec, Vili (Mentor) Več o mentorju... Novo okno
Datoteke:.pdf DOK_Brezocnik_Lucija_2025.pdf (22,60 MB)
MD5: E053B64C51AD54343E42B6AAB8BE3645
 
Jezik:Slovenski jezik
Vrsta gradiva:Doktorsko delo/naloga
Tipologija:2.08 - Doktorska disertacija
Organizacija:FERI - Fakulteta za elektrotehniko, računalništvo in informatiko
Opis:Zanesljiva identifikacija kompleksnih vsebinskih struktur v primerih, kjer posamezni primerki podatkovnega nabora niso homogeni, pač pa združujejo informacije več virov, predstavlja enega izmed ključnih metodoloških izzivov sodobne podatkovne analitike. Relativno enostavna je namreč naloga, kjer je določen primerek homogen in ga z uporabo večrazredne klasifikacije znamo relativno preprosto razvrstiti v enega izmed ponujenih razredov. Kompleksnost pa se drastično poveča, ko se v istem primerku skriva več virov. V tem primeru osnovne metode analize ne zadostujejo več in potrebujemo naprednejše pristope, ki so sposobni razbrati soobstoj več razredov oziroma oznak, kar je tudi domena večznačne klasifikacije. V predloženi doktorski disertaciji obravnavamo omenjeni problem na področju metagenomike, ki med drugim omogoča raziskovanje mikrobiote, raznolike skupnosti bakterij in drugih mikroorganizmov v določenem okolju. Z naprednimi tehnikami sekvenciranja iz njih pridobimo zaporedja DNK celotne mikrobne združbe, ki jih lahko opišemo kot izjemno dolga besedila, zapisana z abecedo štirih nukleotidov: A, T, G in C. Naš cilj je v teh besedilih poiskati t. i. označevalne gene, ki so izključno ali močno povezani z gostiteljem. V ta namen smo na podlagi optimizacijskih pristopov in domenskih pravil predlagali metodo ekstrakcije značilnic, temelječo na osnovi k-merov, tj. krajših delov DNK. Pristop na osnovi k-merov se je izkazal za zelo učinkovitega, zato smo ga uporabili tudi pri sintetičnem generiranju vzorcev mikrobnih oziroma mikrobiotskih podatkov. Metoda temelji na pripravi profilov k-merov in na nanje osnovanih grafih prehodov. Ker smo v doktorski disertaciji analizirali lokacijsko specifične vzorce, smo morali njihov manjši nabor čistih vzorcev ustrezno razširiti. Še več, sintetično smo razširili tudi nabor mešanih vzorcev, kar predstavlja še večji izziv v realnih okoljih. Obe predlagani metodi sta se združili v konceptualno najzahtevnejšem delu doktorske naloge, predlagani metodi hierarhične večznačne klasifikacije na osnovi ekstrakcije značilnic, imenovani MLB. Z njo smo na osnovi vhodnih podatkov, tj. čistih ali sintetično ustvarjenih vzorcev, napovedovali deleže gostiteljev v mešanih mikrobnih vzorcih. Rezultate metode MLB smo primerjali s tistimi, pridobljenimi z orodjem SourceTracker, vodilnim orodjem za natančno identifikacijo in kvantifikacijo gostiteljev mikrobov v mešanih vzorcih. Metodi smo ovrednotili z uveljavljenimi metrikami na področju večznačne klasifikacije, ki razkrivajo, da metoda MLB učinkovito rešuje problem določitve gostiteljev in njihovih deležev ter poda primerljive, večinoma pa boljše rezultate kot orodje SourceTracker.
Ključne besede:strojno učenje, večznačna klasifikacija, ekstrakcija značilnic, obdelava naravnega jezika, mikrobiotski podatki
Kraj izida:Maribor
Kraj izvedbe:Maribor
Založnik:[L. Brezočnik]
Leto izida:2025
Št. strani:XV, 157 str.
PID:20.500.12556/DKUM-94160 Novo okno
UDK:004.5:004.8(043.3)
COBISS.SI-ID:253974787 Novo okno
Datum objave v DKUM:20.10.2025
Število ogledov:167
Število prenosov:111
Metapodatki:XML DC-XML DC-RDF
Področja:KTFMB - FERI
:
Kopiraj citat
  
Skupna ocena:(0 glasov)
Vaša ocena:Ocenjevanje je dovoljeno samo prijavljenim uporabnikom.
Objavi na:Bookmark and Share



Postavite miškin kazalec na naslov za izpis povzetka. Klik na naslov izpiše podrobnosti ali sproži prenos.

Licence

Licenca:CC BY-NC-ND 4.0, Creative Commons Priznanje avtorstva-Nekomercialno-Brez predelav 4.0 Mednarodna
Povezava:http://creativecommons.org/licenses/by-nc-nd/4.0/deed.sl
Opis:Najbolj omejujoča licenca Creative Commons. Uporabniki lahko prenesejo in delijo delo v nekomercialne namene in ga ne smejo uporabiti za nobene druge namene.
Začetek licenciranja:06.08.2025

Sekundarni jezik

Jezik:Angleški jezik
Naslov:Hierarchical multilabel classification method with feature extraction based on textual analysis of microbial data
Opis:Reliable identification of complex content structures in cases where individual dataset instances are not homogeneous, but consist of information from multiple sources, represents one of the key methodological challenges in modern data analytics. The task is relatively straightforward when an instance is homogeneous, and can be easily classified into one of the available classes using multiclass classification. However, the complexity increases drastically when multiple sources are present within the same instance. In such cases, basic analytical methods are no longer sufficient, and advanced approaches capable of determining the coexistence of multiple classes or labels are required, which is the domain of multilabel classification. In the presented doctoral dissertation, we address this challenge within the field of metagenomics, which enables the exploration of the microbiome, a diverse community of bacteria and other microorganisms in a given environment. Using advanced sequencing techniques, we obtain DNA sequences of the entire microbial community, which can be described as extremely long texts written with the alphabet of four nucleotides: A, T, G, and C. Our goal is to identify so-called marker genes in these texts that are exclusively or strongly associated with a specific host. Hence, we proposed a feature extraction method based on optimization approaches and domain rules, relying on k-mers, i.e., shorter segments of DNA. The k-mer-based approach proved to be very effective, and we therefore applied it to the synthetic generation of microbial data samples. The method relies on creating k-mer profiles and corresponding transition graphs. Since we analyzed location-specific samples, we needed to expand their smaller set of pure samples accordingly. Furthermore, we synthetically expanded the set of mixed samples, which poses an even greater challenge in real-world settings. Both proposed methods were combined in the conceptually most demanding part of the dissertation: a proposed hierarchical multilabel classification method with feature extraction, named MLB. This method predicts the proportions of hosts in mixed microbial samples based on input data, i.e., pure or synthetically generated samples. The results of the MLB method were compared with those obtained by the SourceTracker, a leading tool for predicting and quantifying microbial hosts in mixed samples. Both methods were evaluated using established metrics, revealing that the MLB method effectively addresses the problem of identifying hosts and their proportions, delivering comparable, and in most cases, superior results to SourceTracker.
Ključne besede:Machine Learning, Multilabel Classification, Feature Extraction, Natural Language Processing, Microbial data


Komentarji

Dodaj komentar

Za komentiranje se morate prijaviti.

Komentarji (0)
0 - 0 / 0
 
Ni komentarjev!

Nazaj
Logotipi partnerjev Univerza v Mariboru Univerza v Ljubljani Univerza na Primorskem Univerza v Novi Gorici