| | SLO | ENG | Piškotki in zasebnost

Večja pisava | Manjša pisava

Izpis gradiva Pomoč

Naslov:NADZOROVANO ODKRIVANJE PREDMETA TEKSTOVNIH VSEBIN Z UPORABO SELEKCIJSKIH IN STATISTIČNIH METOD
Avtorji:ID Hrnčić, Sašo (Avtor)
ID Kosar, Tomaž (Mentor) Več o mentorju... Novo okno
ID Podgorelec, Vili (Komentor)
Datoteke:.pdf VS_Hrncic_Saso_2016.pdf (2,31 MB)
MD5: 087986506A000E5CC992A3E222C1C702
 
Jezik:Slovenski jezik
Vrsta gradiva:Diplomsko delo
Tipologija:2.11 - Diplomsko delo
Organizacija:FERI - Fakulteta za elektrotehniko, računalništvo in informatiko
Opis:Cilj diplomske naloge je izdelati preprost kategorizacijski sistem, ki zna nov tekstovni dokument čim natančneje uvrstiti v naprej definirane kategorije. Ena izmed funkcionalnosti sistema je prepoznavanje jezika, ki je bilo testirano na podatkovnih korpusih dokumentov Wikipedije, Europarla in jezikovnih modelov projekta LibTextCat. Kategorizacijski sistem je bil razširjen še na prepoznavanje v naprej definiranih tematikah korpusa 20 Newsgroups in Reuters-21578. Za predstavitev dokumentov smo uporabili n-gramsko tehniko, ki smo jo kombinirali s selekcijskimi in statističnimi metodami. Dosežene rezultate smo analizirali ter dokumentirali. Podrobneje smo predstavili problematiko, lastne izkušnje, lastnosti uporabljenih metod ter obstoječe raziskave.
Ključne besede:tekstovno kategoriziranje, n-grami, strojno učenje, teorija informacij, odmik od najpomembnejšega elementa
Kraj izida:[Maribor
Založnik:S. Hrnčić
Leto izida:2016
PID:20.500.12556/DKUM-61990 Novo okno
UDK:004.05:004.5(043.2)
COBISS.SI-ID:19991318 Novo okno
NUK URN:URN:SI:UM:DK:GT5AAOMU
Datum objave v DKUM:16.09.2016
Število ogledov:1220
Število prenosov:111
Metapodatki:XML DC-XML DC-RDF
Področja:KTFMB - FERI
:
Kopiraj citat
  
Skupna ocena:(0 glasov)
Vaša ocena:Ocenjevanje je dovoljeno samo prijavljenim uporabnikom.
Objavi na:Bookmark and Share



Postavite miškin kazalec na naslov za izpis povzetka. Klik na naslov izpiše podrobnosti ali sproži prenos.

Sekundarni jezik

Jezik:Angleški jezik
Naslov:SUPERVISED TOPICS' DETECTION BASED ON FEATURE SELECTION AND STATISTICAL METHODS
Opis:The main goal of diploma work is to develop simple text classification system that is able to automatically classify a document into predefined categories as accurately as possible. One of the functionalities of the system is language detection that has been tested on documents of Wikipedia, Europarl and language models of project LibTextCat. Classification system has been expanded to identify predefine topics of the corpus 20 Newsgroups and Reuters-21578. For document presentation we used n-grams technique, which was combined with feature selection methods and statistical methods. The obtained results were analyzed and documented. We also present text classification problem, our experiences, features of used methods and some existing research.
Ključne besede:text classification, n-grams, machine learning, information theory, out of place


Komentarji

Dodaj komentar

Za komentiranje se morate prijaviti.

Komentarji (0)
0 - 0 / 0
 
Ni komentarjev!

Nazaj
Logotipi partnerjev Univerza v Mariboru Univerza v Ljubljani Univerza na Primorskem Univerza v Novi Gorici