<?xml version="1.0"?>
<metadata xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xmlns:dc="http://purl.org/dc/elements/1.1/"><dc:title>Vpliv priprave nestrukturiranih podatkov na klasifikacijo</dc:title><dc:creator>Pečnik,	Špela	(Avtor)
	</dc:creator><dc:creator>Podgorelec,	Vili	(Mentor)
	</dc:creator><dc:subject>nestrukturirani podatki</dc:subject><dc:subject>klasifikacija besedil</dc:subject><dc:subject>vektorska predstavitev besedil</dc:subject><dc:subject>krnjenje</dc:subject><dc:subject>lematizacija</dc:subject><dc:description>V vsakdanjem življenju se v večini primerov srečujemo z nestrukturiranimi podatki v obliki besedil iz različnih virov. Število teh iz dneva v dan narašča, zato obstaja vse večja potreba po njihovi organizaciji in kategorizaciji. Pri teh podatkih je najpomembnejša njihova predpriprava na uporabo v algoritmih strojnega učenja. Za ustrezno pripravo besedila lahko uporabimo različne metode/tehnike predprocesiranja – besedilo pretvorimo v male črke, iz njega odstranimo stop-besede, nad posameznimi besedami uporabimo krnjenje, lematizacijo, besede sestavljamo v fraze različnih dolžin (uni-grame, bi-grame, tri-grame) ali pa jih na primer pretvorimo v vektorsko obliko (ang. word embedding). S pomočjo laboratorijskega eksperimenta smo ugotovili, da nekatere tehnike predobdelave bolj vplivajo na uspešnost klasifikacije kot druge, poleg tega pa ima velik vpliv na uspešnost klasifikacije sam jezik in količina besedila, ter klasifikator, ki ga uporabimo za strojno učenje.</dc:description><dc:publisher>Š. Pečnik</dc:publisher><dc:date>2019</dc:date><dc:date>2019-06-05 10:47:05</dc:date><dc:type>Magistrsko delo/naloga</dc:type><dc:identifier>73712</dc:identifier><dc:identifier>UDK: 004.94:004.83(043.2)</dc:identifier><dc:identifier>URN: URN:SI:UM:DK:MLJBF77J</dc:identifier><dc:identifier>COBISS_ID: 22489366</dc:identifier><dc:identifier>NUK URN: URN:SI:UM:DK:MLJBF77J</dc:identifier><dc:language>sl</dc:language></metadata>
