| | SLO | ENG | Cookies and privacy

Bigger font | Smaller font

Show document Help

Title:VEČLOČLJIVOSTNO IZLOČANJE ZNAČILK PRI RAZPOZNAVANJU EMOCIJ V GOVORU
Authors:ID Zelenik, Aleš (Author)
ID Kačič, Zdravko (Mentor) More about this mentor... New window
ID Kotnik, Bojan (Comentor)
Files:.pdf DR_Zelenik_Ales_2013.pdf (7,89 MB)
MD5: 8A2122EA906B0C396CE4BAC0D89D1971
PID: 20.500.12556/dkum/c8fb5a4e-e882-4325-9033-b6b3bc8b1a24
 
Language:Slovenian
Work type:Dissertation
Typology:2.08 - Doctoral Dissertation
Organization:FERI - Faculty of Electrical Engineering and Computer Science
Abstract:V doktorski nalogi obravnavamo problematiko prepoznave emocionalnega govora iz avdio posnetkov. V okviru naloge je za izločanje značilk uporabljenih več različnih širin kratkočasovnih procesnih oken, z namenom pridobitve optimalne širine in doseganje najvišje stopnje prepoznave. V dosedanjih raziskavah se največkrat pojavljajo procesna okna širine 20 in 100ms [6], kjer uporaba krajšega okna omogoča boljšo časovno ločljivost, a slabšo frekvenčno ločljivost, medtem ko daljša okna dvignejo frekvenčno ločljivost in poslabšajo časovno ločljivost. V tej točki je definiran nov postopek, ki združi prednosti uporabe ožjih in širših oken in izkorišča prednosti dinamičnega prilagajanja časovne in frekvenčne ločljivosti pri posameznih značilkah. Postopek, poimenovan ESRA, definira koncept večločljivostnega izločanja, izbire in uporabe značilk in pri tem poskrbi za uporabo večločljivostnega koncepta pri razpoznavanju končnih razredov, kjer se za procesiranje uporabi del akustičnega signala, ki vsebuje zvočni govor. Dodatno višanje nivoja uspešnosti prepoznave je doseženo z uporabo normalizacije uporabljenih značilk ter glajenja vrednosti značilk v postprocesiranju. Dodana vrednost pri postopku optimizacije uspešnosti razpoznave je v definiranju algoritma zamenjave končnih razredov, s katerim je bilo doseženo zvišanje uspešnosti najoptimalnejših rezultatov prepoznavanja emocionalnih posnetkov. Za vrednotenje vpliva algoritma na optimizacijo nivoja razpoznave emocionalnega govora sta uporabljeni dve različni območji poimenovani kratko- in dolgočasovno območje, na podlagi katerih poteka izločanje in ocenjevanje od emocij odvisnih značilk govora, z namenom njihove uporabe pri razpoznavanju emocij v govoru. Pri tem sta za potrditev delovanja algoritma uporabljena dva načina generiranja podsetov značilk ter za klasifikacijo štirje različni klasifikatorji (MLP, RF, KNN, GMM). Uporabljeni emocionalni posnetki so del emocionalne govorne baze Interface [18], ki vsebuje igrane posnetke osnovnih šestih emocionalnih razredov (Ekman-ovih velikih šest) in nevtralni govor. Najvišja dosežena uspešnost prepoznave večločljivostnega pristopa je znašala 88,6%, kar je za 3,8% presegalo najboljšo uspešnost enonivojskega pristopa oziroma je bila uspešnost prepoznave za 24,9% višja v relativnem smislu. Podane so primerjave z rezultati uspešnosti dosedanjih raziskav na uporabljeni bazi.
Keywords:govor, razpoznavanje emocij, segmentacija, večločljivost
Place of publishing:Maribor
Publisher:[A. Zelenik]
Year of publishing:2013
PID:20.500.12556/DKUM-39949 New window
UDC:004.934:004.383.3(043.3)
COBISS.SI-ID:266300928 New window
NUK URN:URN:SI:UM:DK:WJRKREAK
Publication date in DKUM:22.03.2013
Views:2706
Downloads:316
Metadata:XML DC-XML DC-RDF
Categories:KTFMB - FERI
:
Copy citation
  
Average score:(0 votes)
Your score:Voting is allowed only for logged in users.
Share:Bookmark and Share



Hover the mouse pointer over a document title to show the abstract or click on the title to get all document metadata.

Secondary language

Language:English
Title:Multi-resolution feature extraction in emotional speech recognition
Abstract:The presented thesis treats the problem of recognizing emotional speech from audio recordings. In order to obtain the optimum processing window width for feature extraction and to achieve the highest level of recognition rates, several different short term processing window widths have been evaluated. In previous studies, the most common process window widths used, were between 20 and 100ms [6], where a shorter window provides better time resolution but poor frequency resolution, while the longer window lifts frequency resolution and worsens time resolution. At this point, we define a new procedure that combines the advantages of narrower and wider windows and takes advantage of dynamically adjusting the time and frequency resolution of individual feature characteristics. The procedure, called ESRA, defines the concept of multi-resolution feature extraction, evaluation and use of selected features to provide for the multi-resolution concept in identifying final classes, where processing acoustic signals, based on the use of voiced speech. Raised levels of recognition performance are achieved using the feature normalization and post feature value smoothing. The added value in the process of optimizing the performance of the recognition algorithm is in defining the algorithm for replacement of final classes, with which increased performance on optimal results have been achieved. To evaluate the impact of the algorithms for optimization of emotional speech recognition, two different areas, called short term and long term areas, are used. On the basis of these two areas the procedures of evaluation and elimination of emotion-dependent features, for the purpose of recognizing emotions in speech, are tested. To confirm the benefits of the algorithm two ways to generate feature subsets and four different classifiers (MLP, RF, KNN, GMM) are used. The audio recordings used are a part of emotional speech database Interface [18], which contains recordings of six basic emotional categories (Ekmans big six) and neutral speech. The highest level of emotion recognition performance with multi-resolution approach was 88.6%, which exceeded the performance of the best single-resolution approach by 3.8%, or by 24,9% speaking in relative terms. There are also comparisons to previous researches recognition rates on above mentioned database.
Keywords:speech, emotion recognition, segmentation, multi-resolution


Comments

Leave comment

You must log in to leave a comment.

Comments (0)
0 - 0 / 0
 
There are no comments!

Back
Logos of partners University of Maribor University of Ljubljana University of Primorska University of Nova Gorica