| | SLO | ENG | Piškotki in zasebnost

Večja pisava | Manjša pisava

Izpis gradiva Pomoč

Naslov:Korpusne oznake za opis konteksta govornih dogodkov v slovenskih govornih korpusih
Avtorji:ID Bizjak, Andreja (Avtor)
Datoteke:.pdf Bizjak.pdf (803,84 KB)
MD5: 3D2A02F1B4BDA71B099A9D5E87A5641B
 
URL https://journals.uni-lj.si/slovenscina2/article/view/18015/16273
 
Jezik:Slovenski jezik
Vrsta gradiva:Članek v reviji
Tipologija:1.01 - Izvirni znanstveni članek
Organizacija:FERI - Fakulteta za elektrotehniko, računalništvo in informatiko
Opis:Zaradi časovno in finančno zahtevne priprave govornega korpusa je ob zasnovi potreben temeljit razmislek o njegovi sestavi in kategorizaciji beleženih metapodatkov. Raznoliki govorni dogodki, vključeni v nacionalni referenčni korpus, naj bi v čim večji meri odražali raznolikost sodobnega govorjenega jezika. Zanimalo nas bo, na kakšen način kategorizirati oznake za opis konteksta govornih dogodkov, da bi to reprezentativnost dosegli, ne da bi se popolnoma odrekli medsebojni primerljivosti podatkov. Premišljena zasnova nam omogoča, da je ob kasnejših korpusnih nadgradnjah potrebnih čim manj časovno zamudnih prilagoditev oznak. Izvedli bomo primerjalno analizo domačih in tujih govornih korpusov, s katero bomo kritično ovrednotili štiri temeljne kategorije oznak za opis konteksta govorne situacije. Pregledali bomo zasnovo tujih referenčnih govornih korpusov FOLK, BNC2014, ORAL2013, Nizozemskega govornega korpusa in C-ORAL-ROM ter jih primerjali z aktualnim referenčnim korpusom govorjene slovenščine Gos 2.1. Problematizirali bomo izbrane oznake in izpostavili težavnejša mesta, ki bi zahtevala dodatne premisleke in potencialno prekategorizacijo v prihodnje.
Ključne besede:govorni korpusi, zasnova korpusa, govorni dogodki, kategorizacija oznak
Status publikacije:Objavljeno
Verzija publikacije:Objavljena publikacija
Datum objave:30.08.2024
Založnik:University of Ljubljana Press, Slovenia (Založba Univerze v Ljubljani)
Leto izida:2024
Št. strani:str. 54-94
Številčenje:Letn. 12, št. 1
PID:20.500.12556/DKUM-90557-3212b11b-a506-210d-d38f-075f6b692399 Novo okno
UDK:004.8:808
COBISS.SI-ID:206755331 Novo okno
DOI:10.4312/slo2.0.2024.1.54-94 Novo okno
ISSN pri članku:2335-2736
Avtorske pravice:https://creativecommons.org/licenses/by-sa/4.0
Datum objave v DKUM:09.09.2024
Število ogledov:133
Število prenosov:9
Metapodatki:XML DC-XML DC-RDF
Področja:Ostalo
:
Kopiraj citat
  
Skupna ocena:(0 glasov)
Vaša ocena:Ocenjevanje je dovoljeno samo prijavljenim uporabnikom.
Objavi na:Bookmark and Share



Postavite miškin kazalec na naslov za izpis povzetka. Klik na naslov izpiše podrobnosti ali sproži prenos.

Gradivo je del revije

Naslov:Slovenščina 2.0. empirične, aplikativne in interdisciplinarne raziskave
Založnik:Trojina, zavod za uporabno slovenistiko, Trojina, zavod za uporabno slovenistiko, Trojina, zavod za uporabno slovenistiko, Znanstvena založba Filozofske fakultete, Znanstvena založba Filozofske fakultete, Založba Univerze v Ljubljani
ISSN:2335-2736
COBISS.SI-ID:264547328 Novo okno

Gradivo je financirano iz projekta

Financer:ARIS - Javna agencija za znanstvenoraziskovalno in inovacijsko dejavnost Republike Slovenije
Številka projekta:J7-4642-2022
Naslov:Temeljne raziskave za razvoj govornih virov in tehnologij za slovenščino

Licence

Licenca:CC BY-SA 4.0, Creative Commons Priznanje avtorstva-Deljenje pod enakimi pogoji 4.0 Mednarodna
Povezava:http://creativecommons.org/licenses/by-sa/4.0/deed.sl
Opis:Ta licenca Creative Commons je zelo podobna običajni licenci Priznanje avtorstva, vendar zahteva, da so materialne avtorske pravice na izpeljanih delih upravljane z enako licenco.

Sekundarni jezik

Jezik:Angleški jezik
Naslov:Corpus annotations for describing the context of speech events in Slovene speech corpora
Opis:The time-consuming and costly preparation of a speech corpus requires ca-reful consideration of its composition and the categorization of the recorded metadata at the time of its design. The variety of speech events included in the national reference corpus should reflect the diversity of contemporary spoken language as much as possible. We will be interested in how to categorize the annotations used to describe the context of the speech events in order to achi-eve this representativeness without completely giving up the intercomparabi-lity of the data. A thoughtful design allows us to minimize the time-consuming tag adjustments required in subsequent corpus upgrades. We will carry out a comparative analysis of domestic and foreign speech corpora to critically eva-luate the four basic categories of annotations used to describe the context of a speech situation. We will review the design of the foreign reference speech corpora FOLK, BNC2014, ORAL2013, the Spoken Dutch Corpus and C-ORAL--ROM and compare them with the current reference corpus of spoken Slovene Gos 2.1. We will problematize the selected annotations and highlight the more problematic areas that would require further consideration and potential futu-re re-categorization.
Ključne besede:speech corpora, corpus design, speech events, categorization of annotations


Komentarji

Dodaj komentar

Za komentiranje se morate prijaviti.

Komentarji (0)
0 - 0 / 0
 
Ni komentarjev!

Nazaj
Logotipi partnerjev Univerza v Mariboru Univerza v Ljubljani Univerza na Primorskem Univerza v Novi Gorici