| | SLO | ENG | Piškotki in zasebnost

Večja pisava | Manjša pisava

Izpis gradiva Pomoč

Naslov:Automatic classification of older electronic texts into the Universal Decimal Classification-UDC
Avtorji:ID Kragelj, Matjaž (Avtor)
ID Kljajić Borštnar, Mirjana (Avtor)
Datoteke:.pdf Kragelj-2021-Automatic_classification_of_older.pdf (1,91 MB)
MD5: 208C31917DFFA5DE7BAAB352534378A0
 
URL https://doi.org/10.1108/JD-06-2020-0092
 
Jezik:Angleški jezik
Vrsta gradiva:Znanstveno delo
Tipologija:1.01 - Izvirni znanstveni članek
Organizacija:FOV - Fakulteta za organizacijske vede
Opis:Purpose:The purpose of this study is to develop a model for automated classification of old digitised texts to the Universal Decimal Classification (UDC), using machine-learning methods. Design/methodology/approach: The general research approach is inherent to design science research, in which the problem of UDC assignment of the old, digitised texts is addressed by developing a machine-learning classification model. A corpus of 70,000 scholarly texts, fully bibliographically processed by librarians, was used to train and test the model, which was used for classification of old texts on a corpus of 200,000 items. Human experts evaluated the performance of the model. Findings: Results suggest that machine-learning models can correctly assign the UDC at some level for almost any scholarly text. Furthermore, the model can be recommended for the UDC assignment of older texts. Ten librarians corroborated this on 150 randomly selected texts. Research limitations/implications: The main limitations of this study were unavailability of labelled older texts and the limited availability of librarians. Practical implications: The classification model can provide a recommendation to the librarians during their classification work; furthermore, it can be implemented as an add-on to full-text search in the library databases. Social implications: The proposed methodology supports librarians by recommending UDC classifiers, thus saving time in their daily work. By automatically classifying older texts, digital libraries can provide a better user experience by enabling structured searches. These contribute to making knowledge more widely available and useable. Originality/value: These findings contribute to the field of automated classification of bibliographical information with the usage of full texts, especially in cases in which the texts are old, unstructured and in which archaic language and vocabulary are used.
Ključne besede:digital library, artificial intelligence, machine learning, text classification, older texts, Universal Decimal Classification
Status publikacije:Objavljeno
Verzija publikacije:Objavljena publikacija
Poslano v recenzijo:09.06.2020
Datum sprejetja članka:30.10.2020
Datum objave:08.04.2021
Založnik:Aslib
Leto izida:2021
Št. strani:Str. 755-776
Številčenje:Letn. 77, št. 3
PID:20.500.12556/DKUM-91682 Novo okno
UDK:004.89:025.45UDC
COBISS.SI-ID:41547267 Novo okno
DOI:10.1108/JD-06-2020-0092 Novo okno
ISSN pri članku:0022-0418
Datum objave v DKUM:28.01.2025
Število ogledov:158
Število prenosov:14
Metapodatki:XML DC-XML DC-RDF
Področja:Ostalo
:
Kopiraj citat
  
Skupna ocena:(0 glasov)
Vaša ocena:Ocenjevanje je dovoljeno samo prijavljenim uporabnikom.
Objavi na:Bookmark and Share



Postavite miškin kazalec na naslov za izpis povzetka. Klik na naslov izpiše podrobnosti ali sproži prenos.

Gradivo je del revije

Naslov:Journal of Documentation
Skrajšan naslov:J. Doc.
Založnik:Aslib
ISSN:0022-0418
COBISS.SI-ID:6866437 Novo okno

Gradivo je financirano iz projekta

Financer:ARRS - Agencija za raziskovalno dejavnost Republike Slovenije
Številka projekta:P5-0018
Naslov:Sistemi za podporo odločanju v digitalnem poslovanju

Licence

Licenca:CC BY 4.0, Creative Commons Priznanje avtorstva 4.0 Mednarodna
Povezava:http://creativecommons.org/licenses/by/4.0/deed.sl
Opis:To je standardna licenca Creative Commons, ki daje uporabnikom največ možnosti za nadaljnjo uporabo dela, pri čemer morajo navesti avtorja.
Začetek licenciranja:08.04.2021

Sekundarni jezik

Jezik:Slovenski jezik
Ključne besede:digitalna knjižnica, umetna inteligenca, stojno učenje, klasifikacija besedil, starejše besedilo, Univerzalna decimalna klasifikacija, UDK


Komentarji

Dodaj komentar

Za komentiranje se morate prijaviti.

Komentarji (0)
0 - 0 / 0
 
Ni komentarjev!

Nazaj
Logotipi partnerjev Univerza v Mariboru Univerza v Ljubljani Univerza na Primorskem Univerza v Novi Gorici