| | SLO | ENG | Piškotki in zasebnost

Večja pisava | Manjša pisava

Izpis gradiva Pomoč

Naslov:Zajemanje in obdelava besedila iz slik z uporabo tehnologij optičnega prepoznavanja znakov in transformerskih modelov za tolmačenje dokumentov : diplomsko delo
Avtorji:ID Kajba, Tjan (Avtor)
ID Novak, Damijan (Mentor) Več o mentorju... Novo okno
Datoteke:.pdf VS_Kajba_Tjan_2025.pdf (3,39 MB)
MD5: A4FDF8693C7C6DD599A6647E2F5AEE82
 
Jezik:Slovenski jezik
Vrsta gradiva:Diplomsko delo/naloga
Tipologija:2.11 - Diplomsko delo
Organizacija:FERI - Fakulteta za elektrotehniko, računalništvo in informatiko
Opis:Informacije imajo dandanes ključno vlogo v digitalnem svetu. Tehnologije zajemanja besedila s slik so ključna rešitev za pretvorbo fizičnih medijev v digitalno obliko. Teoretični del diplomskega dela predstavlja, kaj so omenjene tehnologije in kako jih razvrščamo. V nadaljevanju smo prikazali delovanje posameznih podvrst orodij, tako tistih, ki temeljijo na velikih jezikovnih modelih, kot tudi tistih brez njih ter njihove priporočene uporabe. Proti koncu teoretičnega dela smo izvedli primerjalno analizo različnih tehnologij. Na podlagi rezultata analize je bil izbran transformerski model za razumevanje dokumentov kot osnova aplikacije. Praktični del prikazuje ustvarjeno aplikacijo, namenjeno branju računov.
Ključne besede:multimodalni veliki jezikovni modeli, optično prepoznavanje znakov, transformerski modeli za razumevanje dokumentov, veliki jezikovni modeli, zajemanje besedila s slik
Kraj izida:Maribor
Kraj izvedbe:Maribor
Založnik:[T. Kajba]
Leto izida:2025
Št. strani:1 spletni vir (1 datoteka PDF (VI, 66 str.))
PID:20.500.12556/DKUM-94618 Novo okno
UDK:004.932(043.2)
COBISS.SI-ID:271053315 Novo okno
Datum objave v DKUM:23.09.2025
Število ogledov:212
Število prenosov:46
Metapodatki:XML DC-XML DC-RDF
Področja:KTFMB - FERI
:
Kopiraj citat
  
Skupna ocena:(0 glasov)
Vaša ocena:Ocenjevanje je dovoljeno samo prijavljenim uporabnikom.
Objavi na:Bookmark and Share



Postavite miškin kazalec na naslov za izpis povzetka. Klik na naslov izpiše podrobnosti ali sproži prenos.

Licence

Licenca:CC BY-NC-SA 4.0, Creative Commons Priznanje avtorstva-Nekomercialno-Deljenje pod enakimi pogoji 4.0 Mednarodna
Povezava:http://creativecommons.org/licenses/by-nc-sa/4.0/deed.sl
Opis:Licenca Creative Commons, ki prepoveduje komercialno uporabo in zahteva, da uporabnik predelana dela objavi z enako licenco.
Začetek licenciranja:22.08.2025

Sekundarni jezik

Jezik:Angleški jezik
Naslov:Text extraction and processing from images using optical character recognition technologies and document interpretation transformer models
Opis:Information plays a crucial role in today's digital world. Technologies for text extraction from images are a crucial solution for the digitalization of data. The theoretical segment of my thesis introduces the mentioned technologies and their categorizations. The following chapters describe the inner workings of each subcategory whether it uses large language models or not and their recommended use cases. The theoretical segment is concluded with a comparative analysis of the different technologies. Based on the analysis, document understanding transformer models were selected as a foundation for our app. The practical segment displays the app for reading receipts.
Ključne besede:multimodal large language models, optical character recognition, document understanding transformer models, large language models, text extraction from images


Komentarji

Dodaj komentar

Za komentiranje se morate prijaviti.

Komentarji (0)
0 - 0 / 0
 
Ni komentarjev!

Nazaj
Logotipi partnerjev Univerza v Mariboru Univerza v Ljubljani Univerza na Primorskem Univerza v Novi Gorici