<?xml version="1.0" encoding="utf-8"?>
<Gradivo ID="97077" NadgradivoID="0" NRID="28170038" OceID="0" DomainUrl="https://dk.um.si/" IzpisPolniUrl="https://dk.um.si/IzpisGradiva.php?lang=slv&amp;id=97077" StOgledov="313" StPrenosov="13" StOcen="0" VsotaOcen="0" DatumIzvoza="2026-10-01 14:10:04" OcenaSkupna="0" StPodgradiv="0" StudijskiProgramEvsID="" JeIndeksirano="0" JeVecAvtorjev="0" DovoliZahtevkeZaDostop="0">
  <PID Url="http://hdl.handle.net/20.500.12556/DKUM-97077">20.500.12556/DKUM-97077</PID>
  <Naslov>Utilizing large language models for cyber attack data generation</Naslov>
  <Podnaslov>magistrsko delo</Podnaslov>
  <TujJezik_Naslov>Uporaba velikih jezikovnih modelov za generiranje testnih podatkov</TujJezik_Naslov>
  <TujJezik_Podnaslov></TujJezik_Podnaslov>
  <Opis>This master’s thesis addresses the challenge of limited, imbalanced, and restricted-access datasets in the field of cybersecurity, which significantly hinder the development and evaluation of intrusion detection systems. To overcome these limitations, the thesis explores the use of synthetic data generation as a viable and effective alternative for producing realistic and diverse cyber-attack data while preserving privacy and improving dataset usability.
The work presents a systematic review of existing approaches to synthetic data generation based on Generative Adversarial Networks and Large Language Models, analysing their fundamental characteristics, advantages, and limitations in the context of cyber-attack generation. Particular emphasis is placed on their suitability for creating realistic and diverse attack patterns relevant to intrusion detection research.
The experimental part of the thesis investigates and compares multiple approaches to synthetic data generation, including standalone generative models and a combined methodology. The generated data are evaluated with respect to syntactic correctness, diversity, and practical applicability, supported by the introduction of a novel metric for assessing attack diversity. Additionally, the generated attacks are validated in a controlled test environment to assess their effectiveness in realistic scenarios.
The results demonstrate that while individual generative approaches exhibit distinct strengths, their integration enables the most balanced and effective generation of synthetic cyber-attack data. The thesis concludes that combining Generative Adversarial Networks and Large Language Models provides a robust framework for producing realistic, diverse, and practically useful datasets, thereby contributing to the development of more reliable cybersecurity systems.</Opis>
  <TujJezik_Opis>Magistrsko delo obravnava problem omejene dostopnosti kakovostnih, uravnoteženih in reprezentativnih podatkovnih zbirk na področju kibernetske varnosti, ki pomembno vpliva na razvoj in vrednotenje sistemov za zaznavanje vdorov. Zaradi zaupnosti, redkosti in neuravnoteženosti realnih podatkov se kot učinkovita alternativa uveljavlja uporaba sintetičnih podatkov, ki omogočajo varnejše raziskave, večjo raznolikost primerov ter boljše pokrivanje redkih, a za varnost kritičnih vrst napadov.
V magistrskem delu je predstavljen pregled obstoječih metod generiranja sintetičnih podatkov z uporabo generativnih adversarialnih mrež in velikih jezikovnih modelov. Analizirane so njihove temeljne značilnosti, prednosti in omejitve pri ustvarjanju realističnih vzorcev kibernetskih napadov, s poudarkom na njihovi uporabnosti v sistemih za zaznavanje vdorov.
Eksperimentalni del vključuje primerjavo različnih pristopov k generiranju sintetičnih podatkov, pri čemer so bili ti ovrednoteni z vidika sintaktične pravilnosti, raznolikosti in praktične uporabnosti. Razvita je bila tudi nova metrika za ocenjevanje raznolikosti napadov, ki omogoča objektivnejšo primerjavo med posameznimi metodami. Dodatno je bila izvedena praktična validacija v testnem okolju, ki je omogočila preverjanje učinkovitosti generiranih napadov v realističnih pogojih.
Rezultati raziskave kažejo, da posamezni pristopi izkazujejo različne prednosti, pri čemer kombinacija generativnih adversarialnih mrež in velikih jezikovnih modelov omogoča najbolj uravnoteženo generiranje sintetičnih podatkov. Tak pristop omogoča ustvarjanje realističnih, raznolikih in uporabnih podatkovnih zbirk ter predstavlja pomemben prispevek k razvoju zanesljivejših sistemov za kibernetsko varnost.</TujJezik_Opis>
  <KljucneBesede>
    <Beseda>large language models</Beseda>
    <Beseda>attack data generation</Beseda>
    <Beseda>artificial intelligence</Beseda>
    <Beseda>cybersecurity</Beseda>
  </KljucneBesede>
  <TujJezik_KljucneBesede>
    <Beseda>veliki jezikovni modeli</Beseda>
    <Beseda>generiranje podatkov za napade</Beseda>
    <Beseda>umetna inteligenca</Beseda>
    <Beseda>kibernetska varnost</Beseda>
  </TujJezik_KljucneBesede>
  <Potrjeno>true</Potrjeno>
  <JeZaklenjeno>true</JeZaklenjeno>
  <JeRecenzirano>false</JeRecenzirano>
  <Zaloznik>[B. Zgaga]</Zaloznik>
  <Izvor></Izvor>
  <Jezik ID="1033" ISO639-3="eng">Angleški jezik</Jezik>
  <TujJezik ID="1060" ISO639-3="slv">Slovenski jezik</TujJezik>
  <Povezave></Povezave>
  <Pokrivanje></Pokrivanje>
  <CasovnoPokritje></CasovnoPokritje>
  <AvtorskePravice></AvtorskePravice>
  <VrstaGradiva ID="mb22" DRIVER="info:eu-repo/semantics/masterThesis">Magistrsko delo/naloga</VrstaGradiva>
  <DatumVstavljanja>2026-02-16 20:24:24</DatumVstavljanja>
  <DatumObjave>2026-06-03 13:49:43</DatumObjave>
  <DatumSpremembe>2026-06-16 03:09:00</DatumSpremembe>
  <DatumTrajnegaHranjenja>0000-00-00 00:00:00</DatumTrajnegaHranjenja>
  <LetoIzida>2026</LetoIzida>
  <LetoIzidaDo>0</LetoIzidaDo>
  <KrajIzida>Maribor</KrajIzida>
  <LetoIzvedbe>0</LetoIzvedbe>
  <KrajIzvedbe>Maribor</KrajIzvedbe>
  <Opomba></Opomba>
  <StStrani>1 spletni vir (1 datoteka PDF ([XXI], 67 str.))</StStrani>
  <StevilcenjeNivo1></StevilcenjeNivo1>
  <StevilcenjeNivo2></StevilcenjeNivo2>
  <Kronologija></Kronologija>
  <Patent_Stevilka></Patent_Stevilka>
  <Patent_DatumVeljavnosti>0000-00-00</Patent_DatumVeljavnosti>
  <VerzijaDokumenta>NiDoloceno</VerzijaDokumenta>
  <StatusObjaveDrugje>NiDoloceno</StatusObjaveDrugje>
  <VrstaStroskaObjave>NiDoloceno</VrstaStroskaObjave>
  <DatumPoslanoVRecenzijo>0000-00-00</DatumPoslanoVRecenzijo>
  <DatumSprejetjaClanka>0000-00-00</DatumSprejetjaClanka>
  <DatumObjaveClanka>0000-00-00</DatumObjaveClanka>
  <Licence>
    <Licenca ID="6" Kratica="CC BY 4.0" Naziv="Creative Commons Priznanje avtorstva 4.0 Mednarodna" URL="http://creativecommons.org/licenses/by/4.0/deed.sl" Logo="by.png" LogoPolniUrl="https://dk.um.si/teme/dkumDev2/img/licence/by.png" DatumZacetkaLicenciranja="2026-02-16" VezanoNa="" VezanoNaAng="" Besedilo="" BesediloAng=""></Licenca>
  </Licence>
  <EmbargoDo></EmbargoDo>
  <VrstaEmbarga ID="1" Naziv="Takojšnja javna objava" OpenAIREDostop="openAccess"></VrstaEmbarga>
  <Osebe>
    <Oseba ID="90574" Ime="Bine" Priimek="Zgaga" AltIme="" VlogaID="70" VlogaNaziv="Avtor" ConorID="440831235" Afiliacija="" ArrsID="" ORCID=""></Oseba>
    <Oseba ID="54685" Ime="Tina" Priimek="Beranič" AltIme="Tina Schweighofer" VlogaID="991" VlogaNaziv="Mentor" ConorID="72344675" Afiliacija="" ArrsID="35512" ORCID=""></Oseba>
    <Oseba ID="104131" Ime="Sevtap Duman" Priimek="Kaymaz" AltIme="" VlogaID="994" VlogaNaziv="Komentor" ConorID="473583107" Afiliacija="" ArrsID="" ORCID=""></Oseba>
  </Osebe>
  <Identifikatorji>
    <Identifikator ID="4" Sifra="UDK" Naziv="UDK" URL="">004.6:004.8(043.2)</Identifikator>
    <Identifikator ID="3" Sifra="CobissID" Naziv="COBISS_ID" URL="https://plus.cobiss.net/cobiss/si/sl/bib/281650179">281650179</Identifikator>
  </Identifikatorji>
  <Relacije>
  </Relacije>
  <VerzijeGradiva>
  </VerzijeGradiva>
  <Datoteke>
    <Datoteka ID="206688" DatotekaNRID="14699396" NamenDatotekeID="2" NamenDatoteke="Predstavitvena datoteka" FormatDatotekeID="2" FormatDatoteke=".pdf" MIME="application/pdf" IkonaFormata="pdf.gif" IkonaFormataPolniUrl="https://dk.um.si/teme/dkumDev2/img/fileTypes/pdf.gif" VelikostDatoteke="3565491" VelikostDatotekeKratko="3,40 MB" DatumVstavljanja="2026-06-03 13:49:04" JeZbrisana="false" JeJavnoVidna="true" JeIndeksirana="true" JeVidno="true" VidnoOd="01.01.1970" Zaporedje="0">
      <Naziv>MAG_Zgaga_Bine_2026.pdf</Naziv>
      <OrgNaziv>MAG_Zgaga_Bine_2026.pdf</OrgNaziv>
      <URL></URL>
      <Opis></Opis>
      <OpisTujJezik></OpisTujJezik>
      <UrlObdelave></UrlObdelave>
      <FrekvencaAzuriranjaID>1</FrekvencaAzuriranjaID>
      <Verzija></Verzija>
      <MD5>22AB2BECFA652F6BBDBC0C6F41A89C7D</MD5>
      <SHA256>a8642518edcfda02be518835a50bcf5833a986ccd2fd5c71b3bfd856ebd99d90</SHA256>
      <UUID>3821613e-5f42-11f1-8a3a-00155d580e34</UUID>
      <PID></PID>
      <PrenosPolniUrl>https://dk.um.si/Dokument.php?lang=slv&amp;id=206688</PrenosPolniUrl>
      <Vsebine>
        <Vsebina TipVsebine="GoloBesedilo" JezikID="1033" Oznaka="" Dolzina="116232"></Vsebina>
      </Vsebine>
    </Datoteka>
  </Datoteke>
  <Organizacije>
    <Organizacija OrganizacijaID="3" Kratica="FERI" ZavodEvsID="0000080" Logo="FERI_logo.gif" LogoPolniUrl="https://dk.um.si/teme/dkumDev2/img/logo/FERI_logo.gif">Fakulteta za elektrotehniko, računalništvo in informatiko</Organizacija>
  </Organizacije>
  <OrganizacijeVira>
  </OrganizacijeVira>
  <MetodeZbiranjaPodatkov>
  </MetodeZbiranjaPodatkov>
  <TipologijaDela ID="2.09" Koda="2.09" Naziv="Magistrsko delo" SchemaOrg="Thesis"></TipologijaDela>
  <Ostalo>
    <StIrodsDatotek>0</StIrodsDatotek>
    <StDatotekPodTrajnimEmbargom>0</StDatotekPodTrajnimEmbargom>
    <StDatotekZOmejenimDostopom>0</StDatotekZOmejenimDostopom>
  </Ostalo>
</Gradivo>
