| Abstract: | Cilj magistrske naloge je primerjava dveh modelov strojnega učenja, LSTM (ang. Long short-term memory) in TCN (ang. Temporal convolutional network) pri napovedovanju zavornega momenta. Gre za dva tipa nevronskih mrež. Nevronske mreže so skupek algoritmov, ki delujejo po vzoru človeških možganov. Sestavljene so iz osnovnih enot – nevronov, ki so običajno razporejeni v več plasti. Razmestitev nevronov v mreži vpliva na hitrost učenja in kvaliteto rezultatov naučene mreže.
LSTM spada med povratne nevronske mreže (ang. Recurrent neural network – RNN). Povratne nevronske mreže vsebujejo povratne povezave, ki jim omogočajo pomnenje informacij iz predhodnih časovnih korakov, zaradi česar dosegajo zelo dobre rezultate pri obdelavi sekvenčnih podatkov.
Najpogosteje se uporabljajo za prepoznavanje govora in pisav, zaznavanje anomalij v časovnih vrstah in napovedovanje nadaljnega razvoja časovnih vrst. Pri učenju običajnih RNN naletimo na več problemov: problem izginjanja in eksplozije gradientov ter kratkoročni spomin. LSTM odpravi problem izginjanja gradientov in kratkoročni spomin z uporabo spominskih celic, ki sestojijo iz stanja celice in treh vrat. Stanje celice je posledica predhodnih časovnih korakov in si ga lahko razlagamo kot spomin celice. Vrata služijo za posodabljanje stanja celice in so naučena tekom učenja LSTM.
TCN spada med konvolucijske nevronske mreže (ang. Convolutional neural network – CNN). Konvolucijske mreže uporabljajo matematično operacijo imenovano konvolucija, za pridobivanje značilk in so izjemno uspešne na področju strojnega vida. Njihova uporaba za modeliranje časovnih vrst je manj razširjena, vendar v mnogih primerih dosegajo boljše rezultate kot RNN. TCN združuje najboljše prakse sodobnih konvolucijskih mrež. Uporablja princip razširjenih konvolucij (ang. dilated convolution), kar omogoča razširitev zaznavnega polja.
Primerjava LSTM in TCN je bila izvedena na primeru iz podjetja AVL List GmbH, katerega cilj je izdelava modela za napovedovanje zavornega momenta. Za učenje nevronskih mrež so se uporabili podatki o temperaturi zavor, tlaku zavorne tekočine v zavornem valju, vrtljajih zavornih diskov in zavornem momentu. Podatki so bili prefiltrirani z uporabo nizkopasovnega Butterworth filtra, kar je imelo velik vpliv na kvaliteto naučenih modelov. Dodani sta bili dve značilki, ki smo ju pridobili z obdelavo obstoječih. Za pripravo podatkov sta bili uporabljeni knjižnici programskega jezika Python, Pandas in Scipy. Modela sta bila implementirana v programskem okolju TensorFlow, ki je odprtokodno okolje za strojno učenje.
S primerjavo rezultatov, smo prišli do ugotovitve, da je v obravnavanem primeru TCN model zmožen doseči večjo natančnost napovedi v krajšem času učenja, kot LSTM. Rezultati so pokazali, da se pri večjem številu časovnih korakov, ki jih uporabimo za napoved, pri LSTM pojavi problem eksplozije gradientov, zaradi česar je potrebno uvesti omejevanje gradienta (ang. Gradient clipping). Velika prednost TCN modela napram LSTM je čas potreben za izračun napovedi. Izkazalo se je, da je v obravnavanem primeru že najmanjši LSTM model prepočasen za uporabo v realnem času. Predvidevamo, da bi z implementacijo obeh modelov v programskem jeziku C, lahko tudi LSTM pospešili do te mere, da bi se lahko uporabljal v realnem času. |
|---|