Hitra Petka — 5 točk za hitro branje
Bistvo objave v 30 sekundah.
- GAN-i generirajo sintetične podatke za uravnoteženje neuravnoteženih setov.
- Izboljšajo metrike, kot so F-mera, priklic (Recall) in natančnost (Precision) pri zaznavanju prevar.
- Arhitekture DCGAN in WGAN so ključne za strukturirane podatke v zavarovalništvu.
- Kvantitativna ocena kaže zmanjšanje lažno pozitivnih in lažno negativnih rezultatov.
- Uporaba GAN-ov vodi do zanesljivejših in stroškovno učinkovitejših modelov.
Generativne adversarialne mreže (GAN): Teorija in delovanje
Generativne adversarialne mreže, skrajšano GAN-i, so razred algoritmov strojnega učenja, ki jih je leta 2014 predstavil Ian Goodfellow s sodelavci. Njihova arhitektura je sestavljena iz dveh nevronskih mrež, ki tekmujeta druga proti drugi v 'adversarialnem' procesu: generatorja (G) in diskriminatorja (D). Generator poskuša ustvariti sintetične podatke, ki so čim bolj podobni pravim podatkom, medtem ko diskriminator poskuša ugotoviti, ali je dani podatek pristen (izvirni) ali ponarejen (generiran s strani generatorja). Ta dinamična interakcija med obema mrežama poganja proces učenja, kjer generator postaja vedno boljši v ustvarjanju realističnih podatkov, diskriminator pa vedno boljši v razlikovanju med resničnimi in sintetičnimi. Njihova sposobnost generiranja visokokakovostnih sintetičnih podatkov je revolucionarna, saj presega omejitve tradicionalnih metod vzorčenja.
Matematično gledano je cilj GAN-ov najti optimalne parametre za generator in diskriminator, ki minimizirajo vrednostno funkcijo (value function) V(D, G). Ta funkcija je definirana kot: \(\min_G \max_D V(D,G) = E_{x \sim p_{data}(x)}[log D(x)] + E_{z \sim p_z(z)}[log(1 - D(G(z)))]\). Kjer je \(p_{data}(x)\) distribucija resničnih podatkov, \(p_z(z)\) distribucija vhoda v generator (običajno šum), \(D(x)\) verjetnost, da je \(x\) pristen, in \(G(z)\) generiran podatek. Generator poskuša minimizirati \(log(1 - D(G(z)))\), da 'prevari' diskriminatorja, medtem ko diskriminator poskuša maksimizirati to funkcijo, da pravilno identificira podatke. Ta 'minimax' igra vodi do stanja, kjer je generator sposoben ustvariti podatke, ki so za diskriminatorja nerazločljivi od resničnih podatkov, kar pomeni, da je \(D(x) = 0.5\) za generirane vzorce. To je ključnega pomena za našo aplikacijo, saj želimo sintetične vzorce prevar, ki so čim bolj verodostojni.
Različne arhitekture GAN-ov za strukturirane podatke
Čeprav so GAN-i prvotno zasnovani za generiranje slik, so se razvile številne arhitekture, ki so prilagojene za delo s strukturiranimi podatki, kar je pogosto primer v zavarovalništvu. Med najpomembnejšimi za naš namen sta DCGAN in WGAN. DCGAN (Deep Convolutional GAN) je razširitev originalnega modela GAN, ki uporablja konvolucijske nevronske mreže namesto polno povezanih slojev. Čeprav so konvolucijske mreže znane po delu z vizualnimi podatki, se lahko prilagodijo za ekstrakcijo pomembnih značilnosti iz tabelarnih podatkov z ustreznim predprocesiranjem in reprezentacijo. Njegova stabilnost in sposobnost generiranja kakovostnih vzorcev ga delata privlačnega za določene tipe zavarovalniških podatkov, kjer so relacije med značilnostmi kompleksne in nelinearne.
Druga pomembna arhitektura je WGAN (Wasserstein GAN), ki se osredotoča na izboljšanje stabilnosti učenja in kakovosti generiranih vzorcev z uporabo Wassersteinove razdalje (Earth Mover's Distance) namesto Jensen-Shannonove divergence, ki jo uporablja klasični GAN. Wassersteinova razdalja zagotavlja bolj gladek gradient in preprečuje probleme 'načina propada' (mode collapse), kjer generator proizvaja omejeno paleto izhodov. To je kritično pri generiranju redkih primerov prevar, saj želimo zagotoviti raznolikost generiranih sintetičnih prevar, ki pokrivajo celoten spekter možnih scenarijev. WGAN-GP (WGAN with Gradient Penalty) je nadaljnja izboljšava, ki uvede kazen za gradient, kar dodatno stabilizira učenje in omogoča bolj robustno generiranje kakovostnih sintetičnih podatkov. Za zavarovalništvo, kjer sta natančnost in stabilnost ključnega pomena, so WGAN-i izjemno obetavni.
Aplikacija GAN-ov za generiranje sintetičnih podatkov pri nezgodnih zavarovanjih
Primarna aplikacija GAN-ov v našem kontekstu je generiranje sintetičnih podatkovnih vzorcev za redke razrede – v našem primeru to pomeni generiranje sintetičnih primerov prevar. Proces se začne z zbiranjem in predprocesiranjem realnih podatkov o nezgodnih zavarovanjih, ki vključujejo značilnosti zahtevkov (npr. vrsta nezgode, poškodbe, starost zavarovanca, trajanje zdravljenja, stroški, zgodovina prejšnjih zahtevkov) in binarno oznako, ali je bil zahtevek prevara ali ne. Ker je razred prevar precej majhen (npr. 1–5 % vseh zahtevkov), uporabimo obstoječe primere prevar kot 'seme' za naš generator. Generator se uči na teh resničnih primerih prevar, da bi razumel kompleksne korelacije in distribucije značilnosti, ki so prisotne v fraudulentnih zahtevkih.
Ko je generator treniran, lahko ustvarja poljubno število novih, sintetičnih vzorcev prevar. Ti sintetični podatki so zasnovani tako, da posnemajo statistične značilnosti realnih prevar, vendar ne vsebujejo dejanskih osebnih podatkov ali informacij, kar rešuje tudi pomisleke glede zasebnosti in skladnosti z GDPR. Z dodajanjem teh sintetičnih vzorcev v prvotni neuravnotežen podatkovni set dosežemo bolj uravnoteženo distribucijo razredov. To omogoča, da se modeli strojnega učenja, ki so pozneje trenirani na tem obogatenem setu, naučijo bolje prepoznati vzorce prevar, ne da bi bili preveč pristranski do dominantnega razreda legitimnih zahtevkov. Kvantitativno, namesto da bi imeli razmerje 1:99 (prevara : legitimno), lahko s pomočjo GAN-ov dosežemo razmerje 1:5 ali celo 1:1, kar bistveno izboljša zmožnost učenja modelov.
Kvantitativna ocena vpliva na lažno pozitivne in lažno negativne prevare
Ena najpomembnejših kvantitativnih metrik za oceno vpliva GAN-ov je zmanjšanje stopenj lažno pozitivnih (napaka tipa I) in lažno negativnih (napaka tipa II) prevar. Lažno pozitivne prevare so primeri, ko model napačno označi legitimen zahtevek kot prevaro, kar vodi v nepotrebne preiskave, podaljšanje časa reševanja zahtevka in potencialno nezadovoljstvo strank. Lažno negativne prevare pa so dejanske prevare, ki jih model ne prepozna, kar povzroča neposredne finančne izgube zavarovalnici. Oba tipa napak imata resne posledice, zato je optimizacija modela ključna za zmanjšanje obeh.
Na podlagi simulacij in primerov iz prakse je mogoče oceniti, da lahko z uporabo GAN-ov za obogatitev podatkov zmanjšamo stopnjo lažno negativnih prevar za povprečno 30–50 %. To pomeni, da prepoznamo precej več dejanskih prevar, ki bi jih sicer spregledali. Hkrati lahko ob pravilni kalibraciji modela in upoštevanju kompromisa med priklicem in natančnostjo dosežemo tudi zmanjšanje lažno pozitivnih prevar za 15–25 %. To se morda zdi manjše zmanjšanje v odstotkih, vendar ima velik vpliv na operativne stroške. Recimo, da imamo 10.000 škodnih zahtevkov letno in da je 2 % prevar (200 primerov). Če smo prej spregledali 50 % prevar (100 primerov), zdaj spregledamo le 20–35 % (40–70 primerov). Hkrati, če smo imeli prej 10 % lažno pozitivnih alarmov na 9.800 legitimnih zahtevkih (980 primerov), jih imamo zdaj 7,5–8,5 % (pribl. 735–833 primerov). Neto učinek je znatno izboljšanje učinkovitosti in prihrankov, kar dokazuje diagram konfuzijske matrike in primerjava metrik (npr. AUC-ROC) pred in po implementaciji.
Kaj je krito in kaj ni krito pri nezgodnem zavarovanju – osnova za razumevanje prevar
Razumevanje kritja in izključitev pri nezgodnem zavarovanju je temelj za učinkovito zaznavanje prevar, saj so mnoge prevare poskusi izkoriščanja sivih con ali napačnega predstavljanja dogodkov, da bi ustrezali definiciji kritnega dogodka. Kot zavarovalniška strokovnjakinja poudarjam, da so pogoji zavarovanj podrobno opredeljeni v splošnih in posebnih pogojih posamezne zavarovalnice. Ti pogoji niso splošno pravilo, ampak pogodbeno določilo med zavarovalnico in zavarovancem. Zakonodaja, kot je Zakon o zavarovalništvu (ZZavar-1), določa širši okvir delovanja zavarovalnic, ne pa specifičnih kritij. Podobno ZZVZZ in ZPIZ-2 urejata obvezna zavarovanja in pokojnine, ne pa prostovoljnih nezgodnih zavarovanj. Zato je nujno vedno preveriti pogoje konkretne police.
**Kaj je krito (informativni primeri, odvisno od police):**
1. **Smrt zaradi nezgode:** Izplačilo dogovorjene zavarovalne vsote dedičem. Primer izračuna: Če je zavarovalna vsota 50.000 EUR, se ta znesek izplača v primeru smrti. V Sloveniji se ta vsota zmanjša za regres (v kolikor je bil izplačan) s strani ZZZS, če gre za delovno nezgodo, kar določa specifična pravna praksa in pogoji posamezne zavarovalnice.
2. **Trajna invalidnost zaradi nezgode:** Izplačilo določenega odstotka zavarovalne vsote glede na določene stopnje invalidnosti (tabela invalidnosti). Primer izračuna: Zavarovalna vsota 100.000 EUR. Pri 30-odstotni trajni invalidnosti se izplača 30 % vsote, torej 30.000 EUR. Dejanska stopnja se določi na podlagi medicinske dokumentacije in mnenja izvedenca, pri čemer se upoštevajo določila splošnih pogojev, ki lahko določajo različne tabele invalidnosti.
3. **Dnevna odškodnina za čas zdravljenja:** Izplačilo dnevne vsote za čas nezmožnosti za delo (ali običajne aktivnosti) zaradi nezgode. Pogosto omejeno na določeno število dni. Primer izračuna: 20 EUR/dan za 60 dni = 1.200 EUR.
4. **Stroški zdravljenja:** Povračilo stroškov, ki niso kriti iz obveznega zdravstvenega zavarovanja (npr. nekatere fizioterapije, doplačila za specialistične preglede, medicinski pripomočki).
5. **Bolnišnični dan:** Izplačilo dnevne vsote za vsak dan bivanja v bolnišnici zaradi nezgode. Primer izračuna: 30 EUR/dan za 10 dni = 300 EUR.
**Kaj ni krito (informativni primeri, odvisno od police):**
1. **Bolezni:** Zavarovanje krije le nezgode, ne bolezni (razen če je to izrecno vključeno kot dodatno kritje). Vendar pa se v praksi pojavljajo prevare, kjer se poskuša bolezen prikazati kot posledica nezgode.
2. **Namera/malomarnost:** Poškodbe, ki si jih je zavarovanec namenoma povzročil ali so posledica skrajne malomarnosti (npr. vožnja pod vplivom drog/alkohola nad zakonsko mejo, sodelovanje v prepovedanih aktivnostih).
3. **Vojna, terorizem, naravne katastrofe (nekatera kritja so lahko izključena):** Nekateri dogodki so eksplicitno izključeni, čeprav so lahko vključena specifična kritja zanje kot nadgradnja.
4. **Samomor, poskus samomora:** To so standardne izključitve, razen če je v policah določeno drugače za nekatere specifične primere.
5. **Nezgode pod vplivom drog/alkohola:** Če so stopnje v krvi presegale zakonsko določene meje. Ta izključitev je pogost povod za prikrivanje dejanskih okoliščin nezgode, kar je oblika prevare.
Prevare pogosto nastanejo, ko zavarovanci poskušajo prikriti izključitve (npr. bili so pod vplivom alkohola) ali predstavljati bolezen kot nezgodo. Tukaj nam lahko GAN-i pomagajo prepoznati subtilne vzorce v podatkih, ki nakazujejo na takšne poskuse manipulacije, tudi če so podatki na prvi pogled verodostojni.
Izzivi in etični vidiki implementacije GAN-ov v zavarovalništvu
Čeprav so GAN-i izjemno obetavni, njihova implementacija prinaša tudi določene izzive. Eden glavnih je zagotavljanje kakovosti in verodostojnosti generiranih podatkov. Če generator ustvari sintetične podatke, ki niso dovolj reprezentativni ali vsebujejo pristranskost, lahko to poslabša zmogljivost modela, namesto da bi jo izboljšalo. Potreben je strog postopek validacije, vključno z validacijo s strani strokovnjakov, da se oceni realističnost in raznolikost generiranih vzorcev. Poleg tega je trening GAN-ov računalniško intenziven in zahteva precejšnje strokovno znanje. Drugi izziv je 'način propada' (mode collapse), kjer generator začne proizvajati le omejeno paleto izhodov, kar zmanjšuje raznolikost sintetičnih podatkov in s tem njihovo uporabno vrednost. Temu se zoperstavamo z naprednimi arhitekturami, kot je WGAN-GP, in skrbnim nastavljanjem hiperparametrov.
Etični vidiki so prav tako pomembni. Čeprav sintetični podatki ne vsebujejo dejanskih osebnih podatkov, je pomembno zagotoviti, da generirani podatki ne povzročajo neetičnih posledic, kot je ustvarjanje ali utrjevanje pristranskosti v modelih. Če so naši prvotni podatki o prevarah pristranski, lahko GAN-i to pristranskost celo potencirajo. Zato je ključno transparentno in odgovorno ravnanje s podatki ter nenehno spremljanje delovanja modelov. Akt EU o umetni inteligenci, ki je v fazi sprejemanja, bo imel pomembne implikacije za uporabo takšnih sistemov, saj bo zahteval visoko raven preglednosti, varnosti in spoštovanja temeljnih pravic. Kot strokovnjakinja poudarjam, da je etična uporaba tehnologije enako pomembna kot njena tehnična zmogljivost. Ne smemo pozabiti, da so končni cilj vedno pošteni in transparentni procesi za vse zavarovance.
Vpliv obogatitve podatkov z GAN-i na detekcijo prevar
- Brez ustreznega zavarovanja
- Zavarovalnica je zaznala naraščajoče število prevar pri nezgodnih zavarovanjih, ki so vključevale sumljive poškodbe hrbtenice. Zaradi neuravnoteženega podatkovnega seta so imeli modeli za detekcijo prevar nizek Recall (0.65), kar je pomenilo, da so spregledali 35% dejanskih prevar. Hkrati je bil Precision nizek (0.55), kar je povzročilo visoko število lažno pozitivnih alarmov in nepotrebne stroške preiskav ter nezadovoljstvo strank. Letne izgube zaradi spregledanih prevar so znašale 1.500.000 EUR, stroški preiskav lažno pozitivnih primerov pa 700.000 EUR.
- Z ustreznim zavarovanjem
- Po obogatitvi podatkovnega seta z 1.500 sintetičnimi primeri prevar, generiranimi z WGAN-GP arhitekturo, je model dosegel Recall 0.88 in Precision 0.72. To je pomenilo 23% izboljšanje pri prepoznavanju dejanskih prevar in 17% zmanjšanje lažno pozitivnih alarmov. Izgube zaradi spregledanih prevar so se zmanjšale na 975.000 EUR (zmanjšanje za 35%), stroški preiskav lažno pozitivnih primerov pa na 595.000 EUR (zmanjšanje za 15%). Skupni prihranki in zmanjšanje izgub so presegli 630.000 EUR letno, hkrati pa se je povečalo zadovoljstvo strank zaradi hitrejše obravnave legitimnih zahtevkov.
Primer je ilustrativen in povzet po tipičnih situacijah iz prakse. Kritja, izključitve in postopki se med zavarovalnicami razlikujejo.
Pogosta vprašanja
- Kaj je glavna prednost uporabe GAN-ov pri zaznavanju prevar?
- Glavna prednost je obogatitev neuravnoteženih podatkovnih setov z realističnimi sintetičnimi primeri prevar. To omogoča modelom strojnega učenja, da se bolje naučijo prepoznavati redke vzorce prevar, s tem pa zmanjšajo lažno negativne in lažno pozitivne rezultate, kar vodi do večje učinkovitosti in prihrankov.
- Ali so generirani sintetični podatki varni za uporabo?
- Da, sintetični podatki, generirani z GAN-i, ne vsebujejo dejanskih osebnih podatkov ali informacij. So statistično podobni realnim podatkom, vendar ne dopuščajo reverzibilnega inženiringa do posameznih oseb. To zagotavlja skladnost z GDPR in rešuje pomisleke glede zasebnosti ter omogoča sodelovanje.
- Kateri tip arhitekture GAN je najbolj primeren za zavarovalniške podatke?
- Za strukturirane zavarovalniške podatke so še posebej primerni DCGAN (Deep Convolutional GAN) in WGAN (Wasserstein GAN), še posebej WGAN-GP (z gradientno kaznijo). WGAN-GP je znan po izboljšani stabilnosti učenja in sposobnosti generiranja bolj raznolikih in realističnih sintetičnih vzorcev, kar je ključno za redke primere prevar.
- Kakšen je vpliv na F-mero modelov za zaznavanje prevar?
- Z uporabo GAN-ov za obogatitev podatkov se F-mera modelov za zaznavanje prevar lahko bistveno izboljša, pogosto za 25–40 % ali več. To pomeni precejšnje izboljšanje ravnotežja med priklicem (pravilno identificiranimi prevarami) in natančnostjo (delež napovedanih prevar, ki so resnične), kar vodi do zanesljivejših napovedi in manjših stroškov.
- Kakšni so etični pomisleki pri uporabi GAN-ov v zavarovalništvu?
- Glavni etični pomisleki vključujejo zagotavljanje, da generirani podatki ne povzročajo ali utrjujejo pristranskosti v modelih. Pomembno je tudi zagotoviti transparentnost delovanja in skladnost z zakonodajo, kot je Akt EU o umetni inteligenci. Odgovorno ravnanje s tehnologijo je ključno za ohranjanje zaupanja in poštenosti.
Viri in reference
- Uradni list RS – Zakon o zavarovalništvu (ZZavar-1)
- Uradni list RS – Zakon o zdravstvenem varstvu in zdravstvenem zavarovanju (ZZVZZ)
- Uradni list RS – Zakon o pokojninskem in invalidskem zavarovanju (ZPIZ-2)
- Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., ... & Bengio, Y. (2014). Generative Adversarial Networks. NeurIPS.
- Radford, A., Metz, L., & Chintala, S. (2015). Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks. arXiv preprint arXiv:1511.06434.
- Arjovsky, M., Chintala, S., & Bottou, L. (2017). Wasserstein GAN. International Conference on Machine Learning (ICML).
Nadaljujte branje o tej temi
Povezave so izbrane samodejno glede na steber zaščite in ključne besede te objave.
- Primer: Tehnični vpogledi

Uskladitev nezgodnih polic z inflacijo: Zakaj so stare vsote prenizke?
- Primer: Tehnični vpogledi

Avtoimunske bolezni in zavarovalno kritje: Kaj je realno mogoče
- Primer: Tehnični vpogledi

Davčna obravnava izplačila za hudo bolezen in uporaba sredstev
- Primer: Tehnični vpogledi

Pokojninska vrzel: kako jo izračunate na podlagi svojih podatkov
- Primer: Tehnični vpogledi

Revizija police za hude bolezni: Zakaj jo opraviti vsakih pet let
