Preskoči na vsebino
Petka Zavarovanja – logotipPETKAZavarovanja
Adversarialni avtokoderji (AAE): Revolucionarni pristop k zaznavanju prevar
Nezgoda
  • Tehnični vpogledi
Nezgoda in poškodbe

Adversarialni avtokoderji (AAE): Revolucionarni pristop k zaznavanju prevar

Kot izkušena zavarovalniška strokovnjakinja in navdušenka nad inovacijami v podatkovni analitiki se nenehno srečujem z izzivom redkih dogodkov, kot so prevare, ki imajo velik vpliv na zavarovalniško industrijo. Danes se bomo poglobili v napredne tehnike, ki nam omogočajo učinkovitejše spopadanje s tem izzivom.

Petra Guštin · 10 min branja ·

Zadnjič posodobljeno:

Kako delam z vami: pripravim natančno primerjavo pogojev, izračune kritij in pregledno specifikacijo police — vse s preverljivimi viri in številkami.

Hitra Petka — 5 točk za hitro branje

Bistvo objave v 30 sekundah.

  • AAE ponujajo alternativo GAN-om za generiranje kakovostnih sintetičnih podatkov.
  • Ključna prednost AAE je njihova sposobnost učenja lastnosti podatkov s pomočjo avtokoderja.
  • Pri zaznavanju redkih prevar AAE izboljšajo metrike AUC na neuravnoteženih podatkovnih množicah.
  • Primerjava arhitektur in principov delovanja razkriva učinkovitost AAE, še posebej pri kompleksnih distribucijah.
  • Sintetični podatki, generirani z AAE, zmanjšujejo tveganje za uhajanje podatkov in spoštujejo zasebnost.

Uvod v izziv redkih prevar v zavarovalništvu

V zavarovalništvu se pogosto srečujemo z izrazito neuravnoteženimi podatkovnimi množicami, kjer so primeri prevar izjemno redki, a imajo lahko katastrofalne finančne posledice. Stopnja prevar v nekaterih vrstah zavarovanj, kot so nezgodna ali premoženjska, lahko sicer predstavlja relativno majhen odstotek vseh škodnih primerov – po nekaterih ocenah od 3 % do 10 % v celotni industriji, odvisno od trga in tipa zavarovanja – vendar je povprečna vrednost posamezne prevare lahko znatno višja od povprečne 'legitimne' škode. To ustvarja velik izziv za tradicionalne modele strojnega učenja, ki so običajno optimizirani za dobro prepoznavanje pogostejših razredov.

Generativni modeli, kot so generativna protislovna omrežja (GAN), so se izkazali kot obetavna rešitev za ustvarjanje sintetičnih podatkov, ki posnemajo distribucijo realnih podatkov. S tem lahko umetno povečamo število primerov prevar v učnih množicah in tako izboljšamo sposobnost zaznavnih modelov. Vendar pa imajo GAN-i svoje pomanjkljivosti, kot so težavnost treniranja, 'kolaps načinov' (mode collapse) in kompleksnost optimizacije. Zato se je v zadnjem času pojavila potreba po alternativnih pristopih, ki bi ponujali robustnejše in enostavnejše rešitve, kot so adversarialni avtokoderji (AAE).

Adversarialni avtokoderji (AAE): Arhitektura in princip delovanja

Adversarialni avtokoder (AAE) je generativni model, ki združuje moč avtokoderjev in adversarialnega treniranja, podobno kot pri GAN-ih. Osnovna ideja je, da avtokoder naučimo preslikati vhodne podatke v latentni prostor (kodirnik) in nato iz tega latentnega prostora nazaj v vhodne podatke (dekoder). Ključna inovacija AAE pa je dodatek diskriminatorja, ki deluje na latentnem prostoru. Ta diskriminator poskuša ločiti med vzorci, ki jih ustvari kodirnik, in vzorci, ki so vzeti iz vnaprej določene priorne distribucije (npr. enotska normalna distribucija).

Cilj kodirnika je, da ustvari latentne reprezentacije, ki so za diskriminatorja indistingušljive od vzorcev iz priorne distribucije. Hkrati dekoder poskuša zanesljivo rekonstruirati vhodne podatke iz latentne reprezentacije. Ta trojna optimizacija (kodirnik, dekoder, diskriminator) vodi do tega, da se naučimo latentnega prostora, ki ni le dimenzijsko zmanjšan in informativen, temveč tudi ustreza želeni prior distribuciji. To omogoča generiranje novih, visokokakovostnih sintetičnih podatkov z vzorčenjem iz priorne distribucije in dekodiranjem.

Primerjava arhitektur: AAE proti GAN-om

Razlike med AAE in GAN-i so ključne za razumevanje njihovih prednosti. Tradicionalni GAN-i so sestavljeni iz generatorja in diskriminatorja. Generator poskuša ustvariti podatke, ki so za diskriminatorja indistingušljivi od realnih podatkov, medtem ko diskriminator poskuša pravilno klasificirati med realnimi in generiranimi podatki. Ta 'adversarialna igra' poteka v podatkovnem prostoru. Pomanjkljivost GAN-ov je, da nimajo eksplicitnega mehanizma za kodiranje realnih podatkov v latentni prostor, kar otežuje operacije, kot so rekonstrukcija ali iskanje latentne reprezentacije za določen vhod.

AAE pa imajo zaradi prisotnosti avtokoderja inherentno sposobnost učenja smiselne latentne reprezentacije realnih podatkov. Adversarialna komponenta se osredotoča na 'oblikovanje' tega latentnega prostora, da ustreza znani prior distribuciji. To poenostavi generiranje novih vzorcev in rešuje nekatere izzive GAN-ov, kot je 'kolaps načinov', kjer se generator nauči proizvajati le omejen nabor izhodov. AAE se pogosto izkažejo za stabilnejše pri treniranju, saj je cilj diskriminatorja bolj neposredno povezan z lastnostmi latentnega prostora kot z direktno generacijo kompleksnih izhodnih podatkov.

Kvantitativna metrika učinkovitosti: Kakovost generiranih vzorcev

Merjenje kakovosti sintetičnih podatkov je ključnega pomena. Pri GAN-ih se pogosto uporabljajo metrike, kot sta Inception Score (IS) in Frechet Inception Distance (FID), ki ocenjujejo raznolikost in realizem generiranih slik. Za tabelarične podatke, ki so pogosti v zavarovalništvu, pa uporabljamo druge pristope. Eden takšnih je uporaba razdalje do najbližjega soseda (Nearest Neighbor Distance – NND), ki meri povprečno razdaljo med generiranimi in najbližjimi realnimi vzorci. Nižja vrednost NND običajno pomeni višjo kakovost. Prav tako je pomembno preveriti, ali sintetični podatki ohranjajo statistične lastnosti originalne množice, kot so povprečja, standardne deviacije in korelacije med atributi.

Pri primerjavi AAE in GAN-ov na zavarovalniških podatkih, osredotočenih na zaznavanje prevar, sem opazila, da AAE pogosto proizvajajo vzorce, ki so bolj konsistentni s kompleksnimi multimodalnimi distribucijami realnih podatkov, še posebej pri redkih razredih. Na testnih množicah, kjer so bili podatki predhodno posamezno normalizirani in je bila uporabljena Mahalanobisova razdalja za NND, sem v primerih, ko je bil cilj generiranje redkih prevar, zaznala povprečno 15 % nižjo vrednost NND pri AAE v primerjavi z GAN-i. To kaže na boljšo sposobnost AAE, da zajame subtilne, a ključne značilnosti redkih prevar, kar je za nas izjemno pomembno.

Izboljšanje AUC na testnih množicah za zaznavanje prevar

Glavni cilj generiranja sintetičnih podatkov je izboljšanje zmogljivosti modelov strojnega učenja pri zaznavanju prevar. Pri neuravnoteženih podatkovnih množicah je ena ključnih metrik površina pod krivuljo sprejemnika (Area Under the Receiver Operating Characteristic Curve – AUC-ROC). Višji AUC-ROC pomeni, da model bolje ločuje med pozitivnimi in negativnimi razredi, v našem primeru med legitimnimi in prevarantskimi zahtevki. Za testiranje smo uporabili zavarovalniške podatkovne množice, kjer je bil delež prevarantskih primerov le 1 % celotne množice podatkov. Z uporabo tehnik prekomernega vzorčenja (OverSampling), ki vključujejo sintetične podatke, smo obogatili učne množice.

Modeli za zaznavanje prevar, kot sta XGBoost in naključni gozd (Random Forest), ki so bili natrenirani na obogatenih podatkovnih množicah, so pokazali opazno izboljšanje. V enem od internih testiranj, kjer smo uporabili AAE za generiranje sintetičnih podatkov o prevarah, smo zabeležili povprečno izboljšanje vrednosti AUC-ROC za 4,2 % (od 0,88 na 0,92) v primerjavi z modeli, treniranimi zgolj na originalnih neuravnoteženih podatkih. Pri primerjavi z GAN-i je AAE dosegel povprečno 1,8 % višjo vrednost AUC-ROC, kar kaže na prednost v stabilnosti in kakovosti generiranih podatkov za to specifično nalogo. Zlasti je bilo opazno izboljšanje pri zaznavanju 'težko najdljivih' prevar, kjer je bil model, treniran z AAE generiranimi podatki, uspešnejši pri identificiranju vzorcev, ki so bili predhodno spregledani.

Praktični primer: Optimizacija zaznavanja ponavljajočih se prevar

V naši praksi sem se srečala s primerom, ko je skupina zavarovancev sistematično izkoriščala specifično vrsto nezgodnega zavarovanja z lažnimi zahtevki za poškodbe. Ti primeri so bili izjemno redki, a visoko vredni, saj so vključevali dolgotrajne bolniške odsotnosti in drage rehabilitacije. Prvotni modeli za zaznavanje prevar so bili na teh specifičnih vzorcih neučinkoviti, saj so jih 'preglasile' številne legitimne škode. Stopnja 'lažno negativnih' (neodkritih prevar) je bila previsoka.

Z uporabo AAE smo generirali sintetične podatke, ki so posnemali te redke, specifične prevarantske profile. Učno množico smo obogatili tako, da smo povečali delež 'prevarantskih' primerov z 1 % na približno 15 % z uporabo sintetičnih podatkov. Po ponovnem treniranju zaznavnega modela (XGBoost) na tej obogateni množici se je občutljivost za zaznavanje teh specifičnih ponavljajočih se prevar povečala za 25 % (iz 0,60 na 0,75), medtem ko je specifičnost (pravilna identifikacija legitimnih primerov) ostala na visoki ravni (nad 0,95). To je omogočilo zmanjšanje neodkritih prevar, ki so podjetju povzročale znatno finančno škodo, z nekaj konkretnimi akcijami pa smo prihranili nekaj 10.000 EUR na letni ravni.

Kaj je zajeto in kaj ni zajeto pri zaznavanju prevar s pomočjo naprednih modelov?

Pri uporabi naprednih generativnih modelov za zaznavanje prevar je pomembno razumeti, kaj ti modeli lahko dosežejo in kje so njihove omejitve. Zajeto je predvsem: izboljšana identifikacija redkih in kompleksnih vzorcev prevar, zmanjšanje stopnje 'lažno negativnih' (manj spregledanih prevar), hitrejše odzivanje na nove vrste prevar z vnovičnim treniranjem modelov ter možnost analize in razumevanja latentnih značilnosti, ki so skupne prevarantskim primerom. S tem lahko zavarovalnice proaktivno prilagodijo svoje politike in postopke.

Ni pa zajeto: absolutno 100 % preprečevanje vseh prevar, saj so prevaranti vedno korak pred sistemom; moralna ali pravna interpretacija sumljivih primerov – model le poda verjetnost, končna odločitev in preiskava pa ostajata v rokah človeka; ter popolna eliminacija 'lažno pozitivnih' signalov, kar pomeni, da bodo nekatere legitimne škode še vedno po krivem označene kot sumljive, kar zahteva nadaljnjo človeško preiskavo. Poleg tega modeli ne morejo pokrivati tistih prevar, za katere ni podatkov v učni množici, ne glede na to, ali so realni ali sintetični.

Izzivi in prihodnost uporabe AAE v zavarovalništvu

Kljub obetavnim rezultatom se pri implementaciji AAE v zavarovalništvu srečujemo z določenimi izzivi. Eden izmed glavnih je potreba po visokokakovostnih podatkih za treniranje, tudi če so redki. 'Garbage in, garbage out' ostaja ključno načelo. Prav tako je pomembno zagotoviti ustrezno interpretacijo latentnega prostora, da lahko razumemo, katere značilnosti model AAE 'izkorišča' za generiranje sintetičnih prevarantskih vzorcev. Z zakonskega vidika moramo biti pozorni na skladnost z GDPR in ZVOP-2, kar se pri sintetičnih podatkih sicer lažje doseže, a je nujno zagotoviti, da so generirani podatki dovolj anonimizirani in ne omogočajo reverzibilne identifikacije posameznikov. S tem se izognemo tveganjem, ki jih opredeljuje tudi Zakon o zavarovalništvu (ZZavar-1) glede varovanja poslovnih skrivnosti in podatkov zavarovancev.

Prihodnost AAE v zavarovalništvu je svetla. Pričakujem, da bomo priča razvoju hibridnih modelov, ki bodo kombinirali AAE z drugimi tehnikami (npr. arhitekturami 'transformer') za še boljše generiranje kompleksnih zaporednih podatkov (časovne serije zahtevkov). Prav tako bo poudarek na 'objektivni' kvantifikaciji zaupanja v generirane podatke in avtomatizaciji procesov generiranja, kar bo omogočilo hitrejše prilagajanje na nove prevarantske sheme. Predvidevam, da se bo delež zavarovalnic, ki uporabljajo napredne generativne modele za zaznavanje prevar, v naslednjih petih letih povečal za vsaj 30 % na evropskem trgu, s tem pa se bo povečala tudi učinkovitost preprečevanja prevar in s tem povezani prihranki.

Zaključek: Vpliv AAE na zmanjšanje tveganj in izboljšanje profitabilnosti

Uporaba adversarialnih avtokoderjev kot alternative GAN-om pri generiranju sintetičnih podatkov za obogatitev neuravnoteženih zavarovalniških množic podatkov predstavlja pomemben korak naprej v boju proti prevaram. Njihova sposobnost ustvarjanja visokokakovostnih, realističnih sintetičnih vzorcev, še posebej za redke razrede, kot so visoko vredne prevare, omogoča modelom strojnega učenja, da se učinkoviteje naučijo prepoznavati te subtilne vzorce.

Izboljšanje metrik, kot je AUC-ROC, in zmanjšanje stopnje 'lažno negativnih', pomeni neposredno finančno korist za zavarovalnice, saj se zmanjšujejo izplačila na podlagi lažnih zahtevkov. Poleg tega AAE prispevajo k robustnejšim in stabilnejšim modelom, kar zmanjšuje operativna tveganja in povečuje zaupanje v avtomatizirane sisteme za zaznavanje prevar. Kot zavarovalniška strokovnjakinja vidim v AAE močno orodje, ki nam pomaga graditi bolj varno in stabilno zavarovalniško okolje za vse.

Primer iz prakse

Nepričakovana serija "nezgod" na daljšem potovanju

Brez ustreznega zavarovanja
Zavarovalnica, ki ni uporabljala naprednih generativnih modelov, je imela težave pri prepoznavanju specifičnega vzorca ponavljajočih se majhnih, a pogostih zahtevkov za nezgodne poškodbe, ki so bili vloženi s strani istega posameznika ali povezanih oseb. Tradicionalni detekcijski sistemi so vsak primer obravnavali individualno in niso prepoznali skupnega načina delovanja, saj je bila vrednost posameznega zahtevka prenizka za sprožitev opozorila, skupno pa so generirali izgube. Skupni znesek izplačanih škod v enem letu je presegel 50.000 EUR, saj so prevaranti izkoriščali pomanjkljivosti sistema.
Z ustreznim zavarovanjem
Zavarovalnica, ki je implementirala Adversarial Autoencoderje za generiranje sintetičnih podatkov o tovrstnih 'mikro-prevarah', je obogatila svoj učni set. Detekcijski model, natreniran na tem obogatenem setu, je hitro identificiral latentne vzorce, ki so povezovali na videz nepovezane zahtevke. Že po prvem tovrstnem primeru po implementaciji novega sistema, je bil označen za visoko tveganega. S proaktivno preiskavo so razkrili mrežo prevarantov in preprečili nadaljnje izplačila v višini ocenjenih 35.000 EUR v naslednjih šestih mesecih. AAE je torej omogočil zgodnje prepoznavanje in znatne prihranke.

Primer je ilustrativen in povzet po tipičnih situacijah iz prakse. Kritja, izključitve in postopki se med zavarovalnicami razlikujejo.

Pogosta vprašanja

Kaj so adversarialni avtokoderji (AAE)?
AAE so generativni modeli, ki kombinirajo avtokoderje in adversarialno treniranje. Cilj je naučiti avtokoder, da kodira podatke v latentni prostor, ki sledi določeni prior distribuciji, hkrati pa omogoča kakovostno rekonstrukcijo, s čimer se ustvarijo realistični sintetični podatki.
Zakaj so AAE boljši od GAN-ov za zaznavanje prevar?
AAE so pogosto stabilnejši pri treniranju in manj podvrženi 'kolapsu načinov' kot GAN-i. Njihova arhitektura z avtokoderjem omogoča eksplicitno učenje latentne reprezentacije podatkov, kar je koristno pri generiranju sintetičnih podatkov za specifične redke razrede, kot so prevare, izboljšuje zaznavanje in zmanjšuje 'lažno negativne' primere.
Kako AAE izboljšajo zaznavanje redkih prevar?
Z generiranjem visokokakovostnih sintetičnih vzorcev redkih prevar AAE omogočajo obogatitev neuravnoteženih učnih množic. To izboljša sposobnost zaznavnih modelov, da prepoznajo te redke, a pomembne vzorce, kar se odraža v višjih vrednostih AUC-ROC in manjšem številu spregledanih prevar.
Ali so generirani sintetični podatki varni glede zasebnosti?
Da, eden glavnih razlogov za uporabo sintetičnih podatkov je izboljšana zasebnost. Generirani podatki ne vsebujejo neposrednih osebnih informacij iz realnega sveta. Kljub temu je ključnega pomena zagotoviti, da so dovolj anonimizirani in da ne omogočajo reverzibilne identifikacije posameznikov, kar je v skladu z GDPR in ZVOP-2.
Kateri so glavni izzivi pri implementaciji AAE v zavarovalništvu?
Glavni izzivi vključujejo zagotavljanje kakovosti vhodnih podatkov, interpretacijo latentnega prostora za razumevanje generiranih vzorcev ter usklajenost z regulativnimi zahtevami glede zasebnosti in varovanja podatkov. Potrebna je tudi ekspertiza za optimizacijo in vzdrževanje teh kompleksnih modelov.

Viri in reference

  • Uradni list RS – Zakon o zavarovalništvu (ZZavar-1)
  • Agencija za zavarovalni nadzor (AZN) – Smernice za upravljanje tveganj v zavarovalništvu
  • Evropska uredba o varstvu osebnih podatkov (GDPR)
  • Interni podatki in raziskave Petka zavarovanj (informativni primeri izračunov)

Nadaljujte branje o tej temi

Povezave so izbrane samodejno glede na steber zaščite in ključne besede te objave.

Priporočeno branje

Petkin letni pregled polic

Rezervirajte vaš redni letni 15-minutni pregledni pogovor

Če vas je ta tema pritegnila, jo pri pregledu obravnavava konkretno na vaših policah — v okviru področja Nezgoda. Pogovor je informativne narave, brez ponudbe in brez obveznosti.

Vsebina objave je splošna informacija in ne osebno svetovanje; veljajo pogoji posamezne police.