Preskoči na vsebino
Petka Zavarovanja – logotipPETKAZavarovanja
Neuravnoteženi podatki v GAN-ih za simulacijo prevar: Kvantitativna analiza
Nezgoda
  • Tehnični vpogledi
Nezgoda in poškodbe

Neuravnoteženi podatki v GAN-ih za simulacijo prevar: Kvantitativna analiza

V svetu zavarovalništva se nenehno srečujemo z izzivom odkrivanja in preprečevanja prevar, ki predstavljajo znatno finančno breme. Generativna adverzarialna omrežja (GAN-i) ponujajo inovativne rešitve za simulacijo kompleksnih vzorcev prevar, vendar njihovo učinkovitost pogosto omejuje inherentna neuravnoteženost realnih podatkovnih naborov.

Petra Guštin · 15 min branja ·

Zadnjič posodobljeno:

Kako delam z vami: pripravim natančno primerjavo pogojev, izračune kritij in pregledno specifikacijo police — vse s preverljivimi viri in številkami.

Hitra Petka — 5 točk za hitro branje

Bistvo objave v 30 sekundah.

  • Neuravnoteženi podatki so ključna ovira za učinkovito treniranje GAN-ov pri simulaciji redkih zavarovalniških prevar.
  • Standardne metode uravnoteženja (SMOTE, ADASYN, over/undersampling) lahko izboljšajo stabilnost in kakovost generiranih podatkov.
  • Kvantitativna analiza pokaže, da uravnoteženje izboljšuje Divergence Score (npr. Frechet Inception Distance – FID) in prepoznavnost generiranih prevar.
  • Izbira metode uravnoteženja in njenih parametrov pomembno vpliva na konvergenco GAN-a in realističnost sintetičnih vzorcev.
  • Implementacija teh metod zahteva skrbno evalvacijo, da se prepreči prekomerno prilagajanje (overfitting) in ohrani robustnost modela.

Uvod: Zavarovalniške prevare in izzivi GAN-ov z neuravnoteženimi podatki

V zavarovalništvu se nenehno soočamo z izzivom učinkovitega prepoznavanja in preprečevanja zavarovalniških prevar. Kljub napredku analitičnih metod, kot so algoritmi strojnega učenja, ostaja generiranje verodostojnih sintetičnih podatkov o prevarah kompleksna naloga. Generativna adverzarialna omrežja (GAN-i) so se izkazala kot obetavno orodje za ustvarjanje sintetičnih podatkov, ki posnemajo statistične značilnosti realnih podatkovnih naborov. Vendar pa se pri specifični uporabi za simulacijo zavarovalniških prevar srečujemo z značilno težavo: inherentno neuravnoteženostjo podatkovnih naborov.

Pogostost zavarovalniških prevar je v primerjavi z legitimnimi zahtevki izjemno nizka, običajno predstavljajo manj kot 1 % do 5 % vseh primerov. To pomeni, da je v tipičnem podatkovnem naboru za treniranje modelov le izjemno majhen delež vzorcev, ki spadajo v razred prevar (minoritetni razred). Takšna neuravnoteženost dramatično otežuje treniranje GAN-ov, saj generator težko prepozna in reproducira kompleksne, redke vzorce prevar, medtem ko diskriminator, soočen z obilico legitimnih vzorcev, ne more učinkovito ločiti med realnimi in generiranimi prevarami. Posledica je nestabilno treniranje, slaba konvergenca modela in generiranje sintetičnih podatkov, ki ne odražajo realističnih značilnosti prevarantskih aktivnosti.

Anatomija GAN-a in njegov potencial pri detekciji prevar

GAN-i so sestavljeni iz dveh nasprotujočih si nevronskih mrež: generatorja (G) in diskriminatorja (D). Generator poskuša ustvariti sintetične vzorce, ki so čim bolj podobni realnim podatkom, medtem ko diskriminator poskuša razlikovati med realnimi in generiranimi vzorci. Proces treniranja je tekmovanje med tema dvema mrežama, kjer obe mreži izboljšujeta svoje sposobnosti, dokler generator ne uspe ustvariti tako realističnih vzorcev, da jih diskriminator ne more več zanesljivo ločiti od realnih. V kontekstu zavarovalništva bi idealno treniran GAN lahko generiral sintetične primere prevar, ki bi jih lahko uporabili za obogatitev obstoječih podatkovnih naborov, testiranje detektorjev prevar ali celo za simulacijo novih, še neznanih vzorcev prevar.

Kljub potencialu pa se pri detekciji prevar soočamo s specifičnimi izzivi. Predpostavimo, da imamo podatkovni nabor z N vzorci, od katerih je N_fraud << N_legitimate. Med treniranjem GAN-a bo generator pretežno izpostavljen legitimnim vzorcem, kar lahko privede do t. i. »mode collapse« ali generiranja nerelevantnih vzorcev. To pomeni, da GAN ne bo zajel celotne raznolikosti minoritetnega razreda (prevare), ampak bo generiral le nekaj, morda zelo podobnih primerov. To bistveno zmanjša uporabnost generiranih podatkov za izboljšanje detekcije prevar, saj želimo raznolikost in realističnost, ki pokriva širok spekter prevarantskih scenarijev.

Kvantitativni vpliv neuravnoteženosti podatkov na stabilnost treniranja GAN-a

Neuravnoteženost podatkov ima merljive posledice na proces treniranja GAN-ov. Ena glavnih težav je nestabilnost, ki se kaže v nihanjih funkcije izgube (loss function) in težavah pri konvergenci. Za kvantificiranje nestabilnosti lahko opazujemo standardni odklon funkcije izgube diskriminatorja in generatorja skozi epohe. Pri neuravnoteženih podatkih pogosto opazimo višji standardni odklon in pomanjkanje gladke konvergence proti stabilnemu ravnovesju (Nash Equilibrium).

Empirične študije kažejo, da lahko pri visoko neuravnoteženih podatkovnih naborih, kjer je razmerje med majoritetnim in minoritetnim razredom npr. 1000:1, stabilnost treniranja drastično pade. Generirana distribucija podatkov se namesto, da bi se približala realni distribuciji, lahko oddalji. Kvantitativno se to lahko meri z metriko FID (Frechet Inception Distance), ki ocenjuje podobnost med distribucijo realnih in generiranih podatkov. Višji FID običajno kaže na slabšo kakovost generiranih vzorcev. Pri neuravnoteženih podatkih FID pogosto ostane visok ali celo narašča skozi treniranje, kar kaže na to, da generatorju ne uspe ustvarjati realističnih vzorcev prevar.

Metode za uravnoteženje podatkov: Splošni pregled

Za obvladovanje neuravnoteženosti podatkov so razvite različne tehnike, ki jih lahko razdelimo v tri glavne kategorije: oversampling (povečanje minoritetnega razreda), undersampling (zmanjšanje majoritetnega razreda) in hibridne metode. Vsaka od teh metod ima svoje prednosti in slabosti ter specifične vplive na treniranje GAN-ov.

**Oversampling** metode ustvarjajo dodatne sintetične vzorce minoritetnega razreda. Med najbolj priljubljenimi so SMOTE (Synthetic Minority Over-sampling Technique) in ADASYN (Adaptive Synthetic Sampling). SMOTE ustvarja nove sintetične vzorce tako, da interpolira med obstoječimi vzorci minoritetnega razreda in njihovimi najbližjimi sosedi. ADASYN gre korak dlje in generira več sintetičnih vzorcev za tiste vzorce minoritetnega razreda, ki jih je težje klasificirati (tiste blizu odločitvene meje). **Undersampling** metode, kot je Random Undersampling ali NearMiss, zmanjšajo število vzorcev v majoritetnem razredu. Čeprav lahko izboljšajo uravnoteženost, lahko povzročijo izgubo pomembnih informacij iz majoritetnega razreda. **Hibridne metode** kombinirajo oversampling in undersampling, da izkoristijo prednosti obeh pristopov, na primer SMOTEENN (SMOTE + Edited Nearest Neighbours).

Kvantitativna analiza vpliva oversampling metod na GAN-e

Osredotočimo se na kvantitativno evalvacijo metod oversamplinga, kot sta SMOTE in ADASYN, pri pripravi podatkov za treniranje GAN-ov. Preden podatke podamo GAN-u, jih lahko uravnotežimo. Implementacija SMOTE ali ADASYN lahko znatno poveča število vzorcev prevar, kar generatorju omogoča, da se bolje nauči kompleksnih značilnosti minoritetnega razreda. Predpostavimo, da imamo začetno razmerje 99:1 (legitimni:prevara). Po uporabi SMOTE lahko razmerje zmanjšamo na 1:1 ali 2:1, odvisno od parametrov. To se odrazi v izboljšani stabilnosti funkcije izgube GAN-a, saj diskriminator ne bo več tako preobremenjen z majoritetnim razredom.

Kvantitativni rezultati kažejo, da uporaba SMOTE ali ADASYN pred treniranjem GAN-a lahko zmanjša FID score za povprečno 15 % do 30 % v primerjavi z neobdelanimi neuravnoteženimi podatki. Poleg tega se izboljša »diversity score« generiranih vzorcev, kar lahko merimo z metriko, kot je Kernel Inception Distance (KID) ali entropija razreda. Boljši diversity score pomeni, da GAN generira širši spekter realističnih vzorcev prevar, ne le nekaj identičnih kopij. Vpliv na konvergenco se kaže v bolj gladkih krivuljah funkcije izgube in hitrejšem doseganju Nash Equilibrium, kar pomeni, da je model bolj robusten in manj nagnjen k »mode collapse«.

Undersampling in hibridne metode: Njihov prispevek k robustnosti GAN-ov

Undersampling metode, kot je naključno undersampling, so preproste za implementacijo. Kvantitativno zmanjšanje majoritetnega razreda izboljša razmerje med razredi, kar lahko podobno kot oversampling stabilizira treniranje GAN-a in zmanjša FID. Vendar pa lahko povzroči izgubo kritičnih informacij o majoritetnem razredu, kar lahko zmanjša splošno realističnost generiranih podatkov. Na primer, če zmanjšamo število legitimnih primerov za 90 %, obstaja 90 % verjetnost, da izgubimo redke, a pomembne značilnosti legitimnih transakcij, ki bi lahko pomagale pri boljši diskriminaciji.

Hibridne metode, kot je SMOTEENN, poskušajo združiti prednosti obeh pristopov. Po generiranju sintetičnih vzorcev minoritetnega razreda (SMOTE) se odstranijo majoritetni vzorci, ki so blizu meje razredov in bi lahko bili vir šuma (ENN – Edited Nearest Neighbours). Kvantitativno to lahko privede do optimalnega ravnovesja med izboljšano stabilnostjo treniranja in ohranitvijo informacij. Študije so pokazale, da hibridni pristopi lahko dosegajo boljše FID rezultate kot zgolj oversampling ali undersampling, saj hkrati obvladujejo neuravnoteženost in potencialni šum v podatkih. Na primer, zmanjšanje FID za dodatnih 5–10 % v primerjavi s samostojnim SMOTE je pogosto opazno, kar kaže na superiorno kakovost generiranih podatkov.

Kaj je krito in kaj ni krito pri detekciji zavarovalniških prevar s pomočjo GAN-ov?

Pri uporabi GAN-ov za simulacijo in detekcijo prevar je pomembno razumeti obseg njihovih sposobnosti. GAN-i so namenjeni generiranju realističnih sintetičnih podatkov, ki odražajo vzorce prevar v obstoječem podatkovnem naboru. To pomeni, da lahko simulirajo znane vrste prevar in pomagajo pri odkrivanju prevar, ki imajo podobne značilnosti kot pretekle. Krito je generiranje sintetičnih primerov za obogatitev podatkovnih naborov, ki se nato uporabljajo za treniranje robustnejših detektorjev prevar. Prav tako je krito izboljšanje zmogljivosti modelov strojnega učenja pri klasifikaciji prevarantskih primerov z uporabo uravnoteženih podatkov.

**Krito:**

- Generiranje sintetičnih podatkov, ki posnemajo statistične značilnosti obstoječih prevarantskih primerov (npr. lažne prijave nezgod, ponarejene zdravniške izvide).

- Uravnoteženje podatkovnih naborov za izboljšanje treniranja detektorjev prevar.

- Simulacija »kaj-če« scenarijev za testiranje odpornosti detektorjev na potencialne prevare.

- Povečanje števila razpoložljivih podatkov za minoritetni razred (prevare) v skladu z načeli anonimizacije GDPR.

**Ni krito:**

- Napovedovanje popolnoma novih, še nikoli videnih vrst prevar, ki nimajo predhodnih podatkovnih vzorcev.

- Odkrivanje prevar v realnem času, saj GAN-i primarno služijo za generiranje podatkov, ne neposredno za klasifikacijo.

- Zagotavljanje 100 % zanesljivosti detekcije prevar; so le orodje za izboljšanje, ne pa nadomestek za človeško ekspertizo.

- Nadomeščanje pravnih in forenzičnih preiskav; generirani podatki so sintetični in ne predstavljajo realnih dokazov o prevari.

- Popolna anonimizacija in zagotavljanje skladnosti z vsemi določili ZZVZZ, ZPIZ-2 ali ZZavar-1 brez dodatnih varnostnih ukrepov in revizij. Generiranje sintetičnih podatkov zmanjšuje tveganje, a ga ne odpravlja v celoti.

Izbira funkcije izgube in stabilnost treniranja

Poleg tehnik uravnoteženja podatkov ima tudi izbira funkcije izgube ključno vlogo pri stabilnosti treniranja in kakovosti generiranih podatkov, še posebej pri neuravnoteženih naborih. Standardna binarna križna entropija (Binary Cross-Entropy Loss) je pogosto uporabljena v GAN-ih, vendar je občutljiva na neuravnoteženost razredov. Minoritetni razred (prevare) lahko prispeva zanemarljiv del k celotni izgubi, kar povzroči, da se model osredotoči predvsem na majoritetni razred.

Za izboljšanje treniranja so bile predlagane alternativne funkcije izgube, kot so Wasserstein GAN (WGAN) ali WGAN-GP (Gradient Penalty). Te funkcije izgube so robustnejše proti nestabilnosti in »mode collapse« ter lahko zagotovijo bolj gladke gradientne poti, kar olajša konvergenco. Kvantitativno uporaba WGAN-GP namesto standardne BCE lahko zmanjša FID score za dodatnih 10–20 % pri neuravnoteženih podatkih, hkrati pa zagotavlja stabilnejše metrike, kot je »stability score« (merjeno z nihanjem funkcije izgube skozi treniranje). Kombinacija teh robustnejših funkcij izgube z metodami uravnoteženja podatkov pogosto prinaša najboljše rezultate, saj se hkrati rešujeta problema neuravnoteženosti in inherentne nestabilnosti GAN-ov.

Praktični primer: Optimizacija detekcije lažnih prijav nezgod

Vzemimo primer zavarovalnice, ki se sooča z naraščajočim številom lažnih prijav nezgod, pri čemer je delež prevarantskih primerov v zgodovinskih podatkih le približno 0,8 %. Pred implementacijo naprednega sistema za detekcijo prevar na osnovi nevronskih mrež smo se odločili za uporabo GAN-a za generiranje sintetičnih podatkov, ki bi obogatili naš podatkovni nabor prevar. Izvirni podatkovni nabor je obsegal 100.000 prijav nezgod, od tega 800 prevar in 99.200 legitimnih primerov.

Na začetku smo poskusili trenirati standardni DCGAN (Deep Convolutional GAN) na neobdelanih podatkih. Rezultati so bili slabi: FID score je znašal 125, in vizualna ocena generiranih »prevar« je pokazala pomanjkanje realističnosti in raznolikosti. V drugi fazi smo pred treniranjem GAN-a uporabili metodo SMOTE, da smo povečali število prevarantskih primerov na 50.000, s čimer se je razmerje zmanjšalo na približno 2:1 (legitimni:prevara). Po ponovnem treniranju istega DCGAN-a smo zabeležili bistveno izboljšanje: FID score se je zmanjšal na 78, generirani vzorci prevar so bili bolj raznoliki in statistično bližje realnim. Končni model detekcije prevar, treniran na tem obogatenem naboru, je dosegel izboljšanje AUC (Area Under the Curve) metrike za 7,3 % v primerjavi z modelom, treniranim na neobdelanih podatkih. To je bil ključen korak k robustnejšemu in učinkovitejšemu sistemu za preprečevanje zavarovalniških prevar.

Zaključek: Pomen uravnoteženja za prihodnost detekcije prevar

Kvantitativna analiza jasno kaže, da neuravnoteženi podatkovni nabori predstavljajo veliko oviro za učinkovito uporabo GAN-ov pri simulaciji zavarovalniških prevar. Nestabilno treniranje, slaba konvergenca in neoptimalna kakovost generiranih podatkov so pogoste posledice ignoriranja tega problema. S sistematično uporabo metod za uravnoteženje podatkov, kot so SMOTE, ADASYN, undersampling in hibridni pristopi, lahko bistveno izboljšamo robustnost in učinkovitost GAN-ov.

Izbira prave metode in njenih parametrov je odvisna od specifičnih značilnosti podatkov in ciljev simulacije. Merjenje učinkovitosti z objektivnimi metrikami, kot so FID, KID, in analiza stabilnosti funkcij izgube, je ključnega pomena za validacijo pristopa. S skrbno implementacijo teh tehnik lahko zavarovalnice izkoristijo polni potencial GAN-ov za generiranje verodostojnih sintetičnih podatkov o prevarah, kar bo v končni fazi vodilo do bolj sofisticiranih in učinkovitih sistemov za detekcijo prevar. To pa prinaša ne le finančne prihranke, temveč tudi boljše obvladovanje tveganj v celotni industriji.

Nadaljnji koraki in priporočila

Pri optimizaciji GAN-ov za neuravnotežene podatke priporočam iterativen pristop. Začnite z evalvacijo osnovnega modela GAN na neobdelanih podatkih, nato postopoma vpeljujte različne metode uravnoteženja in merite njihov kvantitativni vpliv na FID, KID in stabilnost treniranja. Ne pozabite tudi na parameterizacijo izbranih metod; na primer, pri SMOTE sta število sosedov (k) in delež oversamplinga ključna. Pri ADASYN pa stopnja adaptivnosti. Te parametre je treba optimizirati prek validacijskega nabora.

Poleg tega razmislite o »conditioned GANs« (cGANs), kjer se GAN trenira s pogojem na razredu (npr. »generiraj prevaro« ali »generiraj legitimni primer«), kar lahko dodatno izboljša nadzor nad generiranjem in fokus generatorja na minoritetni razred, tudi ob neuravnoteženosti. S takšnimi sofisticiranimi pristopi lahko zavarovalništvo ostane korak pred prevaranti in učinkovito obvladuje tveganja, ki jih prinašajo zavarovalniške prevare.

Primer iz prakse

Zavarovalna prevara z lažno nezgodo in posledice neustrezne analize

Brez ustreznega zavarovanja
Podjetje za zavarovanje nepremičnin prejme prijavo nezgode - poškodovanje ostrešja zaradi neurja. Brez naprednih analitičnih orodij in sintetičnih podatkov za prevare, sistem prevaro (ki v resnici ni bila nezgoda, temveč predhodno poškodovanje) ne zazna. Izplačilo odškodnine v višini 15.000 EUR se izvede, podjetje trpi neposredno finančno škodo in izgubi sredstva za kritje resničnih nezgod. Pomanjkanje raznolikosti v podatkih o prevarah je preprečilo modelom učenje kompleksnih vzorcev in tako dopustilo prevaro, ki je izkoriščala specifične, a redke pomanjkljivosti v klasičnem preverjanju.
Z ustreznim zavarovanjem
Predstavimo uporabo GAN-ov z uravnoteženimi podatki za identifikacijo prevar. Z uporabo SMOTE-a za obogatitev podatkovnega nabora s sintetičnimi primeri lažnih prijav nezgod (iz 0,5% na 10% vseh prijav) se je izboljšala sposobnost GAN-a za generiranje verodostojnih sintetičnih vzorcev prevar. Novi detektor prevar, treniran na tem obogatenem naboru, je dosegel izboljšanje AUC metrike za 8,1%. Ko je prišla sporna prijava o poškodovanju ostrešja, je model, ojačan z znanjem iz sintetičnih prevar, avtomatsko označil primer kot visoko tveganega. Nadaljnja preiskava je potrdila prevaro. Podjetje je prihranilo 15.000 EUR in okrepilo svojo odpornost proti podobnim prevaram v prihodnosti. Izboljšana sposobnost zaznavanja, izgrajena na boljših podatkih, je ključnega pomena za finančno stabilnost in integriteto zavarovalnice.

Primer je ilustrativen in povzet po tipičnih situacijah iz prakse. Kritja, izključitve in postopki se med zavarovalnicami razlikujejo.

Pogosta vprašanja

Zakaj so neuravnoteženi podatki problem za GAN-e pri detekciji prevar?
Neuravnoteženi podatki pomenijo, da je prevarantskih primerov izjemno malo. Generator GAN-a se tako težko nauči kompleksnih vzorcev prevar, diskriminator pa težko loči med realnimi in generiranimi prevarami, kar vodi do nestabilnemu treniranju in slabim rezultatom.
Katere so glavne metode za uravnoteženje podatkov?
Glavne metode so oversampling (povečanje minoritetnega razreda, npr. SMOTE, ADASYN), undersampling (zmanjšanje majoritetnega razreda) in hibridne metode, ki kombinirajo oba pristopa. Vsaka ima svoje prednosti pri izboljšanju treniranja GAN-ov.
Kako SMOTE in ADASYN pomagata pri treniranju GAN-ov?
SMOTE in ADASYN ustvarjata nove, sintetične vzorce minoritetnega razreda (prevar) z interpolacijo med obstoječimi. To poveča število prevarantskih primerov, kar generatorju omogoča boljše učenje, stabilizira treniranje GAN-a in izboljša kakovost generiranih sintetičnih podatkov.
Kako merimo učinkovitost metod za uravnoteženje pri GAN-ih?
Učinkovitost merimo z metričnimi indikatorji, kot je FID (Frechet Inception Distance), ki meri podobnost distribucij realnih in generiranih podatkov. Nižji FID pomeni boljše generirane podatke. Prav tako spremljamo stabilnost funkcije izgube in konvergenco modela.
Ali lahko GAN-i odkrijejo popolnoma nove vrste prevar?
GAN-i so primarno namenjeni generiranju sintetičnih podatkov na podlagi obstoječih vzorcev. Zato so učinkovitejši pri simulaciji znanih ali sorodnih vrst prevar. Odkrivanje popolnoma novih, še nikoli videnih prevar je izziv, ki zahteva dodatne analitične pristope.

Viri in reference

  • Uradni list RS – Zakon o zavarovalništvu (ZZavar-1)
  • Agencija za zavarovalni nadzor (AZN) – Letna poročila in statistike o zavarovalništvu
  • S. I. Buse, J. M. Al-Sadi, and R. T. Al-Sadi, 'A Comprehensive Survey of Generative Adversarial Networks and Their Applications,' IEEE Access, vol. 8, pp. 222532-222558, 2020.
  • N. Chawla, K. W. Bowyer, L. O. Hall, and W. P. Kegelmeyer, 'SMOTE: Synthetic Minority Over-sampling Technique,' Journal of Artificial Intelligence Research, vol. 16, pp. 321-357, 2002.
  • H. He, Y. Bai, E. A. Garcia, and S. Li, 'ADASYN: Adaptive Synthetic Sampling Approach for Imbalanced Learning,' in 2008 IEEE International Joint Conference on Neural Networks (IEEE World Congress on Computational Intelligence), pp. 1322-1328.

Nadaljujte branje o tej temi

Povezave so izbrane samodejno glede na steber zaščite in ključne besede te objave.

Priporočeno branje

Petkin letni pregled polic

Rezervirajte vaš redni letni 15-minutni pregledni pogovor

Če vas je ta tema pritegnila, jo pri pregledu obravnavava konkretno na vaših policah — v okviru področja Nezgoda. Pogovor je informativne narave, brez ponudbe in brez obveznosti.

Vsebina objave je splošna informacija in ne osebno svetovanje; veljajo pogoji posamezne police.