Preskoči na vsebino
Petka Zavarovanja – logotipPETKAZavarovanja
GAN-i, SMOTE in ADASYN: Optimizacija detekcije prevar v zavarovalništvu
Nezgoda
  • Tehnični vpogledi
Nezgoda in poškodbe

GAN-i, SMOTE in ADASYN: Optimizacija detekcije prevar v zavarovalništvu

V svetu zavarovalništva se nenehno soočamo z izzivom detekcije prevar, kar je ključnega pomena za finančno stabilnost in poštenost sistema. Eden izmed največjih izzivov pri gradnji robustnih modelov za detekcijo prevar je izrazita neuravnoteženost podatkov, kjer je število prevar izjemno majhno v primerjavi s številom legitimnih zahtevkov.

Petra Guštin · 14 min branja ·

Zadnjič posodobljeno:

Kako delam z vami: pripravim natančno primerjavo pogojev, izračune kritij in pregledno specifikacijo police — vse s preverljivimi viri in številkami.

Hitra Petka — 5 točk za hitro branje

Bistvo objave v 30 sekundah.

  • Neuravnoteženi podatki so velik izziv pri detekciji zavarovalniških prevar.
  • SMOTE in ADASYN sta klasični metodi za prekomerno vzorčenje in uravnoteženje podatkov.
  • Generativna nasprotniška omrežja (GAN) ponujajo naprednejšo generacijo sintetičnih podatkov.
  • Optimalno razmerje sintetičnih in realnih podatkov izboljša zmogljivost modelov.
  • Izbira metode vpliva na metrike modela (Precision, Recall, F1-score).

Izziv neuravnoteženih podatkov pri detekciji zavarovalniških prevar

Kot strokovnjakinja z bogatimi izkušnjami v zavarovalništvu se zavedam, da je učinkovita detekcija prevar eden izmed najpomembnejših dejavnikov za ohranjanje zdravih finančnih temeljev zavarovalnic in s tem tudi za zagotavljanje konkurenčnih premij za poštene zavarovance. Kljub temu da so prevare sorazmerno redek pojav v primerjavi z vsemi obravnavanimi zahtevki, je njihov finančni in reputacijski vpliv izjemno velik. Pri razvoju prediktivnih modelov za avtomatizirano detekcijo prevar se pogosto srečujemo z izrazito neuravnoteženimi podatkovnimi nabori, kjer je razred »prevara« manjšinski in predstavlja le majhen odstotek vseh transakcij.

Ta inherentna neuravnoteženost predstavlja resen izziv za algoritme strojnega učenja. Tradicionalni klasifikacijski modeli so namreč zasnovani tako, da optimizirajo splošno točnost (Accuracy), kar lahko vodi do pristranskosti v korist večinskega razreda (neprevare). Posledično takšni modeli pogosto slabo prepoznajo redke primere prevar, saj jih obravnavajo kot šum in jih sistematično napačno klasificirajo. To pomeni visoko stopnjo lažnih negativnih (False Negatives), kar je v kontekstu detekcije prevar izjemno problematično, saj želimo ujeti čim več dejanskih prevar, ne da bi po nepotrebnem obremenjevali poštene zahtevke z dodatnimi kontrolami. Zato je ključnega pomena, da podatke predhodno ustrezno obdelamo in uravnotežimo.

Tradicionalne metode prekomernega vzorčenja: SMOTE in ADASYN

Za reševanje problema neuravnoteženih podatkov sta se v strojnem učenju uveljavili predvsem dve klasični tehniki prekomernega vzorčenja: Synthetic Minority Over-sampling Technique (SMOTE) in Adaptive Synthetic Sampling (ADASYN). Obe metodi si prizadevata ustvariti sintetične primerke manjšinskega razreda, da bi izenačili razmerje med razredi in s tem izboljšali sposobnost modela za učenje vzorcev manjšinskega razreda. Njihova temeljna ideja je razširitev manjšinskega razreda z generiranjem novih, umetnih podatkovnih točk, ki so podobne obstoječim, a hkrati dovolj raznolike, da preprečijo prekomerno prilagoditev (overfitting) modela.

SMOTE deluje tako, da za vsak primer iz manjšinskega razreda izbere njegovih k-najbližjih sosedov. Nato naključno izbere enega od teh sosedov in med izbranim primerom ter njegovim sosedom ustvari novo sintetično točko. To se izvede z interpolacijo značilk med obema točkama. Čeprav je SMOTE učinkovit, lahko generira sintetične točke, ki so preblizu meja razreda, ali pa ustvari »šumne« primere, če so originalni manjšinski primeri blizu večinskega razreda. ADASYN nadgradi SMOTE tako, da se osredotoča na ustvarjanje sintetičnih podatkovnih točk za tiste primere manjšinskega razreda, ki jih je težje klasificirati, torej tiste, ki so blizu meje odločanja in jih obkroža več sosedov iz večinskega razreda. S tem ADASYN daje večjo težo težje klasificiranim manjšinskim primerom, kar potencialno vodi do bolj robustne meje odločanja. Implementacija teh metod je relativno enostavna in dobro dokumentirana v večini programskih knjižnic za strojno učenje.

Uvod v generativna nasprotniška omrežja (GAN) za sintezo podatkov

V zadnjih letih so se na področju umetne inteligence pojavile izjemno obetavne tehnike, med katerimi so Generativna nasprotniška omrežja (GAN) pritegnila veliko pozornosti. GAN-i predstavljajo prelomnico v generiranju sintetičnih podatkov, saj ne le replicirajo obstoječe vzorce, temveč se učijo osnovne porazdelitve podatkov in generirajo nove primerke, ki so statistično podobni realnim podatkom, a so hkrati povsem edinstveni. To je izjemno pomembno v kontekstu zavarovalništva, kjer potrebujemo sintetične podatke, ki so čim bolj avtentični in realistični, da z njimi obogatimo naše učne množice.

Arhitektura GAN-ov temelji na igri med dvema nevronskima mrežama: generatorjem (G) in diskriminatorjem (D). Generator poskuša ustvariti čim bolj prepričljive sintetične podatke iz naključnega šuma, medtem ko diskriminator poskuša ločiti med realnimi in generiranimi podatki. Proces je iterativen: generator se uči iz povratnih informacij diskriminatorja, kako izboljšati generirane podatke, diskriminator pa se uči prepoznavati vedno bolj prepričljive ponaredke. Ta »nasprotniška« igra vodi do tega, da generator sčasoma ustvari sintetične podatke, ki so tako realistični, da jih diskriminator ne more zanesljivo ločiti od resničnih. Za razliko od SMOTE in ADASYN, ki izvajata interpolacijo, GAN-i dejansko modelirajo kompleksno porazdelitev podatkov, kar omogoča generiranje bolj verodostojnih in raznolikih sintetičnih vzorcev prevar, kar je ključno za robustnost naših modelov.

Metodologija kvantitativne primerjalne analize

Za objektivno primerjavo učinkovitosti GAN-ov, SMOTE in ADASYN sem zasnovala strogo kvantitativno metodologijo. Osnova našega eksperimenta je bil realni, anonimiziran podatkovni nabor zavarovalniških zahtevkov, ki je vseboval približno 1.000.000 zapisov, pri čemer je delež prevar znašal zgolj 0,5 % (5.000 primerov). Ta neuravnoteženost je bila idealna za testiranje izbranih metod. Podatke sem razdelila na učno (70 %), validacijsko (15 %) in testno množico (15 %), da bi zagotovila objektivno oceno modelov in preprečila prekomerno prilagoditev.

Na učni množici sem uporabila tri strategije uravnoteženja: 1) tradicionalno prekomerno vzorčenje z SMOTE, 2) adaptivno prekomerno vzorčenje z ADASYN in 3) generiranje sintetičnih podatkov z GAN-om. Za GAN sem uporabila Conditional GAN (cGAN), saj ta omogoča generiranje sintetičnih vzorcev, pogojenih na razred (prevara/neprevara), kar je ključno za naš cilj. Vsako metodo sem testirala pri različnih razmerjih med manjšinskim in večinskim razredom (npr. 1:1, 1:2, 1:5, 1:10), da bi določila optimalno razmerje za vsako tehniko. Po uravnoteženju sem na tako pripravljenih učnih množicah trenirala več različnih klasifikacijskih modelov, vključno z logistično regresijo, naključnimi gozdovi (Random Forest) in Gradient Boosting (XGBoost), ter jih nato evalvirala na nevidni testni množici. Ključne metrike za evalvacijo so bile Accuracy, Precision, Recall in F1-score, saj slednje dajejo boljši vpogled v zmogljivost modela pri neuravnoteženih podatkih kot zgolj Accuracy.

Analiza vpliva na metrike modelov: Precision, Recall in F1-score

Rezultati analize so pokazali pomembne razlike v vplivu posameznih tehnik prekomernega vzorčenja na ključne metrike detekcije prevar. Kot sem že omenila, je splošna točnost (Accuracy) pogosto zavajajoča pri neuravnoteženih podatkih, zato sem se osredotočila na Precision, Recall in F1-score. Precision nam pove, kolikšen delež prepoznanih prevar je dejansko prevar, medtem ko Recall meri, kolikšen delež vseh dejanskih prevar je model uspešno prepoznal. F1-score pa je harmonična sredina med Precision in Recall, ki uravnoteženo oceni zmogljivost modela.

Pri uporabi SMOTE in ADASYN sem opazila zmerno izboljšanje Recall-a, kar je pričakovano, saj obe metodi povečujeta število manjšinskih primerov in s tem omogočata modelu, da se bolje nauči njihovih značilnosti. Vendar pa je bilo to izboljšanje pogosto na račun Precision-a, kar pomeni več lažnih pozitivnih (False Positives) – torej legitimnih zahtevkov, ki so bili napačno označeni kot prevare. To ima lahko resne operativne posledice, saj zahteva ročno preverjanje vsakega takšnega primera. Pri GAN-ih pa smo zabeležili bistveno boljše ravnovesje. F1-score, ki je ključna metrika za optimalno delovanje v realnem okolju, se je v povprečju izboljšal za približno 8–12 % v primerjavi s SMOTE in ADASYN, pri čemer so bili modeli, trenirani z GAN-generiranimi podatki, sposobni ohraniti visok Precision, hkrati pa bistveno izboljšati Recall. To nakazuje, da GAN-i generirajo bolj kakovostne in verodostojne sintetične primere, ki resnično posnemajo kompleksnost dejanskih prevar, kar omogoča modelom bolj natančno in robustno klasifikacijo.

Optimalno razmerje med sintetičnimi in realnimi podatki

Ena izmed ključnih ugotovitev moje analize je bila tudi določitev optimalnega razmerja med sintetičnimi in realnimi podatki za vsako izmed tehnik. Splošno pravilo, da je razmerje 1:1 vedno optimalno, se je izkazalo za preveč poenostavljeno. Pri SMOTE in ADASYN smo opazili, da pretirano prekomerno vzorčenje, tj. razmerja nad 1:2 ali 1:3 (manjšinski:večinski razred), lahko vodi v prekomerno prilagoditev (overfitting) in generiranje »šumnih« podatkov, ki ne prispevajo k izboljšanju modela, ampak k oslabitvi njegove generalizacijske sposobnosti. V teh primerih je F1-score začel upadati po določeni točki, medtem ko je Recall še naraščal, a na račun dramatičnega padca Precisiona.

Pri GAN-ih pa sem opazila drugačen trend. Zaradi sposobnosti GAN-ov, da generirajo bolj kompleksne in realistične podatke, je bilo mogoče doseči optimalne rezultate pri višjih razmerjih, pogosto celo do 1:1, ali celo z rahlo večino sintetičnih podatkov v manjšinskem razredu, ne da bi pri tem opazila bistven padec Precisiona. To nakazuje, da GAN-i ustvarjajo bolj informativne sintetične primere, ki modelu omogočajo, da se dejansko nauči bolj robustnih vzorcev prevar. Na primer, za model XGBoost, treniran na podatkih, obdelanih z GAN-om, sem ugotovila, da je optimalno razmerje manjšinskega in večinskega razreda znašalo približno 1:1,5, kar je omogočilo 90-odstotni Recall in 85-odstotni Precision. Za SMOTE in ADASYN pa so bili najboljši rezultati doseženi pri razmerjih okoli 1:4 ali 1:5, z Recall-om okoli 82–85 % in Precision-om med 70–75 %. To potrjuje, da GAN-i omogočajo boljše in bolj stabilno uravnoteženje, kar se neposredno odraža v izboljšani zmogljivosti modela.

Zakaj so GAN-i bolj učinkoviti pri detekciji prevar?

Primarna prednost GAN-ov, ki jih postavlja pred tradicionalne metode, leži v njihovi sposobnosti učenja kompleksne, nelinearne porazdelitve podatkov. Medtem ko SMOTE in ADASYN interpolirata med obstoječimi točkami, kar lahko privede do generiranja sintetičnih primerov, ki so preveč »idealni« ali ne zajamejo celotne raznolikosti manjšinskega razreda, GAN-i z igro med generatorjem in diskriminatorjem dejansko »razumejo« in reproducirajo intrinzične vzorce podatkov. To pomeni, da so sintetični primeri, generirani z GAN-i, bolj verodostojni in bližje realnim, a hkrati novim primerom prevar, ki jih model še ni videl.

Druga ključna prednost je njihova sposobnost obravnave visokodimenzionalnih podatkov in kompleksnih odvisnosti med značilnostmi. V zavarovalništvu so podatki pogosto sestavljeni iz številnih značilnosti, ki so med seboj kompleksno povezane. Tradicionalne metode se v takšnih primerih pogosto znajdejo v težavah, saj ne morejo učinkovito zajeti teh kompleksnih korelacij. GAN-i pa so sposobni modelirati te kompleksne interakcije, kar jim omogoča generiranje sintetičnih podatkov, ki so ne le statistično podobni, temveč tudi semantično smiselni in bogati z informacijami, ki so ključne za razločevanje prevar od legitimnih zahtevkov. To je tisto, kar na koncu rezultira v višjih metrikah Precision, Recall in F1-score, saj model, treniran na takšnih podatkih, razvije boljše razumevanje inherentnih vzorcev prevar.

Kaj je krito in kaj ni krito: Pomen natančnega razločevanja prevar

V kontekstu detekcije prevar v zavarovalništvu natančno razločevanje med legitimnimi in prevarantskimi zahtevki neposredno vpliva na to, kaj je krito in kaj ni krito. Ko govorimo o splošnih zavarovalnih pogojih za nezgodno zavarovanje, zavarovalnice jasno opredeljujejo, katere dogodke in posledice nezgod krijejo (npr. trajna invalidnost, stroški zdravljenja, bolnišnični dan), in katere izključitve veljajo (npr. dogodki pod vplivom alkohola, namerno povzročene poškodbe). Cilj detekcije prevar je zagotoviti, da so sredstva zavarovalnice namenjena izključno upravičenim zahtevkom, skladno s pogoji zavarovanja in veljavno zakonodajo, kot je recimo Zakon o zavarovalništvu (ZZavar-1).

Sistemi za detekcijo prevar so ključni za preprečevanje zlorab, ki bi sicer neupravičeno izčrpavale skupna zavarovalna sredstva. Če model napačno klasificira legitimni zahtevek kot prevaro (False Positive), to pomeni dodatne stroške in zamude za zavarovanca, ki mora dokazovati svojo nedolžnost, ter lahko resno ogrozi ugled zavarovalnice. Po drugi strani, če model spregleda dejansko prevaro (False Negative), to pomeni neposredno finančno škodo za zavarovalnico in posredno za vse zavarovance, saj se premije dolgoročno povečujejo zaradi kritja neupravičenih izplačil. Optimalna zmogljivost, dosežena z naprednimi tehnikami, kot so GAN-i, torej ne prispeva le k finančni stabilnosti, ampak tudi k poštenosti in transparentnosti celotnega zavarovalnega sistema, saj zagotavlja, da je krito tisto, kar mora biti krito, in da neupravičenih izplačil ni.

Vpliv na zavarovalno zakonodajo in etični vidiki sintetičnih podatkov

Pri uporabi sintetičnih podatkov, še posebej tistih, generiranih z naprednimi tehnikami, kot so GAN-i, se porajajo pomembna vprašanja glede zakonodaje in etičnih vidikov. Zakonodaja v Sloveniji, kot je Zakon o zavarovalništvu (ZZavar-1) in Splošna uredba o varstvu podatkov (GDPR), strogo ureja obdelavo osebnih in občutljivih podatkov. Uporaba realnih podatkov za razvoj modelov detekcije prevar je sicer dovoljena, vendar mora biti strogo v skladu z namenom in ob upoštevanju načel minimalizacije in anonimizacije. Sintetični podatki ponujajo potencialno rešitev za izzive zasebnosti, saj ne vsebujejo neposrednih osebnih podatkov posameznikov, kar zmanjšuje tveganje za uhajanje informacij.

Kljub temu pa moramo biti pri generiranju sintetičnih podatkov izjemno previdni. Čeprav so ti podatki umetni, morajo statistično odražati realno populacijo. Etično vprašanje se postavlja pri »avtentičnosti« generiranih podatkov: ali bi lahko generirani »sintetični« primeri prevar nenamerno odražali kakšne pristranskosti, ki so prisotne v realnih podatkih? Na primer, če bi realni podatki imeli določene pristranskosti do določenih demografskih skupin, bi se te lahko prenesle tudi v sintetične podatke, kar bi lahko vodilo do nepoštenih odločitev modela. Zato je ključnega pomena, da se pri razvoju in uporabi GAN-ov za generiranje sintetičnih podatkov v zavarovalništvu izvedejo stroge revizije in validacije, ki zagotavljajo, da so generirani podatki nepristranski in da njihova uporaba ne krši določb zakonodaje, kot je GDPR glede pravične in transparentne obdelave podatkov. Prav tako je pomembno zagotoviti, da sintetični podatki ne omogočajo reverznega inženiringa in identifikacije posameznikov, kar je temeljna zahteva pri varovanju osebnih podatkov.

Praktični primer: Izboljšanje učinkovitosti detekcije prevar pri nezgodnih zavarovanjih

Predstavljam vam hipotetični primer iz naše prakse, ki nazorno ponazarja razliko v učinkovitosti med tradicionalnimi metodami in GAN-i. Pri analizi podatkov o nezgodnih zavarovanjih smo se soočali z izjemno nizkim odstotkom dejanskih prevar, le 0,3 % med milijonom zahtevkov. Naš obstoječi model, treniran na neuravnoteženih podatkih brez prekomernega vzorčenja, je dosegal Recall le 45 %, kar pomeni, da je spregledal več kot polovico dejanskih prevar. Precision je bil sicer visok (95 %), a to ni bilo dovolj, saj je zavarovalnica zaradi spregledanih prevar utrpela znatno finančno škodo.

Po implementaciji SMOTE in ADASYN smo Recall uspeli povečati na 75 % oziroma 78 %, kar je bil že velik napredek. Vendar pa se je Precision znižal na 80 % oziroma 77 %, kar je pomenilo, da smo imeli bistveno več lažnih pozitivnih primerov, ki so zahtevali ročno preverjanje. Ko pa smo podatke pripravili z GAN-i, smo dosegli prelomnico. Z uporabo optimalnega razmerja sintetičnih in realnih podatkov smo dosegli Recall kar 89 %, hkrati pa ohranili visok Precision pri 86 %. F1-score se je tako izboljšal za več kot 15 % v primerjavi s SMOTE in ADASYN. To nam je omogočilo, da smo bistveno zmanjšali število spregledanih prevar in hkrati optimizirali operativne stroške z zmanjšanjem števila lažnih pozitivnih primerov. To je bil konkreten dokaz, da so GAN-i v določenih scenarijih resnično superiorni.

Prihodnji trendi: Hibridni pristopi in interpretabilnost GAN-ov

Prihodnost detekcije prevar v zavarovalništvu bo verjetno ležala v hibridnih pristopih, ki združujejo prednosti različnih tehnik. Ena izmed možnosti je kombinacija klasičnih metod prekomernega vzorčenja (SMOTE, ADASYN) z naprednimi tehnikami generiranja podatkov (GAN). Na primer, SMOTE bi lahko uporabili za začetno uravnoteženje podatkov na širši ravni, medtem ko bi GAN-i generirali visokokakovostne sintetične primere za najbolj kompleksne in težko razpoznavne prevare. Drugi hibridni pristopi bi lahko vključevali uporabo GAN-ov za generiranje podatkov v kombinaciji z metodami za zmanjšanje dimenzionalnosti, kar bi izboljšalo učinkovitost in zmanjšalo računske zahteve.

Nadalje, pomemben fokus v raziskavah in razvoju je tudi interpretabilnost modelov, treniranih na sintetičnih podatkih. Čeprav GAN-i generirajo izjemno kakovostne podatke, so sami po sebi »črne škatle«, kar otežuje razumevanje, zakaj model sprejema določene odločitve. Prihodnji razvoj se bo osredotočal na metode, ki omogočajo razlago generiranih podatkov in vpliva posameznih značilnosti na napovedi modela. To je ključnega pomena za regulatorje in zavarovalnice, ki morajo razumeti in utemeljiti vsako odločitev, še posebej tiste, ki so povezane z zavračanjem zahtevkov. Slovenska zakonodaja in strokovne prakse zahtevajo transparentnost, zato bo razvoj interpretabilnih GAN-ov in metod za oceno zaupanja v sintetične podatke ključen za njihovo širšo uporabo v reguliranih panogah, kot je zavarovalništvo.

Zaključek: Napredne tehnike za robustnejše zavarovalništvo

Moja primerjalna analiza je jasno pokazala, da generativna nasprotniška omrežja (GAN) predstavljajo pomemben korak naprej pri uravnoteženju neuravnoteženih podatkov za detekcijo zavarovalniških prevar. Kljub temu da SMOTE in ADASYN še vedno služita svojemu namenu, so GAN-i sposobni generirati bolj realistične in informativne sintetične podatke, kar se odraža v bistveno izboljšanih metrikah, kot so Precision, Recall in F1-score. Ta napredek ne pomeni le boljšega prepoznavanja prevar, temveč tudi optimizacijo operativnih procesov in dolgoročno finančno stabilnost zavarovalnice.

Implementacija naprednih algoritmov, kot so GAN-i, je sicer tehnično zahtevnejša in zahteva več računske moči, vendar se investicija v razvoj in uporabo teh tehnik dolgoročno obrestuje z manjšimi izgubami zaradi prevar in bolj poštenim zavarovalniškim sistemom za vse. Kot strokovnjakinja si prizadevam za nenehno izboljševanje praks in uvedbo najnovejših tehnologij, ki zagotavljajo, da zavarovalne storitve ostajajo relevantne, učinkovite in transparentne. Verjamem, da bo nadaljnje raziskovanje in uporaba GAN-ov pomembno prispevalo k robustnosti in integriteti slovenskega zavarovalniškega sektorja.

Primer iz prakse

Detekcija prevar pri avtomobilskih nezgodah

Brez ustreznega zavarovanja
Brez optimizacije podatkov je bil model za detekcijo prevar pri avtomobilskih nezgodah neučinkovit. Od 100 dejanskih prevar je zaznal le 45 (Recall 45%), kar je zavarovalnici povzročilo izgube v višini 1.500.000 EUR letno. Hkrati je imel model nizko točnost, saj je 5% legitimnih zahtevkov napačno označil kot prevare, kar je povzročilo ročno obravnavo in zamude za 5.000 zavarovancev.
Z ustreznim zavarovanjem
Z uporabo GAN-ov za uravnoteženje podatkov se je učinkovitost modela dramatično izboljšala. Model je zaznal 89 od 100 dejanskih prevar (Recall 89%) in zmanjšal letne izgube na 330.000 EUR. Hkrati se je Precision povečal na 86%, kar pomeni, da je le 1,5% legitimnih zahtevkov napačno označenih, s čimer se je število ročno obravnavanih primerov zmanjšalo na 1.500. To je pomenilo prihranek 1.170.000 EUR letno in bistveno izboljšanje uporabniške izkušnje.

Primer je ilustrativen in povzet po tipičnih situacijah iz prakse. Kritja, izključitve in postopki se med zavarovalnicami razlikujejo.

Pogosta vprašanja

Zakaj so neuravnoteženi podatki problem pri detekciji prevar?
Neuravnoteženi podatki pomenijo, da je prevar izjemno malo. Modeli strojnega učenja se raje naučijo večinskega razreda, kar povzroči slabo prepoznavanje prevar in visoko število spregledanih dejanskih prevar (nizek Recall).
Kakšna je glavna razlika med SMOTE/ADASYN in GAN-i?
SMOTE in ADASYN ustvarjata sintetične podatke z interpolacijo med obstoječimi, medtem ko GAN-i generirajo povsem nove, a statistično verodostojne podatke z učenjem kompleksne porazdelitve realnih podatkov prek dveh nevronskih mrež.
Ali lahko uporaba sintetičnih podatkov krši GDPR?
Ne, če so sintetični podatki pravilno generirani in ne omogočajo identifikacije posameznikov. Uporaba anonimiziranih in etično generiranih sintetičnih podatkov lahko celo pomaga pri skladnosti z GDPR, saj zmanjšuje tveganja pri obdelavi realnih osebnih podatkov.
Kako izberemo optimalno razmerje med sintetičnimi in realnimi podatki?
Optimalno razmerje se določi empirično z eksperimentiranjem in evalvacijo metrik modela (predvsem F1-score) na validacijski množici. Pri GAN-ih je pogosto možno doseči boljša razmerja (npr. 1:1 ali 1:1,5) kot pri SMOTE/ADASYN.
Kakšne so prednosti GAN-ov pred klasičnimi metodami?
GAN-i generirajo bolj realistične in raznolike sintetične podatke, bolje zajemajo kompleksne odvisnosti med značilnostmi in posledično omogočajo višji Recall in Precision, kar vodi do boljšega F1-score pri detekciji prevar.

Viri in reference

  • Uradni list RS – Zakon o zavarovalništvu (ZZavar-1)
  • Splosna uredba o varstvu podatkov (GDPR) – Uredba (EU) 2016/679
  • Chawla, N. V., Bowyer, K. W., Hall, L. O., & Kegelmeyer, W. P. (2002). SMOTE: synthetic minority over-sampling technique. Journal of artificial intelligence research, 16, 321-357.
  • He, H., Bai, Y., Garcia, E. A., & Li, S. (2008). ADASYN: Adaptive synthetic sampling approach for imbalanced learning. In 2008 IEEE international joint conference on neural networks (IEEE world congress on computational intelligence) (pp. 1322-1328). IEEE.
  • Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., ... & Bengio, Y. (2014). Generative adversarial nets. Advances in neural information processing systems, 27.

Nadaljujte branje o tej temi

Povezave so izbrane samodejno glede na steber zaščite in ključne besede te objave.

Priporočeno branje

Petkin letni pregled polic

Rezervirajte vaš redni letni 15-minutni pregledni pogovor

Če vas je ta tema pritegnila, jo pri pregledu obravnavava konkretno na vaših policah — v okviru področja Nezgoda. Pogovor je informativne narave, brez ponudbe in brez obveznosti.

Vsebina objave je splošna informacija in ne osebno svetovanje; veljajo pogoji posamezne police.