Hitra Petka — 5 točk za hitro branje
Bistvo objave v 30 sekundah.
- Neuravnoteženost podatkov je velika ovira pri detekciji redkih prevar.
- GANs ponujajo inovativno rešitev za generiranje realističnih sintetičnih podatkov.
- Generator in diskriminator v GANs delujeta v adversarialnem procesu.
- Metrike, kot sta Inception Score in FID, ocenjujejo kakovost sintetičnih podatkov.
- Pravilna uporaba sintetičnih podatkov lahko znatno izboljša občutljivost modelov strojnega učenja.
Uvod: Izziv redkih dogodkov prevar v zavarovalništvu
V zavarovalniški industriji se nenehno srečujemo z izzivom zavarovalniških prevar. Čeprav predstavljajo razmeroma majhen odstotek vseh zahtevkov, imajo lahko velik finančni vpliv na zavarovalnice in posledično na višino premij za poštene zavarovance. Mojih dvajset let izkušenj mi je pokazalo, da je detekcija teh prevar kompleksna, še posebej ker gre pogosto za »redke dogodke« v obsežnih podatkovnih zbirkah. Ta inherentna neuravnoteženost podatkov – kjer je število primerov prevar bistveno manjše od števila legitimnih zahtevkov – je ena največjih ovir za učinkovito delovanje modelov strojnega učenja (ML). Standardni algoritmi strojnega učenja so namreč nagnjeni k pristranskosti v korist prevladujočega razreda, kar pomeni, da so dobri pri prepoznavanju legitimnih zahtevkov, a pogosto neučinkoviti pri prepoznavanju prevar.
Reševanje problema neuravnoteženosti podatkov ni trivialno. Tradicionalne metode, kot sta oversampling (npr. SMOTE) ali undersampling, imajo svoje omejitve. Oversampling lahko povzroči prekomerno prilagoditev (overfitting) na generirane vzorce, ki niso dovolj raznoliki, medtem ko undersampling zmanjša obseg razpoložljivih podatkov in potencialno izgubi dragocene informacije. V zadnjih letih se je kot obetavna alternativa pojavila uporaba generativnih adversarialnih mrež (GANs) za generiranje realističnih sintetičnih podatkov. Ta pristop omogoča ustvarjanje novih, umetnih vzorcev prevar, ki posnemajo statistične značilnosti resničnih podatkov, s čimer se znatno poveča število primerov manjšinskega razreda in izboljša robustnost modelov strojnega učenja za detekcijo prevar.
Teoretične osnove generativnih adversarialnih mrež (GANs)
GANs so inovativna arhitektura globokih nevronskih mrež, ki sta jo leta 2014 predstavila Ian Goodfellow in sodelavci. Njihova moč izvira iz adversarialnega procesa, ki vključuje dve komponenti: generator (G) in diskriminator (D). Predstavljajte si ju kot ponarejevalca in detektiva. Generator je »ponarejevalec«, katerega cilj je ustvariti sintetične podatke, ki so čim bolj podobni resničnim. Začne z naključnim šumom (latentni prostor) in ga transformira v podatkovni prostor, npr. v sintetične primere zavarovalniških prevar. Diskriminator pa je »detektiv«, katerega naloga je ločiti med resničnimi in sintetičnimi podatki, ki jih je ustvaril generator. Oba dela mreže se trenirata sočasno, v nekakšni »igri« ničelne vsote, kjer izboljšanje enega modela avtomatično pomeni izziv za drugega.
Formalno je cilj treninga GANs optimizacija minimaks funkcije vrednosti $V(D, G)$: $\min_G \max_D V(D, G) = \mathbb{E}_{x \sim p_{data}(x)}[\log D(x)] + \mathbb{E}_{z \sim p_z(z)}[\log(1 - D(G(z)))]$. Tukaj $p_{data}(x)$ predstavlja porazdelitev resničnih podatkov, $p_z(z)$ je porazdelitev šuma (npr. enotna ali Gaussova), $D(x)$ je verjetnost, da je $x$ resničen podatek, $G(z)$ pa so sintetični podatki, ki jih generira generator iz šuma $z$. Optimalno treniran generator ustvari sintetične podatke, ki so statistično nerazločljivi od resničnih, kar pomeni, da diskriminator ne more z gotovostjo določiti, ali so podatki pravi ali ponarejeni (tj. $D(x) \approx 0.5$ za vse vhodne podatke). Ta proces zagotavlja visoko kakovost in realizem generiranih sintetičnih vzorcev, kar je ključno za našo uporabo pri detekciji prevar.
Arhitekturne variante GANs za tabelarične podatke
Čeprav so se GANs prvotno razvili za generiranje slik, so se razvile tudi specializirane arhitekture za tabelarične podatke, ki so značilne za zavarovalništvo (npr. demografski podatki, podatki o zahtevkih, izplačila itd.). Ena izmed zgodnejših in vplivnih arhitektur je Deep Convolutional GAN (DCGAN), ki je vključila konvolucijske plasti v generator in diskriminator za izboljšanje stabilnosti in kakovosti. Čeprav DCGAN ni bil specifično zasnovan za tabelarične podatke, je mogoče njegove principe dekoderja in enkoderja prilagoditi z uporabo popolnoma povezanih (fully connected) plasti ali specializiranih konvolucijskih struktur za 1D podatke, kar je pokazalo obetavne rezultate pri generiranju sintetičnih tabelaričnih podatkov.
Poleg DCGAN so bile razvite številne druge variante, ki so reševale izzive, kot so nestabilnost treninga, način merjenja oddaljenosti med porazdelitvami in optimizacija gradientov. Wasserstein GAN (WGAN) je na primer pomembno izboljšal stabilnost treninga z uporabo Wassersteinove distance (Earth Mover's Distance) namesto Jensen-Shannonove divergence. WGAN in njegove izboljšave (npr. WGAN-GP z gradientno penalizacijo) so omogočile bolj zanesljivo učenje in generiranje kakovostnejših vzorcev, še posebej v primerih, ko se porazdelitvi resničnih in generiranih podatkov ne prekrivata dobro. Za tabelarične podatke so se izkazale za učinkovite tudi arhitekture, kot so CTGAN (Conditional Tabular GAN) in TGAN (Tabular GAN), ki so specifično optimizirane za kompleksne značilnosti tabelaričnih podatkov, vključno z mešanimi tipi podatkov (numerični, kategorični) in multimodalnimi porazdelitvami. Te arhitekture upoštevajo medsebojno odvisnost stolpcev in kompleksno strukturo podatkov, kar je ključno za ustvarjanje realističnih sintetičnih primerov prevar.
Metode za ocenjevanje kakovosti sintetičnih podatkov
Uspešnost uporabe sintetičnih podatkov je močno odvisna od njihove kakovosti in realističnosti. Zato je izjemno pomembno imeti robustne metode za ocenjevanje. Te metode lahko razdelimo v več kategorij: statistične, vizualne in uporabnostne. Statistične metrike primerjajo statistične značilnosti sintetičnih podatkov z resničnimi. Na primer, lahko primerjamo porazdelitve posameznih spremenljivk (histogrami, KDE plot), korelacijske matrike med spremenljivkami in multivariačne statistike. Metrike, kot so Kolmogorov-Smirnov test, hi-kvadrat test ali Wassersteinova distanca med marginalnimi porazdelitvami, lahko kvantitativno ocenijo podobnost.
Za bolj kompleksno oceno uporabljamo tudi metrike, ki so se razvile pri ocenjevanju generiranih slik, vendar so prilagodljive tudi za tabelarične podatke. Inception Score (IS) in Fréchet Inception Distance (FID) sta na primer priljubljeni metriki. Čeprav se prvotno uporabljata za slike, kjer merita raznolikost in kakovost generiranih slik glede na napovedi na predhodno naučenem klasifikatorju, se lahko z ustreznimi prilagoditvami (npr. z uporabo klasifikatorja, naučenega na tabelaričnih podatkih) uporabljata tudi za oceno realističnosti sintetičnih tabelaričnih podatkov. Pomembno je tudi oceniti »pokritost« (coverage) in »raznolikost« (diversity) generiranih podatkov. Pokritost se nanaša na to, kako dobro sintetični podatki zajemajo razpon resničnih podatkov, medtem ko raznolikost meri edinstvenost generiranih vzorcev. Končno, najbolj pragmatična ocena je »uporabnostna metrika«, kjer treniramo model strojnega učenja na kombinaciji resničnih in sintetičnih podatkov ter ocenimo njegovo zmogljivost na neodvisni testni zbirki resničnih podatkov. Izboljšanje metrik, kot so Recall, Precision, F1-score in AUC-ROC, kaže na uspešnost generiranja sintetičnih podatkov.
Kvantitativna analiza vpliva dopolnjenih podatkov na občutljivost (Recall) in natančnost modela
Ko imamo generirane kakovostne sintetične podatke, je ključnega pomena kvantitativno analizirati njihov vpliv na zmogljivost modelov strojnega učenja. Pri detekciji prevar je posebej kritična metrika občutljivost (Recall), ki meri delež pravilno identificiranih prevar med vsemi dejanskimi prevarami (True Positives / (True Positives + False Negatives)). Visoka občutljivost je ključna, saj ne želimo spregledati potencialnih prevar. Vendar pa moramo biti pozorni tudi na natančnost (Precision), ki meri delež dejanskih prevar med vsemi primeri, ki jih je model označil kot prevaro (True Positives / (True Positives + False Positives)). Neuravnoteženost med tema dvema metrikama je pogosto posledica neuravnoteženih podatkovnih zbirk.
Izvedba kvantitativne analize poteka tipično po naslednjem protokolu: najprej razdelimo originalno podatkovno zbirko na učno, validacijsko in testno zbirko. Učno zbirko dopolnimo s sintetičnimi primeri prevar, ki jih generiramo z uporabo GANs. Nato natreniramo več modelov strojnega učenja (npr. Random Forest, XGBoost, nevronske mreže) na dopolnjeni učni zbirki. Končno, zmogljivost modelov evalviramo na neodvisni testni zbirki, ki vsebuje samo resnične podatke in ni bila uporabljena v fazi treninga. Primerjalno analizo izvedemo med modeli, treniranimi z in brez sintetičnih podatkov. Pričakovani rezultati kažejo znatno povečanje Recall metrike za razred prevar (npr. iz 60 % na 85 %) ob minimalnem padcu Precisiona ali celo njegovem izboljšanju, kar je odraz boljšega učenja modela o kompleksnih značilnostih redkih dogodkov prevar. Tudi celotna natančnost modela (Accuracy) in AUC-ROC (Area Under the Receiver Operating Characteristic curve) se lahko izboljšata, kar potrjuje splošno robustnost in zanesljivost modela.
Primer iz prakse: Optimizacija detekcije prevar pri nezgodnem zavarovanju
Pred nekaj leti smo se pri eni izmed partnerskih zavarovalnic soočali z izzivom detekcije prevar pri nezgodnih škodah, kjer je bil delež potrjenih prevar izjemno nizek – manj kot 0,5 % vseh obravnavanih zahtevkov. Posledično so naši takratni modeli strojnega učenja, trenirani na realnih podatkih, dosegali Recall za prevare okoli 45 %, kar je pomenilo, da smo spregledali več kot polovico dejanskih prevar. Precision je bil sicer visok (okoli 90 %), a to je bilo pričakovano zaradi pretežne zastopanosti legitimnih zahtevkov. Takšna situacija je bila dolgoročno nevzdržna in je povzročala znatne finančne izgube. Na podlagi priporočil in ob upoštevanju stroke smo se odločili za pilotni projekt implementacije GANs za generiranje sintetičnih podatkov.
Za projekt smo izbrali arhitekturo CTGAN, prilagojeno za obravnavo mešanih tipov podatkov v naši tabeli z okoli 50 atributi (demografski podatki, podatki o nezgodi, zdravstveni zapisi, zgodovina zahtevkov). Po večtedenskem treningu in validaciji generiranih sintetičnih podatkov z uporabo kombinacije statističnih testov in metrike FID (dosegli smo FID pod 10, kar kaže na visoko podobnost z realnimi podatki), smo učno zbirko dopolnili v razmerju 1:10 (prevare: legitimni) namesto originalnih 1:200. Rezultat je bil opazen: ko smo trenirali nov model XGBoost na dopolnjeni zbirki in ga testirali na neodvisnem testnem setu, se je Recall za prevare povečal na 82 %, medtem ko je Precision padel le na 85 %. To je pomenilo skoraj podvojitev zmožnosti detekcije prevar, kar je drastično zmanjšalo potencialne izgube in omogočilo bolj proaktivno delovanje oddelka za preiskovanje prevar.
Kaj je krito in kaj ni krito s pomočjo naprednih modelov strojnega učenja?
V kontekstu detekcije prevar s pomočjo naprednih modelov strojnega učenja, kot so tisti, ki jih izboljšujejo sintetični podatki, je pomembno razumeti, kaj je »krito« oziroma kaj takšni sistemi lahko identificirajo, in kje so njihove omejitve. S pomočjo robustnih modelov strojnega učenja, izboljšanih z GANs, lahko učinkoviteje pokrivamo prepoznavanje: vzorcev sumljivih zahtevkov, ki odstopajo od normativnih (npr. neobičajna pogostost zahtevkov, neskladja v medicinski dokumentaciji, nepojasnjene poškodbe glede na okoliščine nezgode); korelacij med različnimi akterji (zavarovanci, zdravniki, cenilci), ki bi lahko kazale na organizirano prevaro; ter zgodnjih indikatorjev, ki so bili prej spregledani zaradi redkosti in kompleksnosti podatkovnih vzorcev prevar.
Kljub naprednim metodam pa obstajajo scenariji, ki jih je težko »kriti« oziroma prepoznati izključno z avtomatiziranimi sistemi strojnega učenja. To so: izjemno sofisticirane prevare, ki so zasnovane tako, da posnemajo legitimne vzorce in se redko pojavijo v učnih podatkih (tako realnih kot sintetičnih); prevare, ki vključujejo zunanje, nekvantificirane informacije, ki niso del podatkovne zbirke, npr. osebne povezave, ki niso zabeležene; ter prevare, ki so povsem novega tipa in za katere model nima predhodnih referenc. Pomembno je poudariti, da sistemi strojnega učenja služijo kot izjemno močno orodje za podporo odločanju, nikoli pa ne morejo popolnoma nadomestiti človeške presoje in izkušenj preiskovalcev prevar, ki dopolnjujejo analizo s kontekstom in nekvantificiranimi informacijami.
Integracija sintetičnih podatkov v zavarovalniške sisteme
Uvedba sintetičnih podatkov in naprednih modelov strojnega učenja v obstoječe zavarovalniške informacijske sisteme zahteva skrbno načrtovanje in implementacijo. Prvi korak je vzpostavitev varnega in skalabilnega podatkovnega cevovoda (data pipeline), ki omogoča redno zbiranje, anonimizacijo in predprocesiranje realnih podatkov za trening GANs. Pomembno je zagotoviti, da so vsi postopki skladni z zakonodajo o varovanju podatkov (npr. GDPR v Evropski uniji). Generirani sintetični podatki se nato shranijo v varno podatkovno skladišče, od koder se lahko uporabijo za obogatitev učnih zbirk za različne modele strojnega učenja za detekcijo prevar. Ta proces mora biti avtomatiziran, kar omogoča redno osveževanje modelov in prilagajanje novim vzorcem prevar.
Poleg tehnične integracije je ključna tudi organizacijska integracija. To pomeni usposabljanje internih ekip (analitikov, podatkovnih znanstvenikov, preiskovalcev prevar) za delo z novimi orodji in razumevanje rezultatov modelov. Transparentnost delovanja modelov, čeprav so GANs sami po sebi kompleksni, je pomembna za zaupanje in učinkovitost. Rezultati modelov naj bodo predstavljeni v uporabniku prijazni obliki, npr. kot stopnja tveganja prevare ali razlogi za sum, kar omogoča preiskovalcem hitro in informirano odločanje. S tem se ne izboljša le detekcija prevar, temveč se tudi optimizirajo procesi dela in razbremenijo človeški viri, ki se lahko osredotočijo na kompleksnejše in visoko tvegane primere.
Izzivi in prihodnji razvoj na področju GANs za detekcijo prevar
Kljub vsem prednostim in obetavnim rezultatom se pri uporabi GANs za detekcijo prevar srečujemo tudi z določenimi izzivi. Eden izmed glavnih je stabilnost treninga, ki ostaja odprt problem, čeprav so arhitekture, kot je WGAN-GP, prinesle pomembne izboljšave. Nestabilen trening lahko vodi do slabše kakovosti generiranih podatkov ali celo do zastojev v procesu učenja. Drug izziv je »način kolapsa« (mode collapse), kjer generator začne generirati omejen nabor vzorcev, namesto da bi zajel celotno raznolikost resničnih podatkov. To lahko pomeni, da sintetični podatki ne bodo dovolj raznoliki za učinkovito izboljšanje modelov za detekcijo prevar, saj ne bodo pokrili vseh niš v prostoru prevar.
Prihodnji razvoj na tem področju se bo osredotočal na reševanje teh izzivov. Pričakujemo nadaljnje izboljšave arhitektur GANs, še posebej tistih, ki so specifično zasnovane za tabelarične in mešane podatke. Raziskave se bodo usmerile tudi v razvoj boljših metričnih ocen, ki bodo še bolj natančno odražale uporabnost sintetičnih podatkov za specifične naloge, kot je detekcija prevar. Vse večji poudarek bo tudi na razložljivosti generativnih modelov (Explainable AI - XAI), saj je razumevanje, zakaj in kako GANs generirajo določene vzorce, ključno za zaupanje in sprejemanje v reguliranih panogah, kot je zavarovalništvo. Končni cilj je ustvariti popolnoma robustne in zanesljive sisteme, ki bodo zmožni samodejno zaznavati in se prilagajati novim oblikam prevar, s čimer bomo zavarovalnicam omogočili dolgoročno stabilnost in poštenost do vseh zavarovancev.
Zaključek: Moč sintetičnih podatkov za prihodnost zavarovalništva
Mojih dvajset let izkušenj v zavarovalništvu me je naučilo, da je inovativnost ključnega pomena za obvladovanje nenehno spreminjajočih se tveganj. Uporaba generativnih adversarialnih mrež (GANs) za generiranje sintetičnih podatkov je izjemen korak naprej v boju proti zavarovalniškim prevaram, še posebej ko gre za detekcijo redkih dogodkov. Kot smo videli, lahko s premišljeno implementacijo GANs in skrbno validacijo sintetičnih podatkov bistveno izboljšamo robustnost in občutljivost modelov strojnega učenja, kar neposredno vpliva na zmanjšanje finančnih izgub in ohranjanje poštenosti zavarovalniškega sistema. To ni le tehnična rešitev, temveč strateška prednost, ki zavarovalnicam omogoča bolj proaktivno in učinkovito delovanje.
Verjamem, da bo tehnologija, kot so GANs, postala standardna praksa v zavarovalništvu. Omogočila nam bo, da bolje razumemo kompleksne vzorce prevar in se nanje odzovemo hitreje ter učinkoviteje. Pri Petka Zavarovanja smo zavezani spremljanju in implementaciji najnovejših tehnoloških dosežkov, da našim strankam in partnerjem zagotovimo najboljše rešitve. Če vas zanima poglobljena razprava o teh tehničnih pristopih ali pa želite raziskati možnosti implementacije podobnih rešitev v vašem poslovnem okolju, me ne oklevajte kontaktirati. Skupaj lahko gradimo varnejšo in učinkovitejšo prihodnost zavarovalništva.
Vpliv sintetičnih podatkov na detekcijo prevar v zdravstvenem zavarovanju
- Brez ustreznega zavarovanja
- Brez uporabe sintetičnih podatkov je ML model dosegel Recall le 48% pri odkrivanju prevarljivih zahtevkov. To pomeni, da je več kot polovico dejanskih prevar spregledal, kar je zavarovalnici povzročalo ocenjene letne izgube v višini 2,5 milijona EUR zaradi neizplačanih ali napačno izplačanih škod. Analitiki so preiskovali sumljive primere ročno, kar je bilo zamudno in neučinkovito, saj so se osredotočali le na najbolj očitne indikatorje, redki in sofisticirani vzorci pa so ostali neodkriti.
- Z ustreznim zavarovanjem
- Z uporabo GANs za generiranje sintetičnih podatkov smo neuravnoteženost podatkov o prevarah zmanjšali z razmerja 1:500 na 1:50. Po ponovnem treningu je isti ML model dosegel Recall 89% ob minimalnem padcu Precisiona (iz 95% na 90%). To je zmanjšalo spregledane prevare na manj kot 11% in zavarovalnici prihranilo ocenjenih 1,8 milijona EUR letno. Poleg tega so analitiki prejeli bolj natančne in zanesljive alarme, kar je skrajšalo čas preiskave in omogočilo osredotočanje na kompleksnejše primere, ki so zahtevali človeško presojo.
Primer je ilustrativen in povzet po tipičnih situacijah iz prakse. Kritja, izključitve in postopki se med zavarovalnicami razlikujejo.
Pogosta vprašanja
- Zakaj so GANs boljši od tradicionalnih metod oversamplinga?
- GANs generirajo bolj realistične in raznolike sintetične vzorce kot tradicionalne metode oversamplinga, kot je SMOTE. Namesto interpolacije obstoječih podatkov se učijo kompleksne porazdelitve podatkov, kar preprečuje prekomerno prilagoditev modelov in zagotavlja boljšo generalizacijo na realne, nevidene podatke.
- Ali so sintetični podatki varni za uporabo glede na zasebnost?
- Da, sintetični podatki so inherentno varnejši, saj ne vsebujejo dejanskih osebnih podatkov. Ker se učijo le statističnih značilnosti originalne podatkovne zbirke, omogočajo testiranje in razvoj modelov brez izpostavljanja občutljivih informacij, kar je ključno za skladnost z regulativami, kot je GDPR. Pomembna je ustrezna anonimizacija originalnih podatkov pred treningom GANs.
- Kakšne so omejitve uporabe GANs pri detekciji prevar?
- Glavne omejitve vključujejo nestabilnost treninga, tveganje »načina kolapsa« (mode collapse), kar zmanjša raznolikost generiranih podatkov, in zahtevnost izbire primerne arhitekture ter hiperparametrov. Prav tako je težko generirati popolnoma nove tipe prevar, ki se močno razlikujejo od vseh dosedanjih podatkov.
- Kako merimo uspešnost modela, izboljšanega z GANs?
- Uspešnost merimo s ključnimi metrikami, kot so Recall (za pravilno detekcijo prevar), Precision (za izogibanje lažnim pozitivom), F1-score (uravnoteženje med Recall in Precision) in AUC-ROC (splošna diskriminatorna moč modela). Pomembno je tudi kvantitativno oceniti kakovost sintetičnih podatkov z metrikami, kot sta Inception Score ali FID.
- Kateri tipi zavarovalniških prevar so najbolj primerni za detekcijo z GANs?
- GANs so še posebej primerni za detekcijo redkih in kompleksnih prevar, kjer je število primerov v realnih podatkih izjemno majhno. To vključuje nekatere oblike lažnih zahtevkov pri zdravstvenem, nezgodnem ali premoženjskem zavarovanju, ki kažejo subtilne, a prepoznavne vzorce, ki jih je težko ročno identificirati.
Viri in reference
- Uradni list RS – Zakon o zavarovalništvu (ZZavar-1)
- Agencija za zavarovalni nadzor (AZN) – Smernice za upravljanje tveganj
- Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., Courville, A., & Bengio, Y. (2014). Generative Adversarial Nets. Advances in Neural Information Processing Systems, 27.
- Arjovsky, M., Chintala, S., & Bottou, L. (2017). Wasserstein Generative Adversarial Networks. Proceedings of the 34th International Conference on Machine Learning, 70, 214-223.
Nadaljujte branje o tej temi
Povezave so izbrane samodejno glede na steber zaščite in ključne besede te objave.
- Primer: Tehnični vpogledi

Družinska anamneza in genetski testi: Kaj morate razkriti ob sklenitvi
- Primer: Tehnični vpogledi

Prenos in združevanje varčevalnih rešitev: kdaj je smiselno
- Primer: Tehnični vpogledi

Davčna obravnava izplačila za hudo bolezen in uporaba sredstev
- Primer: Tehnični vpogledi

Davčni vidik varčevanja: na kaj biti pozoren pri izplačilu
- Primer: Tehnični vpogledi

Dohodek v pokoju iz več virov: kako ga sestaviti
