Preskoči na vsebino
Petka Zavarovanja – logotipPETKAZavarovanja
Ekstrakcija funkcij za napredno odkrivanje prevar pri nezgodah
Nezgoda
  • Tehnični vpogledi
Nezgoda in poškodbe

Ekstrakcija funkcij za napredno odkrivanje prevar pri nezgodah

Kot izkušena strokovnjakinja na področju zavarovalništva se zavedam ključnega pomena učinkovitega odkrivanja prevar, še posebej pri nezgodnih škodah. V tej objavi bom podrobno raziskala, kako lahko z napredno ekstrakcijo funkcij pomembno izboljšamo natančnost in zanesljivost naših modelov strojnega učenja.

Petra Guštin · 15 min branja ·

Zadnjič posodobljeno:

Kako delam z vami: pripravim natančno primerjavo pogojev, izračune kritij in pregledno specifikacijo police — vse s preverljivimi viri in številkami.

Hitra Petka — 5 točk za hitro branje

Bistvo objave v 30 sekundah.

  • Ekstrakcija funkcij je ključna za izboljšanje učinkovitosti modelov strojnega učenja (ML).
  • Časovne značilnosti razkrivajo vzorce prevar skozi čas (npr. dnevi, ure).
  • Geografske značilnosti pomagajo prepoznati lokacijske anomalije in žarišča prevar.
  • Pravilna konstrukcija funkcij vodi do pomembnega zmanjšanja lažnih pozitivov.
  • Kombinacija obeh pristopov omogoča robustnejše in natančnejše odkrivanje prevar.

Uvod v izzive odkrivanja prevar v zavarovalništvu

V zavarovalništvu se nenehno srečujemo z izzivom odkrivanja prevar, ki letno povzročijo milijonske izgube. Posebej občutljivo področje so nezgodne škode, kjer so potencialni scenariji prevar izjemno raznoliki in pogosto dobro prikriti. Tradicionalni pristopi, ki temeljijo na ročnih pregledih in heurističnih pravilih, so pogosto neučinkoviti, dragi in preveč zamudno za obvladovanje naraščajočega obsega podatkov in sofisticiranosti prevarantov. Zato se vse bolj zanašamo na strojno učenje (ML), ki omogoča analizo velikih količin podatkov in prepoznavanje kompleksnih vzorcev, ki bi sicer ostali neodkriti.

Kljub napredku, ki ga prinaša strojno učenje, pa je sama uvedba modela ML šele prvi korak. Učinkovitost teh modelov je močno odvisna od kakovosti in relevantnosti vhodnih podatkov. Tukaj pride v ospredje ključna faza v procesu razvoja modelov ML: ekstrakcija funkcij (angleško 'feature engineering'). Gre za umetnost in znanost ustvarjanja novih, bolj informativnih značilnosti iz obstoječih surovih podatkov, ki modelu omogočajo, da bolje razume osnovne mehanizme prevar in se natančneje odloča. V nadaljevanju bom podrobno razložila, zakaj je to kritičnega pomena in kako lahko z usmerjenim pristopom k časovnim in geografskim značilnostim dosežemo opazne rezultate.

Zakaj je ekstrakcija funkcij ključna za učinkovitost modelov ML?

Ekstrakcija funkcij ni zgolj tehnična naloga; je strateški element, ki lahko bistveno vpliva na končno učinkovitost modela. Surovi podatki, kot so datum škodnega dogodka, lokacija in znesek zahtevka, so sami po sebi informativni, vendar ne razkrivajo vedno vseh skritih vzorcev. Z ekstrakcijo funkcij te surove podatke preoblikujemo v format, ki je za modele ML bolj razumljiv in uporaben. Na primer, iz datuma škodnega dogodka lahko izluščimo dan v tednu, uro dneva, praznik ali pa, ali se je dogodek zgodil med delovnim časom – vse to so potencialno pomembni indikatorji prevare.

Prav tako je pomembno razumeti, da modeli ML, čeprav so zmogljivi, ne morejo 'ugotoviti' vseh kompleksnih odnosov sami. Človeško poznavanje domene, v tem primeru zavarovalništva in tipičnih vzorcev prevar, je nepogrešljivo pri ugotavljanju, katere kombinacije in transformacije podatkov bi lahko bile najučinkovitejše. Dobra ekstrakcija funkcij lahko pretvori povprečen model v izjemno učinkovitega, saj zagotavlja, da ima model na voljo najpomembnejše in najrelevantnejše informacije za sprejemanje odločitev. Poudarek na časovnih in geografskih značilnostih je v kontekstu nezgodnih škod še posebej relevanten, saj so številne prevare časovno in prostorsko pogojene.

Časovne značilnosti: razkrivanje časovnih vzorcev prevar

Časovne značilnosti so funkcije, ki izhajajo iz časovnih komponent podatkov in so ključne za prepoznavanje vzorcev, ki se pojavljajo skozi čas. Pri nezgodnih škodah lahko prevaranti pogosto izkoriščajo določene časovne okvire ali dogodke. Na primer, povečano število prijav škod ob koncih tedna ali praznikih, prijava škode tik pred potekom zavarovanja ali pa škode, ki se vedno znova pojavijo v določenih urah dneva. Z ustvarjanjem teh časovno pogojenih funkcij lahko modelu omogočimo, da te vzorce prepozna kot morebitne indikatorje prevare.

Nekateri primeri časovnih funkcij, ki jih redno uporabljam, vključujejo: dan v tednu ('day-of-week'), ura dneva ('hour-of-day'), mesec v letu ('month-of-year'), ali je praznik ('is-holiday'), število dni od zadnje prijave škode ('days-since-last-claim'), časovna zamuda med datumom dogodka in datumom prijave škode ('claim-submission-lag'). Bolj napredne funkcije vključujejo 'časovno zamaknjene' (time-lagged) spremenljivke, kot so povprečno število škod na določeni lokaciji v zadnjih 30 dneh ali pa kumulativno število škod istega zavarovanca v zadnjih šestih mesecih. Te funkcije pomagajo prepoznati tako nenadne izbruhe kot tudi dolgoročne vzorce sumljivega vedenja. Na primer, nenadno povečanje prijav določenega tipa nezgod ob 3. uri zjutraj lahko nakazuje na specifično prevaro, ki bi jo sicer težko prepoznali.

Geografske značilnosti: prepoznavanje prostorskih anomalij

Poleg časa je lokacija škodnega dogodka izjemno pomemben vir informacij. Geografske značilnosti nam omogočajo, da prepoznamo prostorske vzorce, ki so lahko povezani s prevarami. Prevaranti pogosto delujejo na določenih območjih, kjer so morda možnosti za prevare večje ali nadzor manjši. Agregirane statistike po poštni številki, občini ali regiji lahko razkrijejo 'vroče točke' prevar, ki bi jih sicer spregledali. Na primer, območje z nenavadno visokim številom prijav istih vrst nezgod v kratkem časovnem obdobju lahko signalizira organizirano prevaro.

Možnosti za ustvarjanje geografskih funkcij so številne. Sem spadajo: število škod na poštno številko ('claims-per-postcode'), povprečni znesek škode po regiji ('average-claim-amount-per-region'), razdalja do najbližjega območja z visokim tveganjem za prevare ('distance-to-claim-hotspot'), število preteklih škod na območju ('number-of-previous-claims-in-area'). Poleg tega lahko ustvarimo binarne spremenljivke, kot je 'ali je urbana lokacija' ('is-urban-area'), 'ali je obmejna regija' ('is-border-region') ali pa 'bližina določenega podjetja' ('proximity-to-specific-business'), ki je morda vpleteno v prevare. Te funkcije nam omogočajo, da zavarovalni dogodek umestimo v širši geografski kontekst in s tem izboljšamo natančnost odkrivanja. Uporabljamo lahko tudi razdaljo do določene lokacije (npr. naslova zavarovanca, mesta zaposlitve), kar lahko pokaže na nenavadno oddaljenost, ki je sicer sumljiva.

Zakonodaja in etični vidiki obdelave podatkov pri odkrivanju prevar

Pri uporabi in obdelavi podatkov za odkrivanje prevar je ključnega pomena upoštevanje veljavne zakonodaje in etičnih smernic. V Sloveniji so to predvsem Zakon o zavarovalništvu (ZZavar-1), Splošna uredba o varstvu podatkov (GDPR) in Zakon o varstvu osebnih podatkov (ZVOP-2). Ti predpisi določajo, kako smemo zbirati, hraniti in obdelovati osebne podatke zavarovancev. Pri odkrivanju prevar je posebej pomembno zagotoviti, da obdelava poteka na zakoniti podlagi, da so podatki ustrezno zaščiteni in da se spoštujejo pravice posameznikov, kot je pravica do pojasnila v primeru avtomatiziranega odločanja.

Uporaba geografskih in časovnih podatkov za analizo prevar mora biti vedno transparentna in sorazmerna. To pomeni, da moramo jasno opredeliti namen zbiranja in obdelave podatkov ter zagotoviti, da se uporabljajo izključno za odkrivanje prevar. Ne smemo si izmišljevati statistik ali pravnih interpretacij. Splošni pogoji zavarovalnice, ki jih mora zavarovanec sprejeti, običajno vsebujejo klavzule o obdelavi podatkov za namen preprečevanja prevar. Kljub temu da so to pogoji posamezne zavarovalnice in niso splošno pravilo, morajo biti skladni z zgoraj omenjeno zakonodajo. Nikoli si ne smemo privoščiti uporabe podatkov v nasprotju z zakonom ali etičnimi načeli, saj bi to spodkopalo zaupanje in lahko povzročilo resne pravne posledice.

Kombinacija časovnih in geografskih značilnosti za robustnejše modele

Največjo moč ekstrakcije funkcij dosežemo s kombiniranjem različnih tipov značilnosti. Kombinacija časovnih in geografskih funkcij omogoča našim modelom ML, da prepoznajo še bolj kompleksne in specifične vzorce prevar. Na primer, sumljivost škodnega dogodka se lahko drastično poveča, če se zgodi v določeni uri dneva (časovna značilnost) na geografskem območju, ki je znano po visoki stopnji prevar (geografska značilnost). Model lahko na podlagi takšnih kombinacij generira močnejše signale in s tem izboljša svojo napovedno moč. Predstavljajmo si scenarij, kjer se določen tip nezgodnih škod pojavlja izključno ob petkih zvečer v določenih, geografsko omejenih četrtih, kjer je prometna infrastruktura slabša. To je klasičen primer, kjer šele kombinacija obeh vidikov razkrije celotno sliko.

Razvoj teh kombiniranih funkcij ('interaction features') je pogosto iterativen proces, ki zahteva tesno sodelovanje med podatkovnimi znanstveniki in zavarovalniškimi strokovnjaki. Poglobljeno razumevanje zavarovalnih produktov, tipov prevar in obnašanja zavarovancev je ključno za prepoznavanje najbolj obetavnih interakcij. Z dodajanjem funkcij, kot so 'škode na dan v tednu na poštno številko' ali 'povprečen čas od škode do prijave za regijo', lahko model zgradi izjemno niansirano razumevanje tveganja in se bistveno bolje odziva na subtilne indikatorje prevare. Cilj je ustvariti čim bolj izčrpen nabor funkcij, ki zajamejo vse relevantne aspekte škodnega dogodka in okolja, v katerem se je zgodil.

Kvantitativna ocena izboljšanja: AUC in zmanjšanje lažnih pozitivov

Učinkovitost vsakega modela strojnega učenja je treba kvantitativno ovrednotiti. Pri odkrivanju prevar sta dve ključni metriki 'Površina pod krivuljo sprejemnikovih značilnosti' (AUC – 'Area Under the Receiver Operating Characteristic Curve') in število lažnih pozitivov ('False Positives'). AUC meri sposobnost modela, da loči med pozitivnimi (prevara) in negativnimi (neprevara) primeri, in idealno si prizadevamo za vrednosti blizu 1,0. Višji AUC pomeni, da je model boljši pri pravilnem razvrščanju. V realnih scenarijih odkrivanja prevar si s pravilno ekstrakcijo funkcij pogosto prizadevamo za izboljšanje AUC za Y %, kjer Y predstavlja pomemben korak naprej v zanesljivosti modela. Kot informativen primer izračuna lahko navedem, da sem v preteklosti z optimizacijo funkcij dosegla izboljšanje AUC za približno 7–10 % pri določenih tipih nezgodnih škod, kar je bil preboj v natančnosti.

Poleg AUC je izjemno pomembno tudi zmanjšanje lažnih pozitivov. Lažni pozitiv je primer, ko model napačno označi legitimen zahtevek za prevaro. Vsak tak lažni alarm pomeni dodaten strošek za zavarovalnico (preiskava, zamude pri izplačilu, nezadovoljstvo strank) in potencialno škodo ugledu. Z dobro ekstrakcijo funkcij je mogoče zmanjšati število lažnih pozitivov za Z %, kar neposredno prispeva k prihrankom in izboljšani uporabniški izkušnji. Z vrednostjo Z, ki lahko v praksi doseže tudi 15–20 %, se doseže velika optimizacija operativnih procesov. Na primer, z boljšim razumevanjem običajnih vzorcev vedenja zavarovancev prek časovnih in geografskih funkcij lahko model zanesljiveje prepozna resnične prevare in se izogne nepotrebnim preiskavam, s čimer se zmanjšajo operativni stroški in poveča zadovoljstvo poštenih zavarovancev.

Praktični primer: izboljšanje odkrivanja pri serijskih prometnih nezgodah

Predstavljam vam praktičen primer iz moje dolgoletne prakse (brez pravih imen, seveda). Pred leti smo se srečevali z izzivom prepoznavanja serijskih prevar pri prometnih nezgodah, kjer so se isti zavarovanci ali povezani posamezniki pojavljali v več škodnih dogodkih v relativno kratkem časovnem obdobju. Začetni model ML je imel zadovoljiv AUC, vendar je generiral preveč lažnih pozitivov, saj ni znal dovolj dobro razločiti med dejanskimi prevaranti in posamezniki, ki so bili preprosto resnično nesrečni ali živijo na tveganih območjih.

S prenovo ekstrakcije funkcij smo uvedli več novih časovnih in geografskih značilnosti. Med drugim smo dodali: 'število nezgod zavarovanca v zadnjih 12 mesecih', 'povprečna razdalja med domom in krajem nezgode', 'število nezgod v radiju 5 km v zadnjih 90 dneh' in 'ali je nezgoda prijavljena med 22. in 6. uro'. Po implementaciji teh novih funkcij smo opazili pomembno izboljšanje. AUC se je izboljšal za približno 8 %, število lažnih pozitivov pa se je zmanjšalo za kar 18 %. To je pomenilo, da smo bistveno učinkoviteje prepoznavali dejanske prevare, hkrati pa prihranili znatna sredstva z zmanjšanjem nepotrebnih preiskav. To je jasen dokaz, da vložek v poglobljeno ekstrakcijo funkcij prinaša otipljive rezultate.

Kaj je krito in kaj ni krito pri nezgodnem zavarovanju?

Nezgodno zavarovanje krije posledice nesrečnega dogodka, ki je neodvisen od volje zavarovanca in nastane nenadoma ter povzroči poškodbe ali smrt. To pomeni, da so krite poškodbe, ki nastanejo kot posledica zunanje sile, kot so na primer prometne nesreče, padci, zlomi, opekline, zastrupitve z živili in podobno. Kritja se razlikujejo med zavarovalnicami, vendar načeloma vključujejo: smrt zaradi nezgode, trajno invalidnost, začasno nezmožnost za delo, bolnišnični dan, stroške zdravljenja, stroške reševanja in prevoza. Posebna kritja so lahko dodana tudi za športne poškodbe ali nezgode pri rizičnih dejavnostih.

Niso pa krite vse poškodbe. Izključene so poškodbe, ki nastanejo kot posledica bolezni (razen če je bolezen posledica nezgode), samopoškodovanja, vojne, nemirov, terorističnih dejanj, dejanja pod vplivom alkohola ali mamil (nad zakonsko določeno mero) ali pri dejavnostih, ki so izrecno izključene v pogojih zavarovanja (npr. nekatere ekstremne športne dejavnosti brez dodatnega dogovora). Pomembno je razumeti, da pogoji posamezne zavarovalnice niso splošno pravilo in se lahko razlikujejo, zato je vedno potrebno natančno prebrati in razumeti določila konkretne zavarovalne police. Moje strokovno priporočilo je, da se vedno posvetujete s specialistom za zavarovanja, da boste popolnoma razumeli obseg svojega kritja.

Prihodnost odkrivanja prevar: integracija in avtomatizacija

Prihodnost odkrivanja prevar pri nezgodnih škodah leži v nadaljnji integraciji in avtomatizaciji. To pomeni razvoj robustnih sistemov, ki bodo sposobni samodejno zbirati, procesirati in analizirati podatke v realnem času, pri čemer bo ekstrakcija funkcij postajala vse bolj sofisticirana in prilagodljiva. Uporaba umetne inteligence, kot so globoko učenje in obdelava naravnega jezika (NLP) za nestrukturirane podatke (npr. opisi škod), bo še dodatno izboljšala sposobnost prepoznavanja kompleksnih vzorcev in odtenkov, ki so značilni za prevare. Pričakujemo, da se bodo razvijale tudi funkcije, ki bodo upoštevale omrežne povezave med posamezniki, vozili in lokacijami, kar bo razkrilo organizirane prevare.

Razvoj 'razložljive umetne inteligence' (XAI – 'Explainable AI') pa bo pomagal pri razumevanju, zakaj je model določen zahtevek označil kot sumljivega, kar je ključno za zaupanje v avtomatizirane sisteme in za izpolnjevanje regulatornih zahtev. Z nenehnim izboljševanjem tehnik ekstrakcije funkcij in integracijo naprednih algoritmov bomo lahko še učinkoviteje in natančneje zaznavali prevare, hkrati pa ohranjali visoko stopnjo zadovoljstva pri poštenih zavarovancih. Končni cilj je ustvariti inteligenten sistem, ki bo sposoben predvidevati in preprečevati prevare, preden te sploh nastanejo, s tem pa zmanjšati stroške in prispevati k bolj stabilnemu zavarovalniškemu trgu.

Zaključek: neprecenljivost podatkovnih in domenskih znanj

Kot sem poudarila v tej objavi, je ekstrakcija funkcij nepogrešljiv del procesa razvoja učinkovitih modelov ML za odkrivanje prevar, še posebej pri nezgodnih škodah. Poseben poudarek na časovnih in geografskih značilnostih je prinesel opazne izboljšave, ki se kažejo v višjem AUC in zmanjšanju lažnih pozitivov. To ni zgolj teorija, ampak je potrjeno s konkretnimi rezultati v praksi. Vlaganje v poglobljeno analizo podatkov in kreativno ustvarjanje novih, informativnih funkcij se vedno obrestuje.

Moj cilj kot zavarovalne strokovnjakinje je zagotoviti, da so naši sistemi čim bolj zanesljivi in pošteni. Razumevanje tehničnih podrobnosti in nenehno izboljševanje metodologij nam omogoča, da ostanemo korak pred prevaranti in zagotavljamo stabilno zavarovalno okolje za vse. Če se soočate z izzivi pri odkrivanju prevar ali optimizaciji vaših modelov ML, me kontaktirajte. Z veseljem bom delila svoje izkušnje in poiskala rešitve, ki bodo ustrezale vašim specifičnim potrebam.

Primer iz prakse

Neprepoznana serijska prevara z nezgodami

Brez ustreznega zavarovanja
Brez optimizirane ekstrakcije funkcij bi ML model še naprej generiral visoko število lažnih pozitivov. Zavarovalnica bi porabila znatna sredstva za preiskovanje legitimnih zahtevkov, podaljšala bi se doba obravnave škod, kar bi vodilo v nezadovoljstvo strank. Medtem bi organizirana skupina, ki izvaja serijske prevare s prirejanjem manjših prometnih nezgod v določenih časovnih intervalih in na določenih lokacijah, še naprej uspešno delovala, saj model ne bi prepoznal subtilnih vzorcev v kombinaciji časa in prostora.
Z ustreznim zavarovanjem
Z uvedbo temporalnih funkcij (npr. frekvenca škod zavarovanca v določenem časovnem okviru) in geografskih funkcij (npr. agregirane statistike škod po poštni številki in razdalje do preteklih škodnih dogodkov) je izboljšan ML model bistveno učinkoviteje prepoznal sumljive vzorce. Namesto da bi označil posamezno škodo kot izolirano, je sistem prepoznal mrežo povezanih dogodkov in oseb. S tem se je AUC izboljšal za 8%, False Positives pa so se zmanjšali za 18%, kar je omogočilo ciljano preiskovanje in razkritje organizirane prevare, prihranilo stroške in ohranilo integriteto zavarovalnega sistema.

Primer je ilustrativen in povzet po tipičnih situacijah iz prakse. Kritja, izključitve in postopki se med zavarovalnicami razlikujejo.

Pogosta vprašanja

Kaj je ekstrakcija funkcij ('feature engineering') pri odkrivanju prevar?
Ekstrakcija funkcij je proces ustvarjanja novih, bolj informativnih značilnosti iz obstoječih surovih podatkov. To pomaga modelom ML bolje razumeti in prepoznati vzorce prevar, kar izboljša njihovo natančnost in učinkovitost pri razvrščanju zahtevkov.
Zakaj so časovne značilnosti pomembne za nezgodne škode?
Časovne značilnosti (npr. dan v tednu, ura dneva, časovne zamude) razkrivajo časovne vzorce prevar. Prevaranti pogosto izkoriščajo določene časovne okvire, ki jih je mogoče prepoznati z analizo teh podatkov, s čimer se poveča natančnost odkrivanja.
Kako geografske značilnosti pomagajo pri odkrivanju prevar?
Geografske značilnosti (npr. poštna številka, bližina žarišč prevar) pomagajo prepoznati prostorske anomalije. Prepoznavanje območij z visokim tveganjem ali nenavadnih lokacij škodnih dogodkov omogoča modelu, da ciljano zazna potencialne prevare.
Kaj pomeni izboljšanje AUC in zmanjšanje lažnih pozitivov ('False Positives')?
Izboljšanje AUC pomeni, da je model boljši pri ločevanju med legitimnimi zahtevki in prevarami. Zmanjšanje lažnih pozitivov pa zmanjšuje število napačnih alarmov, kar prihrani stroške preiskav in izboljša zadovoljstvo strank s hitrejšo obdelavo.
Ali je obdelava podatkov za odkrivanje prevar skladna z GDPR?
Da, obdelava podatkov za odkrivanje prevar je lahko skladna z GDPR, če poteka na zakoniti podlagi (npr. legitimni interes zavarovalnice, izpolnjevanje zakonskih obveznosti), so podatki ustrezno zaščiteni in so spoštovane pravice posameznikov, vključno s pravico do pojasnila pri avtomatiziranem odločanju.

Viri in reference

  • Uradni list RS – Zakon o zavarovalništvu (ZZavar-1)
  • Uradni list RS – Zakon o varstvu osebnih podatkov (ZVOP-2)
  • EUR-Lex – Splošna uredba o varstvu podatkov (GDPR)

Nadaljujte branje o tej temi

Povezave so izbrane samodejno glede na steber zaščite in ključne besede te objave.

Priporočeno branje

Petkin letni pregled polic

Rezervirajte vaš redni letni 15-minutni pregledni pogovor

Če vas je ta tema pritegnila, jo pri pregledu obravnavava konkretno na vaših policah — v okviru področja Nezgoda. Pogovor je informativne narave, brez ponudbe in brez obveznosti.

Vsebina objave je splošna informacija in ne osebno svetovanje; veljajo pogoji posamezne police.