3. Konfigurering af falske positiver i DataMapper - Admin

Falske positive er forkert markerede data som følsomme data. Målet er at minimere falske positiver for at få mere præcise data.

Hvorfor sker dette?

DataMapper leder efter højrisko-numre, for at at klassificere et dokument som høj risiko. Vi scanner efter: pasnumre (flere sprog), NINO-numre (UK), kørekort (flere sprog), CPR-numre (flere sprog) og betalingskortinformation (kreditkortnumre). Men det hænder, at lignende formatnumre, fremhæves som fx cpr-nummer eller pasnummer, idet dokumentets type kan være afgørende. Det er oftest i .XLS at DataMapper er udfordret på dén parameter.

Risiko dokumenter, der indeholder risk keywords - nøgleord for følsomme emner (fx sundhed, fagforening) eller forretningskritiske begreber (fx kontrakt, budget). Systemet markerer nøgleord som f.eks. virus som følsomme data. Hvis ord som virus dog blev brugt i en anden kontekst, f.eks. online virus til IT-udstyr, er det i virkeligheden ikke et dokument med følsomme data. Systemet forstår dog muligvis ikke hele konteksten og markerer det ofte som et risikodokument.

Hvordan kan man minimere falske positiver?

En måde, at minimere falske positiver er ved at gennemgå, hvilke fund der er gjort ud for specielt risk keywords. Her handler det nemlig meget om konteksten, hvorpå vi har fremhævet et dokument, som er afgørende for om det var et korrekt fund eller en falsk positiv.

DataMapper er bygget på AI og Machine Learning modeller og vil ikke kunne levere 100%, men så tæt på som muligt, da vi løbende træner og udvikler modellerne - også ved hjælp af din og jeres feedback.


For dig som administrator i DataMapper vil du kunne påvirke hvilke fund, som DataMapper skal gøre, ved at tilgå: Risikoindstillinger > Vælg Land > Rediger keywords


Vær opmærksom på, at keywords ikke bærer samme risiko. Fx er ordet "patient" stående alene et svagere signal (og med manglende kontekst) end fx "patient" + navn + diagnose. Ved at kigge på sammenhængende i de fund, som DataMapper har gjort, inden du foretager justeringer, hjælper med at reducere støjen og fremover - falske positiver.

Overvej også, at ordene kan have forskellige betydninger, så det er også vigtigt, ved gennemgang af "falske positiver" at kigge på hele dokumentet og ikke blot ordene alene.


Ved gennemgang af filer og keywords vil det fx se sådan her ud for dig som admin:

Tryk på Forhåndsvisning (Preview) eller Gå til dokument og gennemgå filens indhold.

Forhåndsvisningen vises som nedenfor:

Vælg derefter hvad der skal ske med filen; marker som Løst hvis filen er OK at beholde eller var en falsk positiv. På den måde hjælper du også DataMapper med at forbedre forståelsen af jeres kontekst.


Forbedring af nøjagtighed i højrisiko-fund

Selvom der kan gøres en del ved hjælp af ændring i keywords m.v. så er der nogle gange behov for at gå et spadestik dybere ved hjælp af nærmere træning på netop jeres dokumenter.

Hos Safe Online forstår vi, at virksomheder arbejder med mange forskellige filtyper og formater på tværs af lande og sprog. For at forbedre nøjagtigheden i identifikation af højrisikodata og give jer en bedre brugeroplevelse, tilbyder vi en tilpasset løsning*.


Sådan fungerer processen:

Trin 1: Indledende regelbaseret scanning

Vi starter med en første scanning ved hjælp af vores regelbaserede modeller. Disse modeller er designet til at identificere følsomme data ved at genkende specifikke mønstre og nøgleord, som fx NINO-numre i UK og CPR numre i DK.

Trin 2: Gennemgang og analyse

Når den indledende scanning er afsluttet, samarbejder vi med kunden om at gennemgå resultaterne. Dette trin indebærer at identificere eventuelle falske positiver (forkert markerede data) samt følsomme data, der eventuelt er blevet overset. Dette kan også gøres efter I selv har kigget keywords igennem og foretaget justeringer, og der fortsat er dokumenter tilbage som giver støj til jeres risikobillede.

Trin 3: Tilpasset træning med LLM

Baseret på data fra gennemgangen i trin 3 udfører vi yderligere træning af vores Large Language Models (LLM) med kundens specifikke data. Denne tilpassede træning hjælper LLM’en med bedre at forstå konteksten og reducere falske positiver i fremtidige scanninger.

Trin 4: Re-scanning for forbedret nøjagtighed

Efter LLM’en er blevet trænet med de kundespecifikke data, gennemfører vi et re-scan af data. Dette sikrer mere præcise fund med væsentligt færre falske positiver og eventuelle oversete følsomme data fra første scan.

👌 Fordele ved denne proces:

  • Øget nøjagtighed: Skræddersyet scanning og træning giver mere præcis identifikation af højrisikodata.
  • Reducerede falske positiver: Forbedret LLM-behandling minimerer forkerte markeringer, hvilket sparer tid og ressourcer fremadrettet.
  • Bedre brugeroplevelse: Mere præcise resultater giver en mere smidig og effektiv databehandling for brugeren.
  • Kontinuerlig forbedring: Systemet bliver mere præcist over tid, efterhånden som flere data behandles og LLM’en yderligere trænes.

Ved at udnytte kraften i DataMapper og vores avancerede AIM-motor sikrer Safe Online, at din virksomheds følsomme data identificeres præcist og effektivt – med øget sikkerhed og brugertilfredshed.

Er du interesseret i at høre mere omkring processen for den tilpassede løsning, ræk da ud til vores Success team for at få oplyst priser m.v.


Har du spørgsmål? Så kan du skrive til os via chatten i DataMapper eller sende os en mail support@safeonline.dk 😊

Still need help? Contact Us Contact Us