Client side regel gebaseerd matchen van data op PII* of andere gevoelige informatie

Het is weer een hele mondvol, de titel van deze post. Een korte discussie met mezelf of het dan beter helemaal in het Engels of Nederlands kan, heb ik gevoerd maar sla ik op deze plek nu over. Wel even uitleg wat PII oftewel Persoonlijk Identificeerbare Informatie betekent:

*) PII is alle informatie, al dan niet actief of passief beheerd binnen een organisatie, waarmee potentieel de identiteit van een persoon achterhaald kan worden. Denk aan gegevens als zoals naam, burgerservicenummer, geboortedatum en geboorteplaats, maar ook informatie van verwanten of biometrische gegevens, en daarnaast alle andere informatie die aan een persoon is gekoppeld of kan worden gekoppeld, waaronder medische, educatieve, financiële en werkgelegenheidsinformatie.

Bovenstaande is een vrije vertaling van de uitleg op https://csrc.nist.gov/glossary/term/pii Op https://autoriteitpersoonsgegevens.nl/nl/over-privacy/persoonsgegevens/wat-zijn-persoonsgegevens is ook uitleg over persoonsgegevens te vinden, echter zonder direct de term PII te noemen.

Onder ‘gevoelige informatie’ versta ik hier alle andere niet per se persoonsgebonden gegevens die voor een bedrijf van belang zijn vanuit oogpunt van intern en/of externe (vertrouwelijke) processen, intellectueel eigendom, concurrentie oogpunt etc.

Om even met het resultaat te beginnen: dat zijn actiegerichte bevindingen op basis van de toegepaste regels in de scan met de Data Fitness Agent om deze PII of andere gevoelige informatie te vinden. Deze bevindingen komen automatisch bij de relevante personen terecht komt voor verdere opvolging. Als ondersteuning daarbij is de informatie binnen de online Data Fitness klantomgeving ook toegankelijk in dashboards voor verdere analysedoeleinden en visuele presentatie. Hieronder een voorbeeld van zo’n dashboard, en daarna de verdere uitleg over het waarom en hoe tot dit resultaat te komen.

Waarom client side rule processing met de Data Fitness ControlOne Agent?

Waar het om gaat is het volgende: in de huidige situatie in je organisatie heb je ongestructureerde data (‘losse bestanden’ zoals Office documenten, PDF, afbeeldingen, project informatie en meer…). Die bestanden kunnen gevoelige informatie zoals PII bevatten, maar het is niet bekend welke bestanden dit betreft. Dan kun je met de Data Fitness content scan de inhoud van deze bestanden uitlezen en doorsturen naar de Cloud omgeving voor verdere analyse.

Maar wat als bepaalde inhoud van bestanden niet buiten de organisatie naar een externe omgeving mag, omdat deze bijvoorbeeld PII of andere gevoelige data bevat, maar je wel wilt weten om welke bestanden het gaat? Dan kun je met de client side content check alleen de bevindingen rapporteren naar de Cloud omgeving en daarop verdere analyse uitvoeren en acties ondernemen.

Dus als je binnen je organisatie alleen informatie die aan bepaalde regels voldoet wilt of mag gebruiken voor verdere verwerking, of deze juist wilt uitsluiten, dan is de content check de juiste optie (deze opzet kan natuurlijk ook bij de meta scan gebruikt worden, maar in de content scan is vaak meer te ‘vinden’).

Hoe werkt het?

Stel je voor, je hebt wat willekeurige data waarin misschien PII of andere gevoelige informatie voorkomt…

…en daarnaast regels om te matchen met die PII of organisatie specifieke informatie. In onderstaande code staan een paar regels voor Waterschappen waarvoor op basis van publiek beschikbare documenten gekeken is naar mogelijke definities van regels voor dossier- en projectnummer. Voor de PII regels zijn simpele voorbeelden gegeven voor BSN, IBAN, paspoort en meer. Deze zijn nog niet compleet (want voor iets als BSN is ook een aanvullende berekening als aanvullende validatie check nodig), maar daarover in een volgende blog meer.

Een aantal standaard regels is voor alle Data Fitness gebruikers beschikbaar, en aanvullende regels kunnen door de klant worden toegevoegd in de Data Fitness Cloud omgeving.

Bij de scan wordt de regels opgehaald uit de Cloud omgeving en lokaal toegepast. Een kijkje onder de motorkap laat zien dat aan de inhoud bevindingen (findings) worden toegevoegd voor elke regel die matcht.

De resultaten worden vervolgens naar de Data Fitness Cloud omgeving gestuurd, afhankelijk van de instellingen zijn dat de content of bevindingen, of beide.

De analyse van de bevindingen wordt in een overzichtelijk dashboard gepresenteerd, en daarnaast worden er acties aan gekoppeld, zoals versturen van notificaties naar relevante personen of afdelingen binnen de organisatie met de prioriteit en het voorgestelde vervolg.

Het interactieve dashboard biedt ook mogelijkheden om de informatie te filteren om snel tot specifieke inzichten te komen.

En nu?

Inzet van client side regel gebaseerd matchen van data op PII of andere gevoelige informatie geeft actief zicht en controle op de gegevens binnen de organisatie. Hiermee heb je vanuit de privacy wetgeving of andere externe relevante regelgeving én interne kaders voor datamanagement de mogelijkheid in handen om gericht verantwoordelijk beheren en beheersen van ongestructureerde data binnen de organisatie uit te zetten en op te volgen.

Interessant om binnen je eigen organisatie eens op deze manier bestanden te laten bekijken, of andere vragen? Neem dan contact op met info@dataether.nl

Connecting Data Fitness to Windows Active Directory

The latest new feature in Data Fitness, is the connection with Windows Active Directory (AD) to add user information like name and email to the meta and content scan results. Associating usernames to scan results is another step forward in the analysis and automatic translation into actions: adding the user names makes it possible to relate changes over time at file and folder level to specific users or the departments they belong to, and the email address can be used to directly send out analysis results with proposed actions to relevant people.

How do we do it?

The Data Fitness scan now also keeps track of Windows ACL (Access Control Lists) information. For example a file (or folder) at a network location like:

\\org-srv01.org.lan\\Path\To\Folder\Subfolder\importantdocument.pdf

might have the following ACL information on ownership and permissions:

S-1-5-21-3623811015-3361044348-30300820-1013:(I)(F)
NT AUTHORITY\SYSTEM:(I)(F)
S-1-5-21-3623811015-3361044348-30300820-3607:(I)(F)
S-1-5-21-3623811015-3361044348-30300820-513:(I)(M)
BUILTIN\Administrators:(I)(F)

The ACL overview contains both SIDs (Security Identifiers) in a S-x-x-xx-xxxxxxxxx-xxxxxxxxxx-xxxx format, and more descriptive default roles like BUILTIN\Administrators, together with information on permissions -> the (I)(F)(M) stuff .

The SID is is a unique, immutable identifier of a user, user group, or other security principal within a specific company domain*, that can be used to lookup other relevant user details so let’s do that.

Connect SID with User Name

The next step is to aggregate the ACL information for a full scan to a list with unique SIDs, something like :

S-1-5-21-3623811015-3361044348-30300820-1013
S-1-5-21-3623811015-3361044348-30300820-3607
S-1-5-21-3623811015-3361044348-30300820-513
...etc

Then we use this aggregated list to query Active Directory and retrieve information like Name and UserPrincipalName (the name in email format). There are more properties available, and in the future we might use these too, together with additional information on groups and the permissions.

Using the ACL and Active Directory data

As a result of the previous steps there is a Collection datafitness.ADUser2ACL with ADUser information connected to ACL SIDs in the Data Fitness database. Not every file or folder has a AD user match because the creator and owner can also be a ‘non-empolyee’ roles.

This information is now used for further analysis to find all content from a specific user (or Windows system user or group), and detect and report on changes over time. The code statement and screenshot from Compass below give an idea of how to get this data for a user. In Data Fitness user friendly reports (on changes over time on numbers, size, location, type of files and more…) are generated and can be send to relevant users.

db.foldertrees.find({Name: ["Emil Zegers"]})

*) more on SIDs at

https://docs.microsoft.com/en-us/windows/security/identity-protection/access-control/security-identifiers

https://docs.microsoft.com/en-us/windows/win32/secauthz/well-known-sids

https://en.wikipedia.org/wiki/Security_Identifier

https://renenyffenegger.ch/notes/Windows/security/SID/index

Even kort over de laatste DataEther blog post

Bij DataEther blijven we keihard werken aan de verdere ontwikkeling van de Data Fitness software, terwijl we tegelijkertijd een Proof of Concept ermee uitvoeren. Deze combinatie is een erg waardevolle leerschool waarbij we opgedane ervaringen uit de praktijk meteen toepassen in de volgende verbeterslagen van zowel de software als de analyses.

Een van de aandachtsgebieden nu de hoeveelheid data flink groeit, is efficient gebruik van resources van het cloud platform, en op peil houden of beter zelfs verbeteren van de performance.

Daar moeten we als ontwikkelteam zelf slim in zijn (lukt meestal aardig…), maar wat hulp is nooit weg. Het is daarom mooi om te zien dat de standaard mogelijkheden van het MongoDB Atlas application data platform zoals de Performance Advisor, ons ook snel verder helpen.

Op de DataEther site is daarover nu een blog post te vinden, zie https://www.dataether.nl/uncategorized/rounding-cape-horn/

#easyscalability #nodowntime #developerfriendly #performance

En we zijn los! / And we’re off!

Iets wat al langere tijd lag te sluimeren, of beter gezegd, waar achter de schermen al een goed jaar in de weekenden en verloren nachtelijke uren hard aan werd gewerkt door een team enthousiastelingen van divers pluimage, is nu aan de oppervlakte gekomen → DataEther Data Fitness!

DataEther Data Fitness

Ik ga hier niet het hele verhaal uittypen wat Data Fitness van DataEther is, want meer informatie daarover kan je op de https://www.dataether.nl/ website vinden.

Wat ik wel wil vertellen, is dat we een inmiddels een Proof of Concept hebben afgetrapt bij een leuke overheidsorganisatie in het zuiden van het land, en ik zal de komende tijd wat meer vertellen over de technische achtergrond. Om vast een klein tipje van de sluier op te lichten zonder meteen het technische geheim van de smid te verklappen hierbij een eerste overzicht van de stack:

In een volgende post neem ik de opzet en werking verder onder de loep.

Maar wacht, dat is nog niet alles! Er is ook nog een front end applicatie in ontwikkeling onder de codenaam ‘Venom’. Als dat niets spannends belooft dan weet ik het ook niet meer.

‘Venom voor DataFitness v0.9.0’

De komende tijd zal ik hier samen met Arnout Arntz, Eran Arntz en Geert Josten verder aan werken om hopelijk snel meer te kunnen vertellen over de eerste resultaten uit de praktijk.