Automatische Klassifizierung, und warum DSGVO-Konformität davon abhängt
Personenbezogene Daten, die Sie nicht finden, können Sie weder schützen noch melden noch löschen. Wie NomadVault Dokumente vor der Verschlüsselung auf Ihrem Gerät klassifiziert.
Die meisten DSGVO-Pflichten teilen eine unausgesprochene Voraussetzung: Sie müssen wissen, wo die personenbezogenen Daten liegen. Das Verzeichnis der Verarbeitungstätigkeiten setzt voraus, dass Sie sie auflisten können. Ein Auskunftsersuchen setzt voraus, dass Sie die Daten einer Person binnen eines Monats finden. Die 72-Stunden-Meldefrist bei einer Datenpanne setzt voraus, dass Sie sagen können, was im betroffenen System lag. Die Speicherbegrenzung setzt voraus, dass Sie wissen, was seinen Zweck überlebt hat.
In einer Dokumentenplattform ist nichts davon gegeben. Personenbezogene Daten kommen nicht etikettiert an. Sie kommen als CSV-Export, den jemand in einen Projektordner gelegt hat, als Support-Protokoll mit Kunden-E-Mails, als Vertrag mit einem Geburtsdatum auf Seite vier. Verschlüsselung, die richtige Antwort auf Vertraulichkeit, macht das Problem schwerer: Ein Server, der Dokumente nicht lesen kann, kann sie auch nicht für Sie durchsuchen.
Dieser Artikel erklärt, wie NomadVault damit umgeht, und warum wir glauben, dass die Klassifizierung beim Hochladen, auf Ihrem Gerät, die einzige Variante dieser Funktion ist, die zu einem Ende-zu-Ende-verschlüsselten Produkt passt.
Was die Klassifizierung tut
Ist die Klassifizierung für Ihren Tenant aktiviert, wird jede textbasierte Datei beim Hochladen im Browser gescannt, nach einer etwaigen Inhaltsbereinigung und vor der Verschlüsselung. Der Scanner sucht nach Hinweisen auf vier Kategorien, mit Mustern für deutsche und englische Dokumente:
- Personenbezogene Daten. E-Mail-Adressen, Telefonnummern, nationale Kennnummern, Geburtsdaten und die Feldbezeichnungen, die üblicherweise daneben stehen: Name, Adresse, Geburtsdatum, Personalausweis, Versicherungsnummer und so weiter.
- Finanzdaten. Kartennummern, IBANs, Bankverbindungen und Begriffe wie Gehalt, Einkommen oder Kontostand.
- Gesundheitsdaten. Diagnose, Verschreibung, Befund, Arztbericht, gängige Krankheitsnamen. Diese Kategorie ist standardmäßig aus, denn sie ist eine besondere Kategorie nach Artikel 9, und sie einzuschalten ist eine Entscheidung, die Ihr Datenschutzbeauftragter bewusst treffen sollte.
- Zugangsdaten. Passwörter, API-Schlüssel und Tokens, die in einem geteilten Ordner nichts zu suchen haben.
Ihr Administrator kann eigene Muster hinzufügen, etwa Ihr Kundennummernformat oder ein Projekt-Codewort. Jede erkannte Kategorie wird als Label an der Datei gespeichert. Der Inhalt, in dem sie gefunden wurde, bleibt verschlüsselt und verlässt den Browser wie immer nur als Chiffrat.
Wer die Eigenschaften der Datei öffnet, sieht die erkannten Kategorien und kann sie überschreiben: eine Kategorie ergänzen, die der Scanner übersehen hat, oder einen Fehlalarm entfernen. Überschreibungen sind als manuell gesetzt markiert, und jede Änderung wird ins Audit-Protokoll geschrieben.
Wo die Labels arbeiten
Ein Label allein ist ein Hinweis. Seinen Wert bekommt es durch das, was es liest.
Der Datenbestandsbericht. Administratoren können eine Liste jeder Datei mit ihrer Klassifizierung und etwaigen geplanten Aufbewahrungs- oder Löschterminen erzeugen und als CSV exportieren. Das ist das Nächste an einem Verzeichnis nach Artikel 30, das ein Dokumentenspeicher aus sich heraus erzeugen kann: Hier liegen personenbezogene Daten, in welchen Ordnern, bei wem, zur Löschung fällig wann.
Workflows. Die Klassifizierung ist ein Auslöser. Ein Tenant kann festlegen, dass eine als Gesundheitsdaten klassifizierte Datei in einem mit externen Gästen geteilten Ordner eine Warnung an das Compliance-Team schickt, dass eine Datei mit einem eigenen Muster in einen eingeschränkten Ordner verschoben wird oder dass in einem Upload gefundene Zugangsdaten ein Ticket auslösen. Die Regeln laufen auf Labels, nicht auf Inhalten, und funktionieren daher, ohne dass jemand, auch nicht die Automatisierung, das Dokument liest.
Aufbewahrung. Ordner können ein Ablaufdatum mit automatischer Löschung des Inhalts tragen. Zusammen mit dem Bestandsbericht wird die Speicherbegrenzung so zu einem Zeitplan statt zu einer Absicht.
Zugriffsprüfungen. Die Admin-Berichte, die zeigen, wer worauf Zugriff hat, lassen sich gegen die Klassifizierungslabels lesen, sodass die Frage „wer kann Gesundheitsdaten sehen” ein Filter ist, kein Projekt.
Warum auf dem Gerät, vor der Verschlüsselung
Der naheliegende Ort für einen Scanner ist der Server, nach dem Hochladen, wo er alles sehen kann. Für NomadVault ist das keine Option, und wir finden, es sollte für kein Produkt eine sein, das Ende-zu-Ende-Verschlüsselung für sich beansprucht.
Die Klassifizierung im Browser auszuführen bedeutet, dass der Klartext das Gerät nie verlässt, um analysiert zu werden. Der Server erhält das Label und das Chiffrat, nichts dazwischen. Es bedeutet auch, dass der Kompromiss ausdrücklich ist: Das Label gehört zu den wenigen Dingen, die der Server über ein Dokument sehen kann, neben Größe, Zeitstempeln und Zugriffsliste, und wir sagen das im Sicherheitsüberblick. Ein Prüfer, der fragt, „was erfährt der Anbieter aus der Klassifizierung”, bekommt eine einzeilige Antwort: die Kategorienamen, sonst nichts.
Es gibt einen zweiten Grund. Ein Scanner, der vor der Verschlüsselung läuft, läuft, bevor die Daten irgendwo abgelegt sind. Ein Zugangsdatum oder eine Kartennummer, die beim Hochladen auffällt, kann abgewiesen, markiert oder verschoben werden, bevor sie je in einem Ordner liegt, den vierzig Personen öffnen können.
Was sie nicht tut
Klassifizierung ist Mustererkennung, und Mustererkennung hat Ränder. Wir nennen sie lieber, als dass Sie sie in einem Audit entdecken.
- Nur Textformate. Der Scanner liest reinen Text, CSV, JSON, Markdown, Protokolle, Konfigurations- und Quelldateien, bis zum ersten halben Megabyte. Er öffnet keine PDFs und keine Office-Dokumente, und er liest keine Bilder. Ein gescannter Vertrag ist für ihn unsichtbar. Wo sensible Daten vor allem in Office-Dateien liegen, tragen eigene Muster und manuelle Überschreibungen mehr der Last, und die Lücke steht auf unserer Liste.
- Es gibt falsche Negative. Ein Muster für IBANs erkennt kein Bankkonto, das in Prosa beschrieben ist. Ein falsches Negativ heißt: Die Datei bleibt ohne Label, und kein Workflow feuert. Die Klassifizierung grenzt die Suche ein; sie ersetzt nicht den Menschen, der weiß, wofür ein Ordner da ist.
- Es gibt auch falsche Positive. Eine Telefonnummer in der Signatur eines Lieferanten macht eine Rechnung zu „personenbezogenen Daten”. Nach der DSGVO ist das meist sogar korrekt, und das ist der Punkt, aber es heißt, dass die Labels Vorkommen beschreiben, nicht Sensibilität.
- Labels sind für den Server sichtbar. Absichtlich, damit Berichte und Workflows laufen können. Wenn schon die Tatsache, dass ein Ordner Gesundheitsdaten enthält, vor dem Betreiber verborgen bleiben muss, lassen Sie diese Kategorie aus und verwenden Sie eigene Muster mit neutralen Namen.
- Dateien, die vor der Aktivierung hochgeladen wurden, bleiben ohne Label, bis sie erneut hochgeladen oder von Hand klassifiziert werden.
Wie das auf die DSGVO abbildet
Für Compliance-Leser die Verbindungen an einem Ort:
- Artikel 30, Verzeichnis der Verarbeitungstätigkeiten. Der Datenbestandsbericht liefert Ort, Kategorie und Aufbewahrung personenbezogener Daten innerhalb der Plattform, auf Anfrage exportierbar.
- Artikel 32, Sicherheit der Verarbeitung. Klassifizierungsgesteuerte Warnungen und automatische Verschiebungen sind technische Maßnahmen, die auf Sensibilität reagieren, und sie werden protokolliert.
- Artikel 5 Abs. 1 lit. e, Speicherbegrenzung. Ordnerablauf plus die Aufbewahrungsspalte des Bestandsberichts machen aus einem Grundsatz datierte Handlungen.
- Artikel 15, Auskunftsrecht. Zusammen mit der Suche grenzen Labels ein, wo nach den Daten einer Person innerhalb der Frist zu suchen ist.
- Artikel 33 und 34, Meldung von Datenpannen. Wird ein Konto oder eine Freigabe kompromittiert, sagt der Bestandsbericht binnen Minuten, ob personenbezogene oder besondere Kategorien von Daten betroffen waren, und das entscheidet, ob und wem Sie melden müssen.
- Artikel 9, besondere Kategorien. Die Gesundheitserkennung ist opt-in, ihre Verarbeitung also eine dokumentierte Entscheidung, kein Standard.
Nichts davon macht einen Tenant für sich allein konform. Es gibt den Verantwortlichen für Compliance das eine, was ein verschlüsselter Speicher ihnen sonst vorenthält: eine Landkarte.
Fragen?
Wenn Sie besprechen möchten, wie die Klassifizierung zu Ihrem Verarbeitungsverzeichnis passt, oder Ihr Datenschutzbeauftragter die Erkennungsregeln und das Berichtsformat möchte, schreiben Sie uns an hello@nomadvault.de.