Zum Inhalt springen
Addpriv

Differential Privacy verständlich erklärt

Differential Privacy einfach erklärt: Erfahren Sie, wie Epsilon, Zufall und Datenschutzbudget wirken und welche Grenzen die Methode hat.

Veröffentlicht am · Datenanonymisierung

Was bedeutet Differential Privacy?

Differential Privacy ist ein mathematisches Verfahren, mit dem sich statistische Auswertungen über Gruppen schützen lassen. Eine Organisation kann damit beispielsweise gemeinsame Merkmale in einer Datensammlung untersuchen, ohne dass das Ergebnis stark davon abhängt, ob die Angaben einer einzelnen Person enthalten sind.

Das Verfahren verändert nicht einfach die ursprünglichen Datensätze. Stattdessen beeinflusst es die Antwort auf eine Abfrage oder die Ausgabe eines statistischen Modells. Dafür wird gezielt eine kleine Menge Zufall eingebracht. Die berechneten Ergebnisse bleiben für die vorgesehene Auswertung brauchbar, während Rückschlüsse auf den Beitrag einer einzelnen Person erschwert werden.

Der Schutz bezieht sich auf den Einfluss eines einzelnen Datensatzes auf das Ergebnis. Er verspricht weder vollständige Geheimhaltung noch allgemeine Sicherheit für ein IT-System. Differential Privacy ergänzt daher technische und organisatorische Schutzmaßnahmen, ersetzt sie aber nicht. Wie sich klassische Verfahren wie Anonymisierung und Pseudonymisierung davon unterscheiden, zeigt ein eigener Beitrag.

Wie funktioniert das Verfahren?

Der Vergleich benachbarter Datensammlungen

Die zentrale Idee lässt sich über zwei fast gleiche Datensammlungen beschreiben: In der einen ist ein bestimmter Beitrag enthalten, in der anderen nicht. Das Verfahren soll dafür sorgen, dass eine Auswertung in beiden Fällen ähnliche Ergebnisse liefern kann. Eine Person, die nur das Ergebnis sieht, soll daraus möglichst wenig darüber ableiten können, ob dieser Beitrag vorhanden war.

In der formalen Beschreibung vergleicht man die Wahrscheinlichkeiten, mit denen ein Verfahren bestimmte Ausgaben für solche benachbarten Datensammlungen erzeugt. Eine häufig verwendete Garantie wird als ε-Differential-Privacy bezeichnet. Vereinfacht gilt: Für jede mögliche Ausgabe darf ihre Wahrscheinlichkeit bei der einen Datensammlung höchstens um einen durch ε begrenzten Faktor von der Wahrscheinlichkeit bei der anderen abweichen.

Das Symbol ε, gesprochen Epsilon, steht dabei für eine zentrale Stellschraube. Je kleiner ε gewählt wird, desto enger fällt die mathematische Grenze aus und desto stärker ist grundsätzlich die Garantie für den einzelnen Beitrag. Zugleich kann die zusätzliche Zufälligkeit die Genauigkeit der Ergebnisse stärker beeinträchtigen. Ein kleines ε ist deshalb nicht automatisch die beste Wahl für jede Anwendung: Entscheidend ist, welcher Schutz und welche Aussagekraft benötigt werden.

Warum wird Zufall hinzugefügt?

Eine genaue Auswertung kann zu viel über einzelne Beiträge verraten, besonders wenn sie sehr konkrete Werte ausgibt. Warum schon unscheinbare Angaben zur Re-Identifizierung führen können, beschreibt ein eigener Beitrag. Eine kontrollierte Zufallskomponente verändert das Ergebnis so, dass einzelne Einträge weniger stark ins Gewicht fallen. Bei einer Zählung kann das etwa bedeuten, dass die veröffentlichte Zahl leicht vom exakten Wert abweicht.

Die Zufälligkeit ist dabei kein beliebiger Störfaktor. Sie wird anhand des Auswertungsverfahrens und der gewählten Schutzparameter bemessen. Ist eine Abfrage sehr empfindlich gegenüber Änderungen an einzelnen Datensätzen, kann mehr Zufall nötig sein, um eine festgelegte Garantie einzuhalten. Wie viel Abweichung akzeptabel ist, hängt vom Zweck der Auswertung ab.

Welche Einstellungen bestimmen den Schutz?

Epsilon und die Stärke der Garantie

Epsilon ermöglicht es, den Schutzgrad einer Berechnung formal zu beschreiben. Der Wert ist jedoch nur aussagekräftig, wenn zugleich klar ist, auf welche Daten, welche Abfragen und welche Definition eines einzelnen Beitrags er sich bezieht. Zwei Angaben zu ε sind daher nicht ohne Weiteres vergleichbar, wenn die zugrunde liegenden Annahmen verschieden sind.

Außerdem sollte ein einzelner Wert nicht als umfassendes Gütesiegel verstanden werden. Er sagt für sich genommen nicht, ob die Datenerhebung angemessen war, ob ein System sicher betrieben wird oder ob die veröffentlichte Auswertung für einen bestimmten Zweck geeignet ist. Für die Einordnung sind die gesamte Berechnung und ihre Dokumentation wichtig.

Delta bei einer erweiterten Garantie

Neben ε wird mitunter ein weiterer Parameter verwendet: δ, gesprochen Delta. Eine (ε, δ)-Garantie erlaubt eine sehr kleine zusätzliche Wahrscheinlichkeit, dass die strengere ε-Grenze nicht greift. Delta ist damit kein Ersatz für eine Erklärung des Verfahrens, sondern Teil der mathematischen Beschreibung seiner Schutzwirkung.

Wer eine solche Angabe liest, sollte prüfen, ob erläutert wird, wie ε und δ festgelegt wurden und welche Annahmen dafür gelten. Ohne diesen Zusammenhang ist es schwierig, den Wert sinnvoll zu bewerten. Eine verständliche Dokumentation beschreibt außerdem, welche Art von Ausgaben geschützt wird und wie häufig Berechnungen durchgeführt werden.

Sensitivität der Abfrage

Die Sensitivität beschreibt, wie stark sich das Ergebnis einer Abfrage ändern kann, wenn sich der Beitrag einer einzelnen Person ändert oder entfällt. Eine Abfrage mit hoher Sensitivität kann durch einen einzelnen Eintrag deutlich beeinflusst werden. Dann muss das Verfahren die Zufallskomponente entsprechend berücksichtigen, damit die angestrebte Garantie eingehalten wird.

Darum beginnt eine sorgfältige Anwendung nicht erst beim Hinzufügen von Zufall. Zunächst muss feststehen, was als einzelner Beitrag zählt und welche Abfrage beantwortet werden soll. Eine unklare Definition kann dazu führen, dass die ausgewiesene Garantie nicht zu den tatsächlichen Daten und Abläufen passt.

Was bedeutet ein begrenztes Datenschutzbudget?

Jede Auswertung mit Differential Privacy verbraucht einen Teil eines festgelegten Datenschutzbudgets. Werden mehrere Abfragen über dieselben Daten beantwortet, können sich ihre Auswirkungen summieren. Deshalb reicht es nicht, jede einzelne Ausgabe isoliert zu betrachten: Auch die Gesamtheit der veröffentlichten Ergebnisse zählt.

Ein verantwortlicher Ablauf legt vorab fest, welche Abfragen erlaubt sind und wie das verfügbare Budget auf sie verteilt wird. Werden viele Auswertungen ermöglicht, kann das die gemeinsame Schutzgarantie schwächen. Eine passende Begrenzung verhindert, dass sich über eine lange Folge von Abfragen immer mehr Informationen aus den Ergebnissen ableiten lassen.

Für Nutzerinnen und Nutzer ist deshalb relevant, ob eine Organisation erklärt, wie sie wiederholte Ausgaben verwaltet. Eine einzelne Zahl zu ε sagt wenig darüber aus, wie häufig Berechnungen stattfinden oder ob spätere Auswertungen dasselbe Budget beanspruchen. Transparenz über den gesamten Berechnungsprozess erleichtert die Einordnung.

Wo kann Differential Privacy eingesetzt werden?

Das Verfahren eignet sich vor allem für statistische Ergebnisse, die aus Daten vieler Personen gewonnen werden. Denkbar sind etwa zusammengefasste Häufigkeiten, Trends oder Kennzahlen, sofern die jeweilige Berechnung so gestaltet werden kann, dass einzelne Beiträge begrenzt bleiben. Auch beim Entwickeln oder Auswerten datenbasierter Modelle kann Differential Privacy eine Rolle spielen.

Ob sie für einen konkreten Zweck sinnvoll ist, hängt von den erforderlichen Aussagen ab. Für grobe Gruppenwerte kann eine gewisse Abweichung vertretbar sein. Bei Aufgaben, für die genaue Einzelfallwerte entscheidend sind, lässt sich derselbe Ansatz möglicherweise nicht passend einsetzen. Der Nutzen muss daher gemeinsam mit der erwartbaren Genauigkeit beurteilt werden.

Die Methode ist nicht dasselbe wie Verschlüsselung. Verschlüsselung schützt Informationen beispielsweise während der Übertragung oder Speicherung vor unbefugtem Zugriff. Differential Privacy begrenzt dagegen, wie stark sich ausgewählte statistische Ausgaben durch den Beitrag einer einzelnen Person verändern. Für einen umfassenden Schutz können beide Ansätze unterschiedliche Aufgaben erfüllen.

Grenzen und typische Missverständnisse

Differential Privacy macht nicht automatisch jede Datennutzung unbedenklich. Sie schützt eine bestimmte Art von Ausgaben unter festgelegten Annahmen. Unbefugter Zugriff auf die ursprünglichen Daten, unsichere Konten oder fehlerhafte Abläufe werden dadurch nicht verhindert. Zugriffsschutz, sichere Speicherung und klare Zuständigkeiten bleiben eigenständige Aufgaben.

Auch die Qualität der Ergebnisse kann leiden. Mehr Zufall kann kleine Gruppen oder seltene Ereignisse besonders schwer auswertbar machen. Wird die Schutzstärke hoch angesetzt, kann die veröffentlichte Kennzahl für manche Fragestellungen zu ungenau sein. Verantwortliche müssen deshalb begründen, welche Genauigkeit gebraucht wird und welche Abweichungen vertretbar sind.

Ein weiterer Irrtum besteht darin, einen einzelnen Parameter unabhängig vom Verfahren zu betrachten. Die Garantie hängt unter anderem davon ab, wie ein Beitrag definiert wird, welche Berechnung stattfindet und wie viele Ausgaben veröffentlicht werden. Fehlen diese Angaben, lässt sich die Schutzwirkung nicht allein anhand des genannten Epsilon-Werts beurteilen.

Woran lässt sich eine Anwendung einordnen?

Eine nachvollziehbare Beschreibung sollte mehr enthalten als den Hinweis, dass Differential Privacy verwendet wird. Wichtig sind die Art der geschützten Daten und Ausgaben, die Definition eines einzelnen Beitrags sowie die gewählten Parameter. Ebenso sollte erkennbar sein, wie wiederholte Abfragen berücksichtigt und die Ergebnisse auf ihre Brauchbarkeit hin geprüft werden.

Für Privatpersonen und kleine Unternehmen lohnt sich ein nüchterner Blick auf die jeweilige Aussage. Fragen Sie, ob die Garantie für einzelne Ausgaben oder für einen längeren Ablauf gilt und welche Grenzen ausdrücklich genannt werden. Bei einer komplexen Verarbeitung kann eine fachkundige Einschätzung helfen, die technischen Angaben im Zusammenhang mit den übrigen Schutzmaßnahmen zu verstehen.

FAQ zu Differential Privacy

Kann Differential Privacy auch bei kleinen Datensammlungen sinnvoll sein?

Das hängt von der Fragestellung, der gewünschten Genauigkeit und der Empfindlichkeit der Auswertung ab. Bei wenigen Beiträgen kann hinzugefügter Zufall stärker ins Gewicht fallen und Ergebnisse weniger aussagekräftig machen. Eine pauschale Eignung lässt sich daher nicht allein anhand der Methode bestimmen.

Muss eine Person eine spezielle Software installieren, damit das Verfahren wirkt?

In der Regel wird Differential Privacy durch die Stelle umgesetzt, die Daten auswertet oder Ergebnisse bereitstellt. Für Personen, deren Angaben in eine Auswertung einfließen, ist normalerweise keine zusätzliche Installation erforderlich. Welche technischen Komponenten eingesetzt werden, hängt vom jeweiligen System ab.

Können Ergebnisse mit Differential Privacy für jede Entscheidung verwendet werden?

Nein. Die Methode begrenzt bestimmte Rückschlüsse, garantiert aber nicht, dass eine Kennzahl für jede Entscheidung präzise oder sachgerecht ist. Vor einer Nutzung sollte geprüft werden, ob die Genauigkeit und der Zweck der Auswertung zusammenpassen.

Was sollte eine verständliche Dokumentation erklären?

Sie sollte die geschützte Auswertung, die Definition eines einzelnen Beitrags und die verwendeten Parameter erläutern. Hilfreich sind außerdem Angaben zum Umgang mit wiederholten Abfragen und zu den Grenzen der Ergebnisse. Bei unklaren technischen Aussagen kann eine unabhängige Fachperson bei der Einordnung unterstützen.

Fazit

Differential Privacy begrenzt mathematisch, wie stark statistische Ausgaben von einem einzelnen Beitrag abhängen. Ihre Aussagekraft hängt jedoch von der konkreten Berechnung, den gewählten Parametern und dem Umgang mit wiederholten Abfragen ab. Als Baustein eines Datenschutzkonzepts kann sie nützlich sein, ersetzt aber weder sichere Systeme noch eine sorgfältige Prüfung des jeweiligen Einsatzzwecks. Weitere Verfahren stellt die Rubrik Datenanonymisierung vor.

Passend dazu