Wann sollten Textklassifizierung und ‑entfernung verwendet werden?
Im Folgenden sind einige gängige Anwendungsfälle aufgeführt:
- Nutzer-Eingaben vor dem Speichern in der Datenbank bereinigen: Entfernen Sie sensible personenidentifizierbare Informationen (PII) wie Sozialversicherungsnummern, Kreditkartennummern oder Führerscheine aus Freiformtext, bevor Sie Datensätze in Speicher- oder Anwendungsdatenbanken schreiben.
- Transkripte und Protokolle des Kundenservice bereinigen: Entfernen Sie personenbezogene Daten aus Chatverläufen, Support-Tickets und E-Mail-Konversationen, bevor sie von Kundenservicemitarbeitern geprüft oder in Trainingsdaten aufgenommen werden.
- Sensible Einheiten für das nachgelagerte Tagging identifizieren: Text klassifizieren, um infoTypes und Wahrscheinlichkeitsbewertungen zu extrahieren und diese Informationen in benutzerdefinierten Workflows zu verwenden, um Nachrichten mit hohem Risiko weiterzuleiten oder zu kennzeichnen.
- Vertrauliche Daten in Prompts für generative KI maskieren: Entfernen Sie geschützte oder regulierte Informationen aus Nutzer-Prompts, bevor Sie Inhalte an öffentliche oder Drittanbieter-LLMs senden.
Textklassifizierung
Betrachten Sie die folgende Texteingabe:
Please update my records with the following information: Email address: foo@example.com National Provider Identifier: 1245319599 Driver's license: AC333991
Die Ausgabe ist eine Liste von Ergebnissen, die in die folgenden Kategorien gegliedert sind:
InfoTypeLikelihoodOffset(wo im String der potenzielleInfoTypegefunden wurde)
Die Beispielausgabe ist in der folgenden Tabelle dargestellt.
InfoType |
Likelihood |
Offset |
|---|---|---|
US_HEALTHCARE_NPI |
VERY_LIKELY |
122 |
EMAIL_ADDRESS |
LIKELY |
72 |
US_DRIVERS_LICENSE_NUMBER |
LIKELY |
155 |
CANADA_BC_PHN |
VERY_UNLIKELY |
122 |
UK_TAXPAYER_REFERENCE |
VERY_UNLIKELY |
122 |
CANADA_PASSPORT |
VERY_UNLIKELY |
155 |
Automatisches Entfernen von Text
Beim automatischen Entfernen erhalten Sie anstelle einer Ergebnisliste direkt eine Ausgabe, bei der die sensiblen Daten bereits entfernt sind.
Beispieleingabe für automatisches Entfernen:
Please update my records with the following information: Email address: foo@example.com National Provider Identifier: 1245319599 Driver's license: AC333991
Das Folgende ist ein Beispiel für die Ausgabe mit einem Platzhalter vom Typ „***“:
Please update my records with the following information: Email address: *** National Provider Identifier: *** Driver's license: ***
Ressourcen
- Weitere Informationen dazu, wie Sie Sensitive Data Protection zum Entfernen von Text verwenden, finden Sie unter Sensible Daten aus Textinhalten entfernen.
- Weitere Informationen zur Verwendung von Sensitive Data Protection zum De-Identifizieren sensibler Daten in Textinhalten, einschließlich des Maskierens sensibler Daten, des Ersetzens sensibler Daten durch einen Token-String und des Verschlüsselns und Ersetzens sensibler Daten mit einem zufällig generierten oder vorab festgelegten Schlüssel, finden Sie unter Sensible Daten in Textinhalten de-identifizieren.