Dokumente anonymisieren mit KI, bevor sie in ChatGPT & Co. gehen
Verträge, Akten, Bewerbungen und Tickets enthalten personenbezogene Daten. ShinrAI ersetzt sie automatisch durch realistische Platzhalter, bevor ein Dokument an ein KI-Modell geht. Ihre Anwendung behält das Mapping und stellt die Originale in der Antwort wieder her.
Anwendungsfälle
- Zusammenfassen und Recherchieren. Ein Assistent fasst einen Schriftsatz oder ein Protokoll zusammen. Vorher werden Namen, Adressen und Aktenzeichen ersetzt.
- Wissensdatenbank und RAG. Dokumente werden vor der Indexierung geschützt, damit personenbezogene Daten nicht in Embeddings und Suchindizes landen.
- Bewerbungen und Personalunterlagen. Lebensläufe werden pseudonymisiert vorsortiert; die Entscheidung trifft ein Mensch mit den vollständigen Unterlagen.
- Verträge und Belege. Klassifikation, Fristenprüfung und Vorerfassung laufen auf ersetzten Daten. IBAN, Kennnummern und Geburtsdaten bleiben im Haus.
- Kundentickets. Support-Anfragen gehen pseudonymisiert an das Modell; die Antwort kommt mit den echten Kundendaten zurück.
Das Live-Beispiel zeigt den Ablauf an einem Kundenvorgang: Originaltext in Ihrer Anwendung, ersetzter Text beim Modell, nutzbare Antwort zurück bei Ihnen.
Ablauf mit der Batch-API
- Dokument übermitteln. Senden Sie TXT-, PDF- oder DOCX-Bytes bis 10 MB an
POST /v1/documents/jobs, mitmode=replaceund auf Wunschinclude_mapping=true. - Job verfolgen. Die Antwort enthält eine Job-ID. Fragen Sie
GET /v1/documents/jobs/{id}ab, bis der Job abgeschlossen ist. - Artefakte abholen. Der fertige Job liefert den geschützten Text, ein geschütztes PDF und optional das Mapping.
- An das Modell senden. Der geschützte Text geht an ChatGPT, Claude, Gemini oder ein eigenes Modell. Das Mapping bleibt in Ihrer Anwendung.
- Antwort wiederherstellen. Ihre Anwendung setzt die Originalwerte lokal ein. Dieser Schritt verbraucht keine Records.
- Aufräumen. Löschen Sie den Job oder lassen Sie die verschlüsselten Jobdaten nach 24 Stunden verfallen.
Die Batch-Verarbeitung zählt einen halben Record je 1.000 Codepunkte. Der Dokumenten-Leitfaden enthält die vollständigen Beispiele mit curl.
Integrationen: Nextcloud, n8n und mehr
| Anwendung | Was geschützt wird | Stand |
|---|---|---|
| Nextcloud | Geschützte Dokumentkopien direkt in Nextcloud; ausgewählte Assistant-Aufgaben. | Lab-Preview, Download verfügbar |
| n8n | Text-, Dokument- und KI-Schritte in Workflows; Community-Node oder HTTP-Vorlagen. | Lab-Preview, Download verfügbar |
| Open WebUI | Chats, abgerufener Kontext und neue Dokument-Uploads. | Lab-Preview |
| Dify | Schutz als Pflichtschritt in KI-Workflows. | Lab-Preview |
Alle Integrationen und ihre Versionen stehen auf der Integrationsseite. Ohne Connector reicht ein HTTP-Aufruf aus jedem Workflow-Werkzeug.
Warum die Anonymisierung vor dem Modell passieren muss
- Der Prompt ist der Abfluss. Was im Prompt steht, verlässt Ihr Haus. Ersetzen Sie personenbezogene Daten vorher, nicht nachher.
- Das Mapping bleibt bei Ihnen. ShinrAI gibt das Mapping an Ihre Anwendung zurück. Weder das KI-Modell noch ShinrAI speichern es.
- Keine Archivierung, kein Training. Synchrone Inhalte werden im Arbeitsspeicher verarbeitet. Jobinhalte sind verschlüsselt und verfallen nach 24 Stunden. Es findet kein Modelltraining mit Ihren Daten statt.
- Deutschland oder eigene Hardware. Die Managed-API läuft auf STACKIT in Deutschland. Offline-Pakete mit signierter Aktivierung laufen ohne Verbindung nach außen.
- Vertragliche Grundlage. Ein Auftragsverarbeitungsvertrag nach Art. 28 DSGVO mit Maßnahmen und Subunternehmern ist veröffentlicht.
Pseudonymisierte Dokumente können weiterhin personenbezogene Daten enthalten. Berechtigungen, Rechtsgrundlage und Governance bleiben Aufgabe Ihrer Organisation.
Qualität auf Deutsch, veröffentlicht
ShinrAI 1.4 unterstützt 15 Sprachen und erreicht auf 3.000 Wirtschafts-, Medizin- und Verwaltungstexten einen medianen F1-Wert von 94,8 bei strikter Span-Bewertung. Die Ergebnisse je Sprache und die Methodik stehen auf dem Benchmark-Board und auf der Seite Sprachen und Datenkategorien. Prüfen Sie die Qualität mit eigenen Dokumenten in einem Pilotlauf.
Erstes Dokument heute schützen
Starter kostet 39 € im Monat für 50.000 Records und erlaubt Standard- und Batch-Verarbeitung. Größere Mengen laufen über Team, Business, Platform oder ein Paket ohne Verfall.
Häufige Fragen
Welche Dateiformate kann ShinrAI anonymisieren?
Die Dokumenten-API nimmt TXT, PDF und DOCX bis 10 MB an. Der fertige Job liefert geschützten Text, ein geschütztes PDF und optional das Mapping. Reiner Text, Tabellen, JSON und Transkripte laufen über die Text-API.
Funktioniert das mit ChatGPT, Claude und Gemini?
Ja. ShinrAI sitzt zwischen Ihrer Anwendung und dem Modell. Der geschützte Text geht an einen beliebigen Anbieter; das Mapping bleibt bei Ihnen. Für Azure AI Language PII, Google Cloud DLP und AWS Comprehend gibt es zusätzlich kompatible Endpunkte.
Wie lange speichert ShinrAI meine Dokumente?
Synchrone Anfragen werden im Arbeitsspeicher verarbeitet, ohne Archiv. Inhalte asynchroner Dokument-Jobs sind verschlüsselt und verfallen 24 Stunden nach der Übermittlung. Ein Modelltraining mit Kundendaten findet nicht statt.
Kann ich Dokumente ohne Programmierung anonymisieren?
Mit der Nextcloud-Integration entstehen geschützte Dokumentkopien direkt in Nextcloud. n8n-Workflows nutzen den Community-Node oder HTTP-Vorlagen. Beide Integrationen sind als Lab-Preview zum Download veröffentlicht.
Was kostet die Anonymisierung von Dokumenten?
Ein Record entspricht 1.000 Codepunkten; Batch-Verarbeitung zählt halb. Starter kostet 39 € im Monat für 50.000 Records. Der Kalkulator auf der Startseite rechnet Ihre Dokumentmengen in einen Plan um.