# Jak nie dopuścić do trafienia danych osobowych do promptów AI

*Przewodnik Sluis dla zespołów ds. prywatności, bezpieczeństwa i platform. Ostatnio sprawdzony 23 września 2026 r.*

Każdy prompt, który trafia do dostawcy AI, jest ujawnieniem. Ten przewodnik opisuje, jakie dane osobowe zwykle lądują w promptach, jak skutecznie usuwa je każda metoda wykrywania, co daje zastąpienie ich symbolami zastępczymi w prawie UE po wyroku Trybunału Sprawiedliwości z września 2025 r. oraz co nadal musisz zrobić, nawet gdy redakcja danych działa.

## W skrócie

- **Dopasowywanie wzorców** wychwytuje ustrukturyzowane identyfikatory: adresy e-mail, numery telefonów, IBAN-y, numery kart, krajowe numery identyfikacyjne, klucze API. W naszym teście usunęło **57%** opisanych danych osobowych. Pomija imiona i nazwiska oraz opisy.
- **Wytrenowany model rozpoznawania encji** zamyka większość tej luki. W tym samym teście podniósł skuteczność usuwania do **98,7%**, kosztem około pół sekundy na segment tekstu.
- Zastąpienie identyfikatorów **symbolami zastępczymi** może oznaczać, że tekst nie jest już danymi osobowymi z punktu widzenia dostawcy AI. Potwierdził to Trybunał Sprawiedliwości w sprawie *EDPS przeciwko SRB*, ale tylko tam, gdzie dostawca nie ma realnej możliwości ponownej identyfikacji osoby, także przez łączenie szczegółów.
- Dla ciebie dane nadal są danymi osobowymi i nadal musisz **poinformować ludzi, że trafiają do dostawcy AI**. Trybunał ocenił ten obowiązek z perspektywy administratora, w chwili zbierania danych.
- Sprawdź **domyślną retencję dostawcy w umowie**, a nie na jego stronie marketingowej. Kilku dużych dostawców zmieniło swoje ustawienia domyślne w ciągu ostatnich dwunastu miesięcy.

## Co trafia do promptów

To, co pracownicy wklejają do narzędzi AI, wynika z ich pracy. Te same kategorie pojawiają się w niemal każdej organizacji:

| Dane | Przykład | Co je wykrywa |
|---|---|---|
| Ustrukturyzowane identyfikatory | `jan.devries@example.nl`, `NL91 ABNA 0417 1643 00`, +31 6 1234 5678 | Wzorce i sumy kontrolne, bardzo niezawodnie |
| Poświadczenia | Klucze API, tokeny dostępu, ciągi połączeń we wklejonych logach | Wzorce i kontrole entropii |
| Imiona i nazwiska osób | „Odpisz Mariece w sprawie jej zwrotu" | Słowniki popularnych imion; wytrenowany model dla reszty |
| Organizacje i miejsca | Nazwy firm, adresy ulic, miejscowości | Słowniki plus wytrenowany model |
| Szczególne kategorie danych | „Jest na zwolnieniu z powodu wypalenia od maja" | Kontekst. Żaden detektor nie jest tu niezawodny: potrzebna jest reguła użycia |
| Kombinacje identyfikujące | „Nasza jedyna partnerka w biurze w Eindhoven" | Nic niezawodnego. Identyfikuje kombinacja, a nie pojedyncze słowo |

Dwa ostatnie wiersze liczą się najbardziej. Detektor znajduje wartości; nie rozumie, że stanowisko, miejsce i data razem wskazują jedną osobę. Takie przypadki najlepiej rozwiązywać polityką: niektóre zadania w ogóle nie powinny trafiać do zewnętrznego modelu.

## Jak dobrze działa wykrywanie: nasz pomiar

Zmierzyliśmy trzy konfiguracje wykrywania w naszym własnym gateway na 105 wydzielonych syntetycznych przypadkach testowych (nie 105 niezależnych dokumentach), po 372 opisane dane na konfigurację. To, czy każda dana została usunięta w kontekście, oceniał model oceniający benchmarku, osobny model językowy, a nie przegląd przez ludzi.

| Konfiguracja | Co działa | Usunięte dane | Skuteczność |
|---|---|---|---|
| Tylko wzorce | Wyrażenia regularne, sumy kontrolne, reguły kontekstowe, katalog imion i słowniki | 211 z 372 | **56,7%** |
| Wzorce i lekki model | Powyższe plus mały wielojęzyczny model encji | 299 z 372 | **80,4%** |
| Wzorce i model PII | Powyższe z modelem wytrenowanym specjalnie do danych osobowych | 367 z 372 | **98,7%** |
| Model PII i przegląd LLM | Powyższe plus opcjonalny przegląd przez hostowany model językowy | 371 z 372 | **99,7%** |

Zmierzono 15 września 2026 r. Dwie rzeczy warto pamiętać, korzystając z tych liczb:

- Mierzą, ile **opisanych danych** usunięto w kontekście. Nie mierzą, czy cały dokument stał się anonimowy. Jedna pominięta dana może wystarczyć do zidentyfikowania kogoś.
- To pomiary **naszego własnego potoku** na **naszym własnym syntetycznym zbiorze testowym**. Nie uruchamialiśmy produktów innych dostawców na tych samych przypadkach. Zanim zaufasz liczbom któregokolwiek dostawcy, także naszym, przeprowadź podobny test na 50 własnych dokumentach.

### Ile to kosztuje

| Poziom | Mediana czasu na wywołanie | Najwolniejsze z 30 wywołań |
|---|---|---|
| Lekki model | 3,5 ms | 4,0 ms |
| Model PII | 521,5 ms | 549,6 ms |

Zmierzono 14 września 2026 r. na wielojęzycznym tekście o długości 919 znaków, w procesie, bez czasu sieci. Dla asystenta czatu pół sekundy przed rozpoczęciem odpowiedzi przez model jest zwykle do przyjęcia. Dla API o dużym wolumenie i ostrych celach opóźnienia to decyzja projektowa.

Pełność ma też swoją cenę w precyzji. Agresywne reguły usuwają rzeczy, które nie są danymi osobowymi. Reguła traktująca każde nieznane słowo pisane wielką literą jako możliwe imię lub nazwisko usunie też nazwy produktów, kody projektów i nazwy modeli, co może pogorszyć odpowiedzi. Dlatego dostarczamy tę regułę wyłączoną. Mierz fałszywe trafienia na własnych dokumentach obok pełności.

### Zamykaj w razie awarii

Zdecyduj, co się dzieje, gdy wykrywanie zawiedzie: model przekroczy czas, dokumentu nie da się sparsować, typ pliku jest nieznany. Potok, który **otwiera się przy awarii**, wysyła tekst bez redakcji. Potok, który **zamyka się przy awarii**, blokuje żądanie. Dla danych osobowych zamykaj. To jedno ustawienie liczy się bardziej niż wybór modelu.

## Symbole zastępcze zamiast usuwania

Usunięcie danych osobowych czyni wiele promptów bezużytecznymi: „Napisz odpowiedź do [usunięto] w sprawie zwrotu 40 EUR na [usunięto]" nie daje modelowi nic do pracy. Zastąpienie zachowuje strukturę:

> Napisz odpowiedź do «PERSON_NAME_1» w sprawie zwrotu 40 EUR na «IBAN_1».

Gateway przechowuje mapowanie między «PERSON_NAME_1» a prawdziwym imieniem i nazwiskiem, wysyła do dostawcy tylko symbol zastępczy i przywraca prawdziwe wartości w odpowiedzi, zanim trafi ona do użytkownika. Dwa szczegóły sprawiają, że to działa w praktyce:

- **Spójność.** Ta sama osoba dostaje ten sam symbol zastępczy w całej rozmowie, dzięki czemu model może śledzić, kto jest kim.
- **Informacja o typie.** «PERSON_NAME_1» i «IBAN_1» mówią modelowi, jaka wartość tam była, co utrzymuje odpowiedzi poprawne gramatycznie i użyteczne.

## Co mówi prawo

### Trybunał Sprawiedliwości: *EDPS przeciwko SRB*, 4 września 2025 r.

Sprawa (C-413/23 P) dotyczyła Jednolitej Rady ds. Restrukturyzacji i Uporządkowanej Likwidacji (SRB), która zastąpiła nazwiska osób składających uwagi losowo wygenerowanymi 33-cyfrowymi kodami, zachowała tabelę łączącą kody z nazwiskami i przekazała 1104 uwagi firmie Deloitte. Trybunał orzekł:

1. **Opinie są danymi osobowymi dotyczącymi ich autora** (pkt 58 do 60). Tekst, który twoi pracownicy wpisują do promptu, jest co do zasady ich danymi osobowymi.
2. **Dane spseudonimizowane nie są automatycznie danymi osobowymi dla wszystkich.** Istnienie tabeli łączącej oznacza, że dane spseudonimizowane nigdy nie mogą być traktowane jako anonimowe we wszystkich przypadkach (pkt 73). Ale pseudonimizacja „może, w zależności od okoliczności sprawy, skutecznie uniemożliwić osobom innym niż administrator zidentyfikowanie osoby, której dane dotyczą, w taki sposób, że dla nich osoba ta nie jest lub przestaje być możliwa do zidentyfikowania" (pkt 86).
3. **Dla odbiorcy zależy to od dwóch warunków** (pkt 77): odbiorca nie może cofnąć pseudonimizacji i nie może zidentyfikować osoby „za pomocą innych środków identyfikacji, takich jak porównanie z innymi czynnikami".
4. **Twój obowiązek informacyjny się nie zmienia.** To, czy musiałeś poinformować ludzi, że ich dane trafią do odbiorcy, ocenia się z pozycji administratora, w chwili zbierania danych (pkt 111 i 112). To, co odbiorca może lub nie może później zidentyfikować, nie ma znaczenia dla tego obowiązku.

W odniesieniu do promptów:

| Prompt wysłany do dostawcy | Możliwy do zidentyfikowania dla dostawcy? | Dlaczego |
|---|---|---|
| „Zwrot dla «PERSON_NAME_1», IBAN «IBAN_1», zamówienie 48213" | Prawdopodobnie nie | Numer zamówienia nic nie znaczy dla dostawcy, a mapowanie zostaje u ciebie |
| „«PERSON_NAME_1», nasza jedyna partnerka w Eindhoven, jest na zwolnieniu chorobowym" | Tak | Opis identyfikuje ją bez imienia i nazwiska, a ujawnia dane o zdrowiu |
| Ślad stosu zawierający adres e-mail klienta | Tak | Identyfikator nie został wykryty, więc wysłano go jawnym tekstem |

### Wytyczne EROD nadal są projektem

*Wytyczne 01/2025 w sprawie pseudonimizacji* Europejskiej Rady Ochrony Danych (EROD) opublikowano do konsultacji w styczniu 2025 r.; konsultacje zakończyły się 14 marca 2025 r. Nie znaleźliśmy wersji ostatecznej. Projekt przyjmuje stanowisko, że dane spseudonimizowane pozostają danymi osobowymi, gdy można je przypisać za pomocą dodatkowych informacji. Powstał przed wyrokiem i nie jest jeszcze jasne, jak ostateczny tekst go uwzględni.

W praktyce: traktuj prompty jako dane osobowe we własnych rejestrach i w ocenie skutków dla ochrony danych (DPIA); użyj dwóch warunków z wyroku do oceny pozycji dostawcy; i zapisz swoje rozumowanie.

### Co nadal musisz zrobić

- **Wskaż dostawcę AI jako odbiorcę** w swojej klauzuli informacyjnej, albo kategorię odbiorców, jak wyjaśnia pkt 111 wyroku.
- **Przeprowadź DPIA**, gdy użycie może powodować wysokie ryzyko, na przykład dane kadrowe, zdrowotne lub klientów na dużą skalę.
- **Prowadź rejestr czynności przetwarzania**, który obejmuje dostawcę AI jako podmiot przetwarzający lub odbiorcę.
- **Sprawdź sytuację transferową**, jeśli dostawca lub jego podmiot dominujący jest spoza UE. Obejmuje to nasz przewodnik o ekspozycji na CLOUD Act.

## Co przechowują dostawcy

Domyślne ustawienia retencji zmieniały się wielokrotnie w ostatnim roku. Poniższe stanowiska są takie, jak podają dostawcy w komunikatach i na stronach pomocy; potwierdź je w warunkach, które faktycznie podpisujesz.

| Dostawca | Ustawienie domyślne dla klientów API, według zgłoszeń | O co poprosić |
|---|---|---|
| OpenAI | Treści domyślnie nieużywane do trenowania dla klientów biznesowych. Zerowa retencja danych dostępna dla uprawnionych klientów API, potwierdzona ponownie w sierpniu 2026 r. | Zerową retencję danych w umowie i informację, czy twoje endpointy się kwalifikują |
| Anthropic | Logi API przechowywane 7 dni od września 2025 r. Umowy o zerowej retencji danych dla kwalifikujących się klientów enterprise. Zapowiedziany na jesień 2026 r. schemat 30-dniowej retencji dla najbardziej zaawansowanych modeli, z opcją przechowywania danych we własnej chmurze | Jaka retencja dotyczy używanych przez ciebie modeli oraz umowę o zerowej retencji |

Nakaz sądowy w sprawie New York Times, który zobowiązywał OpenAI do przechowywania logów wyników ChatGPT bezterminowo, został uchylony w październiku 2025 r., z wyjątkami dla logów już zabezpieczonych i kont oznaczonych w sprawie. Nadal bywa przytaczany jako aktualne ryzyko; nie jest już obowiązkiem bez końca.

## Lista kontrolna

- [ ] Zastosowania zmapowane na dane, które trafiają przez nie do promptów
- [ ] Zadania, które nigdy nie powinny trafiać do zewnętrznego modelu, zdefiniowane w polityce użycia AI
- [ ] Warstwy wykrywania dobrane do zastosowania, z wytrenowanym modelem wszędzie tam, gdzie pojawiają się imiona i nazwiska
- [ ] Potok zamyka się przy awarii, gdy wykrywanie zgłosi błąd lub przekroczy czas
- [ ] Pełność i fałszywe trafienia zmierzone na co najmniej 50 własnych dokumentach
- [ ] Symbole zastępcze użyte zamiast usuwania, spójne w obrębie rozmowy
- [ ] Klauzula informacyjna wskazuje dostawcę AI lub kategorię odbiorców
- [ ] DPIA wykonana dla zastosowań wysokiego ryzyka
- [ ] Ustawienia retencji i trenowania dostawcy potwierdzone w podpisanych warunkach

## Źródła

- [Court of Justice of the European Union, *EDPS v SRB*, Case C-413/23 P, judgment of 4 September 2025, paragraphs 23 to 28, 58 to 60, 72 to 77, 85, 86, 111 and 112](https://eur-lex.europa.eu/legal-content/EN/TXT/?uri=celex%3A62023CJ0413)
- [European Data Protection Board, *Guidelines 01/2025 on Pseudonymisation*, consultation version, feedback period 17 January to 14 March 2025](https://www.edpb.europa.eu/public-consultations/guidelines-012025-on-pseudonymisation_en)
- [OpenAI, *Offering Zero Data Retention for frontier models*, 19 August 2026](https://openai.com/index/offering-zero-data-retention-for-frontier-models/)
- [Anthropic, API and data retention documentation](https://platform.claude.com/docs/en/manage-claude/api-and-data-retention)
- Uchylenie nakazu zabezpieczenia w sprawie New York Times (postanowienie z 9 października 2025 r.) oraz jesienny schemat retencji Anthropic z 2026 r. pochodzą z doniesień prasowych, w tym Engadget i CNBC.
- Dane o wykrywaniu i opóźnieniach: pomiary Sluis z 15 i 14 września 2026 r. Metodę opisuje [dokumentacja ochrony danych Sluis](/docs/data-protection).
