Claude steganografie: wat je als ontwikkelaar moet weten
Foto: Rafael Minguet Delgado via Pexels
Steganografie in LLM-output betekent dat een AI verborgen data kan insluiten in tekst, onzichtbaar voor mensen maar detecteerbaar met analyse. Anthropic heeft dit nooit bevestigd voor Claude, maar de techniek is technisch haalbaar. Als je de Claude API zakelijk gebruikt, zijn je outputs mogelijk herleidbaar naar jouw account. Dat is geen bewezen feit, maar een serieuze vraag die je niet kunt negeren.
Wat is steganografie in AI-output precies?
Stel je voor dat een AI twee bijna identiek goede woorden kan kiezen: 'gebruiken' of 'toepassen'. Voor jou maakt het niet uit. Maar als het systeem stelselmatig kiest op basis van een verborgen bitpatroon, dan codeert het data in je tekst zonder dat je het ziet.
Dat is de kern van steganografische markering: de AI exploiteert het feit dat er bij elke generatiestap meerdere tokens zijn met nagenoeg gelijke kans. Door die keuzes te sturen op basis van een payload, kun je informatie insluiten. Denk aan je account-ID, een tijdstempel of een hash van je input-prompt.
Dit is anders dan statistische watermerken, waarbij de kansverdelingen van tokens globaal worden bijgestuurd. Steganografie werkt op een fijnmaziger niveau en is daardoor moeilijker te detecteren of te verwijderen. Zelfs als je de tekst licht herschrijft, kunnen bepaalde patronen bewaard blijven.
Voor wie meer wil weten over hoe AI-veiligheid en monitoring bij Anthropic werken: ik schreef eerder over hoe Anthropic zijn veiligheidsnormen aanscherpt en wat dat voor gebruikers betekent.
Heeft Anthropic dit daadwerkelijk ingebouwd in Claude? Niet bewezen, niet ontkend
Dit is het punt waarop je als nuchtere ondernemer even moet schakelen. Er zijn drie dingen die we weten:
1. Het is technisch mogelijk. De architectuur van grote taalmodellen laat dit toe. De mechanismen zijn goed begrepen in de academische wereld.
2. De prikkels zijn er. Als Anthropic wil kunnen achterhalen welk account misbruik maakt van de API, is steganografische markering een elegante oplossing. Effectiever dan IP-logging, want de marker zit in de tekst zelf.
3. Er is geen bewijs dat het bestaat. Onderzoekers in de community hebben identieke prompts honderden keren gestuurd naar de Claude API en variatie gevonden in de output, zelfs bij temperature=0. Maar dat kan ook komen door infrastructurele niet-determinisme, iets wat Anthropic zelf erkent. Je kunt de twee niet onderscheiden zonder extra controles.
Naar mijn idee is dit een vraag die Anthropic gewoon zou moeten beantwoorden in hun documentatie. Transparantie over output-modificaties is redelijk als je een API aanbiedt waarop anderen commerciële producten bouwen. Dat ze het niet doen, zegt op zichzelf iets, al is dat geen bewijs.
Check ook hoe Claude zich gedroeg tijdens beveiligingstests waarbij het ongeautoriseerde acties uitvoerde: ook daar stelde Anthropic's eigen monitoring zich vragen bij transparantie.
Wat kan er verborgen zitten in Claude's output?
Kijk even wat dit concreet zou betekenen. Je vraagt Claude via de API om een productomschrijving te schrijven. Die tekst publiceer je op je webshop. Als die tekst een verborgen marker draagt die herleidbaar is naar jouw API-sleutel, dan is elk stuk content dat je publiceert potentieel gelinkt aan jouw identiteit.
Dat hoeft geen probleem te zijn als je netjes binnen de gebruiksvoorwaarden werkt. Maar het roept wel vragen op:
- Wat gebeurt er als jouw API-sleutel wordt gestolen en de dief content genereert die via jou herleidbaar is?
- Wat als je content distribueert namens klanten en die content markers draagt die naar jou wijzen?
- Wat betekent dit voor sectoren waar anonimiteit of bronbescherming juridisch relevant is?
De payloads met de hoogste waarschijnlijkheid zijn account-identifiers en tijdstempels. Die zijn compact en passen in een beperkte steganografische bandbreedte. Een volledige prompt-hash zou meer bits vereisen en is dus minder waarschijnlijk bij korte antwoorden.
Let op: dit zijn hypothetische scenario's gebaseerd op de technische mogelijkheden, niet op bevestigde implementaties. Maar hypothetisch of niet, het is de moeite waard om je beleid hierop aan te passen.
Kun je zelf testen of Claude markers in output zet?
De methodologie die onderzoekers hanteren is simpel in opzet. Je stuurt dezelfde prompt tientallen keren naar de API, met temperature op nul zodat de output zo deterministisch mogelijk is. Dan analyseer je op welke posities de output verschilt en of dat patroon correleert met je account of sessie.
Praktisch probleem: Anthropic garandeert geen deterministische output, ook niet bij temperature=0. Floating-point berekeningen op verschillende servers kunnen kleine variaties veroorzaken die niets met steganografie te maken hebben. Je hebt dus minimaal twee verschillende API-accounts nodig om te vergelijken of de variatie account-gebonden is.
Een basistest in Python ziet er zo uit:
pip install anthropicDaarna stuur je dezelfde prompt twintig keer en sla je elke response op. Vergelijk de resultaten op tokenniveau. Als je bij identieke prompts meerdere verschillende antwoorden ziet, is dat het startpunt voor verder onderzoek, maar geen bewijs op zichzelf.
Eerlijk gezegd: tenzij je een specifieke compliance-reden hebt om dit te onderzoeken, is de kans klein dat je als individuele ondernemer de infrastructuur hebt om dit goed te controleren. Behandel het als een open vraag en pas je werkwijze aan op basis van dat risico, niet op basis van bewijs dat je zelf niet kunt leveren.
Wat doe je nu als je de Claude API zakelijk gebruikt? Pas je werkwijze aan, stop niet
Mijn standpunt hierover is pragmatisch. Ik gebruik Claude zelf voor allerlei werk, van code schrijven tot teksten opstellen. Ik ga daar niet mee stoppen op basis van een onbevestigde hypothese. Maar ik pas mijn werkwijze op een paar punten aan:
Gebruik nooit één API-sleutel voor meerdere klanten. Als die sleutel in output-markers zit, dan is content van klant A herleidbaar naar dezelfde sleutel als content van klant B. Dat is een privacyprobleem, ongeacht of steganografie bestaat.
Publiceer nooit onbewerkte API-output in gevoelige contexten. Als je in een sector werkt waar bronbescherming, anonimiteit of vertrouwelijkheid wettelijk relevant is (journalistiek, juridisch, medisch), dan wil je sowieso niet onbewerkte AI-tekst publiceren zonder review. Dat geldt ongeacht steganografie.
Houd Anthropic's documentatie in de gaten. Als ze ooit iets publiceren over output-markering, wil je dat weten. Zet een Google Alert op 'Anthropic output marking' of 'Claude watermarking'.
Voor wie werkt met Claude Code op enterprise-niveau: de limieten zijn verruimd, maar de transparantievragen rondom output blijven hetzelfde. Vraag het na bij je accountmanager als je een enterprise-deal hebt.
Conclusie
Steganografie in AI-output is technisch mogelijk en de prikkels voor providers zijn duidelijk aanwezig.
Anthropic heeft nooit bevestigd noch ontkend dat Claude verborgen markers in tekst insluit.
Wie de Claude API zakelijk gebruikt, doet er verstandig aan om outputs te behandelen als potentieel herleidbaar.
Veelgestelde vragen
-
Steganografie betekent het insluiten van verborgen informatie in tekst die voor mensen normaal leest. Bij AI-taalmodellen werkt dit via tokenkeuzes: als twee woorden nagenoeg gelijkwaardig zijn, kan het systeem stelselmatig voor het ene of het andere kiezen op basis van een verborgen payload. Dat is anders dan een zichtbaar watermerk of een disclaimer. Meer achtergrond over hoe taalmodellen werken vind je op MDN Web Docs over API-architectuur.
-
Nee. Anthropic heeft nooit bevestigd dat Claude steganografische output-markering gebruikt. Ze hebben het ook nooit ontkend of er documentatie over gepubliceerd. Hun gebruiksvoorwaarden reserveren het recht om gebruik te monitoren en te handhaven, maar beschrijven geen specifiek mechanisme voor output-modificaties. Bekijk Anthropic's gebruiksbeleid voor de actuele tekst.
-
Als Claude output genereert met verborgen markers die herleidbaar zijn naar jouw API-account, dan is elke tekst die je publiceert potentieel gelinkt aan jouw identiteit. Dat kan problemen opleveren als je API-sleutel wordt gestolen, als je content distribueert namens anderen, of als je werkt in een sector waar anonimiteit wettelijk relevant is. De Autoriteit Persoonsgegevens geeft richtlijnen over AI en privacy die hier relevant kunnen zijn.
-
Je kunt variatie analyseren door identieke prompts meerdere keren te sturen bij temperature=0 en de resultaten te vergelijken. Maar Anthropic garandeert geen deterministische output, ook niet bij temperature=0. Infrastructurele niet-determinisme kan variatie veroorzaken die niets met steganografie te maken heeft. Je hebt minimaal twee verschillende API-accounts nodig om account-gebonden patronen te onderscheiden van willekeurige variatie. Zie Anthropic's API-documentatie voor de technische details over temperatuur en determinisme.
-
Nee. Er is geen bewijs dat steganografische markering daadwerkelijk bestaat in Claude-output. Wat je wel kunt doen: gebruik nooit één API-sleutel voor meerdere klanten, publiceer geen onbewerkte AI-output in gevoelige of juridisch relevante contexten, en houd Anthropic's documentatie in de gaten. Dat zijn verstandige maatregelen ongeacht of steganografie bestaat. Voor meer context over hoe je AI strategisch inzet als ondernemer, bekijk ook de analyse over AI-implementatiekosten en wat er echt meespeelt.
-
Een statistisch watermerk beïnvloedt de kansverdelingen van tokens globaal, zodat een patroon detecteerbaar is door iedereen die het schema kent. Steganografische markering werkt anders: het sluit data in via specifieke keuzes tussen tokens met nagenoeg gelijke kans. Het resultaat ziet er voor mensen identiek uit, maar draagt een verborgen payload. Steganografie is daardoor moeilijker te detecteren én te verwijderen dan een statistisch watermerk. Meer over watermerken in AI lees je via de EU AI Act, die transparantie-eisen stelt aan AI-gegenereerde content.