Auf einen Blick
Die öffentliche Debatte über Wasserzeichen in KI-Texten wird geführt, als sei die Technik vorhanden und es fehle nur der politische Wille, sie einzusetzen. Das Gegenteil trifft zu: Die Verfahren existieren, teilweise laufen sie produktiv — aber niemand außerhalb der Anbieter kann sie prüfen.
Für Bilder ist die Lage vergleichsweise geordnet. Es gibt einen Signaturstandard, es gibt Prüfwerkzeuge, jeder kann eine C2PA-Signatur unabhängig validieren. Für Text gibt es das alles nicht.
Dieser Artikel trennt sauber zwischen drei Dingen, die regelmäßig vermischt werden: was technisch existiert, was produktiv eingesetzt wird, und was sich von außen tatsächlich nachprüfen lässt. Die drei Mengen sind deutlich verschieden groß.
Warum Text schwerer ist als Bild
Bevor es um einzelne Verfahren geht, lohnt sich die strukturelle Frage: Warum haben Bilder seit 2023 einen funktionierenden Herkunftsnachweis und Text bis heute nicht?
1. Es gibt keinen Metadatencontainer. JPEG, PNG und MP4 haben standardisierte Metadatensegmente, die normale Verarbeitung überstehen. text/plain hat keine. Es gibt schlicht keinen Ort, an dem ein signiertes Manifest liegen könnte — außer in den Zeichen selbst. Genau deshalb musste C2PA für Text auf Variation Selectors ausweichen, und genau deshalb hat das Unicode-Konsortium dagegen Einspruch erhoben (dazu unten mehr).
2. Das Entropiebudget ist winzig. Ein Ein-Megapixel-Bild hat Millionen wahrnehmungsredundanter Bits, in denen sich eine Nutzlast verstecken lässt. Ein Absatz mit 200 Tokens hat vielleicht einige hundert nutzbare Bits — und diese Entropie ist ungleich verteilt. Für ein einzelnes Bit „KI oder nicht" reicht es knapp. Für eine Kennung, einen Zeitstempel oder eine Signatur reicht es nicht.
3. Jede Bearbeitung ist eine semantische Bearbeitung. Ein neu komprimiertes JPEG behält seine Pixel näherungsweise. Ein umformulierter Satz behält kein einziges Token. Bei Text gibt es kein Äquivalent zu „wahrnehmungsgleich, aber bitweise verschieden".
4. Die Menge gleichwertiger Antworten ist riesig und leicht begehbar. Zu jedem Prompt existieren astronomisch viele gleich gute Antworten, und ein Sprachmodell ist selbst das perfekte Werkzeug, um sich in dieser Menge zu bewegen. Genau darauf beruht das Unmöglichkeitsresultat von Zhang et al. („Watermarks in the Sand", ICML 2024): Ein Zufallslauf durch den Raum qualitativ gleichwertiger Ausgaben verlässt irgendwann den markierten Bereich — ohne jede Kenntnis des Verfahrens oder des Schlüssels.
5. Text wird zitiert, gekürzt, abgetippt und vermischt. Das Verdünnen von markiertem Text in einem längeren Dokument ist in allen veröffentlichten Benchmarks der wirksamste Angriff — und zugleich völlig normales Verhalten.
Dazu kommt eine politische Randbedingung, die es bei Bildern nicht gibt: Eine eigene Nutzerumfrage von OpenAI ergab, dass fast 30 Prozent der Nutzer den Dienst seltener verwenden würden, wenn OpenAI Text markiert und ein Wettbewerber nicht. Eine vergleichbare Ablehnung gegen Content Credentials bei Bildern existiert nicht. Das erklärt die Zeitdifferenz besser als jedes technische Argument.
Die Verfahren im Überblick
Alle statistischen Text-Wasserzeichen bestehen aus denselben drei Teilen: einem Startwert, der aus vorhergehenden Tokens und einem Geheimschlüssel abgeleitet wird; einer Regel, die die Tokenwahl verzerrt; und einer Auswertungsfunktion, die die Verzerrung im fertigen Text wiederfindet.
Green-List-Verfahren
Das Gründungsverfahren von Kirchenbauer et al. (2023). Ein Hash der vorhergehenden Tokens teilt das Vokabular in eine „grüne" und eine „rote" Liste. Auf die Logits aller grünen Tokens wird ein konstanter Bonus δ addiert. Das Modell wählt dadurch etwas häufiger grüne Tokens — nicht immer, nur häufiger. Über hunderte Tokens summiert sich das zu einem messbaren Überschuss.
Die Erkennung ist ein Binomialtest. Bei z > 4 liegt der einseitige p-Wert bei etwa 3 × 10⁻⁵. Mit γ = 0,5 und δ = 2,0 meldet die Arbeit, dass 98,4 Prozent der 200-Token-Ausgaben erkannt werden.
Eine wichtige Einschränkung, die selten mitzitiert wird: Fernandez et al. zeigten, dass die tatsächlichen Falschpositivraten die vom Normalapproximation vorhergesagten deutlich übersteigen, weil wiederholte N-Gramme die Unabhängigkeitsannahme verletzen. Die zitierten p-Werte sind optimistisch.
Gumbel-Verfahren
Scott Aaronsons Konstruktion, die OpenAI gebaut und nie ausgeliefert hat. Statt Logits zu verschieben, wird die Sampling-Regel selbst umgeschrieben, sodass die Ausgabeverteilung — über den Schlüssel gemittelt — exakt der ursprünglichen entspricht. Kein Qualitätsverlust, aber ein Nebeneffekt: Derselbe Kontext liefert immer dasselbe Token, die Antwortvielfalt sinkt.
Tournament Sampling
Googles SynthID-Text, seit 2024 in Gemini produktiv und in Nature veröffentlicht. Es werden mehrere Kandidaten aus der echten Modellverteilung gezogen und in einem K.-o.-Turnier gegeneinander bewertet. Die Verteilung bleibt im Mittel erhalten, die Auswahl innerhalb der Kandidaten trägt das Signal.
Der praktisch relevante Punkt: Die Erkennung erfolgt über einen trainierten Bayes-Klassifikator, nicht über einen geschlossenen statistischen Test. Es gibt keinen p-Wert, sondern eine empirisch kalibrierte Schwelle gegen ein Referenzkorpus.
Das Entropieproblem
Alle drei Verfahren teilen dieselbe harte Grenze: Wenn nur ein Token plausibel ist, gibt es nichts zu verzerren.
| Inhaltstyp | Markierbar |
|---|---|
| Längere Fließtexte, Essays, Entwürfe | gut |
| Meinungstexte, Marketingtexte | gut |
| Faktenantworten („Hauptstadt von Frankreich") | praktisch nicht |
| Quellcode | schlecht |
| Zitate, Rezitationen, Textbausteine | nicht |
| Texte unter etwa 100 Tokens | nicht |
Daraus folgt eine unbequeme Beobachtung: Genau die Inhalte, bei denen Herkunft am wichtigsten wäre, sind am schlechtesten markierbar. Eine erfundene Tatsachenbehauptung, ein manipuliertes Code-Snippet, ein kurzer verleumderischer Satz — alle liegen im entropiearmen Bereich.
Verschärfend kommt hinzu, dass niedrige Temperatur, Top-k-Beschneidung und — paradoxerweise — bessere Modelle mit RLHF die Ausgabeverteilung schärfen und das Wasserzeichen dadurch schwächen.
Der Anbieterstatus, Stand August 2026
OpenAI: kein Text-Wasserzeichen
OpenAI hat ein funktionierendes Verfahren gebaut und nie ausgeliefert. Berichten vom August 2024 zufolge lag es rund ein Jahr fertig in der Schublade, mit einer angegebenen Zuverlässigkeit um 99,9 Prozent bei ausreichend langem Text.
Die Gründe waren kommerziell und sozial: die erwähnten 30 Prozent Abwanderungsbereitschaft, die Sorge, Nicht-Muttersprachler zu stigmatisieren, und die Einsicht, dass das Verfahren durch Übersetzung oder durch das Einfügen und Wiederentfernen eines Sonderzeichens trivial ausgehebelt wird.
Ausgeliefert hat OpenAI Herkunftsnachweise nur für Bilder und Audio — C2PA-Metadaten kombiniert mit SynthID — samt öffentlichem Prüfwerkzeug. Für Text: nichts.
Erwähnenswert ist auch der Vorläufer: OpenAIs „AI Text Classifier", ein probabilistischer Detektor ohne Wasserzeichen, startete im Januar 2023 und wurde im Juli 2023 wegen niedriger Trefferquote wieder abgeschaltet.
Google: produktiv, aber verschlossen
SynthID-Text läuft in Gemini. Google hat im Oktober 2024 die Methode quelloffen gemacht — den Logits-Processor, die Konfigurationsklasse, eine untrainierte Detektorarchitektur und Trainingscode.
Nicht veröffentlicht wurden: die Produktivschlüssel und ein trainierter Detektor für Gemini-Ausgaben. Ohne Schlüssel lässt sich die Bewertungsfunktion nicht berechnen, ohne sie gibt es keine Erkennung.
Das Detektorportal von Google nimmt bis heute nur Bild, Video und Audio an. Textkennung wurde im Mai 2025 für „die kommenden Wochen" angekündigt und ist rund fünfzehn Monate später nicht erschienen.
Korrekt formuliert: Google hat das Verfahren offengelegt, nicht sein Wasserzeichen. Wer ein eigenes Modell betreibt, kann markieren und erkennen. Googles Texte kann niemand außer Google erkennen.
Anthropic: neu, undokumentiert, angekündigt
Am 11. August 2026 hat Anthropic dokumentiert, wie Claude KI-generierte Inhalte markiert. Zwei getrennte Mechanismen:
Text. Anthropic beschreibt, dass ein „unmerkliches Wasserzeichen direkt in den Text selbst eingewoben" wird, das beim Kopieren mitwandert und „manche Bearbeitungen überstehen kann".
Dateien. Für .svg, .png und .jpg werden signierte C2PA-Metadaten angehängt, die auch Manipulationserkennung ermöglichen.
Abdeckung: Modelle ab dem 2. August 2026, ältere Modelle in Nacharbeit. Weltweit, über API, Claude, Claude Code, Cowork und die Cloud-Partner.
Prüfbarkeit durch Dritte: heute nicht. Anthropic kündigt an, Werkzeuge bereitzustellen, mit denen Nutzer und Dritte die Markierungen erkennen können, und will Details in einer technischen Dokumentation nachreichen. Beides existiert Stand 13. August 2026 nicht. Das Verfahren ist nicht offengelegt — ob es logit-basiert, sampling-basiert oder zeichenbasiert arbeitet, ist öffentlich unbekannt.
Die C2PA-Metadaten an Bilddateien sind dagegen sofort und von jedem prüfbar, mit Standardwerkzeugen.
Bemerkenswert offen sind Anthropics eigene Einschränkungen: Eine gefundene Markierung bedeute, dass der Inhalt „möglicherweise von Claude verarbeitet wurde" — nicht, dass Claude ihn verfasst hat, da das Modell häufig zum Korrekturlesen eingesetzt wird. Und das Fehlen einer Markierung beweise nichts.
Eine Warnung zur Sekundärberichterstattung: Aus der Formulierung „ändert die Bedeutung nicht" wurde teilweise geschlossen, das Verfahren könne nicht auf Wortwahl beruhen. Dieser Schluss ist technisch falsch. Sämtliche generativen Wasserzeichen der Literatur funktionieren genau so — sie ändern die Wortwahl und erhalten die Bedeutung.
Zusammenfassung
| Anbieter | Text markiert? | Von Dritten prüfbar? |
|---|---|---|
| OpenAI | nein | entfällt |
| Google (Gemini) | ja, seit 2024 | nein |
| Anthropic (Claude) | ja, seit 2. August 2026 | nein, angekündigt |
| Offene Modelle lokal | in der Regel nein | entfällt |
Zeichen-Ebene: was tatsächlich deterministisch prüfbar ist
Statistische Wasserzeichen sind für Außenstehende unzugänglich. Es gibt aber eine zweite Kategorie von Signalen, die keinerlei Schlüssel benötigt, weil sie schlicht Fakten über die Zeichenkette sind.
| Verfahren | Codepunkte | Kapazität |
|---|---|---|
| Zero-Width-Zeichen | U+200B, U+200C, U+200D, U+FEFF | 1–2 Bit je Zeichen |
| Unicode-Tags („ASCII Smuggling") | U+E0000 – U+E007F | 1 ASCII-Zeichen je Codepunkt |
| Variation Selectors | U+FE00–U+FE0F und U+E0100–U+E01EF | genau 1 Byte je Selector |
| Homoglyphen | z. B. kyrillisch а, е, о | ~1 Bit je Ersetzung |
| Leerzeichen-Kodierung | U+2000–U+200A, U+202F | gering |
Die Variation Selectors sind der interessanteste Fall: Die beiden Bereiche umfassen zusammen exakt 256 Codepunkte, sodass sich jedes Byte auf genau einen Selector abbilden lässt. Beliebige Binärdaten lassen sich damit an jedes sichtbare Zeichen anhängen — auch an ein einzelnes Emoji.
Was diese Befunde bedeuten — und was nicht. Ein gefundenes Zero-Width-Zeichen beweist keine KI-Herkunft. Es beweist, dass im Text etwas steckt, das dort nicht sichtbar ist. Das kann ein Herkunftsmarker sein, ein Tracking-Marker, ein Kopierschutz einer Agentur, ein Artefakt eines CMS — oder ein Angriff.
Denn genau dort werden diese Zeichen heute tatsächlich eingesetzt: nicht für Herkunftsnachweise, sondern für Prompt Injection. Versteckte Anweisungen in Webseiten, PDFs, Werkzeugbeschreibungen und Agenten-Konfigurationen sind ein aktives Sicherheitsproblem. Wer eine Texteingabe auf Unicode-Auffälligkeiten prüft, betreibt in erster Linie Sicherheitsprüfung — und erst in zweiter Linie Herkunftsanalyse.
Robustheit: gering. Zeichen-Ebene-Marker überleben den ersten Durchlauf durch einen Plaintext-Editor nicht, keine Paraphrase, keine OCR, kein tr -d, keine Unicode-Normalisierung nach NFKC und kein Abtippen. Ihr einziger Vorteil gegenüber statistischen Verfahren: Sie tragen eine echte Nutzlast — eine Kennung, einen Zeitstempel, eine Signatur — und nicht bloß ein einzelnes Bit Evidenz.
Eine akademische Untersuchung vom Dezember 2025 prüfte zehn format-basierte Verfahren gegen sechs Sprachmodelle. Das Ergebnis ist ernüchternd für alle, die Zeichen-Ebene-Marker für unauffällig halten: Aktuelle Spitzenmodelle erkannten die Anwesenheit aller Wasserzeichentypen mit 100 Prozent Trefferquote. Verdeckt sind diese Verfahren gegenüber einem modernen Sprachmodell nicht — und gegenüber grep erst recht nicht.
Der ChatGPT-Mythos
Kaum eine Behauptung hält sich hartnäckiger als die, ChatGPT verstecke unsichtbare Zeichen im Text.
Der Ursprung ist datierbar. Im April 2025 berichtete Rumi, dass die Modelle o3 und o4-mini in längeren Antworten schmale geschützte Leerzeichen (U+202F) anstelle gewöhnlicher Leerzeichen ausgaben — bei GPT-4o nicht. Die Beobachtung war korrekt.
Die Deutung war es nicht. OpenAI meldete sich am 22. April 2025 und erklärte, die Zeichen seien kein Wasserzeichen, sondern „eine Eigenart großangelegten Reinforcement Learnings". Am 23. April war das Verhalten verschwunden.
Es gibt bis heute keinen dokumentierten Fall, in dem ein großer Anbieter absichtlich Zero-Width-Zeichen, Unicode-Tags oder Variation Selectors als Herkunftsnachweis in Textausgaben einfügt. Wer das behauptet, sollte eine Quelle nennen können.
C2PA für Text — und der Einspruch des Unicode-Konsortiums
Ein Detail, das in der deutschsprachigen Diskussion bislang praktisch fehlt und für die Kennzeichnungspflicht nach der KI-Verordnung erhebliche Bedeutung hat.
C2PA hat inzwischen einen Textmechanismus. Die Spezifikation 2.4 sieht vor, ein signiertes C2PA-Manifest über Unicode Variation Selectors direkt in unstrukturierten Text einzubetten, mit einem eigens dafür vorgesehenen Hard-Binding über einen Daten-Hash. Es existiert eine Referenzimplementierung, die die Bereiche U+FE00–U+FE0F und U+E0100–U+E01EF nutzt, den Container mit einer Magic-Sequenz kennzeichnet und ein ZWNBSP voranstellt.
Das ist bemerkenswert, weil es das erste standardisierte Verfahren ist, mit dem ein kryptografisch signierter, unabhängig prüfbarer Herkunftsnachweis an einen Text gebunden werden kann — nicht bloß ein Bit „KI oder nicht", sondern ein vollständiges Manifest.
Und es steht im Konflikt mit dem Unicode-Standard. Das Dokument L2/26-042 vom 13. Januar 2026 hält fest, dass dieses Vorgehen Unicode-Konformitätsanforderungen verletzt — konkret Klausel D1 und die Bestimmungen zu Variationssequenzen. Variation Selectors sind dafür definiert, Glyphenvarianten des vorangehenden Zeichens auszuwählen; ihre Nutzung als allgemeiner Byte-Kanal ist eine Zweckentfremdung. Das Dokument verweist auf frühere Beschlüsse, wonach Steuer- und Formatzeichen für solche Zwecke ungeeignet sind, weil sie Textverarbeitung zerstören können — und darauf, dass Unicode einen analogen Versuch bereits aufgegeben hat, nämlich die Sprach-Tags im heute für ASCII Smuggling missbrauchten Bereich.
Das Dokument nennt ausdrücklich die Kennzeichnungspflicht der KI-Verordnung ab August 2026 als Grund für die Dringlichkeit und fragt, ob Unicode mit dem EU-KI-Büro und mit C2PA Kontakt aufnehmen sollte. Es ist als Hintergrundinformation eingestuft, ohne formale Empfehlung.
Der Stand ist damit: Der führende standardisierte Mechanismus für Text-Herkunftsnachweise steht in ungeklärtem Konflikt mit dem Zeichenkodierungsstandard, auf dem er aufbaut — und zwar genau in dem Moment, in dem eine Verordnung maschinenlesbare Kennzeichnung verlangt.
Bei den übrigen Standardisierungsgremien ist wenig zu holen: Eine W3C-Community-Group zu KI-Inhaltsoffenlegung wurde im Februar 2026 lediglich vorgeschlagen und zielt auf ein Offenlegungsvokabular, nicht auf Technik. Eine IETF-Arbeitsgruppe zu Text-Provenance existiert nicht.
Wie wenig es braucht, um ein Wasserzeichen zu entfernen
| Angriff | Wirkung | Aufwand |
|---|---|---|
| Tippfehler, Groß-/Kleinschreibung, leichtes Lektorat | vernachlässigbar bei langem Text | trivial, wirkt nicht |
| Synonymersetzung bis 70 % der Wörter | SynthID-AUC weiterhin über 0,94 | hoch, wirkt nicht |
| Trennzeichen einfügen und wieder löschen | zerstört kontext-gehashte Verfahren vollständig | ein Prompt |
| Rückübersetzung über eine Drittsprache | SynthID-F1 fällt auf ≈ 0,71 | Sekunden, kostenlos |
| Paraphrase durch ein Sprachmodell | über 90 % Entfernungsrate | gering |
| Verdünnung auf ≤ 10 % Anteil | nahe Zufallsniveau; bei 20-fach AUC ≈ 0,5 | trivial — normales Zitieren |
| Intensives menschliches Umschreiben | erkennbar, aber erst ab ~800 Tokens | hoch |
| Wasserzeichen-Diebstahl | über 80 % bei Entfernung und Fälschung | unter 50 US-Dollar API-Kosten |
Zwei Einträge verdienen Hervorhebung.
Verdünnung ist kein Angriff. Sie ist der Normalfall. Wer einen KI-Absatz in ein längeres eigenes Dokument einbaut, greift nicht an — er arbeitet. Ein Verfahren, das bei zehn Prozent Anteil versagt, versagt bei gewöhnlichem Zitieren.
Wasserzeichen-Diebstahl kehrt das Bedrohungsmodell um. Die Arbeit von Jovanović et al. zeigte, dass ein Angreifer mit reinem API-Zugang die Regeln für unter 50 Dollar näherungsweise rekonstruieren und dann in über 80 Prozent der Fälle sowohl entfernen als auch fälschen kann. Das Risiko ist nicht nur, dass Schuldige entkommen — sondern dass Unschuldigen Inhalte zugeschrieben werden, die sie nie erzeugt haben.
Die Alternative, die keine ist
Wer keine prüfbaren Wasserzeichen hat, greift oft zu probabilistischen Detektoren. Die Zahlen dazu sollte man kennen, bevor man eine Entscheidung darauf stützt.
Die in Patterns veröffentlichte Studie von Liang et al. prüfte sieben verbreitete GPT-Detektoren an 91 TOEFL-Aufsätzen von Nicht-Muttersprachlern und 88 Aufsätzen US-amerikanischer Achtklässler.
- Rund 61 Prozent der TOEFL-Aufsätze wurden fälschlich als KI-generiert eingestuft.
- Bei den Achtklässler-Aufsätzen lag die Trefferquote nahe perfekt.
- 18 der 91 TOEFL-Aufsätze wurden von allen sieben Detektoren einstimmig falsch eingeordnet.
- Die Ursache ist der Mechanismus selbst: Die Detektoren messen Perplexität. Wer eine Fremdsprache schreibt, verwendet weniger vielfältiges Vokabular, hat niedrigere Perplexität und sieht dadurch maschinell aus.
- Der aufschlussreichste Befund: Ließ man ChatGPT die Wortwahl „muttersprachlicher" gestalten, sank die Falschpositivrate um rund 50 Prozentpunkte auf etwa 12 Prozent. Die Verzerrung ist ein direktes Artefakt der Statistik — und trivial manipulierbar.
Der Schaden ist dokumentiert. Die Vanderbilt University rechnete vor, dass bei Turnitins angegebener Falschpositivrate von einem Prozent und 75.000 eingereichten Arbeiten rund 750 Arbeiten fälschlich markiert worden wären, und schaltete den Detektor im August 2023 ab. An einer australischen Universität standen 2024 rund 6.000 Verdachtsfälle im Raum, etwa 90 Prozent davon mit KI-Bezug; rund ein Viertel wurde nach Prüfung eingestellt. Studierende legten handschriftliche Notizen und vollständige Browserverläufe vor, um ihre Unschuld zu belegen.
Ein fairer Hinweis zugunsten von Wasserzeichen: Diese Studien prüften probabilistische Klassifikatoren, keine Wasserzeichendetektoren. Ein korrekt kalibrierter Wasserzeichendetektor kann prinzipiell nicht dadurch auslösen, dass jemand in einfachem Deutsch schreibt — seine Falschpositivrate ist eine Eigenschaft des Schlüssels, nicht des Schreibstils. Das ist das stärkste echte Argument für Wasserzeichen und sollte nicht unterschlagen werden. Die verbleibende Fairnessfrage ist eine andere: Nicht-Muttersprachler nutzen KI-Schreibhilfen häufiger, sodass auch ein korrekter Detektor überproportional bei ihnen anschlägt.
Was sich also prüfen lässt
Zusammengefasst, Stand August 2026:
Deterministisch prüfbar, von jedem, ohne Schlüssel:
- C2PA-Manifeste an Dateien — Signatur, Signierer, Hash-Integrität, Bearbeitungskette
- Eingebettete Metadaten und ihre Konsistenz
- Zero-Width-Zeichen, Unicode-Tags, Variation Selectors, Homoglyphen, auffällige Leerzeichen
- Bidi-Steuerzeichen und andere strukturelle Auffälligkeiten
- Ob ein C2PA-Textmanifest nach 2.4 vorhanden und gültig ist
Nicht prüfbar, Punkt:
- SynthID-Text von Gemini
- Anthropics Text-Wasserzeichen in Claude-Ausgaben
- Ob ein Text „von einer KI" stammt
Diese Trennlinie ist unbequem, aber sie ist die einzige ehrliche. Ein Werkzeug, das sie verwischt — das aus dem Fehlen eines Signals eine Wahrscheinlichkeit macht — produziert genau die Falschbeschuldigungen, die oben dokumentiert sind.
Der sinnvolle Umgang besteht darin, Befunde und Lücken gleichermaßen zu benennen: was gefunden wurde, mit welchem Werkzeug in welcher Version, und was aus prinzipiellen Gründen nicht geprüft werden konnte. Ein Bericht, der seine blinden Flecken ausweist, ist mehr wert als eine Zahl, die Sicherheit nur behauptet.
Dieser Artikel beschreibt den technischen Stand, keine Rechtsberatung. Provenance Lens ist ein unabhängiges Projekt und steht in keiner Verbindung zu Anthropic, Adobe, Google, OpenAI oder anderen Anbietern, deren Signale geprüft werden.
Häufige Fragen
Kann ich prüfen, ob ein Text von ChatGPT, Gemini oder Claude stammt?
Nein, nicht zuverlässig und nicht von außen. OpenAI hat nie ein Text-Wasserzeichen ausgerollt. Google markiert Gemini-Texte mit SynthID-Text, stellt dafür aber weder Schlüssel noch Detektor noch eine Schnittstelle bereit — die Erkennungsportale von Google decken nur Bild, Video und Audio ab. Anthropic markiert seit August 2026, hat das Verfahren aber nicht offengelegt und Prüfwerkzeuge lediglich angekündigt. Für Text gilt derzeit: Man kann den Anbieter fragen und muss der Antwort glauben.
Warum veröffentlichen die Anbieter keine Detektoren?
Weil bei allen eingesetzten Verfahren derselbe Schlüssel, mit dem man ein Wasserzeichen prüft, es auch fälschen lässt. Wer den Detektor bekommt, kann beliebigen Text — auch verleumderischen — so stempeln, dass er als Ausgabe des Anbieters durchgeht. Forschung der ETH Zürich hat gezeigt, dass sich Wasserzeichen-Regeln für unter 50 US-Dollar an API-Anfragen näherungsweise rekonstruieren lassen. Ein Public-Key-Verfahren, bei dem Prüfen und Fälschen getrennt wären, existiert produktiv nicht.
Versteckt ChatGPT unsichtbare Zeichen in Texten?
Nein. Im April 2025 fiel auf, dass die Modelle o3 und o4-mini in längeren Antworten schmale geschützte Leerzeichen (U+202F) statt normaler Leerzeichen ausgaben. OpenAI erklärte auf Nachfrage, dies sei kein Wasserzeichen, sondern eine Eigenart großangelegten Reinforcement Learnings. Das Verhalten endete innerhalb eines Tages. Kein großer Anbieter ist dafür bekannt, unsichtbare Zeichen als Herkunftsnachweis einzusetzen.
Wie viel Bearbeitung reicht, um ein Text-Wasserzeichen zu entfernen?
Erstaunlich wenig. Eine Rückübersetzung über eine andere Sprache senkt den F1-Wert bei SynthID auf rund 0,71. Ein Paraphrasier-Durchlauf entfernte in unabhängigen Tests über 90 Prozent der Wasserzeichen. Am wirksamsten ist schlichtes Verdünnen: Steht der KI-Text in einem zwanzigfach längeren Dokument, sinkt die Erkennung auf Zufallsniveau. Das ist kein Angriff, sondern normales Zitieren.
Sind KI-Textdetektoren wie GPTZero oder Originality.ai eine Alternative?
Sie beantworten eine andere Frage und tun es unzuverlässig. Diese Werkzeuge raten anhand statistischer Merkmale wie Perplexität. Eine in Patterns veröffentlichte Stanford-Studie prüfte sieben verbreitete Detektoren und fand, dass rund 61 Prozent der TOEFL-Aufsätze von Nicht-Muttersprachlern fälschlich als KI-generiert markiert wurden; 18 von 91 Aufsätzen wurden von allen sieben Detektoren einstimmig falsch eingeordnet. Die Vanderbilt University schaltete Turnitins KI-Detektor 2023 ab.
Was lässt sich an einem Text überhaupt beweisen?
Deterministisch prüfbar sind Fakten über die Zeichenkette selbst: eingebettete Zero-Width-Zeichen, Unicode-Tags aus dem Bereich U+E0000 bis U+E007F, Variation Selectors, Homoglyphen aus fremden Schriftsystemen, ungewöhnliche Leerzeichen. Diese Befunde belegen keine KI-Herkunft — sie belegen, dass im Text etwas steckt, das dort nicht sichtbar ist. Das ist eine wertvolle, aber eng begrenzte Aussage.
Quellen
- Anthropic — How Claude marks AI-generated content
- Dathathri et al., Scalable watermarking for identifying large language model outputs (Nature, 2024)
- Kirchenbauer et al., A Watermark for Large Language Models (ICML 2023)
- OpenAI — Advancing content provenance
- Liang et al., GPT detectors are biased against non-native English writers (Patterns, 2023)
- Rumi — New ChatGPT models seem to leave watermarks on text (April 2025)
- Unicode L2/26-042 — Embedded Metadata in 'Plain' Text
- C2PA Specification 2.4
- Probing Google DeepMind's SynthID-Text — ETH Zürich SRI Lab
- Vanderbilt University — Guidance on AI detection and why we're disabling Turnitin's AI detector