LumenWrite

Sind KI-Detektoren zuverlässig?

Sie liefern einen nützlichen Hinweis, keinen Beweis. Hier steht, was die veröffentlichten Belege sagen, wann ein Wert weniger Vertrauen verdient und wie Lernende und Lehrende ihn fair nutzen können.

Zuletzt aktualisiert: 3. Oktober 2026

Wie zuverlässig sind KI-Detektoren? Die kurze Antwort

Sind KI-Detektoren zuverlässig? Genau genug, um ein nützlicher Hinweis zu sein, aber nicht genau genug für einen Beweis. Am besten schneiden sie bei langen, unbearbeiteten KI-Entwürfen ab. Schlechter sind sie bei kurzen Texten, überarbeiteten Entwürfen, Texten, die menschliche und KI-Teile mischen, sowie bei förmlichem Englisch und dem Englisch von Nicht-Muttersprachlern. Manchmal markieren sie sogar Texte, die ein Mensch ganz allein geschrieben hat. Wie weit du einem Wert trauen kannst, hängt vom Text und vom Tool ab.

So beschreiben wir auch unseren eigenen kostenlosen KI-Detektor: als Orientierung, nicht als Urteil. Wir haben noch keinen eigenen Genauigkeitstest veröffentlicht, deshalb nennt diese Seite keinen. Alles Folgende stammt aus veröffentlichter Forschung und aus dem, was Hersteller über ihre eigenen Tools gesagt haben. Wie die Werte zustande kommen, erklärt Wie funktionieren KI-Detektoren?

Falsch positiv und falsch negativ: ein Rechenbeispiel

Ein Detektor kann sich in zwei Richtungen irren. Falsch positiv ist ein menschlicher Text, der als KI markiert wird. Falsch negativ ist ein KI-Text, der als menschlich durchgeht. Beides zieht in entgegengesetzte Richtungen: Stellt man ein Tool so ein, dass es mehr KI erkennt, markiert es mehr Menschen. Stellt man es so ein, dass es Menschen schützt, rutscht mehr KI durch.

Eine einzelne Prozentzahl verbirgt, was das für echte Menschen bedeutet, also rechnen wir nach. Die Zahlen sind zur Veranschaulichung erfunden und beschreiben kein echtes Tool. Angenommen, eine Schule prüft 1.000 Aufsätze. 100 davon wurden mit KI geschrieben, 900 nicht. Der Detektor erkennt 90 % der KI-Aufsätze und markiert fälschlich 1 % der menschlichen.

  • Er markiert 90 der 100 KI-Aufsätze und übersieht 10. Diese 10 sind falsch negativ.
  • Er markiert außerdem 9 der 900 menschlichen Aufsätze. Diese 9 sind falsch positiv.
  • Von den 99 markierten Aufsätzen gehören 9 zu Schülerinnen und Schülern, die nichts falsch gemacht haben: ungefähr jede elfte Markierung.

Nehmen wir jetzt an, nur 20 der 1.000 Aufsätze wurden mit KI geschrieben. Dasselbe Tool markiert 18 davon und dazu etwa 10 der 980 menschlichen Aufsätze. Jetzt ist mehr als ein Drittel der Markierungen falsch, obwohl sich am Detektor nichts geändert hat. Nur die Mischung der Aufsätze ist eine andere. „1 % falsch positiv“ bedeutet also nie „eine Markierung stimmt mit 99 % Wahrscheinlichkeit“.

Sind KI-Detektoren zuverlässig? Was die veröffentlichten Belege sagen

OpenAI zog seinen eigenen AI Text Classifier zurück

OpenAI veröffentlichte im Januar 2023 einen AI Text Classifier. Auf dem eigenen Testdatensatz stufte er 26 % der KI-Texte korrekt als „wahrscheinlich KI-geschrieben“ ein und hielt menschliche Texte in 9 % der Fälle für KI. Am 20. Juli 2023 nahm OpenAI ihn vom Netz und nannte als Grund die geringe Treffsicherheit. Das Unternehmen hinter ChatGPT konnte also keinen Textdetektor bauen, den es weiter betreiben wollte.

Stanford: Nicht-Muttersprachler werden weit häufiger markiert

Ein Stanford-Team um Weixin Liang und James Zou testete sieben verbreitete Detektoren an 91 TOEFL-Aufsätzen von Menschen, die Englisch nicht als Muttersprache sprechen, und an 88 Aufsätzen von Achtklässlern aus den USA. Bei den Aufsätzen der Achtklässler lagen die Detektoren fast immer richtig, von den TOEFL-Aufsätzen stuften sie dagegen im Schnitt 61 % als KI ein. 89 der 91 wurden von mindestens einem Detektor markiert.

Die wahrscheinliche Ursache ist die Wortwahl: Wer einen kleineren englischen Wortschatz hat, wählt vorhersehbarere Wörter, und genau das lesen Detektoren als KI. Als die Forschenden ChatGPT den Wortschatz derselben Aufsätze anreichern ließen, sank die durchschnittliche Quote falsch positiver Ergebnisse von 61 % auf 12 %. Die Detektoren reagierten auf den Stil, nicht darauf, wer geschrieben hatte.

Ein Test mit 14 Tools: „weder genau noch zuverlässig“

Ein internationales Team um Debora Weber-Wulff testete 14 Erkennungstools, 12 öffentlich verfügbare sowie Turnitin und PlagiarismCheck, mit menschlichen, KI-generierten, bearbeiteten, paraphrasierten und maschinell übersetzten Texten. Keines erreichte 80 % Genauigkeit, nur fünf kamen über 70 %. Die Tools neigten dazu, Texte für menschlich zu halten: Sie übersahen also häufiger KI, als dass sie Menschen zu Unrecht beschuldigten. Maschinell übersetzte menschliche Texte führten trotzdem zu falsch positiven Ergebnissen, und wurden KI-Texte bearbeitet oder paraphrasiert, verschlechterte sich die Erkennung deutlich. Das Fazit der Autorinnen und Autoren: Die Tools seien „weder genau noch zuverlässig“.

Was Turnitin über die eigene Quote falsch positiver Ergebnisse sagt

Turnitin veröffentlicht eigene Zahlen. In einem Update vom Mai 2023 erklärte der Chief Product Officer, die Quote falsch positiver Ergebnisse auf Dokumentebene liege unter 1 %, und zwar bei Dokumenten, in denen Turnitin mehr als 20 % KI-Text findet. Etwa 4 % der einzelnen Sätze, die das Tool hervorhebt, könnten von Menschen stammen, die meisten davon in direkter Nähe zu echtem KI-Text. Wurden weniger als 20 % KI erkannt, gab es mehr falsch positive Ergebnisse, deshalb kennzeichnet Turnitin solche Werte seitdem mit einem Sternchen.

Turnitin weist Lehrende darauf hin, dass sie ihr eigenes Urteil, ihr Wissen über die Studierenden und den Kontext der Aufgabe einbeziehen müssen, weil die Quote falsch positiver Ergebnisse nicht bei null liegt.

Hochschulen, die die KI-Erkennung abgeschaltet haben

Im August 2023 deaktivierte die Vanderbilt University den KI-Detektor von Turnitin. Die Begründung war eine einfache Rechnung: Vanderbilt hatte 2022 insgesamt 75.000 Arbeiten bei Turnitin eingereicht, eine Quote von 1 % falsch positiver Ergebnisse hätte also rund 750 zu Unrecht markierte Arbeiten bedeuten können. Die Universität verwies außerdem auf die Benachteiligung von Menschen, die Englisch nicht als Muttersprache schreiben, und darauf, wie wenig Turnitin über die Funktionsweise des Tools verraten hatte.

Die Curtin University in Australien schaltete dieselbe Funktion zum 1. Januar 2026 ab und behielt die normale Textabgleich-Prüfung von Turnitin bei.

Was die Genauigkeit von KI-Detektoren beeinflusst

Die veröffentlichten Ergebnisse passen dazu, wie Detektoren arbeiten. Vertrau einem Wert weniger, wenn einer dieser Punkte zutrifft:

  • Länge. Kurze Texte liefern wenig Signal. OpenAI nannte seinen Klassifikator unter 1.000 Zeichen sehr unzuverlässig, und Turnitin hob seine Mindestlänge aus demselben Grund von 150 auf 300 Wörter an. Unser Detektor bewertet nichts unter 40 Wörtern.
  • Überarbeitung. Jeder Satz, den ein Mensch umschreibt, verwässert das Signal. Im Test mit 14 Tools brach die Genauigkeit bei von Hand bearbeiteten und paraphrasierten KI-Texten deutlich ein.
  • Sprache. Viele Detektoren sind vor allem für Englisch gebaut. OpenAI erklärte, sein Klassifikator schneide in anderen Sprachen deutlich schlechter ab, und auch unserer funktioniert am besten mit Englisch. Für deutsche Texte sind unsere Werte weniger zuverlässig. Maschinell übersetzte Texte erhöhen die Zahl falsch positiver Ergebnisse.
  • Förmliche oder schematische Texte. Laborberichte, juristische Texte, Anschreiben und Aufsätze nach festem Schema folgen Vorlagen, und Vorlagen sind vorhersehbar. Das gilt auch für Texte von Menschen mit kleinerem englischem Wortschatz, wie die Stanford-Studie gezeigt hat.
  • Gemischte Texte aus Mensch und KI. Ein Entwurf, in dem du einige Absätze selbst geschrieben hast und KI andere, ist schwer zu bewerten. Turnitin stellte fest, dass die meisten falsch positiven Ergebnisse auf Satzebene direkt neben echtem KI-Text lagen, an den Nahtstellen zwischen beidem.

Wenn dein eigener Text immer wieder markiert wird, erklärt Warum wird mein Text als KI erkannt? die üblichen Ursachen.

Können KI-Detektoren falsch liegen? So nutzt du einen Wert verantwortungsvoll

Ja, in beide Richtungen, wie die Belege oben zeigen. Ein Wert taugt am ehesten als ein Indiz unter mehreren, nie als alleinige Grundlage.

Für Schülerinnen, Schüler und Studierende

  • Dokumentiere, wie du geschrieben hast: Entwürfe, Notizen, die gelesenen Quellen und den Versionsverlauf in Google Docs oder Word. Das sagt mehr über die Urheberschaft als jeder Wert.
  • Kenne die KI-Regeln deines Kurses. Wenn du KI so genutzt hast, wie es erlaubt ist, gib an, wie.
  • Wenn deine eigene Arbeit markiert wird, frag, welches Tool und welcher Wert verwendet wurden, verweise auf die veröffentlichten Zahlen zu falsch positiven Ergebnissen oben und biete an, deine Entwürfe durchzugehen oder das Thema persönlich zu besprechen.
  • Wenn du einen Entwurf selbst prüfst, siehst du, welche Sätze für einen Detektor wie KI wirken. Wie ein anderes Tool ihn bewertet, erfährst du dadurch nicht, und es ersetzt nie, dass du dich an die Regeln deiner Schule oder Hochschule hältst.

Für Lehrkräfte und Dozierende

  • Sieh einen Wert als Grund, genauer hinzusehen, nie als Ergebnis. Selbst Turnitin überlässt diese Entscheidung dir.
  • Vergleiche mit dem, was du weißt: frühere Arbeiten, Texte aus dem Unterricht, Entwürfe und ob die Person ihre Argumentation erklären kann.
  • Sei besonders vorsichtig bei kurzen Texten, niedrigen Werten, Nicht-Muttersprachlern und schematischen Aufgaben, denn dort sind falsch positive Ergebnisse am wahrscheinlichsten.
  • Kläre die Erwartungen vor der Aufgabe: welche KI-Nutzung erlaubt ist und was passiert, wenn ein Detektor etwas markiert.

Unsere Seite zu KI-Checkern für Lehrkräfte erklärt mehr zum Einsatz im Unterricht.

Häufige Fragen zur Zuverlässigkeit von KI-Detektoren

Das hängt vom Text und vom Tool ab. In einem Test von 14 Tools aus dem Jahr 2023 erreichte keines 80 % Genauigkeit, und bei kurzen, bearbeiteten oder übersetzten Texten und beim Englisch von Nicht-Muttersprachlern werden die Ergebnisse schlechter. Nutze einen Wert als Hinweis, nicht als Beweis.

KI-Checker sind KI-Detektoren unter anderem Namen, es gelten also dieselben Grenzen. Am besten schneiden sie bei langen, unbearbeiteten KI-Entwürfen ab, schlechter bei kurzen oder überarbeiteten Texten, und sie können menschliche Texte markieren.

Ja, in beide Richtungen. Sie können menschliche Texte als KI markieren (falsch positiv) und KI-Texte übersehen (falsch negativ). Selbst Turnitin sagt, dass seine Quote falsch positiver Ergebnisse nicht bei null liegt.

Darauf gibt es keine ehrliche einzelne Antwort: Die Ergebnisse hängen von der Art des Textes ab, und die Tools ändern sich mit jedem Update. Wir haben noch keinen eigenen Vergleichstest veröffentlicht und erstellen deshalb keine Rangliste, auch nicht mit unserem eigenen Detektor.

Detektoren lesen vorhersehbare, einfache Wortwahl als Zeichen für KI, und wer einen kleineren englischen Wortschatz hat, wählt öfter solche Wörter. Eine Stanford-Studie ergab, dass sieben Detektoren im Schnitt 61 % der TOEFL-Aufsätze als KI einstuften.

Weiterlesen

Text prüfen, dann den Wert mit Bedacht lesen

Füge 40 bis 200 Wörter in den kostenlosen KI-Detektor ein und sieh, welche Sätze wie KI wirken. Nimm das Ergebnis als Hinweis, nicht als Beweis.

Kostenlosen KI-Detektor testen