LumenWrite

¿Son fiables los detectores de IA?

Son una señal útil, no una prueba. Aquí tienes lo que dicen los datos publicados, cuándo una puntuación merece menos confianza y cómo pueden usarla con justicia estudiantes y docentes.

Actualizado el 3 de octubre de 2026

¿Qué fiabilidad tienen los detectores de IA? La respuesta corta

¿Son fiables los detectores de IA? Lo bastante para ser una señal útil, pero no lo bastante para ser una prueba. Funcionan mejor con borradores de IA largos y sin editar. Fallan más con textos cortos, borradores editados, textos que mezclan partes humanas y de IA, y con el inglés formal o de hablantes no nativos, y a veces marcan textos que una persona escribió completamente sola. Cuánto puedes fiarte de una puntuación depende del texto y de la herramienta.

Así describimos también nuestro propio detector de IA gratis: una guía, no un veredicto. Todavía no hemos publicado una evaluación propia de precisión, así que esta página no cita ninguna. Todo lo que sigue sale de investigaciones publicadas y de lo que los fabricantes de detectores han dicho sobre sus propias herramientas. Para entender la mecánica de las puntuaciones, empieza por cómo funcionan los detectores de IA.

Falsos positivos y falsos negativos: un ejemplo con números

Un detector puede equivocarse en dos direcciones. Un falso positivo es un texto humano marcado como IA. Un falso negativo es un texto de IA que pasa por humano. Los dos tiran en sentidos opuestos: si ajustas una herramienta para que detecte más IA, marcará a más personas; si la ajustas para proteger a las personas, se le escapará más IA.

Un solo porcentaje esconde lo que esto significa para gente real, así que hagamos números. Son inventados para ilustrar la idea y no describen ninguna herramienta real. Supongamos que un centro analiza 1000 trabajos. 100 se escribieron con IA y 900 no. El detector caza el 90% de los trabajos hechos con IA y marca por error el 1% de los humanos.

  • Marca 90 de los 100 trabajos hechos con IA y se le escapan 10. Esos 10 son falsos negativos.
  • También marca 9 de los 900 trabajos humanos. Esos 9 son falsos positivos.
  • De los 99 trabajos marcados, 9 son de estudiantes que no hicieron nada malo: más o menos uno de cada once avisos.

Ahora supongamos que solo 20 de los 1000 trabajos usaron IA. La misma herramienta marca 18 de ellos, más unos 10 de los 980 trabajos humanos. Ahora más de un tercio de los avisos son erróneos, y el detector no ha cambiado nada. Solo ha cambiado la mezcla de trabajos. Por eso «un 1% de falsos positivos» nunca significa «un aviso tiene un 99% de probabilidades de acertar».

¿Son fiables los detectores de IA? Lo que dicen los datos publicados

OpenAI retiró su propio clasificador de textos de IA

OpenAI lanzó su AI Text Classifier en enero de 2023. Con su propio conjunto de prueba, etiquetó correctamente el 26% de los textos escritos por IA como «probablemente escritos por IA» y marcó como IA el 9% de los textos humanos. El 20 de julio de 2023, OpenAI lo desactivó por su bajo nivel de precisión. La empresa que creó ChatGPT no consiguió un detector de textos que estuviera dispuesta a mantener en marcha.

Stanford: los hablantes no nativos de inglés, marcados mucho más a menudo

Un equipo de Stanford dirigido por Weixin Liang y James Zou probó siete detectores muy usados con 91 redacciones del TOEFL escritas por hablantes no nativos de inglés y 88 redacciones de estudiantes estadounidenses de octavo grado. Los detectores casi no fallaron con las redacciones de octavo grado, pero etiquetaron como IA una media del 61% de las redacciones del TOEFL. De las 91, 89 fueron marcadas por al menos un detector.

La causa probable es la elección de palabras: quien tiene un vocabulario más reducido en inglés elige palabras más predecibles, que es justo lo que los detectores interpretan como IA. Cuando los investigadores pidieron a ChatGPT que enriqueciera el vocabulario de esas mismas redacciones, la tasa media de falsos positivos bajó del 61% al 12%. Los detectores reaccionaban al estilo, no a quién había escrito el texto.

Una prueba con 14 herramientas: «ni precisas ni fiables»

Un equipo internacional dirigido por Debora Weber-Wulff probó 14 herramientas de detección, 12 de acceso público más Turnitin y PlagiarismCheck, con textos humanos, generados por IA, editados, parafraseados y traducidos automáticamente. Ninguna llegó al 80% de precisión, y solo cinco superaron el 70%. Las herramientas tendían a dar los textos por humanos, así que se les escapaba la IA más a menudo de lo que acusaban a personas. Los textos humanos traducidos automáticamente seguían provocando falsos positivos, y editar o parafrasear un texto de IA empeoraba mucho la detección. Los autores concluyeron que las herramientas «no son ni precisas ni fiables».

Lo que dice Turnitin sobre su propia tasa de falsos positivos

Turnitin publica sus propias cifras. En una actualización de mayo de 2023, su director de producto dijo que la tasa de falsos positivos por documento es inferior al 1% en los documentos en los que encuentra más de un 20% de escritura con IA. Cerca del 4% de las frases concretas que resalta pueden estar escritas por personas, la mayoría muy cerca de texto real de IA. También vio más falsos positivos cuando detectaba menos de un 20% de IA, así que empezó a marcar esas puntuaciones con un asterisco.

Turnitin recuerda a los docentes que, como su tasa de falsos positivos no es cero, deben aplicar su propio criterio, lo que saben del estudiante y el contexto de la tarea.

Universidades que desactivaron la detección de IA

En agosto de 2023, la Universidad Vanderbilt desactivó el detector de IA de Turnitin. Su razonamiento era aritmético: Vanderbilt había enviado 75 000 trabajos a Turnitin en 2022, así que una tasa de falsos positivos del 1% podría haber supuesto unos 750 trabajos etiquetados por error. También mencionó el sesgo contra quienes escriben en inglés sin ser nativos y lo poco que Turnitin había explicado sobre cómo funciona la herramienta.

La Universidad de Curtin, en Australia, desactivó esa misma función a partir del 1 de enero de 2026, aunque mantuvo las comprobaciones habituales de coincidencias de texto de Turnitin.

Qué afecta a la fiabilidad de un detector de IA

Los resultados publicados encajan con cómo funcionan los detectores. Fíate menos de una puntuación cuando se dé alguno de estos casos:

  • Extensión. Los textos cortos dan poca señal. OpenAI dijo que su clasificador era muy poco fiable por debajo de 1000 caracteres, y Turnitin subió su mínimo de 150 a 300 palabras por el mismo motivo. Nuestro detector no puntúa nada por debajo de 40 palabras.
  • Edición. Cada frase que reescribe una persona diluye la señal. En la prueba de las 14 herramientas, la precisión cayó mucho con textos de IA editados a mano y parafraseados.
  • Idioma. Muchos detectores están pensados sobre todo para el inglés. OpenAI dijo que su clasificador funcionaba bastante peor en otros idiomas, y el nuestro también funciona mejor con textos en inglés: con textos en español, la puntuación es menos fiable. Los textos traducidos automáticamente añaden falsos positivos.
  • Textos formales o de fórmula. Los informes de laboratorio, los textos legales, las cartas de presentación y los ensayos de cinco párrafos siguen plantillas, y las plantillas son predecibles. También lo es la escritura de quienes tienen un vocabulario más reducido en inglés, como mostró el estudio de Stanford.
  • Textos mixtos de persona e IA. Un borrador en el que escribiste unos párrafos y la IA escribió otros es difícil de puntuar. Turnitin vio que la mayoría de sus falsos positivos a nivel de frase estaban justo al lado de texto real de IA, en las costuras entre los dos.

Si tus propios textos salen marcados una y otra vez, por qué tu texto sale como IA explica las causas habituales.

¿Pueden equivocarse los detectores de IA? Cómo usar una puntuación con responsabilidad

Pueden, y en las dos direcciones, como muestran los datos anteriores. Una puntuación funciona mejor como una prueba más entre varias, nunca como el caso entero.

Si eres estudiante

  • Guarda un registro de cómo escribiste: borradores, apuntes, las fuentes que leíste y el historial de versiones de Google Docs o Word. Eso dice más sobre la autoría que cualquier puntuación.
  • Conoce la política de tu curso sobre la IA. Si usaste IA de una forma permitida, explica cómo la usaste.
  • Si marcan tu propio trabajo, pregunta qué herramienta y qué puntuación se usaron, señala las cifras de falsos positivos publicadas que tienes más arriba y ofrécete a repasar tus borradores o a hablar del tema en persona.
  • Revisar un borrador por tu cuenta te muestra qué frases suenan a IA para un detector. No te dice cómo lo puntuará otra herramienta, y nunca sustituye a cumplir las normas de tu centro.

Si eres docente

  • Toma una puntuación como un motivo para mirar con más atención, nunca como la conclusión. La propia Turnitin deja esa decisión en tus manos.
  • Compárala con lo que sabes: los trabajos anteriores del estudiante, lo que escribe en clase, sus borradores y si es capaz de explicar su argumento.
  • Ten especial cuidado con los textos cortos, las puntuaciones bajas, quienes escriben en inglés sin ser nativos y las tareas de fórmula, donde los falsos positivos son más probables.
  • Deja claras las expectativas antes de la tarea: qué usos de la IA están permitidos y qué pasa si un detector marca algo.

Nuestra página sobre detectores de IA para docentes tiene más ideas para usar un detector en clase.

Preguntas frecuentes sobre la fiabilidad de los detectores de IA

Depende del texto y de la herramienta. En una prueba de 2023 con 14 herramientas, ninguna llegó al 80% de precisión, y los resultados empeoran con textos cortos, editados, traducidos o escritos en inglés por hablantes no nativos. Usa la puntuación como una señal, no como una prueba.

Los verificadores de IA son detectores de IA con otro nombre, así que tienen los mismos límites. Funcionan mejor con borradores de IA largos y sin editar, peor con textos cortos o editados, y pueden marcar textos humanos.

Sí, en las dos direcciones. Pueden marcar un texto humano como IA (un falso positivo) y dejar pasar un texto de IA (un falso negativo). Hasta Turnitin dice que su tasa de falsos positivos no es cero.

No hay una única respuesta honesta: los resultados dependen del tipo de texto, y las herramientas cambian con cada actualización. Todavía no hemos publicado nuestra propia evaluación, así que no hacemos rankings de detectores, tampoco del nuestro.

Los detectores interpretan las palabras sencillas y predecibles como una señal de IA, y quien tiene un vocabulario más reducido en inglés las usa más. Un estudio de Stanford vio que siete detectores etiquetaron como IA una media del 61% de las redacciones del TOEFL.

Sigue leyendo

Analiza un texto y lee la puntuación con cuidado

Pega de 40 a 200 palabras en el detector de IA gratis para ver qué frases suenan a IA. Toma el resultado como una señal, no como una prueba.

Prueba el detector de IA gratis