Detectores de IA são confiáveis? A resposta curta
Os detectores de IA são confiáveis o bastante para servir de indício útil, mas não o bastante para servir de prova. Eles se saem melhor em rascunhos de IA longos e sem edição. Vão pior em textos curtos, rascunhos editados, textos que misturam partes humanas e de IA, e em inglês formal ou escrito por quem não é nativo. E às vezes marcam como IA um texto que uma pessoa escreveu inteiramente sozinha. Quanto você pode confiar numa pontuação depende do texto e da ferramenta.
É assim que descrevemos também o nosso detector de IA gratuito: um guia, não um veredito. Ainda não publicamos um teste de precisão próprio, então esta página não cita nenhum. Tudo o que vem abaixo sai de pesquisas publicadas e do que os fabricantes de detectores disseram sobre as próprias ferramentas. Para entender a mecânica por trás das pontuações, comece por como funcionam os detectores de IA.
Falsos positivos e falsos negativos: um exemplo com números
Um detector pode errar em duas direções. Um falso positivo é um texto humano marcado como IA. Um falso negativo é um texto de IA que passa por humano. Os dois puxam em sentidos opostos: ajuste a ferramenta para pegar mais IA e ela marca mais pessoas; ajuste para proteger as pessoas e mais IA escapa.
Uma porcentagem sozinha esconde o que isso significa para pessoas reais, então vamos fazer umas contas. Os números são inventados para ilustrar e não descrevem nenhuma ferramenta real. Imagine que uma escola analisa 1.000 redações. Dessas, 100 foram escritas com IA e 900 não. O detector pega 90% das redações de IA e marca por engano 1% das humanas.
- Ele marca 90 das 100 redações de IA e deixa passar 10. Essas 10 são falsos negativos.
- Ele também marca 9 das 900 redações humanas. Essas 9 são falsos positivos.
- Das 99 redações marcadas, 9 são de estudantes que não fizeram nada de errado: mais ou menos uma marcação em cada onze.
Agora suponha que só 20 das 1.000 redações usaram IA. A mesma ferramenta marca 18 delas, mais cerca de 10 das 980 redações humanas. Mais de um terço das marcações agora está errado, e o detector não mudou em nada. Só mudou a mistura de redações. Por isso “1% de falsos positivos” nunca quer dizer “uma marcação tem 99% de chance de estar certa”.
Detector de IA funciona? O que dizem as pesquisas publicadas
A OpenAI retirou o próprio classificador de textos de IA
A OpenAI lançou um classificador de textos de IA, o AI Text Classifier, em janeiro de 2023. No conjunto de testes da própria empresa, ele identificou corretamente 26% dos textos escritos por IA como “provavelmente escritos por IA” e classificou textos humanos como IA em 9% das vezes. Em 20 de julho de 2023, a OpenAI tirou a ferramenta do ar, citando a baixa taxa de acerto. A empresa por trás do ChatGPT não conseguiu criar um detector de texto que estivesse disposta a manter funcionando.
Stanford: quem escreve em inglês como segunda língua é marcado com muito mais frequência
Uma equipe de Stanford liderada por Weixin Liang e James Zou testou sete detectores muito usados em 91 redações do TOEFL escritas por falantes não nativos de inglês e em 88 redações de alunos americanos do 8º ano. Os detectores foram quase perfeitos com as redações do 8º ano, mas classificaram como IA, em média, 61% das redações do TOEFL. Das 91, 89 foram marcadas por pelo menos um detector.
A causa provável é a escolha de palavras: quem tem um vocabulário menor em inglês escolhe palavras mais previsíveis, e é exatamente isso que os detectores leem como IA. Quando os pesquisadores pediram ao ChatGPT para enriquecer o vocabulário dessas mesmas redações, a taxa média de falsos positivos caiu de 61% para 12%. Os detectores estavam reagindo ao estilo, não a quem escreveu.
Um teste com 14 ferramentas: “nem precisas nem confiáveis”
Uma equipe internacional liderada por Debora Weber-Wulff testou 14 ferramentas de detecção, 12 de acesso público mais o Turnitin e o PlagiarismCheck, com textos humanos, gerados por IA, editados, parafraseados e traduzidos por máquina. Nenhuma chegou a 80% de precisão, e só cinco passaram de 70%. As ferramentas tendiam a classificar os textos como humanos, então deixavam passar IA com mais frequência do que acusavam pessoas. Textos humanos traduzidos por máquina ainda geravam falsos positivos, e editar ou parafrasear textos de IA piorava muito a detecção. Os autores concluíram que as ferramentas “não são nem precisas nem confiáveis”.
O que o Turnitin diz sobre a própria taxa de falsos positivos
O Turnitin publica os próprios números. Numa atualização de maio de 2023, o diretor de produto da empresa disse que a taxa de falsos positivos por documento fica abaixo de 1% nos documentos em que a ferramenta encontra mais de 20% de escrita com IA. Cerca de 4% das frases que ela destaca podem ter sido escritas por pessoas, a maioria delas logo ao lado de texto de IA de verdade. A empresa também viu mais falsos positivos quando detectava menos de 20% de IA, e por isso passou a marcar essas pontuações com um asterisco.
O Turnitin orienta os professores a usar o próprio julgamento, o que sabem sobre o aluno e o contexto da atividade, justamente porque a taxa de falsos positivos não é zero.
Universidades que desligaram a detecção de IA
Em agosto de 2023, a Universidade Vanderbilt desativou o detector de IA do Turnitin. O raciocínio foi aritmético: a Vanderbilt enviou 75.000 trabalhos ao Turnitin em 2022, então uma taxa de falsos positivos de 1% poderia significar cerca de 750 trabalhos marcados por engano. A universidade também citou o viés contra quem escreve em inglês como segunda língua e o pouco que o Turnitin tinha explicado sobre o funcionamento da ferramenta.
A Universidade Curtin, na Austrália, desligou o mesmo recurso a partir de 1º de janeiro de 2026, mas manteve as verificações de similaridade de texto que o Turnitin já fazia.
O que afeta a precisão de um detector de IA
Os resultados publicados batem com o modo como os detectores funcionam. Confie menos numa pontuação quando algum destes pontos se aplicar:
- Tamanho. Textos curtos têm pouco sinal. A OpenAI disse que o classificador dela era muito pouco confiável abaixo de 1.000 caracteres, e o Turnitin aumentou o mínimo de 150 para 300 palavras pelo mesmo motivo. O nosso detector não pontua nada abaixo de 40 palavras.
- Edição. Cada frase que uma pessoa reescreve dilui o sinal. No teste das 14 ferramentas, a precisão caiu bastante com textos de IA editados à mão e parafraseados.
- Idioma. Muitos detectores são feitos principalmente para o inglês. A OpenAI disse que o classificador dela ia bem pior em outros idiomas, e o nosso também funciona melhor com inglês: em português, a pontuação é menos confiável. Textos traduzidos por máquina aumentam os falsos positivos.
- Escrita formal ou cheia de fórmulas. Relatórios de laboratório, textos jurídicos, cartas de apresentação e redações de estrutura fixa seguem modelos, e modelos são previsíveis. O mesmo vale para quem tem um vocabulário menor em inglês, como o estudo de Stanford mostrou.
- Mistura de texto humano e de IA. Um rascunho em que você escreveu alguns parágrafos e a IA escreveu outros é difícil de pontuar. O Turnitin descobriu que a maior parte dos seus falsos positivos por frase ficava logo ao lado de texto de IA de verdade, bem na emenda entre os dois.
Se o seu próprio texto vive sendo marcado, o guia por que seu texto é marcado como IA explica as causas mais comuns.
Detectores de IA podem errar? Como usar uma pontuação com responsabilidade
Podem, nas duas direções, como mostram as pesquisas acima. Uma pontuação funciona melhor como um indício entre vários, nunca como a acusação inteira.
Se você é estudante
- Guarde um registro de como você escreveu: rascunhos, anotações, as fontes que leu e o histórico de versões no Google Docs ou no Word. Isso diz mais sobre a autoria do que qualquer pontuação.
- Conheça a política da sua disciplina sobre IA. Se você usou IA de um jeito permitido, diga como usou.
- Se o seu próprio trabalho for marcado, pergunte qual ferramenta e qual pontuação foram usadas, mostre os números de falsos positivos publicados acima e se ofereça para mostrar seus rascunhos ou conversar sobre o tema pessoalmente.
- Conferir um rascunho por conta própria mostra quais frases parecem IA para um detector. Isso não diz como outra ferramenta vai pontuar o texto e nunca substitui as regras da sua instituição.
Se você é professor
- Trate a pontuação como um motivo para olhar com mais atenção, nunca como a conclusão. O próprio Turnitin deixa essa decisão com você.
- Compare com o que você já sabe: os trabalhos anteriores do aluno, o que ele escreve em sala, os rascunhos e se ele consegue explicar o próprio argumento.
- Tenha um cuidado extra com textos curtos, pontuações baixas, alunos que escrevem em inglês como segunda língua e trabalhos de formato fixo, que é onde os falsos positivos são mais prováveis.
- Combine as regras antes da atividade: quais usos de IA são permitidos e o que acontece se um detector marcar alguma coisa.
Nossa página sobre verificadores de IA para professores traz mais sobre como usar um verificador em sala de aula.