Como funciona um detector de IA, em resumo
Como funcionam os detectores de IA, em uma frase: eles estimam a probabilidade de um texto ter sido escrito por um modelo de linguagem. Ao contrário de um detector de plágio, normalmente não comparam suas palavras com um banco de fontes, e não fazem ideia de quem as digitou. Em vez disso, medem padrões: quão previsível é cada palavra, quão uniforme é o ritmo das frases e quanto o texto se parece com os exemplos humanos e de IA com que o detector aprendeu. O que sai no fim é uma probabilidade, não um fato.
A maioria das ferramentas combina vários desses sinais. Dá para ver a ideia no nosso detector de IA gratuito: cada frase é marcada como humana ou IA, e a pontuação é a parte do texto que parece humana. Ele funciona melhor com textos em inglês, então a pontuação de um texto em português merece menos confiança. O resto deste guia explica o que existe por trás de um resultado assim.
O que os detectores de IA procuram: perplexidade e burstiness
Um modelo de linguagem escreve uma palavra de cada vez e, a cada passo, tende a escolher uma próxima palavra provável. Um detector pode passar um modelo parecido pelo seu texto e perguntar, palavra por palavra, o quanto ele se surpreende. A média dessa surpresa ao longo do texto se chama perplexidade.
Pegue “Tomei uma xícara de ___”. “Café” ou “chá” quase não surpreendem um modelo. “Trovão” surpreende muito. Um texto em que quase toda palavra é a esperada tem perplexidade baixa, e perplexidade baixa é um dos sinais clássicos de escrita de máquina.
O segundo sinal, chamado em inglês de burstiness, mede quanto um texto varia de uma frase para outra. As pessoas costumam escrever aos solavancos: uma frase curta, depois uma longa com uma ou duas orações, depois algo no meio. Rascunhos de IA muitas vezes mantêm um ritmo constante e uniforme. Compare estes dois:
- Burstiness baixa: “O plano traz eficiência. Também reduz os custos. As equipes rendem mais. Os clientes também ganham.” Quatro frases, quatro palavras cada, todas montadas do mesmo jeito.
- Burstiness alta: “O plano economiza dinheiro. Não muito no primeiro trimestre, já que o software novo precisa ser pago adiantado, mas no segundo semestre a economia aparece no orçamento de todas as equipes. Os clientes também percebem.”
Os detectores também captam hábitos de superfície que os modelos têm em comum: os mesmos conectivos (“Além disso”, “Ademais”), listas arrumadinhas de três itens, uma frase de resumo no fim de cada parágrafo. Nada disso é prova. Uma receita, uma cláusula de contrato ou um relatório de laboratório devem mesmo ser previsíveis, e algumas pessoas simplesmente escrevem com frases uniformes. Um sinal estatístico é uma pista, e é por isso que muitas ferramentas acrescentam um segundo método.
Classificadores treinados: um modelo que aprendeu com exemplos
A segunda abordagem é um classificador: um modelo treinado com um grande conjunto de textos rotulados como “humano” ou “IA” até aprender quais características separam um do outro. Ninguém dá a ele uma regra como “perplexidade baixa significa IA”. Ele encontra os próprios padrões, inclusive alguns que nenhuma pessoa conseguiria nomear.
O detector da própria OpenAI, lançado em janeiro de 2023, foi construído assim: um modelo de linguagem ajustado com pares de textos escritos por pessoas e por IA sobre o mesmo tema. A OpenAI o tirou do ar cerca de seis meses depois, e o que aconteceu com ele está no guia os detectores de IA são confiáveis?
Um classificador é tão bom quanto os dados com que foi treinado. Ele vai bem em textos parecidos com os que viu no treinamento. Em textos diferentes, como os de um modelo de IA mais novo, de um gênero incomum ou de um idioma que ele quase não viu, fica menos confiável. No mesmo comunicado, a OpenAI avisou que, com entradas muito diferentes do conjunto de treinamento, o classificador às vezes ficava “extremamente confiante em uma previsão errada”.
Pontuação por documento ou por frase
Alguns detectores dão um único veredito para o texto inteiro. Outros pontuam cada frase ou trecho curto e montam o resultado geral a partir disso. Os dois respondem a perguntas diferentes: “este documento foi escrito por IA?” e “quais partes parecem IA?”
O Turnitin funciona do segundo jeito. A empresa diz que divide o trabalho enviado em segmentos sobrepostos de algumas centenas de palavras, dá a cada frase uma nota entre 0 e 1 e tira a média dessas notas para prever quanto do documento foi gerado por IA.
A pontuação por frase ajuda quando um texto é parte humano e parte IA, porque mostra de onde vem o sinal. Ela também tem mais ruído. Uma frase carrega pouquíssima evidência, então uma única linha destacada significa muito menos do que uma página inteira delas. O nosso detector pontua o texto inteiro e cada frase, para você ver o quadro geral e de onde ele vem.
Marca d'água: um sinal colocado enquanto o texto é escrito
A marca d'água inverte o problema. Em vez de adivinhar depois, o próprio modelo de IA marca o que escreve no momento em que escreve. A marca d'água de texto SynthID, do Google DeepMind, faz isso ajustando de leve as probabilidades das palavras que o modelo escolhe. O texto se lê normalmente. Um detector que conhece as configurações da marca d'água verifica depois se as escolhas de palavras seguem o padrão escondido.
O Google anunciou em 2024 que aplica a marca d'água SynthID aos textos do app Gemini. A empresa descreveu o método em um artigo na Nature e liberou o código para que outros desenvolvedores possam usá-lo nos próprios modelos. Segundo a DeepMind:
- O que ela aguenta: mudanças leves, como cortar parte do texto, trocar algumas palavras ou parafrasear de leve. Funciona melhor em respostas longas e abertas, como redações ou e-mails.
- Onde ela tem dificuldade: a confiança cai bastante quando o texto é totalmente reescrito ou traduzido, e ela é mais fraca em respostas a perguntas factuais, em que há poucas escolhas de palavras para ajustar.
Um limite vale para qualquer marca d'água: o detector só encontra a marca que foi colocada. O texto de um modelo que não usa marca d'água é idêntico a um texto sem marca d'água, então “nenhuma marca d'água encontrada” não diz nada sobre o uso de IA.
Como funcionam os detectores de IA? Os três métodos comparados
| Método | O que mede | Funciona melhor em | Principal ponto fraco |
|---|---|---|---|
| Sinais estatísticos (perplexidade, burstiness) | Quão previsíveis são as palavras e quão uniforme é o ritmo das frases | Rascunhos de IA longos e sem edição | Textos humanos simples ou cheios de fórmulas podem parecer igualmente previsíveis |
| Classificador treinado | Padrões aprendidos com exemplos rotulados de textos humanos e de IA | Textos parecidos com os dados de treinamento | Modelos de IA mais novos, gêneros incomuns e outros idiomas |
| Verificação de marca d'água | Um padrão escondido que o modelo de IA colocou ao escrever | Textos mais longos de um modelo que usa marca d'água | Não encontra nada em textos de modelos sem marca d'água, e a marca se apaga depois de muita reescrita ou de uma tradução |
A verificação de marca d'água só ajuda com textos de um modelo que coloca a marca, lidos por um detector que conhece as configurações dela. Por isso, a maior parte do que você cola num detector público é julgada pelos dois primeiros métodos, muitas vezes combinados.
Por que dois detectores de IA dão pontuações diferentes para o mesmo texto
Cole a mesma redação em três detectores e você pode receber três números diferentes. Isso não quer dizer que um deles esteja quebrado. Eles medem de jeitos diferentes:
- Dados de treinamento diferentes. Cada classificador aprendeu com a própria coleção de textos humanos e de IA, então cada um tem os próprios pontos cegos.
- Limites diferentes. Uma ferramenta pode chamar um texto de IA quando tem 50% de certeza, outra só com 90%. A mesma evidência recebe um rótulo diferente.
- Unidades diferentes. “70% IA” pode querer dizer que a ferramenta tem 70% de certeza de que o texto inteiro é IA, ou que 70% das frases parecem IA. São afirmações diferentes, mesmo que as duas apareçam como porcentagem.
- Versões diferentes. Os detectores são treinados de novo conforme surgem novos modelos de IA, então a mesma ferramenta pode dar notas diferentes para o mesmo texto com poucos meses de intervalo.
Com que frequência cada tipo de erro acontece é outra questão, e os testes publicados estão resumidos em os detectores de IA são confiáveis?
O que torna um texto de IA mais difícil de detectar
Todos os métodos acima dependem de o texto manter a marca que o modelo deixou nele. Qualquer coisa que mude as escolhas de palavras ou o ritmo enfraquece o sinal:
- Edição. Cada frase que uma pessoa reescreve troca escolhas do modelo por escolhas humanas. Um rascunho muito editado é de fato uma mistura, e os detectores o pontuam como tal.
- Texto curto. Poucas frases não têm palavras suficientes para que previsibilidade ou ritmo signifiquem muita coisa. Por isso muitos detectores exigem um tamanho mínimo. O nosso precisa de 40 palavras.
- Tradução. Passar um texto para outro idioma substitui quase todas as escolhas de palavras, o que embaralha tanto os sinais estatísticos quanto qualquer marca d'água.
- Paráfrase. Parafraseadores e humanizadores mudam exatamente o que os métodos estatísticos medem: a escolha de palavras e o ritmo das frases.
A mesma lógica vale no sentido contrário. Um texto humano que por acaso é simples, previsível e uniforme pode parecer IA para um detector. Se isso aconteceu com você, leia por que seu texto é marcado como IA.
O que os detectores de IA não conseguem saber
Um detector lê o texto e mais nada. Tudo o que está em volta do texto é invisível para ele, e muitas vezes é justamente isso que mais importa:
- Quem escreveu. Uma pontuação descreve a escrita, não quem escreve. Ela não consegue distinguir a prosa simples de um estudante da prosa de um modelo.
- Como o texto foi feito. Digitado do zero, ditado, rascunhado com IA e reescrito à mão, ou revisado com um corretor gramatical: o detector só vê as palavras finais.
- Qual ferramenta de IA, se houve alguma. Verificações estatísticas e classificadores julgam a escrita, não a ferramenta. Só uma marca d'água aponta para um modelo específico, e só se esse modelo tiver colocado uma.
- Se o uso de IA era permitido. Alguns cursos e empresas permitem IA para ter ideias ou revisar. O detector não faz ideia de quais eram as regras.
Por isso uma pontuação deve abrir uma conversa, não encerrá-la. Se você dá aula, nossa página sobre verificadores de IA para professores explica como usar um de forma justa.