Português (BR)
Motor

DivEye

DivEye é um statistical test construído sobre GPT-2 Medium e um dos 23 detectores que o SlopTotal executa em cada análise. Surprisal diversity — AI text has unnaturally uniform per-token surprisal. Em vez de descrevê-lo e seguir adiante, esta página publica o que ele realmente pontuou quando medimos.

Última revisão: 1 de março de 2026

Analise um texto aqui mesmo

Cole qualquer texto ou uma URL pública. Os 23 motores rodam sobre ele e você recebe a pontuação de cada um: grátis, sem conta e sem limite de análises.

Grátis e privado. Toda a análise roda nos nossos servidores.
Measured 2026-07-25 against 110 AI/human samples across four domains, plus 26 human passages published 1532–1915.
ArchitectureGPT-2 Medium
Parameters355M
Familystatistical test
AUC0.730
Mean score, AI text0.314
Mean score, modern human0.145
Mean score, pre-1920 human0.055
Bias vs archaic prose -0.090
Source read this engine on GitHub
Raw measurements tests/eval/FINDINGS.md

O que DivEye mediu

Contra 110 amostras de jornalismo, prosa literária, poesia e resumos acadêmicos — texto automático de GPT-4, ChatGPT, Llama, Mistral, Cohere e GPT-3 — DivEye atingiu AUC de 0.730. Pontuou texto automático em 0.314 na média e texto humano moderno em 0.145. O AUC é a probabilidade de ele colocar uma passagem de IA acima de uma humana escolhida ao acaso: 1,0 é separação perfeita e 0,5 é cara ou coroa.

Um segundo corpus testa a falha que mais importa. São 26 trechos publicados entre 1532 e 1915 — Maquiavel, Austen, Melville, Kafka — em que qualquer nota alta é erro por construção, porque a escrita antecede os modelos de linguagem em mais de um século. DivEye pontuou esses trechos em 0.055. Isso fica 0.090 abaixo da nota que ele dá à escrita humana moderna, então prosa arcaica não o dispara.

Como ele decide

DivEye contribui com uma das 23 linhas, ao lado de classificadores neurais, testes estatísticos baseados em GPT-2 e heurísticas linguísticas. Nenhum motor isolado define o veredicto. Os pesos vêm de medição: a parcela de cada detector é proporcional a quão bem ele separou texto humano conhecido de texto automático conhecido, reduzida se mostrou viés contra algum tipo de escrita.

Isso importa porque detectores erram de forma correlacionada. Os classificadores neurais foram treinados em dados sobrepostos: quando erram, erram juntos, e a média deixa um motor confiante puxar o resultado. A concordância entre famílias independentes é o sinal em que vale confiar.

Como os 23 motores chegam a um veredicto

O SlopTotal não pede a opinião de um único modelo. Ele executa 23 detectores independentes e mostra todas as 23 linhas, porque o que interessa costuma estar na discordância. Nove são classificadores neurais ajustados para separar texto humano de texto automático, entre eles DeBERTa-v3-large, três variantes de RoBERTa e um BERT-tiny de 4,4 milhões de parâmetros que responde em milissegundos. Sete são testes estatísticos que não exigem treinar detector algum: medem o quanto seu texto parece previsível para o GPT-2 Medium, por perplexidade, distribuição de postos de token, log-rank e razões de entropia cruzada entre dois modelos diferentes. Os sete restantes leem a prosa em si: contrações, uso de travessão, variação no tamanho das frases, atenuações e aberturas de fórmula.

A nota final não é uma média. A média deixa que um único motor confiante puxe o resultado, e detectores erram de forma correlacionada: os classificadores neurais foram treinados com dados parecidos, então, quando erram, erram juntos. O cálculo se apoia nos classificadores que se mostraram precisos e sem viés na nossa própria avaliação, combina isso com o conjunto ponderado completo e trata a concordância entre famílias independentes como o verdadeiro sinal de confiança.

Cada peso vem de medição, não de intuição. A contribuição de cada detector é proporcional a quão bem ele separou texto humano conhecido de texto automático conhecido nos testes, e é reduzida se ele mostrou viés contra algum tipo de escrita. Detectores treinados no mesmo benchmark contra o qual testamos são atenuados, porque um modelo avaliado na própria distribuição de treino sempre se favorece.

Testado com dois corpora, não com um

Afirmações de precisão valem pouco sem dizer o que foi testado. O SlopTotal é avaliado com texto automático de seis famílias de modelos — GPT-4, ChatGPT, Llama, Mistral, Cohere e GPT-3 — em quatro tipos de escrita: jornalismo, prosa literária, poesia e resumos acadêmicos. Medir um único domínio é o caminho curto para números impressionantes que desabam no uso real: encontramos um motor nosso que acertava quase perfeitamente em resumos e funcionava quase exatamente ao contrário em todo o resto.

O segundo corpus é o que quase nenhum detector usa. É prosa publicada entre 1532 e 1915 — Maquiavel, Austen, Melville, Kafka — em que uma nota alta só pode ser erro, porque o texto antecede os modelos de linguagem em mais de um século. Qualquer detector que puna silenciosamente a escrita antiga ou mais formal é exposto por esse conjunto, e vários dos nossos foram. Os resultados estão publicados no repositório, inclusive as falhas.

Onde a detecção deixa de funcionar

Textos curtos não são confiáveis, e nenhum detector honesto dirá o contrário. Abaixo de cerca de 80 palavras a nota oscila pela escolha de uma única palavra; os resultados se estabilizam a partir de umas 200. Se você colar um post curto e receber uma resposta categórica, desconfie da resposta antes do post.

IA levemente editada é o caso difícil. Um texto reescrito frase por frase por uma pessoa perde marcas automáticas a cada passagem, e não existe limiar a partir do qual editar deixe de importar. Código-fonte é uma lacuna real: estes motores foram treinados em linguagem natural e, nos nossos testes, não acusam indevidamente código humano nem detectam de forma confiável código escrito por máquina. Por isso não afirmamos que consigam.

Uma nota é indício, não veredicto. Use as 23 linhas para decidir onde olhar e o que perguntar, e pergunte. Nenhum resultado de detector deveria, por si só, decidir uma nota, uma contratação ou uma publicação — e qualquer ferramenta que incentive isso vende uma certeza que não tem.

Perguntas frequentes

DivEye é confiável sozinho?

Seu AUC medido é 0.730, mas nenhum detector isolado deveria decidir nada. Ele é uma de 23 linhas, e o que interessa costuma estar onde elas discordam.

DivEye penaliza escrita antiga ou formal?

Em 26 trechos humanos publicados entre 1532 e 1915 ele pontuou 0.055 na média, contra 0.145 em texto humano moderno.

Posso rodar o DivEye por conta própria?

Sim. O backend é open source e cada motor roda localmente na CPU, sem chamada de API e sem que o texto saia da sua máquina.

Analisar grátis

23 engines · local · free

Analisar grátis