Português (BR)
Motores

Motores — SlopTotal

23 detectors, each with its measured score.

Analise um texto aqui mesmo

Cole qualquer texto ou uma URL pública. Os 23 motores rodam sobre ele e você recebe a pontuação de cada um: grátis, sem conta e sem limite de análises.

Grátis e privado. Toda a análise roda nos nossos servidores.

BERT-tiny RAID

BERT-tiny RAID (BERT-tiny, 4.4M) é um dos 23 motores do SlopTotal. AUC medido de 1.000 contra texto de IA e um conjunto de controle humano anterior a 1920.

Binoculars

Binoculars (GPT-2 Medium + DistilGPT-2, 355M + 82M) é um dos 23 motores do SlopTotal. AUC medido de 0.836 contra texto de IA e um conjunto de controle humano anterior a 1920.

Burstiness

Burstiness (GPT-2 Medium, 355M) é um dos 23 motores do SlopTotal. AUC medido de 0.582 contra texto de IA e um conjunto de controle humano anterior a 1920.

ChatGPT Detector

ChatGPT Detector (RoBERTa-base, 125M) é um dos 23 motores do SlopTotal. AUC medido de 0.829 contra texto de IA e um conjunto de controle humano anterior a 1920.

Cross-Perplexity

Cross-Perplexity (GPT-2 Medium + DistilGPT-2, 355M + 82M) é um dos 23 motores do SlopTotal. AUC medido de 0.891 contra texto de IA e um conjunto de controle humano anterior a 1920.

Desklib DeBERTa

Desklib DeBERTa (DeBERTa-v3-large, 435M) é um dos 23 motores do SlopTotal. AUC medido de 1.000 contra texto de IA e um conjunto de controle humano anterior a 1920.

DivEye

DivEye (GPT-2 Medium, 355M) é um dos 23 motores do SlopTotal. AUC medido de 0.730 contra texto de IA e um conjunto de controle humano anterior a 1920.

E5-Small

E5-Small (E5-small + LoRA, 33M) é um dos 23 motores do SlopTotal. AUC medido de 0.999 contra texto de IA e um conjunto de controle humano anterior a 1920.

Fakespot

Fakespot (RoBERTa-base, 125M) é um dos 23 motores do SlopTotal. AUC medido de 0.999 contra texto de IA e um conjunto de controle humano anterior a 1920.

Fast-DetectGPT

Fast-DetectGPT (GPT-2 Medium, 355M) é um dos 23 motores do SlopTotal. AUC medido de 0.890 contra texto de IA e um conjunto de controle humano anterior a 1920.

Formulaic Patterns

Formulaic Patterns (—, —) é um dos 23 motores do SlopTotal. AUC medido de 0.698 contra texto de IA e um conjunto de controle humano anterior a 1920.

GLTR

GLTR (GPT-2 Medium, 355M) é um dos 23 motores do SlopTotal. AUC medido de 0.904 contra texto de IA e um conjunto de controle humano anterior a 1920.

Linguistic Markers

Linguistic Markers (—, —) é um dos 23 motores do SlopTotal. AUC medido de 0.713 contra texto de IA e um conjunto de controle humano anterior a 1920.

Log-Rank

Log-Rank (GPT-2 Medium, 355M) é um dos 23 motores do SlopTotal. AUC medido de 0.909 contra texto de IA e um conjunto de controle humano anterior a 1920.

OpenAI Detector

OpenAI Detector (RoBERTa-base, 125M) é um dos 23 motores do SlopTotal. AUC medido de 0.771 contra texto de IA e um conjunto de controle humano anterior a 1920.

Perplexity

Perplexity (GPT-2 Medium, 355M) é um dos 23 motores do SlopTotal. AUC medido de 0.901 contra texto de IA e um conjunto de controle humano anterior a 1920.

Readability Uniformity

Readability Uniformity (—, —) é um dos 23 motores do SlopTotal. AUC medido de 0.581 contra texto de IA e um conjunto de controle humano anterior a 1920.

ReMoDetect

ReMoDetect (DeBERTa, 184M) é um dos 23 motores do SlopTotal. AUC medido de 0.941 contra texto de IA e um conjunto de controle humano anterior a 1920.

Sentiment & Hedging

Sentiment & Hedging (—, —) é um dos 23 motores do SlopTotal. AUC medido de 0.522 contra texto de IA e um conjunto de controle humano anterior a 1920.

Structural Analysis

Structural Analysis (—, —) é um dos 23 motores do SlopTotal. AUC medido de 0.836 contra texto de IA e um conjunto de controle humano anterior a 1920.

SuperAnnotate

SuperAnnotate (RoBERTa-large, 355M) é um dos 23 motores do SlopTotal. AUC medido de 0.989 contra texto de IA e um conjunto de controle humano anterior a 1920.

TMR Detector

TMR Detector (RoBERTa-base, 125M) é um dos 23 motores do SlopTotal. AUC medido de 1.000 contra texto de IA e um conjunto de controle humano anterior a 1920.

Vocabulary Richness

Vocabulary Richness (—, —) é um dos 23 motores do SlopTotal. AUC medido de 0.583 contra texto de IA e um conjunto de controle humano anterior a 1920.

Como os 23 motores chegam a um veredicto

O SlopTotal não pede a opinião de um único modelo. Ele executa 23 detectores independentes e mostra todas as 23 linhas, porque o que interessa costuma estar na discordância. Nove são classificadores neurais ajustados para separar texto humano de texto automático, entre eles DeBERTa-v3-large, três variantes de RoBERTa e um BERT-tiny de 4,4 milhões de parâmetros que responde em milissegundos. Sete são testes estatísticos que não exigem treinar detector algum: medem o quanto seu texto parece previsível para o GPT-2 Medium, por perplexidade, distribuição de postos de token, log-rank e razões de entropia cruzada entre dois modelos diferentes. Os sete restantes leem a prosa em si: contrações, uso de travessão, variação no tamanho das frases, atenuações e aberturas de fórmula.

A nota final não é uma média. A média deixa que um único motor confiante puxe o resultado, e detectores erram de forma correlacionada: os classificadores neurais foram treinados com dados parecidos, então, quando erram, erram juntos. O cálculo se apoia nos classificadores que se mostraram precisos e sem viés na nossa própria avaliação, combina isso com o conjunto ponderado completo e trata a concordância entre famílias independentes como o verdadeiro sinal de confiança.

Cada peso vem de medição, não de intuição. A contribuição de cada detector é proporcional a quão bem ele separou texto humano conhecido de texto automático conhecido nos testes, e é reduzida se ele mostrou viés contra algum tipo de escrita. Detectores treinados no mesmo benchmark contra o qual testamos são atenuados, porque um modelo avaliado na própria distribuição de treino sempre se favorece.

Testado com dois corpora, não com um

Afirmações de precisão valem pouco sem dizer o que foi testado. O SlopTotal é avaliado com texto automático de seis famílias de modelos — GPT-4, ChatGPT, Llama, Mistral, Cohere e GPT-3 — em quatro tipos de escrita: jornalismo, prosa literária, poesia e resumos acadêmicos. Medir um único domínio é o caminho curto para números impressionantes que desabam no uso real: encontramos um motor nosso que acertava quase perfeitamente em resumos e funcionava quase exatamente ao contrário em todo o resto.

O segundo corpus é o que quase nenhum detector usa. É prosa publicada entre 1532 e 1915 — Maquiavel, Austen, Melville, Kafka — em que uma nota alta só pode ser erro, porque o texto antecede os modelos de linguagem em mais de um século. Qualquer detector que puna silenciosamente a escrita antiga ou mais formal é exposto por esse conjunto, e vários dos nossos foram. Os resultados estão publicados no repositório, inclusive as falhas.

Onde a detecção deixa de funcionar

Textos curtos não são confiáveis, e nenhum detector honesto dirá o contrário. Abaixo de cerca de 80 palavras a nota oscila pela escolha de uma única palavra; os resultados se estabilizam a partir de umas 200. Se você colar um post curto e receber uma resposta categórica, desconfie da resposta antes do post.

IA levemente editada é o caso difícil. Um texto reescrito frase por frase por uma pessoa perde marcas automáticas a cada passagem, e não existe limiar a partir do qual editar deixe de importar. Código-fonte é uma lacuna real: estes motores foram treinados em linguagem natural e, nos nossos testes, não acusam indevidamente código humano nem detectam de forma confiável código escrito por máquina. Por isso não afirmamos que consigam.

Uma nota é indício, não veredicto. Use as 23 linhas para decidir onde olhar e o que perguntar, e pergunte. Nenhum resultado de detector deveria, por si só, decidir uma nota, uma contratação ou uma publicação — e qualquer ferramenta que incentive isso vende uma certeza que não tem.

Analisar grátis

23 engines · local · free

Analisar grátis