Moteurs — SlopTotal
23 detectors, each with its measured score.
BERT-tiny RAID
BERT-tiny RAID (BERT-tiny, 4.4M) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 1.000 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
Binoculars
Binoculars (GPT-2 Medium + DistilGPT-2, 355M + 82M) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.836 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
Burstiness
Burstiness (GPT-2 Medium, 355M) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.582 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
ChatGPT Detector
ChatGPT Detector (RoBERTa-base, 125M) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.829 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
Cross-Perplexity
Cross-Perplexity (GPT-2 Medium + DistilGPT-2, 355M + 82M) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.891 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
Desklib DeBERTa
Desklib DeBERTa (DeBERTa-v3-large, 435M) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 1.000 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
DivEye
DivEye (GPT-2 Medium, 355M) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.730 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
E5-Small
E5-Small (E5-small + LoRA, 33M) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.999 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
Fakespot
Fakespot (RoBERTa-base, 125M) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.999 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
Fast-DetectGPT
Fast-DetectGPT (GPT-2 Medium, 355M) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.890 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
Formulaic Patterns
Formulaic Patterns (—, —) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.698 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
GLTR
GLTR (GPT-2 Medium, 355M) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.904 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
Linguistic Markers
Linguistic Markers (—, —) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.713 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
Log-Rank
Log-Rank (GPT-2 Medium, 355M) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.909 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
OpenAI Detector
OpenAI Detector (RoBERTa-base, 125M) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.771 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
Perplexity
Perplexity (GPT-2 Medium, 355M) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.901 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
Readability Uniformity
Readability Uniformity (—, —) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.581 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
ReMoDetect
ReMoDetect (DeBERTa, 184M) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.941 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
Sentiment & Hedging
Sentiment & Hedging (—, —) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.522 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
Structural Analysis
Structural Analysis (—, —) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.836 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
SuperAnnotate
SuperAnnotate (RoBERTa-large, 355M) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.989 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
TMR Detector
TMR Detector (RoBERTa-base, 125M) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 1.000 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
Vocabulary Richness
Vocabulary Richness (—, —) est l'un des 23 moteurs de SlopTotal. AUC mesuré de 0.583 face à du texte d'IA et à un corpus humain témoin antérieur à 1920.
Comment les 23 moteurs arrivent à un verdict
SlopTotal ne demande pas son avis à un seul modèle. Il fait tourner 23 détecteurs indépendants et affiche les 23 lignes, car l'information utile se trouve le plus souvent dans le désaccord. Neuf sont des classifieurs neuronaux entraînés à séparer le texte humain du texte machine, dont DeBERTa-v3-large, trois variantes de RoBERTa et un BERT-tiny de 4,4 millions de paramètres qui répond en quelques millisecondes. Sept sont des tests statistiques qui n'exigent aucun entraînement de détecteur : ils mesurent à quel point votre texte paraît prévisible à GPT-2 Medium, via la perplexité, la distribution des rangs de tokens, le log-rank et des rapports d'entropie croisée entre deux modèles distincts. Les sept derniers lisent la prose elle-même : contractions, usage du tiret cadratin, variance de la longueur des phrases, formules d'atténuation et ouvertures toutes faites.
Le score final n'est pas une moyenne. Faire la moyenne permet à un seul moteur très sûr de lui de tirer le résultat, et les détecteurs se trompent de façon corrélée : les classifieurs neuronaux ont été entraînés sur des données voisines, donc quand ils ont tort, ils ont tort ensemble. Le calcul s'appuie sur les classifieurs qui se sont révélés à la fois précis et sans biais dans notre propre évaluation, les combine avec l'ensemble pondéré complet, et considère l'accord entre familles indépendantes comme le vrai signal de confiance.
Chaque pondération vient d'une mesure, pas d'une intuition. La contribution de chaque détecteur est proportionnelle à sa capacité réelle à séparer du texte humain connu d'un texte machine connu, puis réduite s'il a montré un biais contre un type d'écriture. Les détecteurs entraînés sur le même jeu de test que nous utilisons sont atténués, car un modèle évalué sur sa propre distribution d'entraînement se flatte toujours.
Testé sur deux corpus, pas un seul
Une annonce de précision ne vaut rien sans dire sur quoi elle porte. SlopTotal est évalué sur du texte machine issu de six familles de modèles — GPT-4, ChatGPT, Llama, Mistral, Cohere et GPT-3 — dans quatre types d'écriture : presse, prose littéraire, poésie et résumés scientifiques. Mesurer un seul domaine, c'est obtenir des chiffres flatteurs qui s'effondrent en usage réel : nous avons trouvé l'un de nos propres moteurs quasi parfait sur les résumés et presque exactement inversé partout ailleurs.
Le second corpus est celui que presque aucun détecteur n'utilise. Il s'agit de prose publiée entre 1532 et 1915 — Machiavel, Austen, Melville, Kafka — où un score élevé ne peut être qu'une erreur, le texte précédant les modèles de langue d'un siècle au moins. Tout détecteur qui pénalise discrètement l'écriture ancienne ou plus formelle est démasqué par ce corpus, et plusieurs des nôtres l'ont été. Les résultats sont publiés dans le dépôt, échecs compris.
Là où la détection cesse de fonctionner
Les textes courts ne sont pas fiables, et aucun détecteur honnête ne prétendra le contraire. En dessous d'environ 80 mots, le score bascule sur un seul choix de vocabulaire ; les résultats se stabilisent à partir de 200 mots environ. Si vous collez un tweet et obtenez une réponse catégorique, méfiez-vous de la réponse plutôt que du tweet.
L'IA légèrement retouchée est le cas difficile. Un texte réécrit phrase par phrase par une personne perd des empreintes machine à chaque passage, et il n'existe aucun seuil au-delà duquel la retouche cesse de compter. Le code source est une véritable lacune : ces moteurs sont entraînés sur de la langue naturelle et, lors de nos tests, ils n'accusent pas à tort le code humain mais ne repèrent pas non plus de façon fiable le code écrit par une machine. Nous ne prétendons donc pas qu'ils en soient capables.
Un score est un indice, pas un verdict. Servez-vous des 23 lignes pour décider où regarder et quoi demander, puis demandez. Aucune sortie de détecteur ne devrait à elle seule décider d'une note, d'un recrutement ou d'une publication, et tout outil qui vous y encourage vend une certitude qu'il n'a pas.