Fiabilité du détecteur : nos résultats et nos limites
Un détecteur qui annonce « 100 % fiable » ment. Nous préférons publier nos résultats et nos limites, pour que chacun sache comment lire un score.
Nos tests
Nous avons testé l'outil sur des enregistrements humains (masters de studio, maquettes, chœur a cappella, enregistrement live), sur des morceaux générés par Suno, et sur des morceaux hybrides fabriqués pour l'occasion.
| Type de morceau | Score obtenu | Verdict |
|---|---|---|
| 7 morceaux humains | 0 à 10 % (instrumental) | Humain ou indéterminé, jamais « IA » |
| 4 morceaux Suno | 55 à 98 % | IA détectée dans les 4 cas |
| Voix humaine + instru Suno | 49 % sur l'instrumental seul | Hybride repéré |
| Voix Suno + instru humain | 64 % sur la voix seule | Hybride repéré |
C'est un échantillon de départ. Nous l'élargissons en continu et publierons les résultats mis à jour sur cette page.
Ce qui est fiable
- L'instrumental seul : c'est la lecture la plus discriminante (2 à 10 % pour l'humain, jusqu'à 98 % pour l'IA).
- Les morceaux Suno et Udio, sur lesquels les modèles ont été entraînés.
- La localisation dans le temps : la frise montre les passages qui concentrent les indices.
Ce qui l'est moins
- La voix isolée : c'est l'indice le plus fragile. Certaines voix humaines (chœurs, voix très traitées) peuvent sortir en « indéterminé ».
- Les générateurs récents ou inconnus : chaque nouvelle version peut changer les traces laissées dans le son.
- Les morceaux retravaillés : ralentir, accélérer, re-mastériser ou recompresser un morceau peut brouiller la détection.
- Les liens de plateformes (YouTube…) : le son y est recompressé, ce qui réduit un peu la précision.
- Les styles atypiques : musique électronique très synthétique, voix robotisées (vocoder, Auto-Tune extrême) peuvent faire monter le score sans IA.
Voix parlée (bêta)
Pour la voix parlée, nous avons comparé huit détecteurs publics sur un banc de test composé de vraies voix (livres audio et lectures en français, anglais et russe, enregistrements de studio) et de voix générées (ElevenLabs, voix neuronales Microsoft). Six d'entre eux faisaient à peine mieux que le hasard. Le modèle retenu, réglé avec prudence, donne :
| Type de voix | Signalées comme IA |
|---|---|
| Vraies voix, enregistrement studio | 0 % |
| Vraies voix, lectures (FLEURS, LibriSpeech) | 0 à 4 % |
| Vraies voix, livres audio amateurs (bruit, compression) | 16 % |
| Voix neuronales Microsoft (français) | 90 % |
| Voix ElevenLabs (deux jeux de test) | 55 % et 100 % |
Soit 81 % des voix IA repérées pour 4 % de fausses alertes en moyenne. C'est un module bêta : les voix clonées et les générateurs les plus récents peuvent passer inaperçus, et un enregistrement amateur très compressé peut déclencher une fausse alerte.
Comment lire un score
Un score élevé est un indice à vérifier, pas une preuve. Avant toute décision importante, croise-le avec d'autres éléments : écoute attentive, historique de l'artiste, fichiers de session, échange avec l'auteur. Un score bas ne garantit pas non plus qu'aucune IA n'a été utilisée.