Comment fonctionne le détecteur de musique IA
Une musique générée par IA n'est pas « enregistrée » : elle est fabriquée par un modèle qui produit directement le signal audio. Ce procédé laisse des traces discrètes dans le spectre du son, inaudibles pour l'oreille mais repérables par un modèle entraîné à les reconnaître. Voici comment l'outil procède, étape par étape.
1. Lecture du fichier et des métadonnées
Le fichier est d'abord lu et ses métadonnées inspectées : certains générateurs ou outils d'export laissent leur nom dans les informations du fichier, ou une signature de provenance (Content Credentials / C2PA). Leur absence ne prouve rien, car elles s'effacent très facilement.
2. Analyse du morceau complet
Le morceau est découpé en fenêtres de 5 secondes qui se chevauchent (une toutes les 2,5 secondes). Chaque fenêtre est transformée en spectrogramme puis notée par un modèle de détection. On obtient une probabilité IA pour chaque instant du morceau, visible sur la frise du rapport. Un second modèle regarde des extraits de 2 minutes pour avoir une vue d'ensemble.
3. Séparation voix / instrumental
Le morceau est ensuite séparé en pistes grâce à Demucs, un modèle de séparation de sources développé par la recherche de Meta : voix, batterie, basse et autres instruments. On reconstitue ainsi l'instrumental seul et la voix seule.
4. Analyse de chaque partie
L'instrumental et la voix sont analysés séparément, avec la même méthode par fenêtres. C'est ce qui permet de repérer les morceaux hybrides :
- une vraie voix enregistrée sur une instru générée par IA ;
- une voix générée posée sur une musique jouée par des musiciens.
Dans nos tests, ces morceaux hybrides obtenaient seulement 12 à 25 % sur le morceau complet. Ils seraient passés inaperçus sans la séparation.
5. Le verdict
Les trois lectures sont combinées en un verdict :
| Indice IA | Conclusion |
|---|---|
| moins de 20 % | Probablement humain |
| 20 à 35 % | Indéterminé (faibles indices) |
| 35 à 70 % | Indices d'IA |
| plus de 70 % | Très probablement IA |
Quand les lectures divergent, le verdict le précise, par exemple « Hybride probable : instrumental IA, voix humaine ».
Les modèles utilisés
La détection repose sur les modèles SONICS / SpecTTTra, publiés en accès libre par des chercheurs en 2024 et entraînés sur un jeu de données d'environ 97 000 morceaux, dont près de la moitié générés par Suno et Udio. La séparation utilise Demucs (htdemucs). Les seuils et l'échelle de la voix isolée ont été calibrés sur nos propres tests, détaillés sur la page Fiabilité.
Et pour la voix parlée ?
En mode « Voix parlée », l'enregistrement est découpé en passages de 15 secondes, chacun analysé par un modèle de reconnaissance de la parole (wav2vec2 XLS-R) spécialisé dans la détection des voix de synthèse. Pas de séparation de pistes : le modèle travaille directement sur la voix. Le module est en bêta, ses résultats sont détaillés sur la page Fiabilité.