Comment fonctionne le détecteur de musique IA

Une musique générée par IA n'est pas « enregistrée » : elle est fabriquée par un modèle qui produit directement le signal audio. Ce procédé laisse des traces discrètes dans le spectre du son, inaudibles pour l'oreille mais repérables par un modèle entraîné à les reconnaître. Voici comment l'outil procède, étape par étape.

1. Lecture du fichier et des métadonnées

Le fichier est d'abord lu et ses métadonnées inspectées : certains générateurs ou outils d'export laissent leur nom dans les informations du fichier, ou une signature de provenance (Content Credentials / C2PA). Leur absence ne prouve rien, car elles s'effacent très facilement.

2. Analyse du morceau complet

Le morceau est découpé en fenêtres de 5 secondes qui se chevauchent (une toutes les 2,5 secondes). Chaque fenêtre est transformée en spectrogramme puis notée par un modèle de détection. On obtient une probabilité IA pour chaque instant du morceau, visible sur la frise du rapport. Un second modèle regarde des extraits de 2 minutes pour avoir une vue d'ensemble.

3. Séparation voix / instrumental

Le morceau est ensuite séparé en pistes grâce à Demucs, un modèle de séparation de sources développé par la recherche de Meta : voix, batterie, basse et autres instruments. On reconstitue ainsi l'instrumental seul et la voix seule.

4. Analyse de chaque partie

L'instrumental et la voix sont analysés séparément, avec la même méthode par fenêtres. C'est ce qui permet de repérer les morceaux hybrides :

Dans nos tests, ces morceaux hybrides obtenaient seulement 12 à 25 % sur le morceau complet. Ils seraient passés inaperçus sans la séparation.

5. Le verdict

Les trois lectures sont combinées en un verdict :

Indice IAConclusion
moins de 20 %Probablement humain
20 à 35 %Indéterminé (faibles indices)
35 à 70 %Indices d'IA
plus de 70 %Très probablement IA

Quand les lectures divergent, le verdict le précise, par exemple « Hybride probable : instrumental IA, voix humaine ».

Les modèles utilisés

La détection repose sur les modèles SONICS / SpecTTTra, publiés en accès libre par des chercheurs en 2024 et entraînés sur un jeu de données d'environ 97 000 morceaux, dont près de la moitié générés par Suno et Udio. La séparation utilise Demucs (htdemucs). Les seuils et l'échelle de la voix isolée ont été calibrés sur nos propres tests, détaillés sur la page Fiabilité.

Et pour la voix parlée ?

En mode « Voix parlée », l'enregistrement est découpé en passages de 15 secondes, chacun analysé par un modèle de reconnaissance de la parole (wav2vec2 XLS-R) spécialisé dans la détection des voix de synthèse. Pas de séparation de pistes : le modèle travaille directement sur la voix. Le module est en bêta, ses résultats sont détaillés sur la page Fiabilité.

Confidentialité. Le fichier est analysé sur notre serveur en Suisse (Infomaniak) puis supprimé immédiatement. Il n'est ni écouté, ni conservé, ni réutilisé pour entraîner un modèle.