Suno, la prominente herramienta generativa de música con IA, ha sido expuesta por haber rastreado millones de canciones y letras de plataformas como YouTube Music, Deezer y Genius para entrenar sus modelos. Esta revelación surge de archivos hackeados obtenidos por 404 Media, lo que representa la primera visión clara de las fuentes de datos que Suno siempre se ha negado a revelar públicamente. La noticia confirma acusaciones previas de la RIAA sobre infracción de derechos de autor y stream ripping.
Orígenes de la controversia y litigios
La compañía Suno ha estado bajo escrutinio por su política de entrenamiento de IA, específicamente por la supuesta utilización de material con derechos de autor. Múltiples demandas, incluyendo una presentada por la Recording Industry Association of America (RIAA), han alegado que Suno utiliza indebidamente contenido protegido. Suno, por su parte, ha defendido sus prácticas bajo la doctrina del uso justo, argumentando que el entrenamiento con materiales disponibles públicamente en línea es legal.
La evidencia del hackeo: scraping masivo
Los datos filtrados por un hacker identificado como “ellie.191” incluyen código fuente de Suno de 2023 y 2024, junto con instrucciones detalladas para extraer archivos de audio y letras de una variedad de plataformas. Entre las fuentes citadas se encuentran YouTube Music, Deezer, Genius, Pond5, Jamendo, Freesound y el International Music Score Library Project (IMSLP). Un archivo específico de YouTube Music revela que Suno había procesado 2,013,545 clips de la plataforma al momento de su última actualización en los documentos. Además, el código sugiere que Suno empleó a la empresa de terceros Bright Data para facilitar el scraping de música de YouTube y que, curiosamente, buscaba versiones a cappella de canciones para obtener pistas de voz aisladas.
Implicaciones legales y para la industria musical
La revelación de estas prácticas de scraping directo refuerza las acusaciones de la RIAA de que Suno no solo usó material con derechos de autor, sino que también eludió activamente las protecciones de copyright de YouTube mediante el stream ripping. Este método de descarga no autorizada desafía directamente la postura de Suno sobre el uso justo y podría tener consecuencias significativas en los juicios pendientes. La industria musical ha expresado una creciente preocupación por el uso no regulado de su contenido en el entrenamiento de IA, buscando establecer precedentes legales que protejan los derechos de los creadores.
El debate sobre el ‘uso justo’ en la era de la IA
El caso de Suno reaviva el complejo debate sobre los límites del uso justo en el contexto de la inteligencia artificial. Mientras que las empresas de IA argumentan que el scraping de datos públicos para el entrenamiento es transformador y cae bajo esta doctrina, los titulares de derechos de autor alegan que constituye un robo de propiedad intelectual. La resolución de estas disputas será crucial para definir el futuro de la creación de contenido con IA y establecerá nuevas normativas para la protección de la propiedad intelectual en el entorno digital.
En resumen
- Suno fue expuesto por rastrear millones de canciones y letras de YouTube Music, Deezer y Genius.
- La filtración incluye código fuente y instrucciones de scraping que datan de 2023 y 2024.
- Se confirma el uso de 2,013,545 clips de YouTube Music para entrenamiento de IA.
- La empresa Bright Data fue utilizada por Suno para el scraping de audio.
- La evidencia fortalece las acusaciones de la RIAA sobre infracción de derechos de autor y stream ripping.
- El caso sienta un precedente importante en el debate sobre el uso justo y la IA generativa en la música.


