Amazon usa tus contenidos de Twitch para entrenar su IA y así puedes evitarlo
El procedimiento es sencillo. Desde la página web o la aplicación móvil del servicio, es necesario hacer clic en el avatar de la cuenta, seleccionar “Configuración” y, dentro del menú, ingresar al apartado “Seguridad y privacidad”. Ahí aparece la opción “Entrenamiento para IA generativa”, desde la cual los usuarios pueden deshabilitar el uso de sus contenidos con ese propósito.
La plataforma precisa que “desactivar esta opción no te exime de que Twitch y Amazon utilicen el contenido de tu canal para otros fines descritos en el aviso de privacidad de Twitch”. Entre ellos se encuentran funciones de la plataforma con soporte de IA destinadas a facilitar el crecimiento y la monetización de los streamers, como la asistencia en tiempo real para campañas de patrocinio, el descubrimiento de espectadores mediante recomendaciones, y la seguridad de la comunidad, a través de herramientas como AutoMod.
La nueva configuración busca reconocer el derecho de los creadores a decidir sobre el uso de los materiales que producen. Sin embargo, su lanzamiento también despertó cuestionamientos sobre la manera en que Twitch y Amazon han utilizado esos contenidos hasta ahora.
En un foro dedicado al tema, más de 15,800 creadores expresaron su rechazo a que sus contenidos fueran empleados por defecto para entrenar sistemas de IA de Amazon, una práctica que quedó al descubierto tras la actualización de las opciones de configuración.
El descontento surgió después de una transmisión en vivo en la que Mary Kish, jefa de comunidad de Twitch, explicó la introducción de los cambios. La ejecutiva reconoció que la modificación provocaría una reacción negativa. Mike Minton, jefe de producto de Twitch, también señaló, en lo que describió como “una respuesta sincera”, que mantener activada por defecto la opción de utilizar los contenidos para entrenamiento de IA era una necesidad, pues de lo contrario “nadie se sumaría” al proceso.
Minton señaló que estos mecanismos no son exclusivos de Twitch y consideró probable que otras empresas que desarrollan sistemas de IA también estén extrayendo contenidos de Twitch y otros servicios para utilizarlos en el entrenamiento de sus modelos. “No lo sé con certeza, pero creo que es bastante razonable suponer que casi cualquier contenido disponible públicamente se utiliza para entrenar modelos de una forma u otra, con o sin permiso. Así que creo que también debemos reconocer que hay mucho aquí que escapa incluso a nuestro control directo”.
Estas declaraciones abrieron espacio a nuevas preguntas: ¿desde cuándo se utiliza el contenido de Twitch para entrenar modelos de IA? ¿Amazon es la única empresa que emplea estos datos o también participan sus socios comerciales? ¿Hasta dónde y de qué manera se respeta la autoría de los materiales publicados por los creadores?
Los términos de uso de Twitch, vigentes hasta marzo de 2024, establecían que el usuario concede a Twitch y sus sublicenciatarios derechos para usar, reproducir, modificar, adaptar, distribuir y crear obras derivadas de su contenido. Sin embargo, hasta ahora, no mencionaba expresamente que esos materiales puedan utilizarse para entrenar modelos de IA generativa.
Escasez de contenido de entrenamiento, el gran problema de IA
El caso evidencia, una vez más, uno de los grandes problemas que enfrentan los desarrolladores de sistemas de IA: la creciente escasez de datos de calidad para entrenar modelos.
Aunque compañías como OpenAI han alcanzado acuerdos con diversos editores para utilizar parte de sus contenidos con este propósito, las fuentes de información disponibles disminuyen conforme avanza la tecnología y aumenta la demanda de datos. Como consecuencia, han surgido distintas alternativas que reavivan el debate sobre la ética y la transparencia de los procesos de entrenamiento.
Desde hace tiempo, Meta emplea publicaciones e imágenes que los usuarios comparten en Facebook e Instagram para entrenar sus modelos de IA. Recientemente, también trascendió que la compañía utilizaba la actividad de sus empleados y las capturas obtenidas por los usuarios de sus gafas inteligentes con el mismo objetivo. Casos similares se han documentado en torno a Google y YouTube.
De esta forma, los principales desarrolladores de modelos de inteligencia artificial no solo enfrentan la escasez de chips, memoria y fuentes de energía necesarias para sostener el ritmo de innovación que exige este mercado. La disponibilidad de datos de entrenamiento de alta calidad se ha convertido en otro recurso estratégico, y todo apunta a que una parte de esa demanda será cubierta con información generada por los propios usuarios, a cambio del acceso gratuito a servicios digitales de uso cotidiano.
Fuente: Artículo original