Fuentes
Míralo en acción
Explora los modelos y estilos detrás de historias como esta: cuenta gratis y galería al instante.
Explorar el catálogo
Explora los modelos y estilos detrás de historias como esta: cuenta gratis y galería al instante.
Explorar el catálogoUn raspador web ha derrotado a Google y Reddit en un desafío judicial basado en la DMCA, con un experto legal calificando la estrategia de las plataformas de «bizarra» — y el resultado tiene implicaciones reales para cómo se construyen los conjuntos de datos de entrenamiento de IA y quién controla el acceso a la web pública.
La Ley de Derechos de Autor del Milenio Digital fue diseñada para abordar la infracción de derechos de autor — la copia y distribución no autorizadas de obras protegidas. Utilizarla para impedir que un raspador lea páginas web públicamente accesibles es un esfuerzo forzado, según el experto citado por Ars Technica. Las disposiciones antiburla de la DMCA apuntan a medidas de protección técnica como el DRM, no a archivos robots.txt ni a límites de velocidad de API. Cuando Google y Reddit intentaron enmarcar el raspado como una violación de la DMCA, esencialmente argumentaban que sus servidores constituyen un bloqueo tecnológico protegido — una teoría ante la que los tribunales han mostrado históricamente escepticismo.
El argumento central del raspador es directo: la web abierta no es propiedad de ninguna plataforma en particular. Indexar páginas públicamente disponibles es lo que hacen los motores de búsqueda, los investigadores académicos y los flujos de trabajo de entrenamiento de IA. El acuerdo del tribunal con ese enfoque no significa que el raspado esté libre de consecuencias — el derecho contractual y la Ley de Fraude y Abuso Informático siguen siendo herramientas vigentes para las plataformas — pero elimina una de las armas más agresivas del arsenal antirraspado.
Para los desarrolladores de modelos de IA, el fallo es una luz verde parcial. Los grandes modelos de lenguaje y los sistemas de generación de imágenes como Stable Diffusion y sus derivados se construyeron sobre conjuntos de datos obtenidos mediante raspado web — Common Crawl, LAION y otros. Los desafíos legales a ese flujo de trabajo han provenido principalmente de titulares de derechos de autor (autores, artistas, fotógrafos) que argumentan que sus obras específicas fueron ingeridas sin consentimiento. El caso de Google y Reddit era diferente: se trataba de si las plataformas podían usar la DMCA para controlar el acceso a la propia web.
Con esa vía reducida, el campo de batalla más probable se desplaza hacia la aplicación de los términos de servicio y, de manera crítica, hacia las cuestiones de derechos de autor que los tribunales aún no han resuelto del todo. El acuerdo de Anthropic con los autores estableció un precedente financiero — aproximadamente 3.000 dólares por libro — pero no determinó si entrenar con texto protegido por derechos de autor constituye una infracción en primer lugar. Los desarrolladores de modelos de generación de imágenes enfrentan la misma pregunta sin resolver para el contenido visual.
Para los creadores que utilizan herramientas de IA para imágenes, esto tiene un efecto más silencioso pero real: la amplitud y la actualidad de los datos de entrenamiento determinan lo que los modelos pueden representar, qué tan bien manejan estilos de nicho y con qué rapidez absorben nuevas tendencias visuales. Un entorno legal que mantiene la web pública accesible para los raspadores favorece conjuntos de entrenamiento más ricos y actualizados — lo que eventualmente se refleja en la calidad del modelo y su rango estilístico. Los creadores que exploran lo que es posible con los modelos actuales pueden navegar por el catálogo de Charmloop para ver cómo la diversidad de datos de entrenamiento se manifiesta en la práctica en diferentes estilos de generación.
Según Ars Technica, Google no abandona la lucha a pesar de la derrota judicial — lo cual es notable dado que Google es en sí mismo uno de los mayores raspadores web del mundo. El propio Googlebot de la compañía indexa continuamente toda la web pública. Los críticos han señalado la tensión que supone que Google defienda simultáneamente su derecho a raspar mientras intenta bloquear a otros para que hagan lo mismo, especialmente cuando esos raspadores alimentan a competidores en el ámbito de la IA.
La motivación de Reddit es más clara: la plataforma firmó un acuerdo de licencia de datos con Google y ha estado protegiendo agresivamente ese flujo de ingresos restringiendo el acceso de terceros a su API y el raspado. Un fallo que debilita su capacidad de hacer cumplir esas restricciones a través de la DMCA es un revés comercial directo.
El caso no será la última palabra. Las plataformas adaptarán sus estrategias legales, y el Congreso podría aún aprobar legislación que otorgue a las plataformas web un control más explícito sobre el acceso automatizado. Pero por ahora, la web pública sigue siendo — al menos legalmente — más cercana a un bien común que a un jardín amurallado.