Generative AI Training and Copyright Law
copyrightgenerative-aitraining-datafair-usetext-and-data-mininglegal
Abstraction: Legal analysis of copyright liability for generative AI training data collection
Key points:
- Common practice: web-scraping copyright-protected content for generative AI training may constitute infringement
- US developers rely on "fair use" doctrine; EU developers rely on Text and Data Mining (TDM) exception
- Authors argue generative AI training fundamentally differs from traditional TDM, so TDM exception does not apply
- Training data memorization creates a separate copyright exposure pathway independent of fair use and TDM debates
- Has implications for both public academic research and corporate research on generative models
- Stober and Dornis (2025); raises the question of fair practices for communities like ISMIR (music information retrieval)
Connections: Generative AI · Training Data · Copyright Law · Text And Data Mining