Caro Stefano,

la risposta non è semplice o univoca. Anthropic usava LibGen, Sci-Hub e
Bibliotik, che (correggimi se sbaglio) sono notorie "shadow libraries". Su
Common Crawl non saprei, perché lì dentro c'è un po' di tutto: uno
studio ha stimato che un 70% dei dataset presenti non specifica quale
licenza si applichi. Con il web scraping puoi incorrere in violazioni
contrattuali se non rispetti i termini d'uso (che spesso vietano proprio lo
scraping); puoi inoltre violare di nuovo il copyright se rimuovi i metadati
("rights management information"), cosa piuttosto frequente tra gli
addestratori di IA, e già motivo di altre cause legali.

Che il training in sé sia fair use non è un risultato enorme: era
abbastanza scontato. Che il fair use richieda l'accesso legittimo all'opera
era molto meno scontato, ed è un risultato che è piaciuto molto ai
proponenti della class action.

Un caro saluto,


Il giorno gio 23 lug 2026 alle ore 16:41 Stefano Zacchiroli via nexa <
[email protected]> ha scritto:

> On Thu, Jul 23, 2026 at 09:28:49AM +0200, Maurizio Borghi via nexa wrote:
> > E' vero, ma è una mezza verità: il giudice ha operato una distinzione
> tra l'uso vero e proprio dei libri per il training
> > dell'LLM e le attività preparatorie a questo uso, in particolare la
> raccolta di libri in un database centrale. Il training in sé è fair
> > use, ma la raccolta di milioni di libri scaricati illegalmente da
> internet per essere successivamente utilizzati nel training è una
> > violazione, che inficia ogni successivo uso di quei libri. Questa
> distinzione riduce di molto la portata effettiva del fair use, poiché
> > introduce di fatto un requisito di "acquisizione legittima" delle opere
> per il training degli LLM.
>
> Personalmente ho una visione molto diversa della rilevanza della parte sul
> fair use nella sentenza.
> Se confermata, la ritengo un risultato enorme (nel bene e nel male) che
> valida l'approccio "YOLO" seguito finora dai principali attori commerciali
> nell'ambito dell'IA.
> In particolare, per come la capisco io, significa che tutto ciò che si può
> scaricare legalmente dal web può poi essere usato per l'addestramento.
> Il che vuol dire che, per esempio, 1) usare i dataset di Common Crawl e/o
> 2) in modo equivalente effettuare web crawling e utilizzare per
> l'addestramento il materiale così ottenuto rientrano nel fair use.
> Oppure mi sto perdendo qualche dettaglio legale che renderebbe legale per
> me, come utente, fare la stessa cosa con un browser, ma allo stesso tempo
> la renderebbe illegale quando lo fa un attore che usa i dati per addestrare
> un'IA?
>
> Ciao
> --
> Stefano Zacchiroli - https://upsilon.cc/zack
> Full professor of Computer Science, Polytechnic Institute of Paris
> Co-founder & Chief scientific officer Software Heritage
> _______________________________________________
> nexa mailing list -- [email protected]
> To change settings or unsubscribe please go to:
> https://server-nexa.polito.it/postorius/lists/nexa.server-nexa.polito.it/
> The general archive of the list is located at:
> https://server-nexa.polito.it/hyperkitty/list/[email protected]/
> Permalink to this message:
> https://server-nexa.polito.it/hyperkitty/list/[email protected]/message/X6L7E2LL5FDDCKO6N2MHJQCC6TMJXWML/



-- 
_______________
*Maurizio Borghi*
Università di Torino
https://www.dg.unito.it/persone/maurizio.borghi
Co-Director Nexa Center for Internet & Society <https://nexa.polito.it/>
_______________________________________________
nexa mailing list -- [email protected]
To change settings or unsubscribe please go to: 
https://server-nexa.polito.it/postorius/lists/nexa.server-nexa.polito.it/
The general archive of the list is located at: 
https://server-nexa.polito.it/hyperkitty/list/[email protected]/
Permalink to this message: 
https://server-nexa.polito.it/hyperkitty/list/[email protected]/message/SSSPF7DD3XWIHXT4MOJG7YAO3ZU5QGAN/

Reply via email to