Sì è corretto: condividiamo la tristezza di vedere i libri ridotti a mangime per i pappagalli stocastici, ma dobbiamo prendere atto che per le corti USA è fair use (sentenze Google Books).
Il giorno ven 24 lug 2026 alle ore 10:01 Antonio Vetro' < [email protected]> ha scritto: > E’ corretto quindi dedurre che invece la pratica di Anthropic -ma non > solo- di acquistare massivamente tonnellate di libri usati, > per digitalizzarli e utilizzarli nel training, non porti invece ad alcuna > violazione del diritto d’autore ? > > (Libri che poi -sigh- sono mandati al macero ..) > > Grazie > Antonio > > > Il giorno 24 lug 2026, alle ore 09:15, Maurizio Borghi via nexa < > [email protected]> ha scritto: > > La sentenza non riguarda violazioni contrattuali o di licenza, ma solo > violazioni del diritto d'autore. Sui passi intermedi, semplificando un po', > la sentenza distingue tra le copie fatte per addestrare gli LLM (fair use) > e quelle fatte per creare un database centrale da cui attingere per ogni > evenienza (no fair use se ottenute illegalmente). > > Per rispondere alla tua domanda, il problema principale sta nella fase di > acquisizione del "materiale da addestramento". Se lo prendo da database > pirata, o aggirando un paywall (es. New York Times v OpenAI), o rimuovendo > le informazioni sulle licenze (es. GitHub Copilot), allora tutti gli > utilizzi successivi - che presi isolatamente sarebbero fair use - diventano > illegittimi. > > Il contributo rilevante della sentenza sta essenzialmente nel fatto di > aver respinto la difesa della "copia intermedia", cioè la copia realizzata > quale mero passo intermedio per una finalità di fair use. Il giudice > ridimensiona questa difesa (che ha permesso, ad esempio, a Google di > prevalere nel caso Google Books), affermando che non si applica se la copia > inziale è illecita. > > Naturalmente occorre precisare che si tratta per ora di una sentenza, non > di un approccio consolidato nella giurisprunza USA. > > Un caro saluto, > -- > _______________ > *Maurizio Borghi* > Università di Torino > https://www.dg.unito.it/persone/maurizio.borghi > Co-Director Nexa Center for Internet & Society <https://nexa.polito.it/> > > > Il giorno gio 23 lug 2026 alle ore 18:14 Stefano Zacchiroli via nexa < > [email protected]> ha scritto: > >> Grazie per la risposta, Maurizio. >> Continuo qui sotto per entrare in alcuni dettagli che mi interessano >> particolarmente: >> >> On Thu, Jul 23, 2026 at 05:40:29PM +0200, Maurizio Borghi wrote: >> > la risposta non è semplice o univoca. Anthropic usava LibGen, Sci-Hub e >> Bibliotik, che (correggimi se sbaglio) sono notorie >> > "shadow libraries". >> >> (Confermo per LibGen e Sci-Hub, non conosco invece Bibliotik.) >> >> > Su Common Crawl non saprei, perché lì dentro c'è un po' di tutto: uno >> studio ha stimato che un 70% dei dataset presenti >> > non specifica quale licenza si applichi. >> >> Giusto --- o meglio, non conosco la percentuale, ma è certo che la >> stragrande maggioranza dei contenuti su Web (come del codice su GitHub, e >> contenuti di altra natura su piattaforme dedicate) non specifica una >> licenza. >> Ma questo non impedisce che io, utente di un Web browser, possa >> *accedere* legalmente a quel contenuto. >> Poi i default del diritto d'autore impediscono di fare altre cose, tipo >> copiare, modificare, redistribuire, esibire ad un pubblico, etc. --- ed è >> qui che entra in gioco il fair use che salva, almeno secondo questa >> sentenza, gli allenatori di LLM. >> Sbaglio qualcosa fin qui, strettamente dal punto di vista del diritto >> d'autore? (Vedi sotto per i vincoli contrattuali.) >> >> > Con il web scraping puoi incorrere in violazioni contrattuali se non >> rispetti i termini d'uso (che spesso vietano proprio lo scraping); >> >> Il caso dei vincoli contrattuali è in effetti molto pertinente ed >> interessante. >> La sentenza prevede l'assenza di entrambi i tipi di violazioni (licenza >> ed eventuali contratti), o meno? >> L'avevo finora interpretata come una sentenza principalmente sul diritto >> d'autore, ma è possibilissimo che sia un errore da parte mia. >> >> > puoi inoltre violare di nuovo il copyright se rimuovi i metadati >> ("rights management information"), >> > cosa piuttosto frequente tra gli addestratori di IA, e già motivo di >> altre cause legali. >> >> Questo punto mi pare molto meno evidente. >> Il processo di allenamento contiene molti passi intermedi, non mi è >> chiaro come riuscire legalmente a definire dove ne inizi uno che è protetto >> dal fair use (e nel quale quindi, perdonami la semplificazione, si "può >> violare" il diritto d'autore) e dove invece no. >> Ma ho in mente anche io alcune delle cause aperte su questo punto, quindi >> spero lo scopriremo "presto". >> >> Grazie per la bella discussione e a presto. >> -- >> Stefano Zacchiroli - https://upsilon.cc/zack >> Full professor of Computer Science, Polytechnic Institute of Paris >> Co-founder & Chief scientific officer Software Heritage >> _______________________________________________ >> nexa mailing list -- [email protected] >> To change settings or unsubscribe please go to: >> https://server-nexa.polito.it/postorius/lists/nexa.server-nexa.polito.it/ >> The general archive of the list is located at: >> https://server-nexa.polito.it/hyperkitty/list/[email protected]/ >> Permalink to this message: >> https://server-nexa.polito.it/hyperkitty/list/[email protected]/message/FIBMVPVGNZN63PSB2CFMC7AUTW2WGL7G/ > > > > _______________________________________________ > nexa mailing list -- [email protected] > To change settings or unsubscribe please go to: > https://server-nexa.polito.it/postorius/lists/nexa.server-nexa.polito.it/ > The general archive of the list is located at: > https://server-nexa.polito.it/hyperkitty/list/[email protected]/ > Permalink to this message: > https://server-nexa.polito.it/hyperkitty/list/[email protected]/message/GG6X32WGCVC3S6P26IM5UM4QDSZM2CON/ > > > -- _______________ *Maurizio Borghi* Università di Torino https://www.dg.unito.it/persone/maurizio.borghi Co-Director Nexa Center for Internet & Society <https://nexa.polito.it/>
_______________________________________________ nexa mailing list -- [email protected] To change settings or unsubscribe please go to: https://server-nexa.polito.it/postorius/lists/nexa.server-nexa.polito.it/ The general archive of the list is located at: https://server-nexa.polito.it/hyperkitty/list/[email protected]/ Permalink to this message: https://server-nexa.polito.it/hyperkitty/list/[email protected]/message/57MPXC42LGMWX3GUCRHDTAZNVREJB6WK/
