Sì è corretto: condividiamo la tristezza di vedere i libri ridotti a
mangime per i pappagalli stocastici, ma dobbiamo prendere atto che per le
corti USA è fair use (sentenze Google Books).


Il giorno ven 24 lug 2026 alle ore 10:01 Antonio Vetro' <
[email protected]> ha scritto:

> E’ corretto quindi dedurre che invece la pratica di Anthropic -ma non
> solo- di acquistare massivamente tonnellate di libri usati,
> per digitalizzarli e utilizzarli nel training, non porti invece ad alcuna
> violazione del diritto d’autore ?
>
> (Libri che poi -sigh- sono mandati al macero ..)
>
> Grazie
> Antonio
>
>
> Il giorno 24 lug 2026, alle ore 09:15, Maurizio Borghi via nexa <
> [email protected]> ha scritto:
>
> La sentenza non riguarda violazioni contrattuali o di licenza, ma solo
> violazioni del diritto d'autore. Sui passi intermedi, semplificando un po',
> la sentenza distingue tra le copie fatte per addestrare gli LLM (fair use)
> e quelle fatte per creare un database centrale da cui attingere per ogni
> evenienza (no fair use se ottenute illegalmente).
>
> Per rispondere alla tua domanda, il problema principale sta nella fase di
> acquisizione del "materiale da addestramento". Se lo prendo da database
> pirata, o aggirando un paywall (es. New York Times v OpenAI), o rimuovendo
> le informazioni sulle licenze (es. GitHub Copilot), allora tutti gli
> utilizzi successivi - che presi isolatamente sarebbero fair use - diventano
> illegittimi.
>
> Il contributo rilevante della sentenza sta essenzialmente nel fatto di
> aver respinto la difesa della "copia intermedia", cioè la copia realizzata
> quale mero passo intermedio per una finalità di fair use. Il giudice
> ridimensiona questa difesa (che ha permesso, ad esempio, a Google di
> prevalere nel caso Google Books), affermando che non si applica se la copia
> inziale è illecita.
>
> Naturalmente occorre precisare che si tratta per ora di una sentenza, non
> di un approccio consolidato nella giurisprunza USA.
>
> Un caro saluto,
> --
> _______________
> *Maurizio Borghi*
> Università di Torino
> https://www.dg.unito.it/persone/maurizio.borghi
> Co-Director Nexa Center for Internet & Society <https://nexa.polito.it/>
>
>
> Il giorno gio 23 lug 2026 alle ore 18:14 Stefano Zacchiroli via nexa <
> [email protected]> ha scritto:
>
>> Grazie per la risposta, Maurizio.
>> Continuo qui sotto per entrare in alcuni dettagli che mi interessano
>> particolarmente:
>>
>> On Thu, Jul 23, 2026 at 05:40:29PM +0200, Maurizio Borghi wrote:
>> > la risposta non è semplice o univoca. Anthropic usava LibGen, Sci-Hub e
>> Bibliotik, che (correggimi se sbaglio) sono notorie
>> > "shadow libraries".
>>
>> (Confermo per LibGen e Sci-Hub, non conosco invece Bibliotik.)
>>
>> > Su Common Crawl non saprei, perché lì dentro c'è un po' di tutto: uno
>> studio ha stimato che un 70% dei dataset presenti
>> > non specifica quale licenza si applichi.
>>
>> Giusto --- o meglio, non conosco la percentuale, ma è certo che la
>> stragrande maggioranza dei contenuti su Web (come del codice su GitHub, e
>> contenuti di altra natura su piattaforme dedicate) non specifica una
>> licenza.
>> Ma questo non impedisce che io, utente di un Web browser, possa
>> *accedere* legalmente a quel contenuto.
>> Poi i default del diritto d'autore impediscono di fare altre cose, tipo
>> copiare, modificare, redistribuire, esibire ad un pubblico, etc. --- ed è
>> qui che entra in gioco il fair use che salva, almeno secondo questa
>> sentenza, gli allenatori di LLM.
>> Sbaglio qualcosa fin qui, strettamente dal punto di vista del diritto
>> d'autore? (Vedi sotto per i vincoli contrattuali.)
>>
>> > Con il web scraping puoi incorrere in violazioni contrattuali se non
>> rispetti i termini d'uso (che spesso vietano proprio lo scraping);
>>
>> Il caso dei vincoli contrattuali è in effetti molto pertinente ed
>> interessante.
>> La sentenza prevede l'assenza di entrambi i tipi di violazioni (licenza
>> ed eventuali contratti), o meno?
>> L'avevo finora interpretata come una sentenza principalmente sul diritto
>> d'autore, ma è possibilissimo che sia un errore da parte mia.
>>
>> > puoi inoltre violare di nuovo il copyright se rimuovi i metadati
>> ("rights management information"),
>> > cosa piuttosto frequente tra gli addestratori di IA, e già motivo di
>> altre cause legali.
>>
>> Questo punto mi pare molto meno evidente.
>> Il processo di allenamento contiene molti passi intermedi, non mi è
>> chiaro come riuscire legalmente a definire dove ne inizi uno che è protetto
>> dal fair use (e nel quale quindi, perdonami la semplificazione, si "può
>> violare" il diritto d'autore) e dove invece no.
>> Ma ho in mente anche io alcune delle cause aperte su questo punto, quindi
>> spero lo scopriremo "presto".
>>
>> Grazie per la bella discussione e a presto.
>> --
>> Stefano Zacchiroli - https://upsilon.cc/zack
>> Full professor of Computer Science, Polytechnic Institute of Paris
>> Co-founder & Chief scientific officer Software Heritage
>> _______________________________________________
>> nexa mailing list -- [email protected]
>> To change settings or unsubscribe please go to:
>> https://server-nexa.polito.it/postorius/lists/nexa.server-nexa.polito.it/
>> The general archive of the list is located at:
>> https://server-nexa.polito.it/hyperkitty/list/[email protected]/
>> Permalink to this message:
>> https://server-nexa.polito.it/hyperkitty/list/[email protected]/message/FIBMVPVGNZN63PSB2CFMC7AUTW2WGL7G/
>
>
>
> _______________________________________________
> nexa mailing list -- [email protected]
> To change settings or unsubscribe please go to:
> https://server-nexa.polito.it/postorius/lists/nexa.server-nexa.polito.it/
> The general archive of the list is located at:
> https://server-nexa.polito.it/hyperkitty/list/[email protected]/
> Permalink to this message:
> https://server-nexa.polito.it/hyperkitty/list/[email protected]/message/GG6X32WGCVC3S6P26IM5UM4QDSZM2CON/
>
>
>

-- 
_______________
*Maurizio Borghi*
Università di Torino
https://www.dg.unito.it/persone/maurizio.borghi
Co-Director Nexa Center for Internet & Society <https://nexa.polito.it/>
_______________________________________________
nexa mailing list -- [email protected]
To change settings or unsubscribe please go to: 
https://server-nexa.polito.it/postorius/lists/nexa.server-nexa.polito.it/
The general archive of the list is located at: 
https://server-nexa.polito.it/hyperkitty/list/[email protected]/
Permalink to this message: 
https://server-nexa.polito.it/hyperkitty/list/[email protected]/message/57MPXC42LGMWX3GUCRHDTAZNVREJB6WK/

Reply via email to