IA · 18 settembre 2026 · 5 min di lettura
«Il più grande furto di lavoro della storia»: le carte segrete che imbarazzano Microsoft e OpenAI
In sintesi: Nel contenzioso sul copyright promosso dal New York Times emergono documenti interni finora secretati di Microsoft e OpenAI. Nelle comunicazioni tra dirigenti e ricercatori, lo scraping selvaggio dei contenuti giornalistici veniva descritto come «un furto senza precedenti» e una minaccia esistenziale per l'ecosistema web, con dati che certificano crolli di traffico verso le testate fino al 94%. Le ammissioni rischiano di demolire la linea difensiva del fair use nei tribunali.
di Team Mocchi's
Nelle aule di tribunale e nei comunicati pubblici, i colossi dell'intelligenza artificiale hanno sempre sostenuto che addestrare modelli linguistici su miliardi di pagine web rientri a pieno titolo nel «fair use», la clausola del diritto statunitense che tutela l'uso trasformativo delle opere protette. A porte chiuse, tuttavia, la consapevolezza interna era radicalmente opposta. È quanto emerge da una consistente mole di documenti riservati appena declassificati nel procedimento federale che vede contrapposti The New York Times e altri editori a Microsoft e OpenAI.
Come riporta Ars Technica, le carte depositate a supporto di una mozione per giudizio sommario rivelano scambi epistolari e note tecniche rimaste segrete per anni. Nei testi, figure chiave della ricerca e dello sviluppo prodotti dei due partner descrivevano l'acquisizione massiva di articoli e contenuti editoriali non come una nobile evoluzione della conoscenza umana, ma come una predazione economica insostenibile.
Le confessioni interne: dall'«incredibile furto» alla farsa del fair use
Tra le testimonianze documentali più pesanti figurano le note di Brent Hecht, Director of Applied Science di Microsoft. Nei suoi promemoria interni, Hecht metteva ripetutamente in guardia l'azienda: rastrellare notizie per alimentare i modelli generativi rappresentava «un furto sbalorditivo di proporzioni senza precedenti», arrivando a bollarlo come «forse il più grande furto di lavoro nella storia umana».
Hecht smontava esplicitamente proprio la linea che i legali di Redmond avrebbero poi difeso davanti ai giudici, annotando che il piano di scraping sistematico faceva «un'autentica beffa dell'idea di fair use». Il ricercatore ammetteva con disarmante lucidità che «quasi nessuno ha mai inteso che i contenuti creati venissero utilizzati in questa maniera, né alcuno viene ricompensato per il loro utilizzo».
Sul versante OpenAI, le evidenze non sono meno imbarazzanti. Nick Turley, responsabile di ChatGPT, riconosceva in messaggi interni che gli editori si sarebbero trovati di fronte a una «minaccia esistenziale». Il pericolo scaturiva proprio dal fatto che strumenti commerciali addestrati sul lavoro giornalistico si stavano trasformando in meri sostituti diretti delle fonti d'informazione originarie, privando le testate del proprio pubblico.
Il «doom loop» e il crollo misurato dei click
Uno degli aspetti più rivelatori delle carte declassificate riguarda la teorizzazione di quello che i documenti Microsoft definiscono esplicitamente un «doom loop» (un circolo vizioso autodistruttivo). Nelle analisi interne si legge: «È altamente insolito che un prodotto finale minacci le fondamenta economiche dei suoi fornitori essenziali, ma questa è la situazione che abbiamo creato per il nostro business degli LLM rispetto alla sua catena di fornitura di contenuti».
I manager temevano che, prosciugando le entrate degli editori fino a provocarne la chiusura, i modelli linguistici avrebbero finito per avvelenare la propria stessa fonte primaria di dati freschi e verificati, compromettendo le prestazioni dell'IA e l'utilità del web nel suo complesso.
Le previsioni si sono rivelate esatte nei numeri monitorati dalle stesse aziende. I dati interni di Microsoft e OpenAI allegati agli atti smentiscono la tesi difensiva secondo cui i chatbot genererebbero traffico di rimando: per alcuni editori citati nella causa, il tasso di click-through (CTR) dai motori conversazionali è crollato tra l'83% e il 93%, mentre per altri le flessioni oscillano tra il 51% e il 94%. I motori non indirizzano più i lettori alle testate: rispondono direttamente citando brani quasi testuali, eliminando ogni necessità di cliccare.
Una svolta epocale per la tutela della proprietà intellettuale
La rivelazione di questi carteggi sposta sensibilmente l'equilibrio del contenzioso. Nel diritto statunitense, il quarto pilastro del fair use richiede di valutare l'effetto dell'uso sul valore commerciale e sul mercato potenziale dell'opera originale. Le prove documentali che certificano come le stesse big tech considerassero i chatbot «ampiamente sostitutivi» tolgono credibilità alle perizie tecniche difensive.
Gli editori puntano ora al dibattimento con un arsenale probatorio senza precedenti: la dimostrazione empirica che i sistemi generativi hanno impoverito gli autori usando gli scritti degli stessi autori senza permesso, con la piena consapevolezza del danno da parte dei vertici aziendali.
Il punto di Mocchi's
Per il tessuto produttivo e le imprese italiane che sviluppano o integrano soluzioni di intelligenza artificiale, queste carte segnano la fine definitiva della stagione dell'ambiguità. Se gli stessi creatori dei modelli di frontiera ammettevano privatamente l'insostenibilità giuridica ed economica dello scraping indiscriminato, affidare processi aziendali a sistemi il cui dataset è legalmente vulnerabile rappresenta un rischio operativo non più trascurabile. Per chi detiene patrimoni informativi verticali — archivi tecnici, manualistica industriale, banche dati normative — si aprono spazi senza precedenti per pretendere accordi di licenza trasparenti e remunerati. Come software agency, riteniamo che la vera affidabilità dell'IA applicata non risieda nella voracità dei modelli generalisti, ma nell'adozione di architetture controllate, pipeline RAG su dati proprietari certificati e fornitori capaci di offrire garanzie legali stringenti sulla provenienza del proprio addestramento.