IA · 11 giugno 2026 · 3 min di lettura
Google lancia DiffusionGemma: la generazione di testo locale accelera di 4 volte grazie alla diffusione
In sintesi: Google DeepMind ha presentato DiffusionGemma, un innovativo modello open-source che cambia radicalmente il modo in cui i sistemi IA producono testo. Invece di usare il tradizionale approccio autoregressivo (una parola alla volta), genera interi blocchi di testo in parallelo prendendo ispirazione dai modelli di diffusione di immagini. Questa architettura consente di raggiungere velocità fino a quattro volte superiori su hardware locale e apre nuove strade per l'elaborazione di compiti complessi.
di Team Mocchi's
Oltre il paradigma autoregressivo: come funziona la diffusione del testo
Fino a oggi, la stragrande maggioranza dei modelli linguistici di grandi dimensioni (LLM) ha funzionato seguendo un approccio "autoregressivo". Questo significa che l'intelligenza artificiale genera il testo in modo lineare, da sinistra a destra, prevedendo e scrivendo una singola parola (o "token") alla volta. Pur essendo un metodo efficace, l'approccio autoregressivo presenta colli di bottiglia legati alla larghezza di banda della memoria, poiché l'hardware deve caricare i parametri del modello a ogni singolo token generato.
Come riportato da Ars Technica, i laboratori di Google DeepMind hanno rilasciato un nuovo modello open-source che scardina questo paradigma: DiffusionGemma. Invece di scrivere in modo sequenziale, DiffusionGemma adotta una tecnica simile a quella utilizzata dai generatori di immagini (come Midjourney o Stable Diffusion). Il modello inizia posizionando un blocco di "token segnaposto" su una tela digitale vuota e lavora progressivamente per eliminare il "rumore" e affinare le parole, arrivando a produrre un intero blocco di testo in parallelo.
Specifiche tecniche e prestazioni su hardware locale
DiffusionGemma fa parte della famiglia di modelli aperti Gemma 4 ed è strutturato come un modello Mixture of Experts (MoE). Ha una dimensione complessiva di 26 miliardi di parametri, ma solo 3,8 miliardi vengono attivati durante l'inferenza. Questa configurazione ottimizzata permette al modello di funzionare agevolmente su hardware locale dotato di almeno 18 GB di VRAM, rendendolo ideale per gli sviluppatori e le workstation aziendali.
I benchmark effettuati mostrano risultati straordinari sul fronte della velocità di calcolo:
- Con una singola GPU di fascia consumer, come una Nvidia RTX 5090, il modello raggiunge una velocità di circa 700 token al secondo.
- Utilizzando un acceleratore di livello aziendale come l'Nvidia H100, DiffusionGemma supera i 1.000 token al secondo.
Si tratta di prestazioni circa quattro volte superiori a quelle dei modelli autoregressivi tradizionali di pari dimensioni. Spostando il collo di bottiglia dalla larghezza di banda della memoria alla pura potenza di calcolo, il modello è in grado di elaborare ed emettere fino a 256 token in parallelo per singolo passaggio.
I vantaggi pratici: dalla correzione al problem-solving non lineare
La generazione di testo in parallelo sblocca scenari d'uso in cui i modelli sequenziali hanno sempre faticato. Nei modelli tradizionali, ogni parola dipende esclusivamente dalle parole precedenti; questo rende estremamente difficile la risoluzione di problemi non lineari o compiti che richiedono una costante autovalutazione del contesto globale.
Un esempio pratico mostrato da Google DeepMind riguarda la risoluzione di griglie di Sudoku. Si tratta di un esercizio notoriamente ostico per gli LLM classici, poiché la scelta di un numero in una casella dipende da variabili future e passate contemporaneamente. DiffusionGemma, grazie alla sua capacità di correggere continuamente interi blocchi di token sulla "tela", riesce a risolvere questi schemi con grande agilità. Altri ambiti di applicazione ideali includono l'editing di testo in linea (dove l'IA deve modificare parti di un documento mantenendo coerente il resto), il sequenziamento molecolare e la rappresentazione grafica di formule matematiche complesse.
I limiti attuali: perché non ha ancora sostituito i grandi modelli cloud
Nonostante l'incredibile incremento prestazionale, la diffusione applicata al testo presenta alcune limitazioni che spiegano perché Google non abbia ancora adottato questa tecnologia per i suoi modelli commerciali più grandi, come Gemini.
Il limite principale risiede nel tasso di errore. Mentre nei modelli di generazione d'immagine un pixel leggermente fuori posto passa inosservato, nel linguaggio umano la precisione è discreta: un singolo token errato può compromettere l'intero significato di una frase, costringendo il sistema a rigenerare l'intero blocco da capo. Inoltre, per risposte molto brevi (ad esempio, query di poche parole), i modelli di diffusione risultano meno efficienti, poiché richiedono comunque passaggi paralleli di pulizia del rumore che un modello autoregressivo risolverebbe in pochi millisecondi.
Tuttavia, il rilascio di DiffusionGemma rappresenta una pietra miliare nello sviluppo di IA locali, dimostrando che l'efficienza dei modelli non passa solo dall'aumento dei parametri, ma anche dall'esplorazione di architetture di calcolo radicalmente nuove.