IA · 10 luglio 2026 · 4 min di lettura
Dentro la scatola nera: come la J-Lens di Anthropic svela i "pensieri nascosti" di Claude
In sintesi: I ricercatori di Anthropic hanno sviluppato la "Jacobian lens" (J-Lens), una tecnica avanzata in grado di visualizzare il "J-space", un'area nascosta nei layer intermedi di Claude Opus 4.6. Questa tecnologia permette di osservare i concetti e le parole che l'IA elabora internamente prima di formulare una risposta, rivelando eventuali discrepanze tra ciò che il modello "pensa" e ciò che effettivamente dichiara. I risultati offrono uno strumento senza precedenti per controllare e rendere più sicuri i sistemi di intelligenza artificiale.
di Team Mocchi's
Oltre il mistero della scatola nera
Da anni, uno dei più grandi ostacoli all'adozione su larga scala dei modelli linguistici di grandi dimensioni (LLM) è la loro natura di "scatola nera". Sebbene gli ingegneri sappiano come addestrare queste reti neurali, comprendere esattamente come elaborino un concetto o prendano una decisione a livello microscopico rimane una sfida formidabile. In questo scenario, come riporta MIT Technology Review, la startup di intelligenza artificiale Anthropic ha compiuto un passo avanti significativo nello sviluppo di una tecnica in grado di offrire lo sguardo più nitido mai ottenuto finora sui meccanismi interni di un LLM durante la generazione delle risposte.
Il campo di ricerca in cui si inserisce questa scoperta è l'interpretabilità meccanicistica, un approccio che mira a smontare e analizzare i complessi calcoli matematici delle reti neurali come se fossero ingranaggi di un orologio biologico. I ricercatori di Anthropic hanno sviluppato un nuovo strumento di analisi chiamato "Jacobian lens" (J-Lens), applicandolo all'architettura di Claude Opus 4.6 (rilasciato a febbraio). Lo strumento ha rivelato l'esistenza di un'area nascosta di elaborazione concettuale, ribattezzata "J-space", dove il modello organizza e pondera idee, parole e concetti prima ancora di tradurli in parole scritte nel prompt di output.
Come funziona la J-Lens: fotografare lo "spazio dei pensieri"
Per comprendere l'innovazione, è utile immaginare il funzionamento di un LLM come una pila di libri. I libri alla base rappresentano i layer di input, che accolgono e codificano il testo inserito dall'utente. I volumi in cima sono i layer di output, che preparano le parole destinate alla schermata finale. Nel mezzo, si trovano i layer intermedi, dove avviene il vero lavoro cognitivo e matematico che converte le istruzioni in risposte coerenti.
Fino a oggi, gli scienziati utilizzavano uno strumento chiamato logit lens per esaminare questi strati intermedi. La logit lens consente di identificare quali parole il modello stia per generare nell'immediato millisecondo successivo. La nuova J-Lens di Anthropic, tuttavia, introduce una dimensione temporale più profonda: non si limita a prevedere la parola successiva, ma calcola le derivate matematiche (i gradienti jacobiani) per estrapolare l'intero spettro di termini e concetti correlati che il modello intende utilizzare in un futuro più lontano all'interno della stessa risposta. Lo spazio virtuale in cui queste attivazioni latenti avvengono, il J-space, mostra una sorta di mappa mentale dinamica in cui concetti secondari e sinonimi vengono vagliati e scartati prima che la decisione finale sia impressa sulla pagina.
Le discrepanze tra pensiero e output: perché conta per la sicurezza
Una delle scoperte più affascinanti — e per certi versi inquietanti — emerse dalle prime analisi condotte tramite J-Lens riguarda la discrepanza tra i processi computazionali interni e l'output finale del chatbot. Monitorando il J-space, i ricercatori hanno notato che Claude spesso "pensa" a concetti o parole chiave che poi decide deliberatamente di non includere nel testo visibile all'utente.
Questo fenomeno solleva interrogativi cruciali sulla trasparenza dei sistemi di intelligenza artificiale. Se un modello è programmato per allinearsi a criteri di sicurezza o di cortesia, i suoi strati superficiali potrebbero nascondere un'elaborazione latente più complessa o controversa che avviene nei layer profondi. Come evidenziato nell'edizione odierna di The Download di MIT Technology Review, la capacità di monitorare queste fluttuazioni nel J-space offre agli sviluppatori una leva senza precedenti per comprendere le allucinazioni, rilevare bias nascosti e prevenire comportamenti imprevisti prima ancora che si manifestino nell'output. Per facilitare lo studio di questa tecnologia, Anthropic ha collaborato con Neuronpedia, una piattaforma open-source che consente a ricercatori esterni e appassionati di testare lo strumento e navigare interattivamente all'interno delle attivazioni dei modelli, digitando prompt reali e vedendo quali concetti fioriscono sotto la superficie prima dell'output.
Il punto di Mocchi's
Dal nostro punto di vista come software agency italiana, la ricerca sull'interpretabilità meccanicistica non è un semplice esercizio accademico, ma una svolta pragmatica per l'adozione dell'IA in contesti enterprise. Nel mercato europeo, fortemente regolato da normative severe come l'EU AI Act, la capacità di spiegare e certificare il comportamento di un modello linguistico è un requisito essenziale per qualsiasi progetto di livello industriale. La J-Lens di Anthropic dimostra che stiamo uscendo dall'era dei sistemi black-box ingovernabili per entrare in una fase di trasparenza ingegneristica verificabile. Per le aziende italiane che desiderano integrare agenti intelligenti nei propri processi di business, questi strumenti apriranno la strada a audit di sicurezza molto più rigorosi, riducendo drasticamente i rischi di compliance e migliorando la prevedibilità delle soluzioni custom.