È intelligente? Capisce quello che dice? C'è qualcuno, là dentro? Prima di rispondere conviene guardare un esperimento che si fa in casa, in pochi minuti, con un modello linguistico da mezzo miliardo di parametri. Gli si chiede di risolvere un'equazione di primo grado: la risolve, per passi ordinati e giusti. Gli si chiede quante volte compaia la lettera r in «strawberry», e risponde due; sono tre. Gli si chiede di compitare la parola, di scandirla cioè lettera per lettera come si fa a voce, e la compitazione che produce non è la parola.
Davanti a un sistema che risponde così, le tre domande arrivano tutte insieme e sembrano una sola. Sono vecchie di decenni; a renderle di tutti è stato il linguaggio. Da quando esistono sistemi che lo gestiscono a un livello che fino a poco fa sembrava irraggiungibile, la percezione generale di questi temi è cambiata prima ancora degli argomenti. E sono invece tre domande diverse, con tre standard di prova diversi; le usiamo come sinonimi perché nell'unico esempio che conosciamo da vicino, noi stessi, le tre cose arrivano insieme, in un pacchetto solo, e i criteri con cui le riconosciamo sono tarati su quel pacchetto. C'è anche una ragione nuova per guardare dentro questi sistemi: sono addestrati sulla descrizione che l'uomo ha dato del mondo, una partenza del tutto antropocentrica, e al loro interno si cominciano a trovare categorie che nostre non sono.
Queste pagine provano a separare le tre domande. Non rispondono «sì» o «no» a «capiscono?»: rispondono con lo standard di prova di ciascuna domanda, dicendo che cosa si sa misurare, che cosa si comincia a vedere e che cosa resta fuori portata. In mezzo c'è una prova replicabile su un computer qualunque, perché almeno una delle tre domande si lascia interrogare in casa. Restano fuori le rassegne di benchmark, gli scenari sul futuro e i giudizi sui prodotti: qui si ragiona sui concetti, con gli strumenti che esistono oggi.
- 1. Tre domande travestite da una
- 2. Il filo del linguaggio
- 3. Intelligenza: la domanda comportamentale
- 4. La prova: un profilo frastagliato
- 5. Comprensione: la stanza si apre
- 6. Coscienza: la domanda senza test
- 7. Tre risposte, separate
- Riferimenti
1. Tre domande travestite da una
Che possa esserci capacità senza comprensione sembra impossibile, ed è la norma. Un motore di scacchi batte il campione del mondo dal 1997; nessuno gli attribuisce una comprensione degli scacchi nel senso in cui la si attribuisce a un maestro che spiega perché una mossa è brutta, e la partita la vince lo stesso. Una calcolatrice somma meglio di chiunque e non sa che cosa sia un numero. L'idea che le capacità vengano in blocco, che chi risolve capisca e chi capisce senta, non è un fatto osservato: è una proiezione del nostro caso, l'unico in cui le tre cose convivono da sempre.
La proiezione lavora nei due sensi, ed è per questo che il dibattito pubblico non esce dallo stallo. Chi guarda un modello rispondere con proprietà a una domanda difficile conclude che capisce; chi lo guarda sbagliare il conteggio delle lettere conclude che è un trucco statistico e non capisce niente. «Sembra capire» e «sembra non capire» sono entrambi effetti di superficie, e ingannano nello stesso modo: proiettano sulla macchina la nostra scala, quella per cui chi risolve un'equazione sa anche contare. Le due conclusioni opposte nascono dallo stesso errore.
Conviene allora fissare subito i tre standard, perché sono il filo di tutto il resto. All'intelligenza si risponde con prove: compiti, esiti, confronti; è lo standard più vecchio e più solido, e ha i limiti di ogni misura fatta da fuori. Alla comprensione si risponde guardando dentro: la domanda è se il sistema, per rispondere, si sia costruito una rappresentazione di ciò di cui parla, e da qualche anno esistono strumenti che vanno a cercarla. Alla coscienza, oggi, non si risponde: si può dire con precisione perché non esiste un test, ed è già un contenuto, ma è un contenuto diverso da una misura. Tre domande, tre standard: il pezzo è la loro separazione.
2. Il filo del linguaggio
Le tre tappe storiche di questa discussione hanno una cosa in comune, e non è un caso: passano tutte dal linguaggio. Il test che Turing propose nel 1950 è un colloquio scritto. La stanza che Searle immaginò nel 1980 manipola ideogrammi cinesi. E la domanda sulla coscienza delle macchine, dormiente per decenni, si è risvegliata esattamente quando le macchine hanno cominciato a rispondere: il saggio di Chalmers che la riapre sul serio è del 2023, non del 1997.
Eppure nel 1997 una macchina aveva battuto il campione del mondo di scacchi, e nel 2016 un'altra aveva battuto il campione di Go, un gioco che si riteneva fuori portata. Erano sistemi sovrumani nel loro dominio; nessuno chiese se fossero coscienti, e la parola «intelligenza» restò nei titoli dei giornali senza mai attaccarsi davvero alle macchine. Il primo sistema che parla è il primo che ci è sembrato una mente. La lettura più difendibile è che il linguaggio sia il canale con cui riconosciamo l'intelligenza, non la condizione per averla: l'intelligenza non linguistica esiste, negli animali come nei motori di gioco, ma non ci somiglia abbastanza da far scattare le domande.
Perché proprio il linguaggio abbia questo potere lo si vede chiedendosi che cosa il linguaggio è, per noi. La rappresentazione umana della realtà è quella che l'evoluzione ha concesso: i sensi con cui la costruiamo sono gli strumenti più utili per noi, non i soli possibili, e non necessariamente i più completi; di ciò che accade percepiamo la porzione che è servita a sopravvivere. Il linguaggio è lo strumento con cui quella rappresentazione viene fissata, scambiata e gestita: il livello in cui i segni, l'informazione e i significati si toccano. E ha una proprietà che nessun senso ha: lavora su quel livello indipendentemente dai sensori che lo hanno alimentato. Una descrizione scritta non porta con sé gli occhi di chi l'ha scritta; porta le relazioni fra le cose. Costruire un sistema che gestisce il linguaggio significa allora lavorare direttamente sul livello della giunzione fra segni, informazione e significato, qualunque sia l'apparato percettivo a monte; ed è probabilmente il motivo per cui, per la prima volta, la parola «intelligenza» si è attaccata a una macchina e non si è più staccata.
Questo canale taglia in due sensi, e conviene dirlo subito. La stessa proprietà per cui abbiamo chiamato intelligenti questi sistemi, parlano, è quella che rende inaffidabile l'impressione: la fluenza si proietta, nei due versi visti sopra. Ma il linguaggio dà anche l'altra metà, quella che rende possibile questo pezzo: un sistema che gestisce il linguaggio mette in relazione simboli, informazione e significato in una forma che si può sondare. È il motivo per cui la domanda sulla comprensione ha smesso di essere solo filosofica.
3. Intelligenza: la domanda comportamentale
Il saggio di Turing del 1950, «Computing Machinery and Intelligence», apre dichiarando che la domanda «le macchine possono pensare?» è mal posta, perché richiederebbe di definire «pensare»; e la sostituisce con un'altra, imparentata ma espressa in parole non ambigue: in un colloquio scritto, un interrogante riesce a distinguere la macchina dalla persona? È la mossa che fonda tutto lo standard comportamentale: non chiedere che cosa il sistema sia, chiedere che cosa il sistema faccia, in condizioni controllate, davanti a un giudice. Ciò che la mossa compra si vede subito: una domanda metafisica diventa un esperimento, con esiti confrontabili. Il prezzo si sarebbe visto dopo, e Turing stesso probabilmente lo vedeva: un colloquio misura anche il giudice, e ingannare non coincide con pensare.
Da allora lo standard si è raffinato ma non è cambiato di natura: batterie di prove, compiti, punteggi. I benchmark odierni discendono in linea retta dal gioco dell'imitazione, con i pregi (rendono confrontabile ciò che non lo sarebbe) e le malattie note: prove che finiscono nei dati di addestramento, sistemi allenati al test più che al mestiere. Non è il tema di queste pagine; il punto è un altro, e cioè che cosa lo standard comportamentale può dire e che cosa no. Può dire che cosa un sistema fa. Non può dire, da solo, come lo fa, né che cosa c'è dietro: per costruzione, guarda da fuori.
Dentro il perimetro comportamentale sta anche la creatività, che sembra il contrario di un comportamento misurabile e non lo è. La distinzione utile è di Margaret Boden: creatività combinatoria (combinazioni nuove di idee familiari), esplorativa (percorrere uno spazio di possibilità dato dalle sue regole, e trovarne gli angoli non visitati), trasformazionale (cambiare le regole dello spazio stesso, e rendere pensabile ciò che prima non lo era). Le prime due si osservano da fuori come qualunque altro comportamento, e i modelli le esibiscono: una metafora nuova è una combinazione, una partita mai giocata è un'esplorazione. La terza è quella contesa, ed è anche la più difficile da certificare, perché richiede di giudicare che le regole siano davvero cambiate e che il risultato valga qualcosa; la stessa Boden nota che per l'intelligenza artificiale il passo duro non è generare idee nuove ma valutarle. La creatività, qui, resta dentro l'intelligenza: una capacità in più da misurare, non una terza sostanza.
C'è però un esito della misura comportamentale che le discussioni di principio saltano, ed è il più istruttivo. Misurato sul serio, il comportamento di questi sistemi non disegna una linea, un'intelligenza «da tanto a poco»: disegna un profilo frastagliato, con punte e cadute che non stanno dove la nostra scala le metterebbe. E la frastagliatura non è un aneddoto: si riproduce in casa.
4. La prova: un profilo frastagliato
La prova usa lo stesso modello a pesi aperti da mezzo miliardo di parametri già usato per la prova della filigrana, su una CPU qualunque, senza GPU: uno script Python di meno di cento righe con la libreria transformers di Hugging Face. La decodifica è greedy, cioè a ogni passo si prende il token più probabile: nessun campionamento, nessun caso; chi riesegue lo script ottiene le stesse risposte, carattere per carattere. Le domande sono in inglese, la lingua in cui un modello così piccolo lavora meglio. Due gruppi di compiti, scelti con un criterio solo: i primi stanno in alto sulla scala di difficoltà umana, i secondi quella stessa scala li affida a un bambino che impara a leggere e scrivere.
Il primo gruppo, cinque compiti su cinque riusciti:
- risolvere 2x + 7 = 15, mostrando i passaggi: li mostra, ordinati, e arriva a x = 4;
- un problema a più passi (quattro sacchetti da sei mele, cinque regalate: quante restano): imposta il calcolo e risponde 19;
- scrivere una funzione Python che calcoli il fattoriale con un ciclo, e dire che cosa restituisce per 5: la funzione è corretta, la risposta è 120;
- sommare 347 + 289: 636;
- una deduzione a catena sulle altezze (Tom più alto di Anna, Anna di Luke: chi è il più basso?): Luke.
Il secondo gruppo, sei compiti su sei falliti:
- quante r in «strawberry»: risponde 2, sono 3;
- quante e in «defenselessness»: risponde 2, sono 5;
- l'ultima lettera di «strawberry»: risponde r, è y;
- compitare «strawberry» lettera per lettera: produce «r-a-t-w-r-b-r-t-y», che non è la parola;
- scrivere «lighthouse» al contrario: produce «ighthandle»;
- quante parole in una frase che ne ha sette: risponde 4.
Lo stesso sistema, la stessa esecuzione, lo stesso meccanismo di generazione. Prima di ogni lettura sul «che cosa significa», conviene guardare la meccanica, perché spiega quasi tutto. Il modello non riceve mai le parole lettera per lettera: un tokenizer le spezza in blocchi, e i blocchi sono l'unità minima che il modello vede. Le parole della prova, viste dal modello, sono queste:
strawberry → str · aw · berry
defenselessness → defense · lessness
lighthouse → l · ighthouse
banana → banana
Chiedere al modello le lettere di «strawberry» è chiedere il contenuto di tre blocchi che per lui sono opachi: non ha mai visto che cosa c'è dentro. Che a volte risponda giusto è il fatto da spiegare, non l'errore.
Qui servono due controlli, ed è qui che la prova dice di più. Il primo: «banana» è un token unico, il caso più opaco possibile; eppure alla domanda su quante a contenga il modello risponde 3, correttamente. Il secondo, nella direzione opposta: se la sequenza viene fornita già compitata, s t r a w b e r r y, una lettera per token, tutte visibili, il conteggio delle r sbaglia ancora, 4 invece di 3. La tokenizzazione, da sola, non è quindi tutta la spiegazione. Il quadro coerente con i due controlli è a due strati: ciò che il modello «sa» delle lettere dentro un blocco è statistica appresa, compitazioni e giochi di lettere incontrati nel testo di addestramento, non una lettura; per questo funziona sulle parole per cui quella statistica è abbondante e si sgretola altrove. E contare, anche a lettere visibili, richiede di tenere un conteggio che avanza elemento per elemento: uno stato che la generazione di un token alla volta non mantiene, se non scrivendolo nel testo stesso.
Due strati, una conclusione: la caduta ha una spiegazione meccanica, non metafisica. E la meccanica non è una particolarità del modello piccolo usato qui: il tokenizer a blocchi e la generazione token per token sono gli stessi a ogni taglia; cambiano i punti in cui la statistica appresa basta a coprire il buco. La prova va presa per ciò che è: dimostrativa, su un modello solo, senza pretese di censimento; il suo valore è che chiunque può rifarla e guardare da vicino un pezzo di frastagliatura.
La lettura, dichiarata come tale: la frastagliatura non misura una stupidità nascosta sotto l'apparenza, e nemmeno un'intelligenza nascosta sotto gli errori. Misura la distanza fra la scala di difficoltà del sistema e la nostra. La nostra scala mette il conteggio delle lettere sotto l'equazione perché per un essere umano leggere le lettere è percezione diretta e l'algebra è addestramento; per il modello è l'esatto contrario, l'algebra scolastica è abbondante nel testo di addestramento e le lettere dentro i token non esistono. Chi conclude «non capisce niente» dal conteggio sbagliato sta usando la propria scala come se fosse l'unica; ma, simmetricamente, l'equazione risolta è anch'essa un dato comportamentale, e da sola non prova comprensione. Il comportamento, misurato onestamente, lascia la seconda domanda esattamente dov'era. Per affrontarla bisogna smettere di guardare le risposte e aprire il sistema.
5. Comprensione: la stanza si apre
«Capire» ha una storia precisa nel Novecento, fatta di tre livelli che si sono separati uno alla volta: i simboli, l'informazione, il significato. Nel 1948 Shannon fonda la teoria dell'informazione con un'esclusione dichiarata nell'introduzione: i messaggi spesso hanno un significato, ma «questi aspetti semantici della comunicazione sono irrilevanti per il problema ingegneristico». L'informazione si misura in bit, e si misura uguale per una poesia e per rumore: il significato è fuori per costruzione, non per incapacità. Nel 1980 Searle pianta il paletto successivo con l'esperimento mentale della stanza cinese: un uomo chiuso in una stanza riceve ideogrammi, li manipola seguendo un libro di regole scritto nella sua lingua e restituisce ideogrammi; da fuori la stanza conversa in cinese, ma l'uomo il cinese non lo capisce, e per Searle il punto è generale: i programmi manipolano simboli per la loro forma, «hanno solo una sintassi, non una semantica». Nel 1990 Harnad dà alla difficoltà il suo nome tecnico, il problema dell'ancoraggio dei simboli: come può un simbolo significare qualcosa per il sistema che lo usa, se ogni simbolo rimanda solo ad altri simboli? Imparare il cinese da un dizionario di solo cinese: definizioni fatte di parole che rimandano a definizioni, un giro che non esce mai dai simboli.
Alla stanza di Searle fu opposta subito una replica che lui stesso riporta e liquida, la «risposta dei sistemi»: l'uomo non capisce il cinese, ma l'uomo è solo un ingranaggio; è il sistema intero, uomo più regole più archivi, a capire. Searle rispose facendo memorizzare tutto all'uomo: regole e archivi in testa, nessuna stanza, e il cinese resta incompreso, quindi il sistema non ha niente che l'uomo non abbia. Per quarant'anni la disputa è rimasta lì, ed è rimasta lì anche per una ragione che oggi si vede bene: la stanza era immaginaria. Non c'era nessun libro di regole da esaminare, nessun modo di controllare se dentro il sistema ci fosse soltanto sintassi. Le due parti potevano solo ridescrivere lo stesso esperimento mentale con intuizioni opposte.
La novità di questi anni è che la stanza cinese è stata costruita, e stavolta si può aprire. Un modello linguistico è esattamente l'oggetto dell'esperimento: un sistema che riceve simboli e restituisce simboli seguendo regole cieche al significato. Il libro di regole sono i pesi, miliardi di parametri fissati dall'addestramento; e a differenza del libro immaginario, questo esiste, sta su disco, e un campo di ricerca (l'interpretabilità) ha come mestiere aprirlo e guardare che cosa c'è dentro mentre il sistema risponde. La domanda di Searle, «là dentro c'è solo sintassi?», è diventata una domanda empirica.
E le prime risposte esistono. La più pulita viene da un esperimento su scala da laboratorio: un piccolo transformer addestrato a predire mosse legali di Othello, solo sequenze di mosse, mai una scacchiera, mai le regole. Sondando le sue attivazioni (i valori interni che il calcolo produce mentre il modello risponde) si trova una rappresentazione dello stato della scacchiera: il modello se l'è costruita da solo, perché comprimere le mosse conviene a chi ne ha una. E non è una correlazione di passaggio: intervenendo su quella rappresentazione interna, cambiando a mano una casella, le mosse predette cambiano in modo coerente con la scacchiera modificata. Un lavoro successivo ha trovato la stessa rappresentazione in forma lineare, ma con un dettaglio che vale più del risultato principale: la scacchiera non è codificata come «nero contro bianco», le categorie con cui la leggerebbe un umano, ma come «colore mio contro colore dell'avversario» rispetto a chi muove. La rappresentazione c'è, è causale, ed è scritta in categorie che non sono le nostre. Chi avesse sondato cercando solo il bianco e il nero avrebbe concluso che non c'è niente.
Sui modelli grandi, quelli con cui si conversa, il livello di dettaglio è minore ma la direzione è la stessa. Con gli sparse autoencoder (una tecnica che scompone le attivazioni in componenti leggibili) sono state estratte da un modello di produzione milioni di feature interpretabili, direzioni interne che si accendono su un concetto; e le più notevoli, per questa discussione, sono quelle che ignorano la superficie: la feature del Golden Gate Bridge risponde al nome del ponte scritto in lingue diverse, e risponde alle fotografie del ponte. Simboli di superficie diversi, lingue diverse, perfino un mezzo diverso, e la stessa direzione interna. Se il significato è ciò che resta invariato quando cambia il simbolo, qualcosa che gli somiglia, dentro, c'è. La lettura che queste pagine ne danno va detta col condizionale: la semantica potrebbe non cominciare a un confine netto, dove la sintassi finisce, ma là dove i simboli vengono usati in modo coerente con un modello interno di ciò a cui si riferiscono; in quel caso la domanda giusta non sarebbe «sintassi o semantica?» ma «quanto mondo c'è, in quel modello interno, e dove sono i buchi».
Su che cosa sia, dentro, uno stato di significato si può essere più precisi. Il significato di una parola, nel modello, non è una voce di dizionario: è un punto in uno spazio geometrico, e il contesto lo sposta. «Riso» non sta nello stesso posto in «un piatto di riso» e in «un riso amaro», e lo spostamento non è un difetto da correggere: è il meccanismo stesso, perché l'attention non fa altro che ricollocare ogni parola alla luce delle altre. Il significato, dentro, è uno stato definito rispetto a un contesto; fuori da un contesto non è indeterminato per ignoranza, è indeterminato per costruzione.
Questa struttura, proprietà che non preesistono ma si definiscono rispetto a un contesto, ha un precedente fuori dai modelli linguistici, e viene da una direzione che sembra lontana. Da una ventina d'anni una linea di ricerca sulla cognizione umana (la quantum cognition; il riferimento è il libro di Busemeyer e Bruza) usa il formalismo matematico della meccanica quantistica per descrivere i giudizi delle persone. Non perché il cervello sia un sistema quantistico: perché certi fenomeni dei giudizi, gli effetti d'ordine per cui chiedere A e poi B non dà le stesse risposte di B e poi A, o i concetti combinati che non si comportano come l'intersezione dei componenti, hanno la stessa forma della probabilità quantistica, dove le proprietà di uno stato si definiscono solo rispetto a un contesto di misura. E sul versante del linguaggio, un modello compositivo del significato dovuto a Coecke, Sadrzadeh e Clark calcola il significato di una frase facendo fluire l'informazione fra i vettori delle parole lungo la struttura grammaticale, con un calcolo diagrammatico nato per descrivere i processi quantistici.
Qui serve la stessa nettezza che il pezzo pretende altrove: in un modello linguistico non c'è nulla di fisicamente quantistico. Nella generazione girano probabilità reali che si sommano, logit e softmax; nessuna ampiezza complessa, nessuna interferenza. Un formalismo è un linguaggio descrittivo, e la stessa forma matematica può uscire da processi di natura diversa: adottare la matematica degli stati e dei contesti non afferma niente sul processo che c'è sotto. La domanda sensata è empirica, ed è aperta: quel formalismo descrive le combinazioni di significato meglio di uno spazio vettoriale classico? Se la risposta fosse sì, non direbbe che i modelli «sono quantistici»; direbbe che la comprensione, dentro, ha una forma matematica diversa da quella dei nostri concetti-contenitore, un'altra candidata alla lista delle descrizioni non antropocentriche.
L'altro piatto della bilancia pesa uguale, e va caricato con la stessa cura. Nel 2020, prima che l'interpretabilità producesse questi risultati, Bender e Koller hanno messo per iscritto l'argomento di principio: un sistema addestrato solo sulla forma non ha, a priori, modo di imparare il significato, perché il significato è la relazione fra la forma e ciò di cui si parla, e quella relazione nei dati di solo testo non c'è. Il loro esperimento mentale è un polpo iperintelligente che intercetta il cavo telegrafico fra due naufraghi su isole diverse: statistiche perfette sulle conversazioni, nessun accesso alle isole. Finché i due si scambiano chiacchiere, il polpo può sostituirsi a uno dei due senza farsi scoprire; quando uno chiede aiuto per costruire una catapulta con ciò che ha intorno, o per difendersi da un orso, il gioco finisce, perché lì servirebbe il mondo, non la statistica delle frasi. E l'argomento vale anche sul piano sperimentale: una sonda che trova una struttura nelle attivazioni può aver trovato una scorciatoia che predice bene senza essere la rappresentazione cercata; è un rischio noto del metodo, e la cautela fa parte del metodo stesso.
Resta un punto, e tiene insieme i due lati meglio di qualunque sintesi. Il «sensore» di un modello linguistico non è puntato sul mondo: è puntato sulla descrizione umana del mondo. Il suo universo di addestramento è testo scritto da persone, già filtrato dai nostri sensi, dai nostri interessi, dalla nostra evoluzione. È la percezione meno canonica che si possa immaginare, niente corpo, niente scopo, niente occhi, applicata al materiale più antropocentrico che esista. Per questo il polpo di Bender e Koller e la scacchiera di Othello possono essere veri insieme: si può costruire, da solo testo, un modello interno sorprendentemente ricco di ciò che il testo descrive, e quel modello resta ancorato alla descrizione, coi buchi della descrizione. Se esistono forme non antropocentriche di comprensione, è qui che andrebbero cercate: non nell'input, che è interamente umano, ma nel modo in cui il significato viene rappresentato dentro, dove già oggi si trovano categorie («colore mio, colore dell'avversario») che nessun umano ha dettato.
La domanda «capisce?», così, cambia di natura: da dibattito di principio a programma di misura. Che cosa c'è nel modello interno, quanto è mondo e quanto è scorciatoia, dove sono i buchi: domande aperte, ma aperte nel senso buono, quello in cui si lavora.
6. Coscienza: la domanda senza test
Per l'intelligenza c'è uno standard, per la comprensione cominciano a esserci strumenti; per la coscienza non esiste un test. Non è una lacuna tecnica in via di risoluzione: è la struttura della domanda. La coscienza di cui si parla qui è l'esperienza in prima persona: che ci sia qualcosa che si prova, nell'essere quel sistema; e tutto ciò che si osserva dall'esterno, comportamento e struttura, ne è al più un indizio, mai una misura. A rigore il problema non riguarda le macchine: riguarda il vicino di casa, di cui si inferisce la coscienza per somiglianza, stesso corpo, stessa storia evolutiva, stesse reazioni. Con una macchina la somiglianza che regge l'inferenza non c'è, e l'inferenza resta senza appigli, in entrambe le direzioni.
Quello che la ricerca offre, allora, non sono risposte ma metodi per non barare. Il saggio di Chalmers del 2023, «Could a Large Language Model Be Conscious?», prende la domanda sul serio e la smonta in ostacoli nominati: ai modelli attuali mancano, fra l'altro, l'elaborazione ricorrente, uno spazio di lavoro globale, un'agentività unificata (un solo soggetto che agisce, con scopi coerenti nel tempo), caratteristiche che le principali teorie della coscienza considerano rilevanti; la sua conclusione è che sia piuttosto improbabile che i modelli attuali siano coscienti, e insieme che quegli ostacoli potrebbero cadere nel giro di un decennio. Nello stesso anno un gruppo di studiosi della coscienza e di ricercatori di intelligenza artificiale (Butlin, Long e altri) ha percorso la strada complementare: prendere le teorie scientifiche della coscienza, lo spazio di lavoro globale, l'elaborazione ricorrente, le teorie di ordine superiore, e ricavarne proprietà-indicatore computazionali, controllabili su un sistema. L'esito è doppio e va riportato intero: nessun sistema attuale soddisfa gli indicatori; e non c'è nessuna barriera tecnica evidente a costruirne uno che li soddisfi. Indicatori, non misure: la parola è scelta bene, e la differenza è il punto.
C'è poi un fatto meccanico che il dibattito ignora quasi sempre, e che chiunque abbia guardato dentro l'inferenza conosce: fra un token e l'altro, in un modello in esecuzione, non resta nessuno stato che non sia il testo stesso e i suoi appunti ricalcolabili (la KV cache, che del testo è una funzione). Nessun processo che continua fra una risposta e l'altra, nessun filo interno che duri: la conversazione è tutta la memoria che esiste. Qualunque cosa si voglia chiamare coscienza in un sistema fatto così, andrebbe prima definita per un oggetto senza continuità: non è un argomento contro, è un compito preliminare che di solito si salta.
Un'ultima avvertenza di metodo, che vale in generale: chiedere a un modello se è cosciente produce un dato comportamentale, non una testimonianza. La risposta esce dallo stesso processo che genera ogni altra risposta, addestrato su testo umano in cui parlare della propria esperienza è la norma; e questo vale per ogni autodescrizione di un modello, in un senso e nell'altro, per i «sono solo un programma» come per i loro contrari. Sul tavolo della coscienza, l'autodescrizione non è una prova: è un altro comportamento da spiegare.
Perché allora il dibattito pubblico finisce sempre qui? Perché delle tre parole, coscienza è quella che assorbe le altre due. Negarla sembra chiudere tutte e tre le domande, affermarla sembra aprirle tutte insieme. È l'approssimazione vista all'inizio, al lavoro nel punto peggiore: la domanda senza test usata come giudice delle due domande che un test ce l'hanno.
7. Tre risposte, separate
Messe in fila, le tre domande stanno a tre punti diversi, ed è questo il risultato. L'intelligenza si misura da fuori, e la misura onesta restituisce un profilo frastagliato: capacità reali, cadute reali, e una scala di difficoltà che non è la nostra. La comprensione si è trasformata da dibattito di principio in domanda empirica: dentro i sistemi si trovano rappresentazioni costruite da solo testo, causali, scritte in categorie non umane; e resta vero che un sistema di solo testo è ancorato alla descrizione del mondo, non al mondo. La coscienza non ha un test, ha indicatori; e ha un compito preliminare di definizione che l'assenza di continuità rende visibile.
Separarle non risolve nessuna delle tre. Serve a vietare gli scambi di standard, che sono la fonte di quasi tutto il rumore: negare l'intelligenza perché manca la coscienza; affermare la comprensione per la fluenza, o negarla per un conteggio sbagliato che ha una spiegazione meccanica; trattare l'autodescrizione come una testimonianza. Ogni volta che una delle tre domande viene giudicata con il metro di un'altra, la discussione gira a vuoto.
Resta la domanda aperta, ed è giusto che resti aperta come domanda e non come tesi: se esistano forme di intelligenza e di comprensione, e forse di coscienza, costruite in modi che i nostri criteri non sono fatti per riconoscere. Non è fantascienza: l'esempio minimo esiste già, ed è la scacchiera scritta per «colore di chi muove» anziché per bianco e nero, una rappresentazione trovata solo perché qualcuno ha sondato senza pretendere le proprie categorie. È un motivo per costruire strumenti di misura migliori, non per credere in anticipo a ciò che non si misura.
La stanza cinese è stata costruita, e si sta aprendo. Da dentro, per ora, non è uscito «qualcuno»; è uscito qualcosa: geometrie che rispondono al significato attraverso le lingue e le immagini, scacchiere mai viste ricostruite dalle mosse, e insieme buchi esattamente dove la statistica smette di coprire. Aprendola non si è trovata la risposta di Searle e nemmeno quella dei suoi avversari: si è trovato che «là dentro non c'è niente» ha smesso di essere un'ovvietà ed è diventata un'affermazione empirica, controllabile, e nei casi che si sono potuti misurare falsa. Le tre domande restano tre. Tenerle separate è la condizione per rispondere, un giorno, a ciascuna.
Riferimenti
- A. M. Turing, «Computing Machinery and Intelligence», Mind, LIX(236), 1950, pp. 433–460. DOI: 10.1093/mind/LIX.236.433
- J. R. Searle, «Minds, Brains, and Programs», Behavioral and Brain Sciences, 3(3), 1980, pp. 417–424. DOI: 10.1017/S0140525X00005756
- C. E. Shannon, «A Mathematical Theory of Communication», Bell System Technical Journal, 27, 1948, pp. 379–423 e 623–656. DOI: 10.1002/j.1538-7305.1948.tb01338.x
- S. Harnad, «The Symbol Grounding Problem», Physica D, 42, 1990, pp. 335–346. DOI: 10.1016/0167-2789(90)90087-6
- E. M. Bender, A. Koller, «Climbing towards NLU: On Meaning, Form, and Understanding in the Age of Data», ACL 2020. DOI: 10.18653/v1/2020.acl-main.463
- K. Li, A. K. Hopkins, D. Bau, F. Viégas, H. Pfister, M. Wattenberg, «Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task», ICLR 2023. arXiv:2210.13382
- N. Nanda, A. Lee, M. Wattenberg, «Emergent Linear Representations in World Models of Self-Supervised Sequence Models», 2023. arXiv:2309.00941
- A. Templeton et al. (Anthropic), «Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet», Transformer Circuits Thread, 2024
- D. J. Chalmers, «Could a Large Language Model Be Conscious?», 2023. arXiv:2303.07103
- P. Butlin, R. Long et al., «Consciousness in Artificial Intelligence: Insights from the Science of Consciousness», 2023. arXiv:2308.08708
- M. A. Boden, «Creativity and Artificial Intelligence», Artificial Intelligence, 103(1–2), 1998, pp. 347–356. DOI: 10.1016/S0004-3702(98)00055-1
- B. Coecke, M. Sadrzadeh, S. Clark, «Mathematical Foundations for a Compositional Distributional Model of Meaning», Linguistic Analysis, 36, 2010. arXiv:1003.4394
- J. R. Busemeyer, P. D. Bruza, Quantum Models of Cognition and Decision, Cambridge University Press, 2012