Post con tag #DwarfStar
-
Viaggio dentro la macchina che risponde: come si muovono i byte nell'inferenza
Che cosa succede, fisicamente, quando un modello linguistico risponde, e che cosa cambia se a rispondere è una macchina sola, in casa? Un percorso dentro i principi di funzionamento, dall'attention fino al mestiere dell'inferenza, con le sue due fasi, la sua organizzazione dei dati, le tecniche per farla costare meno, letto seguendo un filo: dove stanno i byte e quanto costa muoverli. Sullo sfondo un'idea: l'inferenza locale, come scelta e come possibilità, conta già oggi e conterà sempre di più. A tenerla concreta, un motore scritto in C che porta un modello da centinaia di miliardi di parametri a girare in locale: DwarfStar, con cui antirez mostra fin dove ci si può spingere, e che quella strada è percorribile.