Post con tag #LLM
-
Viaggio dentro la macchina che risponde: come si muovono i byte nell'inferenza
Che cosa succede, fisicamente, quando un modello linguistico risponde, e che cosa cambia se a rispondere è una macchina sola, in casa? Un percorso dentro i principi di funzionamento, dall'attention fino al mestiere dell'inferenza, con le sue due fasi, la sua organizzazione dei dati, le tecniche per farla costare meno, letto seguendo un filo: dove stanno i byte e quanto costa muoverli. Sullo sfondo un'idea: l'inferenza locale, come scelta e come possibilità, conta già oggi e conterà sempre di più. A tenerla concreta, un motore scritto in C che porta un modello da centinaia di miliardi di parametri a girare in locale: DwarfStar, con cui antirez mostra fin dove ci si può spingere, e che quella strada è percorribile.
-
Costo energetico di un modello linguistico
Da dove viene davvero il costo energetico di un modello linguistico quando risponde
-
…it may not exist or you may not have access to it…
Riflessioni sull'importanza dell'indipendenza tecnologica per i singoli stati, le singole organizzazioni e, perchè no, per i singoli individui