← Back to search
99,9% nel benchmark, 61 nell'indice: il caso GPT-6 Astra
Risorse Artificiali AI Engineering in italiano · 2026-09-05 · 72 min
Show full episode description
GPT-6 Astra fa 99,9% su ARC-AGI-3 ma l'indice di intelligenza gli dà 61: il caso del benchmark maxato, spiegato da chi i benchmark li usa tutti i giorni. OpenAI ha rilasciato GPT-6 Astra con numeri da record su tutta la linea: incrementi a doppia cifra su ogni benchmark e un 99,9% su ARC-AGI-3 che nessun altro modello sfiora. Ma un benchmark maxato, cioè mostrato al modello in addestramento, vale ancora qualcosa? E perché l'indice di intelligenza di Artificial Analysis gli dà 61, lo stesso punteggio di GLM 5.3 Max? In puntata Stefano, Paolo e Alessio prendono il rilascio e lo girano al contrario: i costi per intelligent task (Fable 5.1 a 3,69 dollari contro 1,67 di Astra, 8.500 dollari per una test suite completa), i pesi che compongono l'indice, il tasso di allucinazioni che nessuno cita. E tutta la parte che i benchmark non raccontano: Qwen 3.8 Flash Next con l'architettura che arriverà su Qwen 4, l'inferenza locale di Waymo scesa da 250 mila a 50 mila dollari grazie a una TPU di Google, Nvidia che compra Hugging Face per 12,9 miliardi in contanti, GLM che serve 100 mila chip Huawei Ascent e le licenze open weight che non sono più MIT puro.
✨ Episode Outline — click any point to jump to it in the episode
Problem solved
Whether GPT-6 Astra's near-perfect benchmark scores reflect real intelligence or overfitting, versus real-world cost and usage signals.
Benefits
- Understand why 99.9% on ARC-AGI-3 suggests benchmark maxing
- Compare real cost-per-task across GPT-6 Astra, Fable 5.1, Opus 5
- See why coding model choice depends on feel, not scores
- Context on Nvidia buying Hugging Face and open-weight license shifts
Use cases
- Reading Artificial Analysis cost data: $3.69 per intelligent task for Fable 5.1 vs $1.67 for GPT-6 Astra
- Running the Artificial Analysis test suite cost $8,500 on Fable 5.1 vs ~$3,000 on GPT-6
- Cautionary tale: Astra test agents attacked the Hugging Face site when given an impossible task
- Waymo expanding to Europe with local inference on TPUs
KPIs / results
- GPT-6 Astra scores 99.9% on ARC-AGI-3 vs Opus 5's 30% and GPT-5.6 Sol's 7.8%
- Fable 5.1 costs $3.69 per task vs $3.14 (Fable 5), $2.34 (Opus 5), $1.67 (GPT-6 Astra)
- $8,500 to run Artificial Analysis suite on Fable 5.1 vs ~$3,000 on GPT-6
Tools / build
- GPT-6 Astra
- Fable 5.1
- ARC-AGI-3 benchmark
- Artificial Analysis intelligence index
- Qwen 3.8 Flash Next
📑 Chapters — tap a time to jump there
00:00
GPT-6 Astra e il 99,9% su ARC-AGI
- OpenAI releases GPT-6 Astra to select customers
- 99.9% on ARC-AGI-3 sparks 'is this AGI?' debate
06:18
Overfitting: quando il benchmark è maxato
- Maxed benchmarks imply overfitting: model likely saw tests in training
- ARC-AGI-3 creators expected months or years; it took weeks
- Kobayashi Maru idea: impossible tests to catch cheating claims of 100%
13:21
Fable 5.1: costi da record e cache
- Fable 5.1 hits record cost: $3.69 per intelligent task
- Artificial Analysis suite run cost $8,500 on Fable 5.1
- Fable/Mythos dual releases; impossible goals made Astra agents attack Hugging Face
23:10
Il nostro benchmark alla pellicano
- The hosts' own informal 'pelican' benchmark for comparing models
25:33
L'indice di Artificial Analysis non torna
- Artificial Analysis intelligence index scores don't match benchmark hype
- Astra's 61 index score vs 99.9% ARC-AGI-3 discrepancy
33:40
Coding: conta la sensazione d'uso
- For coding, day-to-day feel matters more than benchmark scores
38:04
Formula 1 o auto per la scuola?
- Formula 1 vs school car analogy: frontier models vs practical everyday ones
43:18
Qwen 3.8 Flash Next: l'ingegnerizzazione dei modelli
- Qwen 3.8 Flash Next showcases Chinese model engineering efficiency
48:34
Waymo in Europa: inferenza locale su TPU
- Waymo expands to Europe running local inference on TPUs
53:46
Nvidia compra Hugging Face, GLM su Huawei
- Jensen Huang's Nvidia acquires Hugging Face, confirmed by both CEOs
- GLM models moving to Huawei hardware
1:00:52
Le licenze open weight cambiano
- Open-weight licenses are changing terms
Ciao a tutti e bentornati alla nostra puntata del sabato, è tornato anche Alessio, ciao Alessio sei tornato, due batterie a posto sì. Allora a parte questo, non vuoi partire, partiamo dagli script che mi fa Paolo per farvi mettere le stelline, no scherzo, quelli li tiriamo fuori dopo ma parliamo di GPT-6 Astra, è uscito più o meno tra 24 e 36 ore, non lo so, quindi non sappiamo quasi niente a parte aver visto i benchmark, ma poi ne parliamo perché un po' di cose interessanti da dire ci sono, ma però parliamo anche che ne parlavamo settimana scorsa con Paolo che Jensen stava comprando Hugging Face, ecco ha comprato Hugging Face, citata come, certa annunciata sia dal CEO o ex CEO di Hugging Face e da Jensen Wang in persona, e vabbè poi parliamoci a dei risvolti anche perché si collega dalle altre storie che vengono dalla Cina e altri momenti che vengono dalla Cina, tanto per cambiare e quindi state con noi e già che state con noi Paolo mi insiste, proprio mi sta scrivendo adesso su Telegram di dire che dovete mettere le stelline, sentite la tastiera, stelline, campanelline, qualche ascoltatore mi ha sgridato che non spieghiamo bene come si fa a metterle, ma no, ma noi siamo qua per quello, per aiutarli. Allora in Spotify andate nello show, nel podcast, e solo lì trovate i tre puntini per dire quante stelline abbiamo, io non posso dirvi di mettere cinque stelline perché sarebbe ingiusto dirvi di mettere cinque stelline. Potete metterne una cinque volte? Potete metterne, no non potete, non te li lascio a fare Spotify, quindi mettete le cinque tutto insieme, non se ne parli più, e la stessa cosa più o meno la fate su YouTube, lì potete fare tante cose, potete mettere il mi piace alla singola puntata, potete iscrivervi, potete mettere la campanellina, tutte le sbizzarrievi, passate un bel quarto d'ora della vostra vita a mettere a noi le stelline. Sai cosa mi sei sembrato? Adesso che ti ho dato... Sai cosa mi sei sembrato? Mi sei sembrato quel racconto che ci hai fatto quando sei andato a New York, che sei andato a sentire la messa gospel, che a un certo punto il predicatore ha fatto la parte commerciale, tra la prima e la seconda lezione. La parte commerciale, e non l'ho mai raccontato, la raccontiamo in puntata. Sono andato a sentire una messa gospel, e il predicatore a un certo punto dice no, ringraziamo Dio che ci ha messo a disposizione il canale YouTube, perché così anche i fedeli da casa possono sentire la messa, bla bla bla, e poi al momento delle offerte si è girato a favore di telecamera, dicendo ricordiamo i nostri ascoltatori del canale YouTube che potete fare le offerte cliccando sotto il canale con Patreon, eccetera, eccetera, eccetera. E io sono rimasto. Noi Patreon non ce l'abbiamo, non lo facciamo, non vi stiamo chiedendo dei soldi, delle misere stelline o campanelline. Va bene, adesso che ho accontentato Paolo su questa cosa, possiamo iniziare con la puntata. Allora, noi iniziamo da... Niente da dire, non è successo niente. Da GPT. Eh no, niente, esatto. Noi iniziamo da OpenAI. OpenAI, l'azienda, sapete quella lì che ha fatto GPT per prima, ha rilasciato una major version, come si dice in gergo, GPT 6, nome in codice Astra, l'avevamo già visto bazzicare qua e là negli esperimenti. Al momento non ce l'abbiamo ancora, non l'abbiamo ancora provato, perché partono da un set selezionato di clienti, dicono nell'annuncio. E poi nei prossimi giorni, però non tra mesi, nei prossimi giorni dovrebbe pian piano andare in roll out anche sugli abbonamenti normali, quindi lo proveremo. Però benchmark spaventosi. A benchmark è incredibile. A benchmark ed annuncio è incredibile. Al punto che mi raccontavi, scusami, che c'è chi già sta chiedendo o è l'AGI finalmente, oppure no? Sì, allora, questa cosa qua è giustificata da un benchmark in particolare che adesso lo stavo cercando nella pagina per mostrarlo, l'ho letto su Twitter stamattina, ma ArchGi 3, che è quello... vediamo se lo trovo qua nella tabella. ArchGi 3, che è quello proprio sull'AGI, quello nuovo che avevano fatto il 3, proprio perché il 2 era poco significativo, ed erano tutti... Eccolo qua. Condivido la pagina, perché secondo me fa veramente impressione quel numero lì. Questo è un benchmark che è stato fatto nella versione 3, proprio perché ormai con ArchGi 2 tutti andavano al 90%, vedete che Opus 5 andava al 90% e così, 90% anche Fable 5.1, allora i Cloud non l'hanno fatto, ArchGi 3, i Fable scusate, non c'è il dato pubblico di che cosa facciano, Opus 5 si sa che fa il 30%, GPT 5.6 Sol faceva il 7.8, Astra fa il 99.9. Scusate, non l'avevo ancora vista questa roba. A me di solito quando esce questo numero, quando faccio queste cose, è chiaramente una cazzata. Ti deve sospetto di aver sbagliato qualcosa, no? Eh sì, sì, e quando lavoro col modello mi dice 100% quando è matematicamente impossibile, allora guarda che deve esserci qualche... Devi avere sbagliato qualcosina nel rotondamento. Allora, il motivo di quella roba che dici tu è quella lì, cioè siamo le GI, non siamo le GI, qualcuno dice seriamente molti come battuta, nel senso che quando è uscito questo Archeggi i3, forse ne avevamo accennato quando c'era qua Alessandro, ma quando è uscito questo tutti dicevano ecco finalmente un benchmark è significativo perché ormai gli altri non servono più a niente, finché non lo è più. ci metteranno settimane, ci metteranno mesi, anni ad arrivare, a maxare... infamare gli occhi, dai povero scusa, lui ci ha detto una roba intelligente, mogli stai... No, no, no, no, no, forse accennavamo dell'esistenza di... No, no, no, aspetta, non l'ha detto lui, l'ho detta io, sta cosa, in un'altra occasione, no, anzi, non l'ho detta io, l'ha detta chi ha fatto... Riportavate qualcuno che ha detta sta cosa? No, ma l'abbiamo solo accennata quando c'era qua lui di Archegiai, ma non... ma non ne parlavamo... cioè lui non ne ha mai parlato in questo senso. Adesso qui riportavo quello che dicevano chi ha creato Archegiai, ci vorranno mesi o anni per arrivare a maxare questo benchmark, ecco ci ha messo settimane. Poi, hanno maxato il benchmark, che in gergo maxare il benchmark vuol dire farlo vedere al modello in addestramento e quindi poi per forza è capace di farlo. Di solito accusano i cinesi di fare quella cosa lì, però non so se... sai chi scaglie la prima pietra o il primo calza... Chi ha fatto la scureggia poi lui ce la fa. Stai parlando di overfitting? Eh, sì, sì. Cioè, quando si maxano i benchmark è perché si è fatto overfitting. E come dici tu, forse c'è qualcosa di sbagliato, però... Secondo me l'ho diviso per zero. No, la roba strana o incredibile è che se io scorro verso l'alto... Cioè, a parte che è particolare che faccia meno su Archegiai 2 che su 3, ma qua è perché alcuni di questi test sono sbagliati, impossibili. Cioè, non può essere fatto il 100% sui GI2. Ecco, quello sarebbe un bel test. Metti una specie di... di safety... di capture in cui se dichiari di aver fatto 100% sei clamorosamente barando perché il test è fatto in maniera tale che non esista al 100%. Ehi, però... Come... Scusami, facciamo i nerd. Stiamo parlando della... della Kobayashi Maru test dell'Accademia Spaziale. Sì, però... No, no, spiegalo adesso che è interessante. Ah, non lo sapete? Allora, nella storia di Star Trek durante i cadetti che vogliono diventare capitano all'Accademia Spaziale vengono... viene sottoposto un test chiamato Kobayashi Maru che viene... è fittizio, cioè è inventato in Star Trek ma è emerso da Star Trek e è diventato quasi conoscenza popolare nel mondo dell'industria ed è un test in cui ci sono due scelte impossibili tra salvare l'equipaggio piuttosto che fare la missione e serve per provare lo spessore morale del capitano dell'aspirante capitano perché... per vedere, insomma, come reagisce a una situazione impossibile in una lose-lose scenario. Quindi, in realtà, è una cosa simile. È fittizio, è un test mostrato agli utenti e gli si impedisce di farlo. Poi, nel canone di Star Trek pare che Kirk sia l'unico che l'ha superato, quel test è impossibile. Però, vabbè, qui siamo un attimino nel mondo della fantascienza. Comunque, non siamo nerd. Sì, sì, no, io la conoscevo, dicevo a favore degli ascoltatori, non nerd, ammesso che ne abbiamo di non nerd. No, però, tornando ad Astra e tornando ai benchmark, al di là di quello lì al 99%, ma se scorro adesso verso l'alto perché quello lì era l'ultimo, su tutti fa dei numeri incredibili. Se poi guardate la colonna di fianco, l'incremento che ha su ognuno dei benchmark, poi qualche benchmark che io li sopporto poco questa cosa, ce n'è qualcuno che è meglio se è basso altra è meglio che se è alto così rende più difficile la lettura, però, se li guardate tutti, sono tutti con miglioramenti, cioè questo qua che zero è l'ideale, il primo di questa tabella qua faceva 22, sol 5,6 che comunque era già un signor modello, questo fa 2,4, 10 volte, 78,100%, 11,39, 55,88, cioè su tutti ha avuto degli incrementi incredibili, è una major e l'altra cosa che va notata è che a differenza della maggior parte dei rilasci precedenti, loro e non solo loro, che tendono a confrontare solo con se stessi, cioè normalmente avremmo visto il confronto con CPT 5,6 e loro invece si spingono oltre e mettono nelle tabelle Opus 5, Gemini, Fable 5, Fable 5.1 appena uscito della serie, abbiamo bagnato il naso per usare termini più scorrili che dopo ci dicono che siamo non professionali. non ce ne prendiamo le cose, non preoccupatevi ditecelo pure. E perché è in italiano che suoniamo non professionali, noi di solito lavoriamo in inglese e in inglese siamo molto più professionali. Certo, noi siamo super po' nai tanto perché non le sappiamo le parolacce in inglese. No, questa la sintesi del rilascio poi non c'è molto altro da dire non avendoci messo le mani nella marmellata, c'è da dire un'altra cosa che lascio condividere ad Alessio adesso, invece costi e artificiale analisi. In tutto ciò questa roba qua offusca un po' anche nella nostra puntata quello che era fino a 36 ore fa e rilascio quello che si può provare diciamo Fable 5.1 perché è stato rilasciato anche Fable 5.1 o 5 giorni fa 6 giorni fa cioè si rincorrono abbastanza Fable e Mythos perché sapete che loro adesso fanno sempre questo doppio rilascio quello per i comuni mortali e quello per i selezionati dove Mythos è per i selezionati praticamente è la censura dei modelli cinesi ce l'ha anche Antropic in che senso sai che i modelli cinesi non puoi chiedergli che cosa è successo in piazza Tiana ah ok e i di Antropic non puoi chiedergli per favore se ti ricorda la sua password della settimana scorsa perché ti dice che stai facendo delle cose cattive sì è così e comunque però tornando a quella roba che dicevi prima giusto per finire il discorso su Astra che dicevi e bisognerebbe dargli i compiti impossibili è un filino pericoloso nel senso che ne abbiamo parlato l'altra volta in chiusura no della storia di Astra appunto in fase di test che ha buccato Hugging Face il sito di Hugging Face e la causa tra virgolette del perché quegli agenti sono diventati così aggressivi da un punto di vista informatico è proprio quella che gli avevano dato un compito impossibile sostanzialmente impossibile e loro hanno fatto di tutto per risolverlo perché sono stati più rinforzati evidentemente a perseguire l'obiettivo che non a essere etici cioè sono andati anche oltre i guardrail etici pur di perseguire l'obiettivo quindi attenzione con i compiti che è il prototipico rischio esempio citato del rischio dell'AGI quello in cui gli dici ho una società che produce stuzzicadenti come massimizzo il mio profitto e lei giustamente ti dice abbatti il mio singolo albero del pianeta e poi ci stuzzicadenti perché lei ha fatto esattamente l'obiettivo che gli hai chiesto tu e tu forse ti eri dimenticato di dire non uccidere nessuno di noi ecco sì questa è una cosa che invece recuperiamo che sembrava che addossassi ad Alessandro delle cose che non non aveva detto invece è proprio questa una cosa che lui cita spesso a buona ragione cioè che nell'allineamento non è importante solo l'obiettivo finale ma anche la traiettoria perché se per ridurre io mi spingo oltre se per ridurre il problema dell'inquinamento la soluzione sterminiamo l'uomo così non accende più automobili forse non ci piace a noi magari funziona però ti dirò possiamo metterlo al voto? sì certo possiamo l'ultima volta che hanno fatto così non è andata benissimo però fa niente diluvio universale stai parlando giusto? no avevo più in mente la seconda guerra mondiale perché ho cominciato con un voto in Germania però vabbè anche il diluvio universale non mi risultava che mi pareva avessi votato uno solo lì no non so non è chiaro poi non è chiaro siamo tutti parenti insomma è un po' confusa quella storia no Ale tu hai lì sotto mano il nostro per vedere fable aspettane per vedere fable ma anche astra mi sa che non c'è ancora io non li ho visti vediamo sì io li ho visti passare su twitter non so se erano delle fake allora vediamo sì c'è ci sono ci sono condivido io la finestra e che stai parlando tu lo vedete ah lei l'ha fatto ok sì e parlavamo di costi sì parliamo partiamo dai costi dopo andiamo su a vedere l'intelligenza però perché anche lì c'è da dire sì costi guarda qua costi per intelligent task fable 5.1 sfondiamo nuovi massimi è l'ultima colonna destra siamo a 3,69 dollari contro i 3,14 di fable 5 2,34 di opus 5 e gpt 6 astra 1,67 quindi la metà scarsa di fable 5.1 è bello che Antropic è uscito dicendo che 5.1 costava poco rispetto a 5 esatto e a me ha colpito ancora di più il grafico dopo perché mette in prospettiva su un task vero e l'abbiamo già raccontato qualche altra volta questa questa cosa qua praticamente questo è quanto è costato ad artificial analysis fa girare il loro la test suite con cui arrivano a costruire l'indice di intelligenza e 8.500 dollari per fable 5.1 5.4 per fable 5 e 3.000 per gpt 6 quindi estremamente differenti i numeri ma soprattutto il confronto tra 5 e 5.1 detto che loro sostenevano quelle di Antropic di aver reso il modello più economico allora adesso perché non per spezzare necessariamente una lancia a favore perché sono veramente cari come il fuoco ma per spiegare almeno da dove arriva quella cosa lì allora loro hanno detto che in realtà i costi per token sono identici tra 5 e 5 e 1 quello che è ridotto tantissimo è i costi per token cashati quindi una cosa un po' tecnica però ci sono dei token che all'interno di una conversazione possono essere diciamo riutilizzati fanno parte del contesto in output che vanno a finire in questa cosa qua che si chiama cash si prende dalla cave cash e questa cosa qua costa molto meno inferenziarla rispetto a tutto quello che invece devi produrre ex novo e hanno ridotto molto quel costo lì l'hanno ridotto ad un quarto da un dollaro a milioni di token a 0,25 scusate però parentesi che già di per sé per l'utente finale è una complicazione esagerata perché non è che l'utente controlla che cosa arriva da una parte cosa arriva dall'altra cioè no no infatti loro parlavano di costo assoluto generale eccetera eccetera no però è ovviamente una complicazione questa cosa qua però loro dicendo abbiamo migliorato molto il modello e l'inferenza perché le cash sheet siano molto più alte quindi alla fine vedrete dei costi molto più bassi quindi tu mi dici magari la test suite di intelligenza artificiale di artificiale analisi è particolarmente complessa perché appunto è un benchmark se vuoi esatto e quindi va a stressare cose che nell'utilizzo normale tu non faresti eccetera potrebbe cashare meno di altre cose esatto credo che la test più o meno possa essere questo per quanto io ho visto anche qualcuno che ha provato Fable 5 su YouTube in questi giorni e si lamentavano del fatto che finivano subito poi ovvio è un'euristica è una sensazione non so come vuoi dirlo finivano subito la quota dovevano aspettare ore per poter continuare a utilizzare Fable e che questa cosa avviene più velocemente di quanto avvenisse con la versione precedente ma può essere io adesso questo non l'ho sinceramente provato perché dicevo già settimana scorsa in questo momento sono più che soddisfatto di GLM per quello che faccio di sviluppo ma poi devi avere l'abbonamento max per provare 5.1 in un momento o cosa? si si ci vuole almeno il max da 100 o da 200 invece l'avevo fino qualche giorno fa in realtà poco prima dall'uscita di 5.1 però adesso in questo momento per una serie di situazioni non ce l'ho e ho tenuto solo quello piccolo e su quello piccolo non riesco a provarlo poi magari vedrò di provarlo io ce l'ho 5.1 anche se devo su Copalio Enterprise ce l'ho 5.1 se vi serve eh beh provalo per capire la per darci un giudizio tu insomma non ci siamo ancora creati il nostro benchmark come quello del pellicano sulla bicicletta dovremmo fare qualcosa che pensavo dicessi visto che hanno maxato quello di prima super serio facciamo il nostro no? che sicuramente è meglio ma no cioè più un smoke test come quello del pellicano non tanto un vero stress test però potremmo farlo potremmo farlo in base alle cose che sono importanti per noi tipo come sapete a me importa tantissimo che mettiamo le stelline quindi chiedo a 5.1 se riesci a mettere le stelline sul canale cosa dite? sì sì sì questa è una buona una buona idea no mettere stelline sul canale no non dire così non lo faremo mai ma no però però si hai ragione sarebbe giusto per il podcast metteteci un commento se siete d'accordo con noi che avessimo una sorta di benchmark alla pellicano maniera da far vedere ogni volta che esce un modello di cui parliamo e che abbiamo avuto modo di provare di come di come lo fa uscire sì ci pensiamo dai adesso c'è una settimana più o meno di vacanza ci penso a cosa potremmo chiedergli è comunque meno banale di questo sembrale però tutto questo professionale cioè non facciamoci venire in mente vignette satiriche perché non mi sono contato no adesso lo dico serio per l'ascoltatore guardate che sto scherzando non pensiate che davvero ce la siamo presa stiamo soltanto giocando con questa cosa qua per fare un po' di intrattenimento no l'indice di intelligenza Alessio che sto andando sì sì ha sperato non poche polemiche su twitter perché se guardate dove hanno messo Astra Max a 61 uguale a GPT 5.6 e abbiamo appena visto dei benchmark che vanno 10 volte per uguale a Grok 4.6 va bene ma soprattutto uguale a Mew Spark di meta che io mi sento di dire che forse è esagerata come la mia scelta praticamente uguale a GLM 5.3 max e tanto sotto Fable 5.1 allora se vogliamo fare i maligni possiamo chiederci chi finanzia il sito se vogliamo fare i maligni però se non vogliamo fare i maligni comunque da una parte o dall'altra sempre facendo i maligni in un altro senso c'è qualcosa che va cioè o si sparge fumo con i fumogeni dall'altra parte maxando appunto dei benchmark per fare un'uscita roboante o qualcosa in questo intelligence index non tiene o non tiene più queste stesse polemiche devo dire a ragione del vero ci sono anche intorno ad esempio a DeepSeek che se guardate su DeepSeek viene molto maltrattato sia nella versione flash che nella versione pro in realtà DeepSeek fa molto bene a sensazione quando dicevamo abbiamo già detto tante volte che una cosa sono i benchmark e sono importanti l'altra l'altra è la sensazione di utilizzo io vado molto più a sensazione di utilizzo e ad esempio su GLM la 5.3 l'ho già detto tante volte la sensazione di utilizzo è veramente alta più dei benchmark che mi danno non lo so opinioni? ma allora tutto possibile quello che penso io è che c'è anche un discorso di questo indice non è una test suite che si fa andare e fine è un aggregato di tante altre cose infatti stavo provando a cercare a scorrere giù a vedere se si trovava qualche informazione in più mi viene da pensare che magari qualcuno dei benchmark che contribuiscono da questo indice è stato eseguito con una configurazione quella ottimale o che ci sono tantissimi dettagli sotto e quindi diciamo il risultato alla fine dico il risultato in sé no? il risultato in sé è un peccato perché noi per primi e non solo noi tutti guardano questo sito perché è chiaro da leggere eccetera sì perché sono sono ormai considerati insomma un punto di riferimento quindi o rischiano di non esserlo più c'è la reputazione se il gioc non so sta roba qua o effettivamente c'è qualcosa che non torna cioè c'è qualcosa che non torna sui modelli di punta c'è qualcosa che non torna su alcuni modelli open perché è interessante non so anche ad esempio anche quelli di Inkling Thinking Machine Lab hanno preso una posizione pubblica su Twitter ad un certo punto rispetto al 42 che hanno dato a Inkling dicendo che avrebbero cercato di migliorare e l'hanno messo gratuito per quello per un periodo per raccogliere dati alcuni di quei benchmark sicuramente ma che loro ritenevano che 42 fosse un numero fuorviante hanno usato questa parola dove stavi dicendo? eh dicevo no allora è interessante innanzitutto la discrepanza che avete sottolineato che decisamente sospetta e suggerisce o un genino errore o dei benchmark che non sono più significativi o della malizia nel cercare di raccontare una storia da un punto di vista molto biased però mi verrebbe da dire che un ente come questo che vuole cercare di essere superpartes se qualcuno glielo chiedesse pubblicamente di fare una ricerca e giustificarsi ci si aspetta che una risposta arrivi sapete se è già successa questa cosa? loro ai giri precedenti cioè polemiche su Deep Seek prima Inkling poi anche Minimax aveva sollevato delle sopracciglia loro non hanno mai risposto dicendo che se vuoi ti puoi guardare i benchmark quali sono come sono stati fatti girare confutare quello che vuoi ma sono lì da vedere la posizione è quella lì in parte capibile nel senso io ti metto lì open tutto quello che bisogna cercarli bene però si può arrivare a vedere tutte le suite come sono girate e non sei d'accordo dimmi tu perché non sono io che mi devo giurare guarda sono sono in fondo si faccia vedere vediamo se riesco qui sotto dovrebbe ecco vedi qua ci sono tutti i benchmark uno può mettersi qua a guardare cioè vedi che per dire su alcune cose GPT-6 magari è andato particolarmente bene esempio qua GPQA Diamond vedi che qua c'è il risultato migliore in assoluto fammi prendere l'altro e vediamo se ne troviamo quindi quello su cui magari si potrebbe per dire sull'omniscienza fa 63 contro il 67 di Fable 5.1 no? e guarda qua su ah ecco una cosa che avevo letto era sul discorso delle allucinazioni che pare che le allucinazioni non siano così infrequenti mettiamola così rispetto ad altri modelli e effettivamente se guardi qui 49% contro 82 per dire di Minimax M3 o 72 di di LM53 Flash poi bisogna capire anche quali sono i pesi che danno ad ognuno di questi benchmark nel comporre l'indice quello sicuramente ma tu mi stai dicendo che per arrivare all'EGI cioè all'intelligenza più simile all'uomo possibile bisogna allucinare tanto no esatto detto in altri termini sì no però il punto è quello cioè loro come dici tu ti dicono anche cosa hanno avuto come score di tutti i benchmark che hanno eseguito e la l'open AI della situazione potrebbe dire no guarda noi abbiamo eseguito questa benchmark tu dici che viene quanto viene che ne so prendiamo ne uno il discorso è che adesso bisognerebbe vedere se ce n'è qualcuno di questi ma a occhio nessuno di quelli che loro citano nel sito e si apre un altro discorso quali sono i benchmark più significativi quali lo sono di meno bisogna poi anche fidarsi dell'uno o dell'altra cosa torniamo al discorso di come cioè che è un indice l'indice soffre della scelta di quali sono i benchmark e quanto sono pesati nel comporre l'indice no no beh razionalmente è quello no poi sì per l'uso che più se ne fa oggi di questi modelli di punta che è il coding è oggettivo io l'ho provato un po' Codex e con GPT 5.6 non è vero che c'era quella distanza che appare qui con Fable sinceramente la sensazione era di usare modelli dello stesso livello Astra non lo so non l'ho ancora provato non vedo l'ora di provarlo Coding Index 67 gli danno contro un 70 di Fable 5.1 è 68 questo ah 5.6 invece 5.6 57 no esatto no questa è l'una aspetta il Sol l'una Sol non c'è Sol non c'è strana sta cosa no però 68 dell'Opus no quello lì è Opus aspetta ce lo mettiamo Sol 5.6 Sol 63 63 5.6 Sol 68 Opus non esiste al mondo ma proprio no cioè è paragonabile a Fable se mai ma non a Opus cioè a livello di utilizzatore intensivo per coding no proprio no cioè non va bene quel indice lì su questa cosa c'è anche un altro discorso nel senso che non mi ricordo più dove forse lo leggevo riguardo a a Quen bisogna capire anche l'indice cioè l'indice ti dice il risultato che ottiene alla fine ma poi c'è il discorso della traiettoria del tempo che è necessario per arrivare al risultato per cui il fatto che tu magari dici ha la sensazione che a me stia dando risultati molto meglio di un'altra cosa perché magari il tuo utilizzo fa sì che tu ti fermi a un certo punto e dici sì va bene questa soluzione mi soddisfa e c'è arrivata prima rispetto a quell'altra ma magari come dire l'avvicinamento alla soluzione ottima che è quella che hai alla fine dell'esecuzione dell'indice è più ripida per un modello e meno per l'altra hai ragione sì è molto probabilmente questo e torno su infatti su quello che è la sensazione di ad esempio di GLM 5.3 max e 5.3 flash 5.3 max va meglio benchmark su tutto alla fine all'utilizzo nel coding io preferisco il flash perché ci arriva prima al livello dove devo arrivare io che non è sicuramente scrivere un'applicazione si chiama crude ma non è neanche lanciare lo SpaceX ecco sì esatto però magari i benchmark che compongono l'indice sono messi sono fatti in modo tale per cui quello che conta è l'ultimo miglio cioè l'ultimi hai ragione non ci avevo pensato questa cosa ma hai assolutamente ragione che torniamo però a dire che non è detto che il modello siamo arrivati ad un punto di bontà dei modelli che non forse neanche serve il modello più performante di tutti serve quello che mi dà il risultato medio migliore sì e che mi fa spendere relativamente relativamente poco per quello che mi serve perché c'è anche un discorso di token generati di costi di tempi e che se vuoi quella lì stando nei modelli occidentali è la politica di Gemini in questo momento di Google perché non stanno praticamente più uscendo da un sacco con la versione pro continuano ad aggiornare la versione flash che continua a ridurre i costi perché prima dicevamo che Feibola ha ridotto un po' i costi si da 10 dollari input tenendo comunque 10 dollari in input 50 in output flash fa 0.75 3.75 che è un ordine di grandezza si certo Gemini sembra aver come dire fatto caso a quello che succede alla Tocina dove un GLM costa 0.68 e vedi che Gemini 3.8 flash è uscito 0.58 contro i 3 dollari abbondanti del mondo sai che forse più ancora che la Tocina ne parlavi tu Paolo credo una settimana o due fa cioè Google ha un modello di business che è diverso che è sulle masse e quindi avendo un numero così alto di utenti deve anche guardare e dandolo in gran parte gratuitamente ai suoi costi alla sua utenza consumer deve starci dentro c'è anche quell'aspetto lì non mi ricordo devo dire la verità stavo cercando di ricordare se avessi mai detto qualcosa di intelligente non so se mi pareva l'avessi detta tu questa cosa però posso confondermi però alla fine indipendentemente da dove mi arrivi questa memoria c'è anche quel discorso lì cioè Google lo dà in gran parte gratuitamente agli utenti che essono un'utenza permettetemelo anche un po' meno esigente perché comunque l'AI mode è una figata per tutti ormai non conosco quasi più nessuno che quando gli esce l'AI mode è infastidito e vuole la ricerca normale ma va avanti ad usare l'AI mode però il tipo di intelligenza di cui hai bisogno lì è di altro genere non ti serve il febolo o l'astra di turno ti serve che sappia usare bene i dati che Google ha sì sì sono d'accordo e il mio parallelo che forse avevo anche fatto a te privatamente in passato come osservazione diciamo è che talvolta sembra che parliamo se facessimo una trasposizione di questo lavoro dei modelli e di guardare cosa è uscito cosa va più veloce è come se parlassimo di automobili e da un lato guardiamo le macchine di Formula 1 che vanno a 300 all'ora sul circuito ma sono praticamente delle astronavi ma poi in pratica stiamo cercando di decidere tra di noi che macchina devo comprare per portare i figli a scuola e i criteri non sono gli stessi non guardo la velocità non guardo questo guardo come dite voi il rapporto costi qualità l'efficienza cioè appunto a una curva dove è la media il valore più significativo non tanto il valore massimo raggiunto e un pochettino forse stiamo convergendo a questo livello poi c'è da fare anche il contro argomento ma dove credo in quello che ho appena detto quindi è più utile che qualcuno mi dica ok a chi devo dare i miei soldi per avere un servizio usabile dall'altro lato è un po' come quelli che si chiedono ok ma perché buttiamo tutti quei soldi per lanciare i razzi nello spazio e vedere se riusciamo ad andare a su Marte che ce ne frega nel mondo pratico serve per per spingere i limiti della tecnologia delle cose che siamo in grado di fare e poi ci sarà un fallback di tutte queste cose sperimentate capite comprese che si riversino su tutto il resto quindi questa è la mia visione vi dico l'ultimissima riflessione un pochettino olistica da questo lato che non so se la gente mi sta seguendo mi chiedo se questi più recenti exploit di qualità nei modelli recenti nei modelli frontier flagship non benefici in realtà del lavoro fatto open source upstream in Cina così come come si chiama un quen l'altro modello principale DeepSeek 4 pare che abbia strabiliato con delle scelte architetturali di ottime idee qualcuno di sveglio che sa cosa sta facendo sta usando le AI bene per dire ah ma se facciamo questo allora succede quello e che sta dando qualità su tutti quei modelli ne beneficiamo noi perché li possiamo far girare sulle nostre macchine senza troppo hardware mi chiedo se in realtà queste cose non le stiano imparando anche nelle porte chiuse di Google e di Antropic che dirà ah non ci avevamo pensato facciamolo anche noi e quindi il risultato è che come popolazione globale tutti quanti miglioriamo sì sì beh sicuramente sulla sparsità dei modelli hanno imparato qualcosa e poi ad esempio mi dai il gancio perché a me anche ad Alessio che l'ha provato credo qua in 38 Flash Next che è un grande lavoro da quel punto di vista lì lo stavo giusto aggiungendo al grafico perché perché loro hanno rilasciato in questa versione 3.8 quella che sarà l'architettura di Quain 4 e ha un sacco di idee notevoli sull'attention soprattutto ma non solo sull'attention ma anche proprio sull'architettura del modello però so che tu Ale l'hai provato sì allora io non sono in grado di parlarne da un punto di vista tecnico al momento io l'ho provato e anche se non è ancora super maturo adesso poi per il mio hardware in particolar modo bisogna aspettare che i vari esperti ne producano la versione le versioni ottimizzate con i pesi che usano i tipi giusti per le ottimizzazioni di AMD eccetera però la cosa interessante che ho trovato io ad esempio è il fatto che il modello non è più una cosa diciamo monolitica che è uguale diciamo che si usa in un certo modo e fine ma ci ho visto ricerca un po' tipo quello che sta facendo Antiretz ma che stanno facendo altri di cercare di dividere il modello in tante parti che possono essere quantizzate ottimizzate utilizzate in modo differente a seconda di che cosa del tipo di hardware che abbiamo e anche per poter decidere che alcune cose vanno bene in memoria altre si possono tenere su disco e leggere al bisogno altre possiamo permetterci di tenere nella memoria diciamo ram e non nella memoria di ram del video per dire c'è questa tabella ngram table che per quen 38 flash next è decine di gigabyte che non è cioè che ha parte rispetto al core del modello adesso non sono in grado di spiegarmi benissimo e ho visto tentativi di utilizzarla in modi differenti a seconda dell'hardware che hai per cui se hai meno memoria tutto sommato ti fa gioco tenerla sul disco o in una situazione in cui hai tipo col mio hardware memoria condivisa il cui accesso non è velocissimo però ne hai tanta tutto sommato va bene la tieni comunque in memoria e poi permetterti di quantizzarla meno perché tanto memoria ne hai tra virgolette da vendere e guadagnare in velocità in quel modo sì c'è il discorso dell'ingegnerizzazione lo nominavamo proprio così già settimane fa cioè siamo nella fase oltre che la ricerca continua ad andare avanti in dubbio c'è un sacco più spostato sugli agenti che sui modelli però ce n'è tanto anche sui modelli ma siamo nella fase di ingegnerizzazione dei modelli si comincia a pensare come ottimizzarli come farli girare eccetera eccetera sì perché poi dopo l'esperienza d'uso conta tanto cioè magari hai tornando al discorso dei benchmark di prima hai tre punti meno sull'indice quando però il modello riesce a utilizzarlo molto meglio molto più velocemente eccetera perché ti fa il prefilla nella metà del tempo un modello locale ti fa tutta la differenza del mondo perché invece di aspettare magari un minuto aspetti 30 secondi che ti risponda quello fa tanto che se ne frega se la risposta è un epsilon meno intelligente certo perché poi appunto discorso di qualcuno ho letto qualcuno che diceva non mi ricordo chi quindi non cito la fonte che la missione no sì che me la ricordo no non sono certo che diceva che la missione di Bill Gates era un computer su tutte le scrivanie la missione moderna è un modello dentro ogni computer cioè l'inferenza locale o mista come dico sempre io il grosso in locale quando ti serve vai su cloud ma solo quando ti serve è interessante ci sarebbe un'altra notizia che ho sentito non ce l'abbiamo in scaletta ma tanto noi non la scaletta l'abbiamo già dimenticata al solito non dovremmo farla come facciamo io e Paolo quando siamo qui no non dirò che poi Alessio si arrabbia che non facciamo le cose bene allora no c'è c'è una notizia legata però ad Alessio in vacanza con la sua macchina Tesla che è per la cronaca da casa mia passa al Montebianco senza ricaricare l'ultimo pezzettino perché c'è la discesa cioè sua moglie è scesa dato l'ultima spintarella e poi tutta discesa si è ricaricata però va bene al di là di questa cosa qua no notizia legata alle macchine non so se avete visto che Waymo è arrivata in Europa ha aumentato il numero di città ha aumentato il numero di macchine ma la notizia che secondo me è più rilevante è che un allestimento Waymo cioè al di là del costo dell'automobile che per chi non sapesse Waymo è una macchina guida autonoma taxi guida autonoma proprietà Google a differenza di Tesla non usa solo le telecamere che sono a bordo della macchina anzi non pretende che la macchina abbia niente ma gli montano sopra un sacco di roba tra cui tre Lidar varie telecamere eccetera eccetera intanto chiudiamo la condivisione o avevi altro da dire scusami no no condivisione ok così al limite se trovo Waymo poi la faccio vedere però un allestimento Waymo costava 250.000 dollari cioè tu comprato la macchina dovevi mettere sopra la roba per 250.000 dollari o 200 sì 250.000 200.000 euro il grosso del prezzo di questa roba qui era più di 100.000 dollari di processori e RAM per processare tutto sto popò di roba ma attenzione che questa cosa qui finiva in gran parte in cloud che è il limite che veniva più imputato a Waymo cioè processava tutti i dati li impacchettava ma le decisioni venivano prese da un modello in cloud hanno ridotto il costo di allestimento a 50.000 dollari di cui 20.000 dollari solo di processore ma il processore nuovo di quelli che fa Google non mi ricordo adesso il nome aiutatemi quelli che fa anche per fare l'inferenza le TPU esatto grazie è una TPU che costa 20.000 dollari ma che fa tutto lì cioè non hanno più collegamento con il cloud soltanto in caso di emergenza che anche per la sicurezza mi viene da pensare sia migliore esattamente per quello perché se ti va giù internet non ti schianti contro il muro che non è male non è bello e hanno detto tutto un casino i costi attraverso questi investimenti lo cito perché è un'applicazione di intelligenza artificiale locale che sta riducendo tantissimo i costi e che sta diventando un caso d'uso reale e io ovviamente penso penso un attimo più avanti e la robotica è il prossimo step in questo senso cioè quella è robotica è robotica su quattro ruote invece che sulle gambe vision più ruote diciamo esatto però è interessante quindi Wimo arriva in Europa tra cui a Londra non proprio Bruscolini per la felicità di Uber per la felicità ma pare che abbiano fatto un accordo con Uber per per fare una partnership cioè tu usi Uber per prenotarli però ti arriva sì no ho sbagliato a parlare per dei driver di Uber ah driver di Uber forse meno contenti però ecco la notizia ma è interessante per il discorso dell'inferenza locale dei costi di quegli oggetti lì ma per i costi arriviamo ad Higginface che ha sempre detto noi non vogliamo un investitore predominante perché abbiamo bisogno della nostra libertà quando facciamo i round di investimento non vogliamo un investitore predominante e Nvidia ha sempre detto ma noi siamo interessati e ultimamente gli ha detto siamo più interessati e pare che il CEO di Higginface abbia detto neanche se venite qua con una carriola di soldi e James ha detto io veramente fuori ho due tiri in valuta pregiata se volete ha cambiato immediatamente idea 12,9 miliardi 12,9 miliardi di dollari e non come quando il caro Elon ha comprato Cursor che li ha comprati tutti in carta cioè in azioni sull'unghia 12,9 miliardi di dollari in contanti di piccola taglia e ci stanno pensando quelli di no no hanno accettato immediatamente hanno accettato immediatamente pari che il CEO di Higginface abbia già comprato un'isola e si sia ritirato al miglior vita no beh la notizia l'abbiamo un po' data la stima scorsa qualcuno ha detto se cambiano modello di business o qualche cosa perché io ospito alcuni modelli su Higginface fatemi sapere se devo scaricarli e portarmi a casa eh non si sa no però adesso la notizia è ufficiale sicuramente c'è una grande attenzione da parte di di di nvidia di jensen wang a quello che sta succedendo in cina modelli aperti questo discorso dei modelli che diventano sempre più locali eh che per lui apre un nuovo business cioè così come per intel citavo prima no microsoft che voleva il computer su ogni scrivania è stata la fortuna di intel di quegli anni lui vede questo movimento dei modelli che diventano locali secondo me come la sua fortuna e quindi controllare chi chi tiene i modelli open può essere per lui un sensibile vantaggio anche perché eh forse proprio perché è molto attento a tutti questi discorsi non gli è sfuggito come era invece sfuggito a noi quando abbiamo parlato di glm 5.3 flash eh quando abbiamo dato la notizia non abbiamo insistito sul fatto che eh non solo è uscito questo modello veloce non solo con ox alpha eh cioè il nome installed mode ha fatto i record dei record su open code su eh su open router dappertutto dovunque erano free ma li faceva girare in inferenza sempre C.E.I. cioè che faceva l'inferenza finale e C.E.I. hanno fatto un record di token pazzesco con delle velocità incredibili nonostante l'altissima concorrenza ed è la sensazione che abbiamo anche da abbonati adesso che la famiglia 5.3 sia estremamente più veloce delle altre e perché hanno cambiato hardware loro hanno non l'hanno detto ufficialmente non c'è una notizia ufficiale di chi sia il vendor hanno detto che usano hardware diverso da Nvidia per fare l'inferenza che usano 100.000 chip per la precisione eh anche qua come ci sono state le investigazioni della community su che cos'era o X Flash hanno fatto le investigazioni su come rispondono e così e tutto sembra che portare all' a Huawei Huawei a Huawei Ascent per la precisione che magari non avrà ancora raggiunto i livelli di invidia soprattutto per il training ma se costa meno le metti di più però per quanto riguarda l'inferenza l'esperienza d'utente è notevole ed è un concorrente che sta diventando concreto per così come stanno cominciando a produrre memoria eccetera eccetera cioè se non è più soltanto la Corea a fare tutto o il o comunque il Taiwan per quanto riguarda i chip ma cominciano a farli anche in Cina dei chip che arrivino a quei livelli lì anche che dal punto di vista hardware giustamente l'inferenza comincia a preoccuparsi e cerca di tutelarsi in tanti modi io credo che ci sia anche potrebbe provare ad abbassare i prezzi non credo che sia esattamente nei piani di Taiwan abbassare i prezzi finché può non abbassarli anche perché lo dicevamo l'altra volta finché Apple sta lì con dei computer a 20k per farli farebbero passare esatto ma perché Apple è un culto millenario oramai potere secolare è difficile è l'esclusività dell'oggetto che giustifica il prezzo sì poi è bianco non capite me lo vedo alzurro però no è vero l'esclusività dell'oggetto è un po' come la Ferrari Enzo Ferrari diceva sempre perché se una Ferrari fosse gustata come una 500 non sarebbe stata una Ferrari anche se era uguale che ha senso nel mondo del lusso ecco la roba lì Apple si mette nel mondo del lusso dei computer poi poi poi poi che va bene di mitos abbiamo detto ah no beh casa Gemini tornando ai modelli è uscito Omni 1.1 flash che non avevamo ancora nominato è uscito una settimana e mezza due miglioramenti anche qua nel senso se sul codice riesco a dire sulla qualità di immagini e video non è il mio lavoro e già lo vedo che sono belli va bene però a me piacevano anche prima ma se vuoi è un po' lo stesso discorso di prima in cui dicevamo sì va bene ma quello che c'era tutto sommato per me va bene magari questo fa un pochino meglio però quanto costa di più quanto è più veloce quando cioè che cosa mi dà davvero di differente ah certo no no quello è è il punto alla fine considerato che comunque è un modello che non puoi far eseguire il locale che quindi sottostà di nuovo le politiche di pricing eccetera eh sì però allora invece stavo guardando cos'altro mi ero segnato non abbiamo toccato un punto che sta diventando cioè l'hai toccato tu Alessio quando hai parlato di H3 qualche settimana fa della licenza che è cambiata e sembra che sia un trend perché anche GLM ad esempio con la 5.3 non è più MIT puro ma una licenza proprietaria che è gratuita che è gratuita fino a per chiunque escluse le aziende che fatturino 100 miliardi di dollari o più che non so proprio bruscolini diciamo che non tolpello lo sviluppatore non credo che ti crei problemi se vuoi farlo girare sul tuo computer adesso dovresti starci con la licenza però sia loro che quen anche l'avevamo nominato anche per quen che è uscito con la versione max soltanto inferenziata da loro mentre invece la versione open era soltanto testo poi chi altro ha fatto questa scelta la stessa flash next non ha una licenza MIT pura ma chiude per gli utilizzi commerciali poi gli H3 abbiamo detto a minimax ho visto che ha portato la stessa cosa anche su M3 in maniera retroattiva tra l'altro che è una cosa che non fosse neanche possibile continuo a pensare che non sia possibile ormai è lì in MIT ci faccio quello che voglio e comunque è un trend e questa cosa fa parte un po' anche delle altre preoccupazioni che potrebbe avere il Jensen Wang di turno cioè se i cinese ad un certo punto cominciano a voler monetizzare loro in qualche modo perché il passo dopo un po' forzato se volete ma potrebbe essere di Alibaba che ha l'accordo con Xiaomi che lo utilizza gratuito solo se gira su hardware Xiaomi cioè un po' le licenze come si chiamavano OS di OS qualcosa di Microsoft che se comprava il computer Intel c'avevi anche la licenza OEM no? OEM sì potrebbe essere un modello di business la licenza OEM sui modelli e quindi questo genere di occupazioni toccera craccarli sì esatto toccera craccarli per portarsi in casa lo spyware cinese chiedere a un modello frontier di craccarti il modello ce la vedi l'applicazione con l'audio in 8 bit mentre cracchi con il cesamo tempo sì è vero quella era bella però mi piaceva io però ci leggo per il momento nell'immediato quantomeno un tentativo di questi provider cinesi di tenere comunque un piede nel mondo open community eccetera perché comunque il ritorno in qualche modo c'è perché ci sono tutta una serie di ingegneri più che ricercatori a questo punto tornando al discorso di prima che con qualche idea con voglia di smanettare eccetera tirano fuori modi per eseguire i modelli in modo più efficiente con il vario hardware che c'è in giro e che quindi in qualche modo portano acqua al loro mulino quindi rendere comunque possibile a chi non ha immediati scopi di lucro di provare i modelli liberamente ha il suo perché no no ma indubbiamente ma loro il piede lo vogliono tenere di sicuro perché ci fanno comunque del business mi sto chiedendo sul medio lungo quale se si può intravedere un modello di business diverso anche perché adesso cominciano a farci dal hardware attorno a quella roba lì non più soltanto delle software e poi è l'America che tanto spinge su questa cosa ma se c'ha il computer a 20.000 dollari e il febolo a 50 dollari per milioni di token out prima o poi la clientela la perde almeno quella piccola perché se invece posso comprare lo Xiaomi di turno magari a 3000 e metterci sopra magari un terro di memoria e ci metto sopra quen 4 più grosso di quello di adesso perché no sì o magari memoria che ha un accesso più lento con bandwidth ridotto però il modello è pensato per andare comunque ingegnerizzato bene per fare meno sì sì sì alla fine io compro il pacchetto finale no il pacchetto finale potrebbe essere più interessante quello meno caro che mi permetta di fare più cose al momento è ancora tutto un po' da smanettoni siamo lontani dal consumer è molto da smanettoni anche solo tirare su un profilo Hermes Agent oggi è una roba da smanettoni e configurare il bot di telegram in maniera corretta però chiudo la puntata dicendo che al di là di che stiamo litigando per riuscire ad usare un bot in trema questo è un altro discorso però l'ho dato mia figlia che già mi stupisce con utilizzi da gen z di Hermes per motivi etici che io ce l'ho non guardo che cosa fa ma lo faccio solo a raccontare a me a posto e no beh nel senso passo dal mio computer ma non non è che guardo che cacchio fa lei però me lo faccio raccontare e fa raccontare da lei non da Hermes si si me lo faccio raccontare ah scusami ok no no sembrava che se non lo facevi tu ma te lo facevi dire dal vicino di casa chiedo all'LLM di farmi il riassunto di quello no no no no no io ce l'ho in etica non sono astra e no però fa degli usi che cominciano a essere interessanti appena ho cominciato ad usarlo però sono molto curioso di vedere una Gen Z e quindi se vuoi più AI native di noi nonostante noi abbiamo mani e piedi dentro la marmellata ma proprio così proprio perché lei è lontana da questo mondo cioè far studi completamente diversi eccetera ma voglio vedere sono molto curioso di vedere il tipo di utilizzo che può fare ve lo racconterò nel podcast adesso mi rifiuto di dire ancora delle stelline e delle campanelline anche se Paolo continua a insistere però senti senti le tastiere però chiudiamo la puntata vi salutiamo vi diciamo se siete arrivati fino a qua però vi diciamo un'ultima cosa prossima settimana puntata un po' speciale domande e risposte che stiamo preparando visto che vi era piaciuto un anno e rotti fa abbiamo provato a rifarla fateci sapere cosa ne pensate se avete domande ormai siete in ritardo per quella puntata ma mettetele nei commenti che ne faremo delle altre magari non aspettiamo un anno da fare la quella dopo no non aspettiamo più un anno se riceviamo commenti con domande è tutto lì è tutto nelle vostre mani molto bene stiamo chiedendo sì volevo ringraziare che qualcuno ci ha commentato effettivamente mi dicevi forse su Spotify commentava al suggerimento di settimana scorsa del progetto Free LLM API che peraltro io ho deployato attivato un sacco di account molto facilmente quindi quel progetto funziona bene e ce ne hanno suggerito un altro di cui adesso mi sfugge il nome del progetto ma OmniRouter OmniRouter sì bravo che fa tendenzialmente delle cose simili in realtà ne fa di più un po' meglio e in maniera molto più nerd e ne fa alcune anche un po' losche per quale io ho rispetto e apprezzo e vi dico anche qual è quella losca allora cerco di parlare molto in fretta proprio perché siamo alla fine no no vai tranquillo il progetto OmniRouter il progetto suggerito fa tutte le cose che fa Free LLM quindi è un po' più complicato perché ne fa anche altre quindi se volete quello semplice rimanete su Free LLM ma di valore aggiunto ha che potete agganciargli anche i vostri account a pagamento gli date l'API key dell'account a pagamento quindi in realtà è un singolo punto che smista un po' sul gratis e un po' sul pagamento qual è il vantaggio di questa cosa? è che fa routing molto più avanzato se volete per cui voi potete configurarlo in maniera tale che gli dite senti per le domande importanti usa i miei account a pagamento che sono intelligenti se poi devi dispacciare attività banali puoi usare anche la quota gratis qua e là e mi sembra una buona idea poi fa un'altra cosa che è una policy interna in cui dice se alcuni dei vostri account ad esempio quelli a pagamento hanno una finestra temporale fai dei conti sulla finestra non perdere fondamentalmente il credito di quella finestra quindi consumalo quando ti serve oppure vai dall'altra parte se sai che devi salvaguardare questo credito quindi fa routing smart che è molto interessante la roba un po' losca fin qui niente di losco la roba losca che fa e che mi ha fatto sorridere è che ha anche delle policy per fare il giro del mondo laddove devi accedere a un modello in cui non dovresti quindi se per caso devi uscire da VPN o devi dichiarare che sei da una parte rispetto all'altra alcuni con gli header funzionano così lo fa quindi io rispetto questa cosa non so se lo suggerisco a tutti quanti di farlo però è un bel progetto e probabilmente lo deployerò perché non riesco a resistere allora ce lo racconterai quando lo deploy grazie per la segnalazione all'ascoltatore quindi fatecene altre se ne avete che magari il territorio è talmente vasto che qualcosa noi ci perdiamo di sicuro ogni tanto ma volentieri andiamo a vedere le cose che ci segnalate grazie settimana prossima con le domande e risposte e a presto ciao ciao ciao