Benvenuti a una nuova puntata di TalkOne, il podcast ufficiale di Melamorsicata.it! In questo episodio affrontiamo uno dei limiti più frustranti degli attuali assistenti basati su intelligenza artificiale: la mancanza di una memoria a lungo termine. Di cosa parliamo oggi: La sindrome dell'agente "stateless": Perché la maggior parte degli AI Agent oggi vive solo nell'istante della conversazione, dimenticando le nostre preferenze, i nostri progetti e il nostro stile di scrittura non appena si chiude la sessione. I costi della memoria in Cloud: Sebbene esistano soluzioni come Mem0 o Honcho per memorizzare le conversazioni, queste elaborano i dati su server esterni, sollevando importanti problemi di privacy e generando costi che possono arrivare a migliaia di dollari. La rivoluzione di Mnemosyne: Scopriamo un memory layer universale per AI Agent che funziona interamente in locale. Utilizzando una pipeline deterministica senza varianza stocastica, permette di mantenere la persistenza senza alcuna bolletta API da pagare. Come "pensa" Mnemosyne: Analizziamo la sua architettura a 5 livelli ispirata al cervello umano, che non si limita a salvare testi ma li classifica e consolida. Il suo sistema di recupero ibrido mixa la ricerca vettoriale (50%), la ricerca testuale esatta (30%) e lo scoring di importanza (20%) per trovare sempre il ricordo giusto. Installazione pratica su Hermes Agent: I passaggi per integrare nativamente Mnemosyne con Hermes Agent usando Python (pip install mnemosyne-memory[all]) e database locali come SQLite e sqlite-vec, funzionando perfettamente anche su hardware leggeri come un Raspberry Pi. Mnemosyne è un software open source, completamente gratuito e rilasciato sotto licenza MIT. Per la guida completa e dettagliata alla configurazione, leggi l'articolo completo sul nostro sito. Risorse e Approfondimenti:Supporta TalkOne: Se questa puntata ti è stata utile, ricordati di seguire il podcast sulla tua piattaforma preferita e di lasciarci una valutazione a 5 stelle ! I tuoi feedback e i tuoi commenti sono fondamentali per aiutarci a crescere.
✨ Episode Outline — click any point to jump to it in the episode
Problem solved
Stateless AI agents forget everything each session, forcing costly context rebuilding every day.
Benefits
Eternal, personalized memory with zero subscription cost
Fully local, private data control — nothing on third-party servers
Deterministic memory pipeline prevents hallucinated or degraded facts
Ultra-light footprint, easy one-command install
Hybrid retrieval beats blurry vector-only search
Use cases
Cloud memory layers like Memzo or Oncio can cost thousands of dollars a month for high-volume API users
Mnemosyne memory layer runs on just 100 to 200 MB of RAM — less than one browser tab
Deduplication stops a preference repeated across 100 different chats from clogging the database
Installed locally via one command 'pip install Mnemosine Memory' with the all-mnemosine flag, needing only Python 3.10
🌐 This transcript was automatically translated to English from the original.
imagine the scene, Monday morning arrives, the coffee machine approaches, you meet the desk colleague with whom you have worked side by side for three years the same routine practically exactly the same routine but you find yourself forced to say something like hello I'm back at work here I take care of the front-end development and I take the coffee hot latte with absolutely no sugar the colleague says nothing as if everything were normal just like that he seems to have understood everything but then Tuesday morning arrives with the same coffee machine and the colleague stares into space as if there had never been any previous interaction absolute zero a relational nightmare in short we start from scratch every single day welcome to tolquan which I remember for those who have recently tuned in it is the in-depth space of melamorsicata.it and this little slightly surreal scene perfectly describes the daily frustration of anyone who uses artificial intelligence agents today it is an almost comical paradox look but which then on the work level turns into an absolutely incalculable waste of time that is to say interacting with digital assistants today means having to deal with entities that are indeed brilliant but suffering from total amnesia, yes exactly goldfish amnesia, having to reconstruct the operational context every single time pasting dozens of files to explain the history of a project or simply having to remind the machine of a banality such as not using an overly formal tone which is the thing that happens most often I believe yes creates a formidable bottleneck practically we spend more time debriefing people than working on the real problem and this is exactly the reason why our today's chat has a very clear mission we are based on a substantial technical article published by Kiro which is very detailed among other things the objective is to explore a way out of this endless loop nished specifically we will see how to transform a forgetful AI agent we will take as a practical example Hermes agent into a real collaborator one with an eternal and deeply personalized memory and the beautiful thing is that there are two fundamental conditions in all this right the conditions the first is not to spend a single cent on subscriptions the second which for me is vital is to maintain absolute and private control over one's data well, it is a goal that let's be clear until very recently it seemed like pure science fiction but now with the right tools it is becoming the basic setting however to understand the scope I think we need to take a step back from this solution, that is, why artificial intelligence works in this very compartmentalized way today, of course, the context is fundamental, the technical term that defines the architecture of the agents that we usually use is stateless which translated literally means stateless which for those who know computer science is very clear yes, but translated for artificial intelligence stateless simply means that the linguistic model does not have any internal hard disk dedicated to the individual user, no fixed memory, exactly when a chat window opens that particular assistant is born exactly at that instant it has a fixed memory short term limited exclusively to the messages exchanged in that specific session what in technical jargon we call a context window and the moment that browser tab is closed poof, everything disappears or maybe a new session starts and that instance of people ceases to exist, right? disappears completely there is no common thread and it must be said that from an engineering and also commercial point of view for large companies this stateless approach is an absolute necessity I imagine for the costs more than anything else a question of survival of the servers if these companies had to keep in active and constantly updated memory the complex network of preferences, projects and habits of millions of users at the same time it would be a disaster the costs of the infrastructure would explode in an unsustainable way therefore the memory problem was cleverly downloaded onto the end user and obviously those who listen to us know well that when such a clear void is created in a market that is exploding, paid solutions arrive immediately to fill it very punctually, the funds that we have analyzed today highlight precisely how the industry has already attempted to resolve digital amnesia by relying on the cloud, real memory layer services such as Memzo or Oncio have been created, much talked about systems lately, these companies practically propose to act as intermediaries, they put themselves there between those who work and artificial intelligence and create a huge database on their servers, they store every single interaction and technically they work, this must be recognized, they monitor the chats do they extract the key concepts and as soon as you make a new request to people, they fish out the relevant information from their cloud and secretly inject it? yes, they inject them invisibly into the conversation to give the illusion of a continuous memory but this approach brings with it two enormous burdens and the first is certainly economic exactly, purely economic for professionals or companies that manage high volumes of API calls these cloud services can cost thousands of dollars a month madness but the second burden is the one that has always worried me the most and it is a question of pure and simple privacy a very delicate topic if you take up the logic of these cloud services I imagine it like this it's like taking your own secret diary or worse, the source code of the company's flagship product various draft patents and decide, on the spot, to entrust them to an external public relations agency an agency that promises you to keep everything in order, for goodness sake promises you to suggest the right answer at the right time yes, but the undeniable fact is that your data is no longer under your control they end up on third-party servers perhaps subject to privacy regulations of other continents it is a brutal compromise until yesterday the message from the market was practically if you want an assistant that really knows your flow of work you have to pay a hefty subscription and give up your sensitive data a technological blackmail that is in practice unacceptable for those who water industrial security but also simple personal confidentiality I would say of course and it is precisely starting from the rejection of this compromise that Chiro's analysis shifts the attention towards the local alternative if the cloud costs and is a sieve for privacy the memory must be built at home which is the philosophy behind NemoSign the solution analyzed in the sources and be careful because it is not the usual graphic interface glued to the nice better on a vector database no, in fact the article underlines it well an exact universal memory layer is defined to understand the difference many tools in circulation they are simple wrappers i.e. they take the text of the chat they throw it into a vector database and ask to fish it out in a decent way when needed a little too crude as a very crude approach NemoSign on the other hand intervenes at a much deeper level the most interesting aspect of the documentation is that you manage memories through a strictly deterministic pipeline using local embedding models? everything in exact locality on this point of the deterministic pipeline however I would like to play devil's advocate for a moment go because there is a passage that seemed a bit counterintuitive to me at the beginning when we talk about advanced linguistic models the beauty, the charm lies precisely in their stochastic probabilistic nature of course their controlled unpredictability we love it that people are creative and able to invent a metaphor from nothing or find a lateral solution to solve a bug in the code absolutely yes therefore if creativity and variability are the driving force Why is the article so insistent that a deterministic memory system is such a crucial advantage? look, it's a great question and does it exactly touch the fault line between what artificial intelligence should generate and what should instead just maintain a division of labor? that's right, you absolutely want the model to be creative when you have to write an essay or create a marketing campaign, but memory, that is, the storehouse of concrete facts, is the last place in the world where you want to find creativity, ah, in short, we don't want people to start being creative with our deadlines or with our tastes. Exactly, memory must not hallucinate if you tell people that the production database uses post-grace-qual and that the credentials should never be written clearly, never with the fact it must remain a monolith. unalterable using a stochastic approach for archiving means risking that the concepts degrade like the game of wireless telephone exactly the determinism of mnemosyne guarantees that by converting the information into vectors through local and rigid mathematical rules a given input will always correspond to the exact same output no poetic interpretations of the facts only naked and raw data re-proposed exactly as they were acquired maximum creativity for the execution but ruthless mathematical rigor for the memory it has an unassailable logical sense I am convinced it is a fundamental change of perspective and speaking of perspectives, before diving into the engineering of the system I wanted to remind those who appreciate this type of technical deconstruction where we take things apart to understand why that following Talk One and leaving a 5-star rating on your listening platform is the best way to support us, a very precious support even a short comment helps immensely to keep this research alive which is what allows us to tackle these complex topics without necessarily having to trivialize them absolutely, so let's get to engineering because by reading the documentation of Mnemosyne turns out that it doesn't do a simple chronological pile of data, it has a 5-layer architecture clearly inspired by the human brain and a div isa in 12 steps may seem cumbersome I know but a huge exaggeration how does it work in practice? it seems like a lot but it's exactly what prevents chaos in the long term when people decide that a piece of information in chat needs to be remembered they don't immediately put it in the database they make them follow a path or obstacles what are the key steps? therefore, first, the security filter ensures that API keys or critical data are not stored by fundamental mistake. Second, perhaps the most important of all is deduplication. I imagine it serves to prevent people from developing, let's say, a fragmented memory. For example, if I repeat something to them 100 times in 100 different chats, you've made the point. If every Monday you remind them that you prefer short answers without deduplication, the database gets clogged up with copies of the same preference, slowing everything down, slowing down the search and confusing the AI. The pipeline instead recognizes that the concept is identical and simply reinforces the importance of that memory that was already there, after which there is the extraction of the entities, that is, it divides the exact text, identifies who does what, subjects, verbs, then assigns a scoring, a fascinating priority score, but the real black magic, if we want to call it that, arrives at the moment of recovery, right? because the guide highlights a specific mathematical formula used by Mnesosyn the magic formula yes the final relevance score is dictated by 50% of the vector similarity then there is 30% of pure textual search and finally 20% given precisely by that importance score that you were saying it is this mixture that makes the leap in quality compared to elementary databases because relying only on mathematical vectors often leads to results that are a little too blurry while only the full text is too rigid exactly it fails as soon as you use a synonym mnemosyne hybridizes the two things by adding the weight of historical importance look to make this mechanism crystal clear to those who listen to us I thought of an analogy we feel it is like having a librarian with superhuman talent available ok that 50% of vector similarity comes into play when you ask something about sheepdogs he understands the concept the deep meaning and therefore he knows that he must also bring you the books that talk about border collies or dog breeding even if you have not used those words the vectors create a map of the correct meaning similar concepts are close regardless of the letters, however, 30% textual search intervenes because the librarian knows that sometimes you need surgical precision if I'm looking for the variable this process included the integration of a knowledge graph which would be a kind of mind map right? yes exactly that connects for example the entity Mario to the company with Hermes Agent it sensationally disproves all this and it is the most rewarding part I would say the integration between Hermes Agent and Mnemosine is designed to be ridiculously light the minimum requirements ask for Python 3.10 fine no abstruse containers or infinite configurations nothing the installation is literally done with one command a simple pip install Mnemosine Memory with the all mnemosine flag and it does everything it configures itself and people learn to independently use background tools invisible to the user functions like Mnemosin recall to fish out memories or before the chat even starts it injects incredible context and we come to the question of hardware resources because the article numbers left me stunned the entire memory layer requires between 100 and 200 MB of RAM a feather 200 MB to give a bit of context is less memory than is needed to keep a single browser tab open on a web page a heavy minimum means that this system runs comfortably on a Raspberry Pi a gadget as big as a pack of cards or on that old entry level server that many geeks have gathering dust in the cellar and the costs are eliminated MIT open source license free forever the practical effect on the workflow I would define it as transformative people start up and without saying anything to them he has already adapted the tone of voice he already knows which libraries and software you avoid like the plague ric horde of bugs that you had solved exactly three months earlier builds a sort of invisible personal file a true digital shadow we move from isolated interactions to continuous collaboration it's a total paradigm shift we move from a rented memory parked in the data centers of some multinational and paid for in gold to a secure, democratic locally owned memory and this inevitably leads us to the final reflection which is a bit of the closing of the circle of this chat of ours in this regard I would really like to launch a provocation to those who listen to us please if an artificial agent exploiting free and local systems how mnemosyne begins to develop a perfect unassailable private memory of all our habits of all our routines our mental shortcuts even of our mistakes at what exact point does this tool stop being perceived as a simple software assistant the line of demarcation becomes very thin it almost becomes a cognitive clone an extension of the mind of those who train it and the question is how far we will go in delegating our logical processes to these local memories is a question that makes us a little dizzy how deep this digital shadow will have to become before we realize that we can no longer do without it and not so much for the computing power but for the amount of ourselves that we have poured into it, it is a question that will affect many of us in the coming months. I am undoubtedly convinced of it. The invitation to delve deeper into every single technical aspect and perhaps to follow the installation guide step by step is always to visit the website www.melamorsicata.it. There are all of Chiro's articles there to get your hands on an exploration truly full of ideas which demonstrates how fast this sector really runs. thank you very much for this exchange of ideas and thanks to you and a special thanks to those who have followed our analysis up to this point. I'm eager as always for the next episode of Talk One, see you soon
si immagini la scena, arriva il lunedì mattina, ci si avvicina la macchina del caffè, si incontra il collega di scrivania con cui si lavora fianco a fianco da tre anni la solita routine praticamente esatto la solita routine però ci si ritrova costretti a dire una roba tipo ciao mi ripresento lavoro qui mi occupo dello sviluppo front-end e il caffè lo prendo macchiato caldo assolutamente senza zucchero il collega nuisce fa finta di niente come se fosse tutto normale proprio così sembra aver capito tutto poi però arriva il martedì mattina stessa macchina del caffè e il collega fissa il vuoto come se non ci fosse mai stata alcuna interazione precedente zero assoluto un incubo relazionale insomma si ricomincia da zero tutti i santi giorni benvenuti a tolquan che ricordo per chi si fosse sintonizzato da poco è lo spazio di approfondimento di melamorsicata.it e questa piccola scena un po' surreale descrive alla perfezione la frustrazione quotidiana di chiunque utilizzi oggi gli agenti di intelligenza artificiale è un paradozzo quasi comico guarda ma che poi sul piano lavorativo si trasforma in una in una perdita di tempo incalcolabile assolutamente cioè interagire con gli assistenti digitali oggi significa avere a che fare con entità che sono sì geniali ma affette da un'amnesia totale sì un'amnesia da pesciolino rosso esatto dover ricostruire il contesto operativo ogni singola volta incollare decine di file per spiegare lo storico di un progetto o semplicemente dover ricordare alla macchina una banalità tipo di non usare un tono troppo formale che poi è la cosa che capita più spesso credo sì crea un collo di bottiglia formidabile praticamente si passa più tempo a fare il debriefing alla gente che a lavorare al vero problema ed è esattamente il motivo per cui la nostra chiacchierata di oggi ha una missione chiarissima ci basiamo su un corposo articolo tecnico pubblicato da Kiro molto dettagliato tra l'altro molto l'obiettivo è esplorare una via d'uscita da questo loop infinito nello specifico vedremo come trasformare un AI agent smemorato prenderemo come esempio pratico Hermes agent in un vero e proprio collaboratore uno con una memoria eterna e profondamente personalizzata e la cosa bella è che ci sono due condizioni fondamentali in tutto questo giusto le condizioni la prima è non spendere un singolo centesimo in abbonamenti la seconda che per me è vitale è mantenere il controllo assoluto e privato sui propri dati beh, è un traguardo che parliamoci chiaro fino a pochissimo tempo fa sembrava pura fantascienza ma ora con gli strumenti giusti sta diventando l'impostazione di base però per capire la portata di questa soluzione credo bisogna fare un passetto indietro cioè perché l'intelligenza artificiale funziona in questo modo così compartimentato oggi certo, il contesto è fondamentale il termine tecnico che definisce l'architettura degli agenti che usiamo di solito è stateless che tradotto significa letteralmente senza stato che per chi mastica informatica è chiarissimo sì, ma tradotto per l'intelligenza artificiale senza stato significa semplicemente che il modello linguistico non ha alcun disco rigido interno dedicato al singolo utente niente memoria fissa esatto quando si apre una finestra di chat quel particolare assistente nasce esattamente in quell'istante ha una memoria a breve termine limitata esclusivamente ai messaggi che ci si scambia in quella specifica sessione quella che in gergo tecnico chiamiamo finestra di contesto e nel momento in cui quella scheda del browser viene chiusa puff, sparisce tutto o magari si avvia una nuova sessione e quell'istanza della gente cessa di esistere, no? sparisce completamente non c'è un filo conduttore e bisogna dire che da un punto di vista ingegneristico e anche commerciale per le grandi aziende questo approccio stateless è una necessità assoluta immagino per i costi più che altro una questione di sopravvivenza dei server se queste aziende dovessero mantenere in memoria attiva e costantemente aggiornata la complessa rete di preferenze, progetti e abitudini di milioni di utenti contemporaneamente sarebbe un disastro i costi dell'infrastruttura esploderebbero in modo insostenibile quindi il problema della memoria furbescamente è stato scaricato sull'utente finale e ovviamente chi ci ascolta sa bene che quando si crea un vuoto così evidente in un mercato che sta esplodendo arrivano subito le soluzioni a pagamento per riempirlo puntualissime le fondi che abbiamo analizzato oggi evidenziano proprio come l'industria abbia già tentato di risolvere l'amnesia digitale affidandosi al cloud sono nati servizi dei veri propri layer di memoria tipo Memzo o Oncio sistemi molto chiacchierati ultimamente praticamente queste aziende propongono di fare da intermediari si mettono lì tra chi lavora e l'intelligenza artificiale e creano un enorme database sui loro server immagazzinano ogni singola interazione e tecnicamente funzionano questo bisogna riconoscerlo monitorano le chat estraggono i concetti chiave e non appena si fa una nuova richiesta alla gente pescano le informazioni rilevanti dal loro cloud le iniettano di nascosto? sì, le iniettano invisibilmente nella conversazione per dare l'illusione di una memoria continua ma questo approccio porta con sé due zavorre enormi e la prima è sicuramente economica esatto, puramente economica per professionisti o aziende che gestiscono volumi elevati di chiamate API questi servizi cloud possono arrivare a costare migliaia di dollari al mese follia ma la seconda zavorra è quella che da sempre mi preoccupa di più ed è una questione di pura e semplice privacy tema delicatissimo se si riprende la logica di questi servizi cloud io me la immagino così è come prendere il proprio diario segreto o peggio, il codice sorgente del prodotto di punta dell'azienda vari bozze di brevetti e decidere, così su due piedi di affidarli a un'agenzia di pubbliche relazioni esterna un'agenzia che ti promette di tenere tutto in ordine, per carità ti promette di suggerire la risposta giusta al momento giusto sì, ma il fatto innegabile è che i tuoi dati non sono più sotto il tuo controllo finiscono su server di terze parti magari soggetti a normative sulla privacy di altri continenti è un compromesso brutale fino a ieri il messaggio del mercato era praticamente se vuoi un assistente che conosca davvero il tuo flusso di lavoro devi pagare un abbonamento salato e cedere i tuoi dati sensibili un ricatto tecnologico in pratica inaccettabile per chi acquare la sicurezza industriale ma anche la semplice riservatezza personale direi certo ed è proprio partendo dal rifiuto di questo compromesso che l'analisi di Chiro sposta l'attenzione verso l'alternativa locale se il cloud costa ed è un colabrodo per la privacy la memoria bisogna costruirsela in casa che poi è la filosofia alla base di NemoSign la soluzione analizzata nei sorgenti e attenzione perché non si tratta della solita interfaccia grafica incollata alla belle meglio su un database vettoriale no, infatti l'articolo lo sottolinea bene viene definito un memory layer universale esatto per capire la differenza molti strumenti in circolazione sono semplici wrapper cioè prendono il testo della chat lo buttano in un database vettoriale e pregano di ripescarlo in modo decente quando serve un po' troppo grezzo come approccio molto grezzo NemoSign invece si interpone a un livello molto più profondo l'aspetto più interessante della documentazione è che gestisci i ricordi attraverso una pipeline rigorosamente deterministica usando modelli di embedding locali? tutto in locale esatto su questo punto della pipeline deterministica però vorrei fare un attimo l'avvocato del diavolo vai perché c'è un passaggio che mi è sembrato un po' controintuitivo all'inizio quando parliamo di modelli linguistici avanzati il bello, il fascino sta proprio nella loro natura stocastica probabilistica certo la loro imprevedibilità controllata ci piace da impazzire che la gente sia creativo che riesca a inventare una metafora dal nulla o a trovare una soluzione laterale per risolvere un bug nel codice assolutamente sì dunque se la creatività e la variabilità sono il motore delle AI per quale motivo l'articolo insiste così tanto sul fatto che un sistema deterministico per la memoria sia un vantaggio così cruciale? guarda è un'ottima domanda e tocca esattamente la linea di faglia tra ciò che l'intelligenza artificiale dovrebbe generare e ciò che invece dovrebbe solo conservare una divisione dei compiti? proprio così si vuole assolutamente che il modello sia creativo quando deve scrivere un saggio o ideare una campagna di marketing ma la memoria cioè il magazzino dei fatti concreti è l'ultimo posto al mondo in cui si desidera trovare della creatività ah chiaro in sintesi non vogliamo che la gente si metta a essere creativo con le nostre scadenze o con i nostri gusti esatto la memoria non deve allucinare se si comunica alla gente che il database di produzione usa post-grace-qual e che le credenziali non vanno mai scritte in chiaro mai con il fatto deve rimanere un monolite inalterabile usare un approccio stocastico per l'archiviazione significa rischiare che i concetti si degradino tipo il gioco del telefono senza fili esattamente il determinismo di mnemosine garantisce che convertendo le informazioni in vettori attraverso regole matematiche locali e rigide a un determinato input corrisponderà sempre lo stesso identico output niente interpretazioni poetiche dei fatti solo dati nudi e crudi riproposti esattamente come sono stati acquisiti creatività massima per l'esecuzione ma rigore matematico spietato per la memoria ha un senso logico inattaccabile sono convinta è un cambio di prospettiva fondamentale e a proposito di prospettive prima di tuffarci nell'ingegneria del sistema volevo ricordare a chi apprezza questo tipo di decostruzione tecnica dove smontiamo le cose per capirne il perché che seguire Talk One e lasciare una valutazione a 5 stelle sulla propria piattaforma di ascolto è il modo migliore per sostenerci un supporto preziosissimo anche un breve commento aiuta immensamente a mantenere viva questa ricerca che poi è ciò che permette di affrontare questi argomenti complessi senza doverli per forza banalizzare assolutamente veniamo quindi all'ingegneria perché leggendo la documentazione di Mnemosyne si scopre che non fa un semplice mucchio cronologico dei dati ha un'architettura a 5 livelli chiaramente ispirata al cervello umano e una pipeline di ingestione divisa in ben 12 passaggi può sembrare macchinoso lo so però un'esagerazione enorme come funziona nella pratica? sembra tanto ma è esattamente ciò che previene il caos nel lungo termine quando la gente decide che un'informazione in chat va ricordata non la sbatte subito nel database le fa fare un percorso o ostacoli quali sono i passaggi chiave? dunque primo il filtro di sicurezza si assicura che chiavi API o dati critici non vengano archiviati per sbaglio fondamentale secondo è forse più importante di tutti la deduplicazione immagino serva a evitare che la gente sviluppi diciamo una memoria frammentata tipo se gli ripeto 100 volte una cosa in 100 chat diverse hai centrato il punto se ogni lunedì gli ricordi che preferisci le risposte breve senza deduplicazione il database si intasa di copie della stessa preferenza rallentando tutto rallentando la ricerca e confondendo le AI la pipeline invece riconosce che il concetto è identico e si limita a rafforzare l'importanza di quel ricordo che c'era già dopodiché c'è l'estrazione delle entità cioè diviseziona il testo esatto individua chi fa cosa soggetti verbi poi assegna uno scoring un punteggio di priorità affascinante ma la vera magia nera se così vogliamo chiamarla arriva al momento del recupero giusto? perché la guida evidenzia una formula matematica specifica usata da Mnesosyn la formula magica sì il puntezzo finale di rilevanza è dettato per il 50% dalla similarità vettoriale poi c'è un 30% di ricerca testuale pura e infine un 20% dato proprio da quel punteggio di importanza che dicevi è questa miscela che fa fare il salto di qualità rispetto ai database elementari perché affidarsi solo ai vettori matematici spesso porta a risultati un po' troppo sfocati mentre solo il testo pieno è troppo rigido esatto fallisce appena usi un sinonimo mnemosine ibrida le due cose aggiungendoci il peso dell'importanza storica guarda per rendere cristallino questo meccanismo a chi ci ascolta ho pensato un'analogia sentiamo è come avere a disposizione un bibliotecario dal talento sovrumano ok quel 50% di similarità vettoriale entra in gioco quando chiedi qualcosa sui cani da pastore lui capisce il concetto il significato profondo e quindi sa che deve portarti anche i libri che parlano di border collie o cinofilia anche se non hai usato quelle parole i vettori creano una mappa del significato corretto concetti affini stanno vicini indipendentemente dalle lettere poi però interviene il 30% di ricerca testuale perché il bibliotecario sa che a volte ti serve la precisione chirurgica se sto cercando la variabile X temp 42 non mi serve un concetto affine mi serve quella roba lì e lui controlla le etichette esatte perfetto e infine il 20% di importanza tra tutti i libri che ha trovato il bibliotecario scarta gli appunti presi per noia e mette in cima i documenti fondativi quelli cruciali l'analogia descrive alla perfezione come funzionano questi motori ibridi e la cosa sbalorditiva è che tutto questo processo inclusa l'integrazione di un knowledge graph che sarebbe una specie di mappa mentale giusto? sì esatto che collega per esempio l'entità Mario all'azienda XYZ col nodo lavora per ecco tutto questo avviene senza scomodare server esterni niente cloud tutto offline usa SQLite con il modulo FTS 5 per il testo rapido e SQLite e il testo rapido per i calcoli vettoriali e qui viene il bello perché quando metti sul tavolo termini come pipeline a 12 passaggi elaborazione di embeddings vettoriali knowledge graph insomma la conclusione logica è che serva un super computer della NASA con decine di giga di memoria video minimo eppure l'esperienza pratica con Hermes Agent smintisce clamorosamente tutto questo ed è la parte più gratificante direi l'integrazione tra Hermes Agent e Mnemosine è pensata per essere ridicolamente leggera i requisiti minimi chiedono python 3.10 fine niente container astrusi o configurazioni infinite niente l'installazione si fa letteralmente con un comando un semplice pip install Mnemosine Memory con il flag all mnemosine e fa tutto lui si autoconfigura e la gente impara a usare autonomamente degli strumenti in background invisibili all'utente funzioni tipo Mnemosin recall per ripescare i ricordi o prima ancora che inizi la chat inietta il contesto incredibile e veniamo alla questione delle risorse hardware perché i numeri dell'articolo mi hanno lasciata di stucco l'intero strato di memoria richiede tra i 100 e 200 MB di RAM una piuma 200 MB per dare un po' di contesto è meno memoria di quanta ne serva per tenere aperta una singola scheda del browser su una pagina web un minimo pesante significa che questo sistema gira comodamente su un Raspberry Pi un aggeggino grande come un pacchetto di carte o su quel vecchio server entry level che molti smanettoni hanno a prendere polvere in cantina e i costi sono azzerati licenza MIT open source gratis per sempre l'effetto pratico sul flusso di lavoro lo definirei trasformativo si avvia la gente e senza dirgli nulla lui ha già adattato il tono di voce sa già quali librerie e software eviti come la peste ricorda i bug che avevate risolto tre mesi prima esatto costruisce una sorta di scheda personale invisibile una vera ombra digitale passiamo da interazioni isolate a una collaborazione continua è un cambio di paradigma totale passiamo da una memoria in affitto parcheggiata nei data center di qualche multinazionale e pagata a peso d'oro a una memoria di proprietà locale sicura democratica e questo inevitabilmente ci porta alla riflessione finale che è un po' la chiusura del cerchio di questa nostra chiacchierata a questo proposito vorrei proprio lanciare una provocazione a chi ci ascolta prego se un agente artificiale sfruttando sistemi gratuiti e locali come mnemosine inizia a sviluppare una memoria perfetta privata inattaccabile di tutte le nostre abitudini di tutte le nostre routine le nostre scorciatorie mentali perfino dei nostri errori a quale punto esatto questo strumento smette di essere percepito come un semplice assistente software la linea di demarcazione diventa sottilissima diventa quasi un clone cognitivo un'estensione della mente di chi lo addestra e la domanda è fino a che punto ci spingeremo nel delegare i nostri processi logici a queste memorie locali è una domanda che fa un po' vertigine quanto dovrà diventare profonda quest'ombra digitale prima di accorgerci che non possiamo più farne a meno e non tanto per la potenza di calcolo ma per la quantità di noi stessi che ci abbiamo versato dentro è un interrogativo che toccherà molti di noi nei prossimi mesi ne sono convinto senza dubbio l'invito per approfondire ogni singolo aspetto tecnico e magari per seguire passo dopo passo la guida all'installazione è sempre quello di visitare il sito www.melamorsicata.it lì ci sono tutti gli articoli di Chiro per mettere le mani in pasta un'esplorazione davvero ricca di spunti che dimostra quanto corra veloce questo settore davvero grazie mille per questo scambio di idee e grazie a te e un ringraziamento speciale a chi ha seguito la nostra analisi fin qui l'appuntamento come sempre è per la prossima puntata di Talk One a presto