KI-Gilde Podcast 159: Agenten verstehen GEPA – Wie KI ihre eigenen Regeln umschreibt Wie verbessert sich eine KI eigentlich selbst? In dieser Folge entzaubern wir den Mythos der autonomen KI-Evolution am Beispiel des neuen Hermes-Agenten-Updates. Das Geheimnis dahinter ist GEPA (Genetic Pareto Prompt Evolution).Statt blind Parameter auf teuren Serverfarmen anzupassen, lernt die KI hier durch die sprachliche Reflexion ihrer eigenen Fehler und schreibt ihre Arbeitsanweisungen (Skill Files) einfach selbst als Textdokumente um. Wir erklären anschaulich, wie die drei Säulen von GEPA funktionieren: Reflektierende Veränderung Pareto-Selektion für mehr Vielfalt Evolutionäre Stammbäume Erfahre, warum dieser Ansatz mit 2 bis 10 US-Dollar pro Lauf extrem günstig und durch einfache Textdateien vollkommen transparent ist. Außerdem klären wir, warum unvollständige Testdaten die größte Gefahr (Goodharts Gesetz) bei dieser Methode bergen und stellen die provokante Frage: Ist der hochbezahlte Beruf des Prompt Engineers bald Geschichte?
✨ Episode Outline — click any point to jump to it in the episode
Problem solved
How AI agents self-improve via reflective prompt evolution (GEPA) instead of costly weight retraining.
Benefits
Massively cheaper optimization than reinforcement learning
Learns from language error logs, not blind weight shifts
Pareto selection preserves solution diversity, avoids local optima
Automates expert prompt-engineering knowledge
Transparent, explainable improvements vs black-box weights
Use cases
GEPA matched GRPO's top result using only 32 rollouts vs 24,000 — a 750x efficiency gain
Pupa data-privacy prompt evolved from 82 points (gen 0) to 97 points (gen 11)
HotpotQA multi-hop search prompts rewritten to find logically linked concepts
Reflective approach beat traditional methods by 6% average, up to 20% at peak
Beat leading prompt-optimization methods by over 10% on average
🌐 This transcript was automatically translated to English from the original.
This podcast is a project of the AI Guild. The content and voices are generated with AI and are used for information and demonstration. Have fun listening! When any company in the tech world makes big announcements today, like we now have an AI that improves itself, all of my science fiction alarm bells immediately ring. Oh yes, absolutely. That immediately resonates with this whole Hollywood fantasy, doesn't it? Total. That always sounds like pure marketing. In other words, a system that secretly develops its own consciousness on servers at night and wakes up smarter the next morning. Um, yes. Terminator sends his regards. But this is exactly the promise that the new update from this so-called Hermes agent has put on the table for us. And now in the spring of 2026. Exactly that. But if you look under the hood, the reality behind it is much more sober. More sober. Yes, but from a technical point of view it's actually almost more awesome than any science fiction fantasy. And that is exactly our goal for this mental dive today. If you're wondering how AI will actually learn in the future without anyone building new server farms, we want to unravel that today. Mmm. Step by step. The engine behind this supposedly magical self-improvement is a tangible concept called GEPA. So let’s take a closer look at the paper from 2025. This concept is already described there. By the way, GEPA stands for Genetic Pareto Prompt Evolution. Just in case anyone was wondering. Thanks for the classification. But before we understand what makes GEPA so revolutionary, we need to briefly clarify why the previous path was so incredibly painful. That's a good point. Today, modern AI systems are rarely just a single chat window into which you type something. We are talking about composite systems. So systems that consist of several modules. Exactly. It's like a pipeline. One module formulates a search query, another searches the Internet, and a third calls external tools. Like a calculator or something? Exactly. And at the end, another module puts together the final answer from all these scraps of information. It's basically like a small digital factory. That's a great comparison. And if you end up with a defective product on the assembly line, you have to somehow find out at which station in the factory the error occurred. And how has this been done so far? So if you wanted to optimize this factory? Traditionally there were two ways. And both have massive blind spots. The first way is classic reinforcement learning, i.e. reinforcing learning. There is this GRPO procedure, right? Correct. GPRPO. You let the system solve tens of thousands of tasks. Every single attempt by the AI to chase a problem through this factory from start to finish is called a rollout. So a complete process from the first click to the final answer. Exactly. And with GPRPO you only look at the end result after every rollout. So was the answer right or wrong? Pass or fail? Does that mean all the intermediate steps don’t matter? Yes, completely. Based on this simple yes or no, the algorithm then goes deep into the AI's neural networks and adjusts the mathematical weights. Those tiny probabilities with which words are strung together. Exactly. You blindly change a few numbers in the background and hope that the system happens to take the right path during the next rollout. That sounds like an extremely inefficient trial and error process, right? It is too. You need huge GPU clusters for this. It takes forever and in the end you've slightly shifted billions of incomprehensible model weights. But no one knows why anymore. Exactly. No one in the world can explain to you in normal language what the system has actually learned. An absolute black box. But you said there was a second way. Yes, the prompt optimization. Known under the name Mipro V2. The mathematical weights in the AI's brain are left completely alone. Okay, that sounds safer. It is too. Instead, you systematically vary the prompts, i.e. the pure text work instructions that you give the AI. And then you just test thousands of variants? Exactly. The computer tries out slightly different instructions and simply measures which variant ultimately brings the highest success rate, i.e. the highest score. But wait a minute. If I understand correctly, we have exactly the same fundamental problem, right? What are you referring to? Well, in the end I only have this one metric. This one score. I completely throw the entire AI solution into the trash. Ah yes, you are absolutely right. It's as if my driving instructor was sitting completely silent in the passenger seat for the entire driving lesson. He just secretly takes notes on his clipboard. Exactly. And he doesn't say a single word. And then when I turn off the engine after 45 minutes, it just calls out and gets out. A terrible driving instructor. Yes, totally. I then have no idea whether I didn't stop correctly at the stop sign, whether I didn't look over my shoulder or whether I hit the curb when parking. The entire so-called reasoning trace, i.e. the AI's chain of reasoning, is simply thrown away. The tool calls, the error messages in between, none of that matters. This is a gigantic waste of information. And it was precisely this frustration that was the absolute spark for the development of GPAR. Researchers have realized that language is a much denser and richer medium for correcting errors than simply a numerical value. Makes sense. If the system is already extremely good at understanding text without it, why don't we use it? Exactly. Why don't we let him think about his own mistakes? So we switch from bluntly moving numbers to actively reflecting in language. How should I specifically imagine the mechanism behind it? The whole thing is based on three pillars. The first is called reflective mutation. Okay, what's happening? Instead of simply exchanging prompts blindly, the AI is presented with its own log files. She sees her entire thought process in text form. So something like, here I queried the database, this was the result and then I drew this wrong conclusion. Exactly. And then a so-called reflection model comes into play. Almost a separate analytical coach. This coach then reads through these text protocols. Yes. And it specifically looks for the moment when the AI took a wrong turn. He diagnoses the error linguistically and then specifically rewrites the prompt for the next attempt. Do you have an example to make this tangible? Clear. Let’s look at the Hotpot QA example from research. These are tasks where the AI has to think about multiple corners. Mmm. So multi-level searches. Exactly. Imagine the original command is simply, generate a new, more in-depth search query from the original question and the first summary. This sounds like a very classic standard prompt. Millions of people probably use it in a similar way every day. And it is precisely because of such prompts that systems often fail. During the second search, the AI usually simply phrases the original question slightly differently. Which is completely pointless because it doesn't bring any new facts. Correct. And this is where Jeeper intervenes. The coach model reads the error log. It looks like, hey, we just paraphrased the question. That didn't get us anywhere. And then the coach rewrites the prompt. Completely independent. He then writes in, be careful, the second search query cannot simply be a repetition. You have to look for logically linked concepts that were missing in the first step. Craziness. Yes. And he might also add that if the first search describes a small community, but the original question is aimed at an entire region, then now search specifically for higher-level information. I have to comment on that for a moment. That's phenomenal. Here, the system extracts deep, domain-specific knowledge from its own failures. Yes, it recognizes systematic failure and actively formulates a rule against it. This is exactly the moment when companies normally fly in expensive prompt engineers. Correct. They then spend days refining the instructions. And here it just happens fully automatically. It is the automation of expert knowledge. But, and a thought immediately comes to mind, doesn't that also pose a danger? To what extent? Well, if the system only looks at the prompt that worked best in the last run and then tightens it further, it won't get completely lost. Ah, I see what you're getting at. If I build a machine that only ever looks for the one perfect solution to a very specific problem, then I'm breeding an absolute idiot, right? She then forgets everything else. This is the infamous local optimum problem. If you only ever take the emissary winner from the last round, evolutionary diversity dies. You are then trapped on a small hill and never reach the actual mountain top. Very nice picture. And to prevent exactly that, the concept uses its second pillar. The Pareto selection. Pareto? Does this refer to the Pareto principle, the classic 80-20 rule from business administration? It comes from the same mathematical family, yes. But what we mean here is the so-called Pareto front. What does that mean in this context? The algorithm doesn't simply throw away all prompts that perform worse overall. Okay, then who does he keep? It keeps every single prompt in its gene pool that was the undisputed winner in at least one very specific task. Ah, I see. Even if a prompt completely fails in 99 tasks and produces terrific nonsense, but finds an absolutely brilliant, unconventional solution in task number 100, then it can survive. Exactly. Because this very niche prompt may have discovered a unique strategy that could be incredibly valuable in future generations. Diversity beats greed, you might say. Exactly, that's the motto. It's not about greedily chasing the highest average score, but rather keeping a broad catalog of solution approaches alive. Okay, that solves the idiot problem. But how does knowledge build up over time? That brings us to the third pillar. When we talk about generations and evolution, how does a language model actually inherit knowledge? In biology we have DNA. What is the DNA of a prompt? The DNA in this case is a historical text log file. And this third pillar is called the Genetic Tree. So the prompts don't mutate in isolation in a vacuum? No. When the reflection model generates a new prompt, it doesn't just see the very last attempt. It reads a summary of all evolutionary history before it. So it looks like, ah, in Generation 1 we tried that, that swallows fairly. Exactly. And in Generation 2 we added Strategy B. That helped a little. So the system layers lessons on top of each other. Do you have a concrete example of this? How does such a prompt grow? A very impressive example is a task on the subject of data protection. The so-called Pupa example. The AI should learn to formulate database queries in such a way that sensitive customer data is never leaked to the outside world. OK. Important topic. How does this start? In the very first generation, i.e. generation 0, the success rate is 82 points. The basic prompt is simply, create a privacy-friendly request. Pretty flat. That's like me saying to an employee, do your job well. Correct. But in Generation 3 the score rose to 87. The prompt is now significantly longer. What's in there now? It contains specific rules for recognizing email addresses and phone numbers. And then let's jump to generation 7. Here we are at 91 points. And the text continues to mutate? Yes. Here the AI suddenly demands very structured justifications from itself for each individual filter step. And it has built in explicit bans on sharing real names. That's crazy. And where does it all end? In generation 11 the system reaches 97 points. The prompt has grown into a detailed manual. So a real set of rules? Completely. It now requires a strict, step-by-step protocol, understandable justifications for each individual data transfer and an absolute zero-tolerance policy for data leaks. So the system has stacked new protective mechanisms layer by layer over eleven generations like a bricklayer? Until a waterproof wall is created. And all because it read its own error logs. That must also have a dramatic impact on efficiency, right? You mentioned earlier that the old methods require huge GPU clusters. The numbers are actually the point at which the industry has now really woken up. If we compare GEPA with the extremely computationally intensive method GRPO... The method that requires tens of thousands of rollouts to only call pass or fail in the end. Exactly. On a standard test for AI systems, GEPA achieves exactly the same top result as GRPO. But with less effort? With massively less effort. While GRPO needed 24,000 rollouts, GEPA managed it with only 32 rollouts. Wait, 32 attempts instead of 24,000? Yes, let that sink in. That's an increase in efficiency by a factor of 750. That's not just a little better, it's a completely different league. On average across all tested tasks, the reflective approach beats traditional methods by 6 percent. At its peak even by 20 percent. And that with a fraction of the computing power. Craziness. Even the leading methods for prompt optimization are beaten by an average of over 10 percent. OK. Now let's put all this crazy theory into practice and get back to our starting point. To the Hermes agent. Exactly. How is this technology now used by the Hermes agent in the real world? If the system learns through reflection, does that happen live? What do you mean? Well, will I witness the AI getting smarter while I chat with it? Uh. This is a common misconception. This type of self-improvement never happens live while you are interacting with the system. Why not? Wouldn't that be practical? That would be a conceptual nightmare. Imagine you are working with a digital assistant and in the middle of your project it suddenly changes its basic rules of behavior because it has mutated in real time. Ah, okay. So a system that simply remembers that I drink my coffee black isn't self-improvement in that sense? No, this is simple memory, i.e. memory, the storing of facts. Self-improvement through GEPA is a purely analytical offline process. Okay, offline. But what exactly is being optimized in the background if not the model itself? The so-called skill files are optimized. Uh, skill files? What is that exactly? These are simple text files, usually in Markdown format, in which the agent's behavior rules, skills and tools are defined in plain text. So the AI rewrites pure text documents? Exactly. Not their own neural networks. The mathematical weights of the model remain completely untouched. Okay, let me translate that into an image. So it's not like the AI is performing neurological surgery on itself in the server room at night in order to have a higher IQ the next day. No, not at all. It's more like an extremely conscientious employee reading through the operations manual for the morning shift after work, when day-to-day business is at a standstill. Mmm. He analyzes where his colleagues made mistakes today and then rewrites the process description in such detail that everything runs more smoothly the next day. This is an absolutely apt image. It's about the ongoing optimization of textual work instructions. And because everything takes place in text format, there are also hard guardrails. So the system doesn't just overwrite these manuals in secret? Exactly. It submits its suggestions for improvement as a so-called pull request. Ah, like human software developers do. Correct. So there is a bouncer. A human reads the proposed changes in the text file, reviews the logic, and must actively approve them before they are committed to the live system. Of course, this guarantees full control. And perhaps most importantly for practice, it is incredibly cheap. What does that mean in numbers? A complete evolutionary optimization pass for such a capability only costs between $2 and $10 per pass in pure API costs. $2 to $10. We were just talking about weeks of training on huge computer machines, which costs tens of thousands of dollars. Yes. This completely redefines the rules of the game for the economy. Especially for companies that are not huge tech giants. This is an enormous lever for medium-sized businesses. A gigantic one. Firstly, you no longer need expensive hardware. You don't need highly specialized engineers to train the core of the model. And secondly? Secondly, you are completely independent of the provider. Since only text files are optimized here, you can apply this perfected prompt to a model from provider A today. And tomorrow I'll just switch to the latest model from provider B. Exactly. This is called vendor independence. And what about traceability? We had already discovered that in classic training, in the end no one knows what the billion parameters actually do. This is the third crucial point. Auditability. Especially for industries that are subject to strict compliance rules. So you can always prove what the AI is doing and why. Yes, you can always read what the AI has learned because it is written in simple, human-readable text. So a compliance officer can see in black and white, okay, the AI added the sentence in rule number 4, always match the account number twice. Exactly that. And he can then approve it. With a black box of probabilities, this is completely impossible. When I listen to all this, $2 per run, full transparency, no server farm, complete independence, I inevitably have to put the brakes on it. You're looking for the catch. Yes. Where is the trap? That just sounds too perfect. There is a catch. And it is deeply rooted in how evolutionary algorithms work. This brings us to a concept known as Good Hearts Law. Good Heart's Law. What does that mean? This law states that when a measure becomes a target, it ceases to be a good measure. OK. And how does this manifest itself in prompt evolution? This algorithm optimizes mercilessly and highly efficiently. But only what is measured. Explain. The reflection model evaluates the errors based on a test data set that you give it. Let's think this through. You build a digital customer advisor for an online shop. OK. Your test data set meticulously checks whether the AI correctly reflects the facts about the return and whether it solves the customer's problem quickly. Then the AI will probably become extremely good at reciting these return conditions without errors. Yes. But if you don't measure friendly tone of voice and include it as a criterion in your test data set, then evolution will simply cut out this aspect over the generations. Because being friendly doesn't give you a score bonus. Exactly. You then get an AI that provides all the facts in record time, but sounds like an incredibly rude, cold bureaucrat. It will no longer greet the user at all because, according to the test data set, this is an unnecessary waste of time. Exactly. So the big challenge is shifting. It's no longer a matter of laboriously training the AI or writing the prompt yourself. No. The new, complex task is to curate perfect, balanced test sets. Test sets that represent all soft and hard factors. Because if my test set has a blind spot... then this algorithm will find it, exploit it and amplify it mercilessly. The engineer's work therefore shifts from writing the rules to defining the testing criteria. Wow. If we pull all these threads together now, a very clear picture emerges. We have seen today that the much-advertised, self-improving AI is not a mystical process. Definitely not. It is a highly pragmatic, understandable mechanism. A process based on linguistic reflection and structured evolution… decency to blindly shift billions of parameters. And that not only makes these systems more tangible, but above all much faster, more transparent and customizable for a fraction of the cost. The initial science fiction promise has been demystified here. But what emerged underneath is a technical brilliance that really gives every company completely new tools. We are simply no longer dependent on someone writing us the perfect work instructions. The system does it itself. It is a true democratization of AI’s adaptability. Finally, a thought comes to mind that we should give the listener something to think about further. Shoot away. Today we have seen how exponentially better these systems are already becoming at analyzing their own logic errors. They layer new rules on top of each other, restructure their prompts and quickly outperform human engineers. If you think about that, the currently extremely celebrated and highly paid profession of prompt engineer may end up just being like the profession of elevator operator from the early 20th century. Oh, that's a harsh comparison. But think about it. A job that simply only exists until the machines understand how to push their own buttons. A very provocative thought. But after what we've discussed today, it's not that far-fetched. A thought that we would like to let sink in. Thank you for these deep insights today. Very gladly. Was fun. And to you out there. Until the next mental dive.
Dieser Podcast ist ein Projekt der KI-Gilde. Die Inhalte und Stimmen sind mit KI erzeugt und dienen der Information und Demonstration. Viel Spaß beim Hören! Wenn heute in der Tech-Welt irgendwelche Unternehmen große Ankündigungen machen, also von wegen, wir haben jetzt eine KI, die sich selbst verbessert, dann klingeln bei mir sofort sämtliche Science-Fiction-Alarmglocken. Oh ja, absolut. Das schwingt sofort diese ganze Hollywood-Fantasie mit, oder? Total. Das klingt halt immer nach purem Marketing. Also nach einem System, das nachts heimlich auf irgendwelchen Servern ein eigenes Bewusstsein entwickelt und am nächsten Morgen einfach schlauer aufwacht. Ähm, ja. Terminator lässt grüßen. Aber genau dieses Versprechen hat uns ja das neue Update von diesem sogenannten Hermes-Agent auf den Tisch gelegt. Und zwar jetzt im Frühjahr 2026. Genau das. Aber wenn man mal unter die Haube schaut, ist die Realität dahinter ja viel nüchterner. Nüchterner. Ja, aber aus technischer Sicht eigentlich fast noch geiler als jede Science-Fiction-Fantasie. Und das ist genau unser Ziel für diesen gedanklichen Tauchgang heute. Wenn du dich nämlich fragst, wie KI in Zukunft eigentlich dazulernt, ohne dass jemand neue Serverfarmen baut, das wollen wir heute auftröseln. Mhm. Schritt für Schritt. Der Motor hinter dieser vermeintlich magischen Selbstverbesserung ist nämlich ein handfestes Konzept namens GEPA. Also schauen wir uns das Paper aus 2025 mal genauer an. Da wird dieses Konzept nämlich schon beschrieben. GEPA steht übrigens für Genetic Pareto Prompt Evolution. Nur falls sich das jemand gefragt hat. Danke für die Einordnung. Bevor wir aber verstehen, was GEPA jetzt so revolutionär macht, müssen wir kurz klären, warum der bisherige Weg so unfassbar schmerzhaft war. Das ist ein guter Punkt. Moderne KI-Systeme sind ja heute selten nur noch so ein einzelnes Chatfenster, in das du was eintippst. Wir sprechen da von zusammengesetzten Systemen. Also Systemen, die aus mehreren Modulen bestehen. Exakt. Das ist wie so eine Pipeline. Ein Modul formuliert eine Suchanfrage, ein anderes durchforstet das Internet, ein drittes ruft externe Tools auf. Wie einen Taschenrechner oder sowas? Genau. Und am Ende baut wieder ein anderes Modul aus all diesen Infofetzen die finale Antwort zusammen. Das ist ja im Grunde wie eine kleine digitale Fabrik. Das ist ein super Vergleich. Und wenn du am Ende ein fehlerhaftes Produkt auf dem Fließband hast, musst du ja irgendwie rausfinden, an welcher Station in der Fabrik der Fehler passiert ist. Und wie hat man das bisher gemacht? Also wenn man diese Fabrik optimieren wollte? Traditionell gab es da zwei Wege. Und beide haben massive blinde Flecken. Der erste Weg ist das klassische Reinforcement Learning, also Bestecken des Lernens. Da gibt es doch dieses Verfahren GRPO, richtig? Richtig. GPRPO. Da lässt man das System Zehntausende von Aufgaben lösen. Jeder einzelne Versuch der KI, ein Problem von Anfang bis Ende durch diese Fabrik zu jagen, nennt sich dann ein Rollout. Also ein kompletter Durchlauf vom ersten Klick bis zur finalen Antwort. Genau. Und bei GPRPO schaut man sich nach jedem Rollout nur das Endresultat an. Also war die Antwort richtig oder falsch? Pass oder Fail? Das heißt, die ganzen Zwischenschritte sind egal? Ja, völlig. Basierend auf diesem simplen Ja oder Nein geht der Algorithmus dann tief in die neuronalen Netze der KI und passt die mathematischen Gewichtungen an. Diese winzigen Wahrscheinlichkeiten, mit denen Wörter aneinandergereiht werden. Exakt. Man ändert blind ein paar Zahlen im Hintergrund und hofft, dass das System beim nächsten Rollout zufällig den richtigen Weg nimmt. Das klingt nach einem extrem ineffizienten Trial-and-Error-Verfahren, oder? Ist es auch. Du brauchst dafür riesige GPU-Cluster. Es dauert ewig und am Ende hast du Milliarden von unverständlichen Modellgewichten leicht verschoben. Aber keiner weiß mehr warum. Genau. Kein Mensch auf der Welt kann dir mehr in normaler Sprache erklären, was das System jetzt eigentlich gelernt hat. Eine absolute Blackbox. Du meintest aber, es gab noch einen zweiten Weg. Ja, die Prompt-Optimierung. Bekannt unter dem Namen Mipro V2. Da lässt man die mathematischen Gewichte im Gehirn der KI völlig in Ruhe. Okay, das klingt schon mal sicherer. Ist es auch. Man variiert stattdessen systematisch die Prompts, also die reinen Textarbeitsanweisungen, die man der KI gibt. Und dann testet man einfach tausende Varianten durch? Genau. Der Computer probiert leicht veränderte Instruktionen aus und misst einfach, welche Variante am Ende die höchste Erfolgsquote bringt, also den höchsten Score. Aber warte mal. Wenn ich das richtig verstehe, haben wir da doch genau das gleiche fundamentale Problem, oder? Worauf spielst du an? Na ja, auch da habe ich am Ende ja nur diese eine Metrik. Diesen einen Score. Ich werfe den gesamten Lösungsweg der KI komplett in den Müll. Ah ja, da hast du vollkommen recht. Das ist doch, als würde mein Fahrlehrer während der gesamten Fahrstunde völlig stumm auf dem Beifahrersitz sitzen. Er macht sich nur heimlich Notizen auf seinem Klemmbrett. Genau. Und er sagt kein einziges Wort. Und wenn ich dann nach 45 Minuten den Motor abstelle, ruft er einfach nur durchgefallen und steigt aus. Ein furchtbarer Fahrlehrer. Ja, total. Ich habe dann keine Ahnung, ob ich am Stoppschild nicht richtig gehalten habe, ob der Schulterblick gefehlt hat oder ob ich beim Einparken den Bordstein berührt habe. Der ganze sogenannte Reasoning Trace, also die Argumentationskette der KI, wird einfach weggeworfen. Die Werkzeugaufrufe, die Fehlermeldungen zwischendurch, all das interessiert nicht. Das ist doch eine gigantische Verschwendung von Informationen. Und genau diese Frustration war der absolute Zündfunke für die Entwicklung von GPAR. Die Forscher haben erkannt, dass Sprache ein viel dichteres und reichhaltigeres Medium ist, um Fehler zu korrigieren als einfach nur ein Zahlenwert. Macht Sinn. Wenn das System ohne ihn schon extrem gut darin ist, Texte zu verstehen, warum nutzen wir das nicht? Genau. Warum lassen wir es nicht über seine eigenen Fehler nachdenken? Wir wechseln also vom stumpfen Zahlenverschieben zum aktiven Reflektieren in Sprache. Wie muss ich mir den Mechanismus dahinter konkret vorstellen? Das Ganze stützt sich auf drei Säulen. Die erste nennt sich Reflective Mutation, also reflektierende Veränderung. Okay, was passiert da? Anstatt Prompts einfach blind auszutauschen, bekommt die KI ihre eigenen Logdateien vorgelegt. Sie sieht ihren kompletten Gedankengang in Textform. Also sowas wie, hier habe ich die Datenbank abgefragt, das war das Ergebnis und daraus habe ich dann diesen falschen Schluss gezogen. Exakt. Und dann kommt ein sogenanntes Reflexionsmodell ins Spiel. Quasi ein separater analytischer Coach. Dieser Coach liest sich diese Textprotokolle dann durch. Ja. Und er sucht gezielt nach dem Moment, an dem die KI falsch abgebogen ist. Er diagnostiziert den Fehler sprachlich und schreibt dann den Prompt für den nächsten Versuch ganz gezielt um. Hast du da mal ein Beispiel, um das greifbar zu machen? Klar. Lass uns auf das Hotpot-QA-Beispiel aus der Forschung schauen. Das sind Aufgaben, bei denen die KI über mehrere Ecken denken muss. Mhm. Also mehrstufige Suchanfragen. Genau. Stell dir vor, der ursprüngliche Befehl lautet einfach, generiere aus der Ursprungsfrage und der ersten Zusammenfassung eine neue, tiefer gehende Suchanfrage. Das klingt nach einem sehr klassischen Standard-Prompt. Den nutzen wahrscheinlich Millionen Menschen jeden Tag so ähnlich. Und genau an solchen Prompts scheitern die Systeme oft. Bei der zweiten Suche formuliert die KI dann nämlich meistens einfach nur die ursprüngliche Frage minimal anders. Was ja völlig sinnlos ist, weil das keine neuen Fakten bringt. Richtig. Und hier greift nun Jeeper ein. Das Coach-Modell liest das Fehlerprotokoll. Es sieht, hey, wir haben die Frage nur paraphrasiert. Das hat uns nicht weitergebracht. Und dann schreibt der Coach den Prompt um. Völlig eigenständig. Er schreibt dann rein, pass auf, die zweite Suchanfrage darf nicht einfach eine Wiederholung sein. Du musst nach logisch verknüpften Konzepten suchen, die im ersten Schritt noch gefehlt haben. Wahnsinn. Ja. Und er fügt vielleicht noch an, wenn die erste Suche eine kleine Gemeinde beschreibt, die ursprüngliche Frage aber auf eine ganze Region abzielt, dann suche jetzt gezielt nach übergeordneten Informationen. Da muss ich kurz einhaken. Das ist ja phänomenal. Das System extrahiert hier aus seinen eigenen Fehlschlägen tiefes, domänenspezifisches Wissen. Ja, es erkennt ein systematisches Scheitern und formuliert aktiv eine Regel dagegen. Das ist doch exakt der Moment, in dem Unternehmen normalerweise teure Prompt-Engineers einfliegen lassen. Richtig. Die dann tagelang an den Instruktionen feilen. Und hier passiert das einfach vollautomatisiert. Es ist die Automatisierung von Expertenwissen. Aber, und da komme mir direkt ein Gedanke, bringt das nicht auch eine Gefahr mit sich? Inwiefern? Na ja, wenn sich das System immer nur den Prompt ansieht, der im letzten Durchlauf am besten funktioniert hat und den dann weiter verschärft, verrennt es sich dann nicht völlig. Ah, ich verstehe, worauf du hinaus willst. Wenn ich eine Maschine baue, die immer nur den einen perfekten Lösungsweg für ein ganz spezifisches Problem sucht, dann züchte ich mir doch einen absoluten Fachidioten heran, oder? Sie verlernt dann alles andere. Das ist das berüchtigte Problem des lokalen Optimums. Wenn du immer nur den Gesandtsieger der letzten Runde nimmst, stirbt die evolutionäre Vielfalt. Man ist dann auf einem kleinen Hügel gefangen und erreicht nie den eigentlichen Berggipfel. Sehr schönes Bild. Und um genau das zu verhindern, nutzt das Konzept seine zweite Säule. Die Pareto-Selection. Pareto? Bezieht sich das auf das Pareto-Prinzip, also diese klassische 80-20-Regel aus der Betriebswirtschaft? Es kommt aus derselben mathematischen Familie, ja. Aber es meint hier die sogenannte Pareto-Front. Was heißt das in diesem Kontext? Der Algorithmus wirft nicht einfach alle Prompts weg, die im Gesamtdurchschnitt schlechter abschneiden. Okay, wen behält er dann? Er behält jeden einzelnen Prompt in seinem Genpool, der bei mindestens einer ganz spezifischen Aufgabe der unangefochtene Gewinner war. Ah, verstehe. Selbst wenn ein Prompt bei 99 Aufgaben völlig versagt und grandiosen Unsinn produziert, minus aber bei Aufgabe Nummer 100 eine absolut geniale unkonventionelle Lösung findet, dann darf er überleben. Genau. Weil genau dieser Nischen-Prompt vielleicht eine einzigartige Strategie entdeckt hat, die in zukünftigen Generationen noch unfassbar wertvoll sein könnte. Diversität schlägt Gier, könnte man sagen. Exakt, das ist das Motto. Es geht nicht darum, gierig nach dem höchsten Durchschnittsscore zu jagen, sondern einen breiten Katalog an Lösungsansätzen am Leben zu erhalten. Okay, das löst das Problem des Fachidioten. Aber wie baut sich das Wissen dann über die Zeit auf? Das bringt uns zur dritten Säule. Wenn wir von Generationen und Evolution sprechen, wie vererbt ein Sprachmodell eigentlich Wissen? In der Biologie haben wir ja die DNA. Was ist die DNA eines Prompts? Die DNA ist in diesem Fall eine historische Textlog-Datei. Und diese dritte Säule nennt sich Genetic Tree, also Stammbaum. Die Prompts mutieren also nicht isoliert im luftleeren Raum? Nein. Wenn das Reflexionsmodell einen neuen Prompt generiert, sieht es nicht nur den allerletzten Versuch. Es liest eine Zusammenfassung der gesamten evolutionären Geschichte davor. Es sieht also, ah, in Generation 1 haben wir das probiert, das schluckt fair. Genau. Und in Generation 2 haben wir Strategie B hinzugefügt. Das half ein bisschen. Das System schichtet also Lektionen aufeinander. Hast du dafür ein konkretes Beispiel? Wie wächst so ein Prompt? Ein sehr eindrückliches Beispiel ist eine Aufgabe zum Thema Datenschutz. Das sogenannte Pupa-Beispiel. Die KI soll lernen, Datenbankabfragen so zu formulieren, dass niemals sensible Kundendaten nach außen dringen. Okay. Wichtiges Thema. Wie startet das? In der allerersten Generation, also bei Generation 0, liegt die Erfolgsquote bei 82 Punkten. Der Basis-Prompt lautet schlicht, erstelle eine datenschutzfreundliche Anfrage. Ziemlich platt. Das ist so, als würde ich zu einem Mitarbeiter sagen, mach deinen Job gut. Richtig. Aber in Generation 3 ist der Score dann schon auf 87 gestiegen. Der Prompt ist jetzt deutlich länger. Was steht da jetzt drin? Er enthält spezifische Regeln zur Erkennung von E-Mail-Adressen und Telefonnummern. Und dann springen wir mal zu Generation 7. Da stehen wir bei 91 Punkten. Und der Text mutiert weiter? Ja. Hier verlangt die KI von sich selbst plötzlich sehr strukturierte Begründungen für jeden einzelnen Filterschritt. Und sie hat explizite Verbote für das Teilen von Klarnamen eingebaut. Das ist verrückt. Und wo endet das Ganze? In Generation 11 erreicht das System 97 Punkte. Der Prompt ist zu einem detaillierten Handbuch angewachsen. Ein richtiges Regelwerk also? Komplett. Er verlangt nun ein striktes, schrittweises Protokoll, nachvollziehbare Begründungen für jede einzelne Datenübertragung und eine absolute Null-Toleranz-Politik für Datenlecks. Das System hat also über elf Generationen hinweg wie so ein Maurer Schicht für Schicht neue Schutzmechanismen aufeinandergesetzt? Bis eine wasserdichte Wand entstanden ist. Und das alles nur, weil es seine eigenen Fehlerprotokolle gelesen hat. Das muss doch auch dramatische Auswirkungen auf die Effizienz haben, oder? Vorhin hast du ja erwähnt, dass die alten Methoden riesige GPU-Cluster brauchen. Die Zahlen sind tatsächlich der Punkt, an dem die Industrie jetzt richtig aufgewacht ist. Wenn wir GEPA mit der extrem rechenintensiven Methode GRPO vergleichen... Also der Methode, die Zehntausende von Rollouts braucht, um am Ende nur Pass oder Fail zu rufen. Genau. Auf einem Standardtest für KI-Systeme erreicht GEPA das exakt gleiche Spitzenergebnis wie GRPO. Aber mit weniger Aufwand? Mit massiv weniger Aufwand. Während GRPO dafür 24.000 Rollouts brauchte, schaffte GEPA das mit nur 32 Rollouts. Warte mal, 32 Versuche statt 24.000? Ja, lasst das mal sacken. Das ist ein Effizienzgewinn um einen Faktor von 750. Das ist ja nicht einfach nur ein bisschen besser, das ist eine völlig andere Liga. Im Durchschnitt über alle getesteten Aufgaben hinweg schlägt der reflektierende Ansatz die traditionellen Methoden um 6 Prozent. In der Spitze sogar um 20 Prozent. Und das eben bei einem Bruchteil der Rechenleistung. Wahnsinn. Selbst die bisher führenden Methoden zur Promptoptimierung werden im Schnitt um über 10 Prozent geschlagen. Okay. Lass uns all diese krasse Theorie jetzt mal in die Praxis übersetzen und den Bogen zurück zu unserem Aufhänger spannen. Zum Hermes-Agent. Genau. Wie wird diese Technologie jetzt beim Hermes-Agent in der echten Welt eingesetzt? Wenn das System durch Reflexion lernt, passiert das dann live? Wie meinst du das? Naja, werde ich Zeuge, wie die KI schlauer wird, während ich mit ihr chatte? Ah. Das ist ein weit verbreiteter Irrtum. Diese Art der Selbstverbesserung passiert niemals live, während du mit dem System interagierst. Warum nicht? Wäre das nicht praktisch? Das wäre ein konzeptioneller Albtraum. Stell dir vor, du arbeitest mit einem digitalen Assistenten und mitten in deinem Projekt ändert er plötzlich seine grundlegenden Verhaltensregeln, weil er in Echtzeit mutiert ist. Ah, okay. Ein System, das sich einfach nur merkt, dass ich meinen Kaffee schwarz trinke, ist also keine Selbstverbesserung in diesem Sinne? Nein, das ist einfaches Memory, also ein Gedächtnis, das Speichern von Fakten. Die Selbstverbesserung durch GEPA ist ein rein analytischer Offline-Prozess. Okay, Offline. Aber was genau wird denn dann im Hintergrund optimiert, wenn nicht das Modell selbst? Es werden die sogenannten Skill-Files optimiert. Äh, Skill-Files? Was ist das genau? Das sind einfache Textdateien, meist im Markdown-Format, in denen die Verhaltensregeln, die Fähigkeiten und die Werkzeuge des Agenten in Klartext definiert sind. Die KI schreibt also reine Textdokumente um? Exakt. Nicht ihre eigenen neuronalen Netzwerke. Die mathematischen Gewichte des Modells bleiben völlig unangetastet. Okay, lass mich das mal in ein Bild übersetzen. Das ist also nicht so, als würde die KI nachts im Serverraum an sich selbst eine neurologische Operation durchführen, um am nächsten Tag einen höheren IQ zu haben. Nein, überhaupt nicht. Es ist eher so, als würde ein extrem gewissenhafter Mitarbeiter nach Feierabend, wenn das Tagesgeschäft ruht, das Betriebshandbuch für die Frühschicht durchlesen. Mhm. Er analysiert, wo die Kollegen heute Fehler gemacht haben und schreibt dann die Prozessbeschreibung so detailliert um, dass am nächsten Tag alles reibungsloser läuft. Das ist ein absolut treffendes Bild. Es geht um die fortlaufende Optimierung von textuellen Arbeitsanweisungen. Und weil das alles im Textformat abläuft, gibt es auch harte Leitplanken. Das System überschreibt diese Handbücher also nicht einfach im Geheimen? Genau. Es reicht seine Verbesserungsvorschläge als sogenannten Pull-Request ein. Ah, wie menschliche Softwareentwickler sie auch tun. Richtig. Es gibt also einen Türsteher. Ein Mensch liest die vorgeschlagenen Änderungen in der Textdatei, überprüft die Logik und muss sie aktiv freigeben, bevor sie in das Live-System übernommen werden. Das garantiert natürlich volle Kontrolle. Und das vielleicht Wichtigste für die Praxis, es ist unfassbar günstig. Was heißt das in Zahlen? Ein kompletter evolutionärer Optimierungsdurchlauf für eine solche Fähigkeit kostet pro Durchgang nur zwischen 2 und 10 US-Dollar an reinen API-Kosten. 2 bis 10 US-Dollar. Vorhin sprachen wir noch von wochenlangem Training auf riesigen Rechnerklastern, was zehntausende Dollar verschlingt. Ja. Das definiert die Spielregeln für die Wirtschaft völlig neu. Gerade für Unternehmen, die keine riesigen Tech-Giganten sind. Für den Mittelstand ist das doch ein enormer Hebel. Ein gigantischer. Erstens brauchst du keine teure Hardware mehr. Du brauchst keine hochspezialisierten Ingenieure, um das Modell im Kern zu trainieren. Und zweitens? Zweitens bist du völlig unabhängig vom Anbieter. Da hier ja nur Textdateien optimiert werden, kannst du diesen perfektionierten Prompt heute auf ein Modell von Anbieter A anwenden. Und morgen wechsle ich einfach zum neuesten Modell von Anbieter B. Genau. Vendor-Independenz nennt man das. Und was ist mit der Nachvollziehbarkeit? Wir hatten ja vorhin festgestellt, dass beim klassischen Training am Ende niemand mehr weiß, was die Milliardenparameter eigentlich tun. Das ist der dritte entscheidende Punkt. Auditierbarkeit. Gerade für Branchen, die strengen Compliance-Regeln unterlegen. Man kann also immer beweisen, was die KI warum macht. Ja, du kannst jederzeit nachlesen, was die KI gelernt hat, weil es in einfachem, für Menschen lesbarem Text geschrieben steht. Ein Compliance-Officer kann also schwarz auf weiß sehen, okay, die KI hat in Regel Nummer 4 den Satz hinzugefügt, gleiche die Kontonummer immer doppelt ab. Genau das. Und das kann er dann absegnen. Bei einer Blackbox aus Wahrscheinlichkeiten ist das völlig unmöglich. Wenn ich mir das alles anhöre, 2 US-Dollar pro Lauf, volle Transparenz, keine Server-Farm, völlige Unabhängigkeit, da muss ich unweigerlich die Bremse ziehen. Du suchst den Haken. Ja. Wo liegt die Falle? Das klingt einfach zu perfekt. Den Haken gibt es. Und er ist tief in der Funktionsweise von evolutionären Algorithmen verwurzelt. Das bringt uns zu einem Konzept, das als Good Hearts Gesetz bekannt ist. Good Hearts Gesetz. Was besagt das? Dieses Gesetz besagt, wenn ein Maß zur Zielvorgabe wird, hört es auf, ein gutes Maß zu sein. Okay. Und wie äußert sich das bei der Prompt-Evolution? Dieser Algorithmus optimiert gnadenlos und hochkladig effizient. Aber eben ausschließlich das, was auch gemessen wird. Erklär mal. Das Reflexionsmodell bewertet die Fehler ja anhand eines Testdatensatzes, den du ihm vorgibst. Lass uns das mal durchdenken. Du baust einen digitalen Kundenberater für einen Online-Shop. Okay. Dein Testdatensatz prüft akribisch, ob die KI die Fakten zur Rücksendung korrekt wiedergibt und ob sie das Problem des Kunden schnell löst. Dann wird die KI wahrscheinlich extrem gut darin, diese Rücksendebedingungen fehlerfrei aufzusagen. Ja. Aber wenn du den freundlichen Tonfall nicht misst und nicht als Kriterium in deinen Testdatensatz aufnimmst, dann wird die Evolution diesen Aspekt über die Generationen hinweg einfach wegschneiden. Weil Freundlichkeit keinen Score-Bonus bringt. Genau. Du bekommst dann eine KI, die in Rekordzeit alle Fakten liefert, dabei aber klingt wie ein unfassbar unhöflicher kalter Bürokrat. Sie wird den Nutzer gar nicht mehr begrüßen, weil das laut dem Testdatensatz unnötige Zeitverschwendung ist. Exakt. Die große Herausforderung verlagert sich also. Es geht dann gar nicht mehr darum, die KI mühsam zu trainieren oder die Prompt selbst zu schreiben. Nein. Die neue, komplexe Aufgabe ist es, perfekte, ausbalancierte Test-Sets zu kuratieren. Test-Sets, die alle weichen und harten Faktoren abbilden. Denn wenn mein Test-Set einen blinden Fleck hat… Dann wird dieser Algorithmus ihn finden, ausnutzen und gnadenlos verstärken. Die Arbeit des Ingenieurs verschiebt sich also vom Schreiben der Regeln hin zum Definieren der Prüfungskriterien. Wow. Wenn wir all diese Fäden jetzt zusammenziehen, zeichnet sich ein sehr klares Bild ab. Wir haben heute gesehen, dass die viel beworbene, selbstverbessernde KI kein mystischer Prozess ist. Definitiv nicht. Es ist ein hochgradig pragmatischer, nachvollziehbarer Mechanismus. Ein Prozess, der auf sprachlicher Reflexion und strukturierter Evolution basiert… Anstand blind Milliarden von Parametern zu verschieben. Und das macht diese Systeme nicht nur greifbarer, sondern vor allem viel schneller, transparenter und für einen Bruchteil der Kosten anpassbar. Das anfängliche Science-Fiction-Versprechen wurde hier also entzaubert. Aber das, was darunter zum Vorschein kam, ist eine technische Brillanz, die wirklich jedem Unternehmen völlig neue Werkzeuge in die Hand gibt. Wir sind einfach nicht mehr davon abhängig, dass uns jemand die perfekte Arbeitsanweisung schreibt. Das System macht es selbst. Es ist eine echte Demokratisierung der Anpassungsfähigkeit von KI. Da drängt sich mir zum Abschluss noch ein Gedanke auf, den wir dem Hörer mal zum Weiterdenken mitgeben sollten. Schieß los. Wir haben heute gesehen, wie exponentiell besser diese Systeme jetzt schon darin werden, ihre eigenen Logikfehler zu analysieren. Sie schichten neue Regeln aufeinander, strukturieren ihre Prompts um und übertreffen dabei menschliche Ingenieure in kürzester Zeit. Wenn du dir das vor Augen führst, ist der aktuell noch so extrem gefeierte und hochbezahlte Beruf des Prompt-Engineers am Ende vielleicht einfach nur wie der Beruf des Fahrstuhlführers aus dem frühen 20. Jahrhundert. Oh, das ist ein harter Vergleich. Aber denk mal drüber nach. Ein Job, den es schlichtweg nur so lange gibt, bis die Maschinen verstanden haben, wie sie ihre eigenen Knöpfe drücken können. Ein sehr provokanter Gedanke. Aber nach dem, was wir heute besprochen haben, gar nicht so abwegig. Ein Gedanke, den wir gerne mal sacken lassen können. Danke dir für diese tiefen Einblicke heute. Sehr gerne. Hat Spaß gemacht. Und an dich da draußen. Bis zum nächsten gedanklichen Tauchgang.