Esta semana, o Agent Stack Release Readout traz o Hermes Agent v2026.7.1 junto com o Claude Code CLI 2.1.193, enquanto o Kimi K2.7 Code chega ao GA no GitHub Copilot. O ZCode lança um wrapper para GLM-5.2 que chegou à primeira página do Hacker News, o Leanstral 1.5 traz geração de provas Lean com pesos abertos, e a Alibaba proíbe o uso do Claude Code no trabalho citando riscos de backdoor. Jamesob apresenta um guia no GitHub com LLMs SOTA executáveis localmente, o WebBrain libera um agente de navegador local-first para Chrome e Firefox, a ReContext publica um harness de contexto longo sem treinamento, a Snorkel lança o Senior SWE-Bench, além de ghealth CLI, Program-as-Weights, DramaSR-532K e AgenticSTS. Show notes: https://tobyonfitnesstech.com/pt/podcasts/episode-79/
✨ Episode Outline — click any point to jump to it in the episode
Problem solved
Daily agent-stack news: Hermes Agent 2026.7.1 and Claude Code 2.1.193 released, Z-code wraps GLM 5.2, Kimi K2.7 Code hits Copilot, Mistral ships LeanStral 1.5.
🌐 This transcript was automatically translated to English from the original.
I'm Nova I'm Alloy, and this is AgentStack Daily. Hermes Agent 7.1 and terminal-based artificial intelligence coding agent ClaudeCode.193 lead the release summary. Hermes added first class Mix of Agents sets, fixed the bug. From Cibon Fork interrupt-protected compression, strengthened protection against credential exfiltration, introduced completion contracts in Slash Go, and added GateY drain coordination for Scale To Zero deployments. Hermes also promoted subagents in the background with lifecycle isolation, exposed the reasoning trace of each reference model during Ansemble runs, live-streamed the aggregator response, and closed approximately 692 high-priority issues and pull requests over an intense 12-day period. Today, Hermes and ClaudeCode lead the Arnis update, C-Code wraps GLM 5.2 and hits the front page of Hacker News, Mica 2.7 Code becomes generally available on GitHub Copilot, and Mistral releases Lensstral 1.5 as an open weights proof link model. You'll hear why Alibaba's ban on ClaudeCode matters at the Arnis layer, how Webbrain keeps browser automation local, why recontext attacks the use of long contexts without training, and how Senior SW WebEnt, Gentica STS, Drama SR, Progress Vates, Guiault, Olama, and MCP Project Radar fit into Agents Tacks in production. Hermes Agents 7.1 was released on July 1, tagged line 0.18, and the team is calling it a trial release. The main number is surprisingly concrete. In 12 days, Hermes closed all open P0 and P1 issues and pull requests in the project. Approximately 692 highest priority items out of approximately 1950 total closures. The final P0 cluster centered on an interrupt-protected compression sibling fork bug, and the same push included Cron reliability work, hardening against credential exfiltration, and a broad P1 cleanup wave. The most visible change for builders is mixing off-agents as a first-class model choice. Instead of connecting a custom router that calls up multiple models, waits for them, and stitches together a result, Hermes now lets you choose a named ensemble the same way you would choose a model. The call spreads to the reference models, shows the reasoning trace of each member, and transmits the synthesized response from the aggregator as it is being produced. This makes multi-model review usable within the normal agent loop rather than as a separate layer of orchestration. The second important change is completion contracts in Slash Go. Hermes can tie task completion to evidence checks rather than relying on the agent's own declaration that the work is finished. Slash Learn and Slash Journey make self-improvement more manageable, while background subagents now run with lifecycle isolation, so long-running subtasks can be spread out without collapsing the PIE session. Scale to Zero Gateway with drain coordination matters in production-style deployments because active sessions can terminate before capacity scales down. Claude Code.193, Antropic's terminal-based artificial intelligence and coding agent, is the other Arnes stable mentioned in the summary. Its relevance appears partly through Alibaba's later policy history. Claude Code's Diffit shell loop is powerful precisely because it sees active code context and terminal output. Hermes is pushing toward verifiable completion of deployable agents and ensembles. Claude Code remains a reference point for how much authority coding agents now wield on the terminal. ZA's Z-Code wrapped GLM 5.2 in code in Arnes and soared to over 500 points on Hacker News, which is serious attention from Western developers for an agent tool from a Chinese vendor. Z-Code is not just a template page around GLM 5.2. It's a terminal-facing Arnes that puts an agent loop, tool routing, project safolding, and code edit prompting around the template for developers to interact with the workflow instead of a raw chat endpoint. The separation is the important part. GLM 5.2 provides the weights, tokenizer, and inference path. Z-Code adds a runtime that decides when to inspect project context, when to propose an edit, how to format tool calls, and how to package code tasks for the model. This allows ZA to improve Arnes without retraining GLM 5.2 and allows the model to evolve without forcing developers to relearn the entire coding interface. Claude Code and Codex use the same product form. Arnes becomes the part that developers feel every day. The discussion on Hacker News focused on three questions. Whether ZA can price inference aggressively, whether GLM 5.2 performs well enough on repository-scale coding tasks. And if the integration surface goes beyond a terminal harness. Thread size matters because it takes Z-Code out of curiosity territory. Developers were comparing against Sonnet-style coding rams and GPT-class agent behavior, not treating it as a regional novelty. The next adoption step is integration. An IDE plugin, JetBrains extension, or MCP server would make it easier to put Z-Code into Western team workflows. Without this, it remains attractive to FAST terminal users and cost-sensitive experiments. With this, GLM 5.2 gains a credible route into the same market of everyday coding agents where Cloud Code, Codex and Copilor already compete. GitHub Copilot added Moonshot Artificial Intelligence chemistry 2.7 Code as a generally available template option on July 1st. This puts Moonshort's key-tuned K2.7 variant directly inside the Copilot selector, alongside Anthropic Sonnet, GPT family models, and Xemini inputs. The announcement on Hacker News surpassed 400 points in a few hours, which follows the demand from developers who were already routing QMI through Moonshort's andwins, or third-party providers. K2.7 Code runs on the same backbone mix off and 100 billion parameter experts as the K2 line. Instead of activating the full weight matrix on each token, the model selects a subset of experts per token, so it can carry a large total parameter budget while maintaining cost and latency per token closer to a smaller dense model. The coding-specific tuning targets smooth thread completion, multi-step edit handling, and tool call reliability, which are exactly the pieces that decide whether an agent loop feels stable. Fast Party availability on Copilot changes the adoption path. Teams no longer need to connect a Moonshort key, route through a third-party gateway, or maintain separate provider config just to compare K2.7 Code against Sonnet or a GPT model. The same selector can trigger suggestions in Copilot's line, chat and agent mode. This matters for cost-sensitive teams because model choice becomes a workspace configuration rather than a parallel integration. The interesting comparison is with long context refactoring and multi-step coding work, not with a single autocomplete. K2.7 Code has to maintain design intent, respond with reliable edits, and keep tool calls structured enough for Copilot to execute. If Moe's price advantage holds while encoding quality stays close to frontier options, Kimi could become a standard economic model for many team plans rather than an experimental choice. Jamesobi's local LLM guide rose to the front page of Hacker News with approximately 380 upvotes because it solves a problem. Actual acquisition. Which open weights model should you run on the hardware you actually have? The guide brings together scattered community wisdom about local inference, quantization, Vrão budgets, and 1 service teams into a practical reference for developers who don't want to spend weeks reading forum conversations. The guide starts with memory levels rather than hype. At the 24GB, 48GB, and 80GB tiers, it maps usable model sizes to gufo quantization choices and runtime options, with lama.cpp as the default backing. It also highlights cave cache scaling for longer context windows, because a model that fits at load time can still become infeasible once prompt length and cache growth come into play. This detail saves people from buying hardware that looks good on paper but crashes under real decoding load. The timing is why it landed well. Open weight models have established themselves in several useful ranges, fast little wizards, medium-sized 20- to 30-something billion parameter models, and 70 billion+ systems that need serious memory. Each track now sends in multiple quantization formats and with different service assumptions. A curated guide gives teams a defensible way to choose a local stack without treating every GPU purchase as a gamble. The integration angle is direct. Local inference can support encoding agents, browser agents, private rag, and evaluation harnesses through an OpenAI-compatible endpoint or lama.cpp server. The guide makes local deployment seem less like an enthusiast's hobby and more like capacity planning, model size, quantization level, context target, runtime, and sustained troupo. They all need to fit together before the agent loop feels responsive. Alibaba directed employees to stop using Antropic's Cloud Code internally, according to Reuters reports dated July 3. The directive treats Cloud Code as a data egress and backdoor concern within the company's infrastructure. It doesn't appear to be a public technical finding against the Cloud model itself. It targets the agentive coding harness that runs in the developer environment and sends work context to Antropic's inference API. The reason security teams focus on Arnis is concrete. Cloud Code reads active code context, sees shell output, schedules edits, and uses tool calls to continue the session. Each round trip can include surrounding div context, endpoint results, and project content needed for the next step. This exit channel is also the surface that a prompt injection attack or supply chain trickery would attempt to exploit. From a sovereign risk perspective, the concern is not just model quality, it's where sensitive engineering context travels during an unattended coding session. For companies operating within Chinese cloud perimeters, this turns agent choice into a procurement and compliance decision. Domestic alternatives built on who? Systems derived from DeepSec, GLM or locally hosted models become more attractive when a Western Arnis is categorized as risky. The fracture happens at the Arnis layer because that's where shell access, code edits, credentials, and terminal output meet the model provider. Distributed engineering teams will feel this first. The same codebase can be edited with Cloud Code on one side of a border and a home or self-hosted agent on the other. This pushes teams toward Arnis-agnostic review, CI surfaces, and assessment. The agent may vary by region, but merge gates, regression checks, and security review need to remain consistent if the organization wants an engineering standard. Amistral has released LensTral 1.5, the second major version of its Lean-tuned language model for automated theorem proving. The framing of the release, plenty of evidence for everyone, signals open weights rather than an API-only gate. This matters because proof generation is computationally hungry and iterative, enthusiastic researchers. Compiler engineers and security teams can now place a competitive Lean model within their own Lean 4 environment rather than routing each attempt through a hosted endpoint. LensTral works with the Lean 4 tactics-based workflow. A user states a theorem. The model outputs a candidate proof script using tactics such as Apli, Intro, Simp Ring and the Lean kernel verifies the proof. The model is unreliable just because the text is only plausible. The kernel checks whether the proof is valid. Version 1.5 improves tactic prediction and expands coverage of Matlib-style patterns, which should reduce the dead ends that appear when the model knows the form of a proof but misses the library call that actually closes it. The integration path is familiar to the Lean community. Existing evidence search harnesses already use Lean. Lean, repl interfaces and language server workflows. LensTral can serve as a local tactics suggester in this loop. The developer still gets kernel-backed correctness, but the model can search the space of tactic sequences faster than a human manually guessing each step. The broader impact goes beyond pure mathematics. Formal methods are advancing for verifying compilers, cryptographic protocols, and high assurance systems. An open weights proof model reduces the cost of experimenting with certified code and machine-verified reasoning. The item of observation is benchmark transparency. Mini F2F style results. License terms and community reports will decide whether LensTral becomes a standard local proofing assistant or remains a promising research tool. WebKit introduced the Safari MCP server for web developers, and the announcement gained attention with over 260 spots on Hacker News. The release matters because it puts Safari's browser inspection and automation surface behind the Model Context Protocol, giving agent tools a standard way to talk to WebKit-backed developer capabilities rather than relying solely on Chrome-centric automation paths. The concrete surface is browser debugging and web development automation. MCP gives an agent a structured tool interface to inspect a page, reason about runtime state, interact with developer surfaces, and return results via a protocol that the surrounding agent stack already understands. For web developers, this means Safari can be part of the same tool graph as code fetching, endpoint actions, testers, and browser checks. Agents no longer need to treat Safari as an out-of-the-loop browser. This is especially useful when specific Safari behavior matters. Web applications may pass under Xoromi 1 and fail under WebKit because layout, privacy rules, media behavior, or mobile-adjacent rendering differ. A Safari MCP server gives coding agents a direct route to examine the faulty surface, connect that to source code changes, and propose fixes without asking the user to manually translate the browser state into a prompt. The adoption question is how quickly the surrounding tools will integrate it. Fast MCP-style server Fram and Vork, coding harnesses, and local browser agents can all benefit from a native WebKit MCP target. The practical gain is not flashy. There are fewer blind spots when an agent is asked to fix a web bug that only appears in Safari. For teams delivering web apps to consumers, this is the difference between an agent that just programs and an agent that can actually inspect the browser your users use. WebBrain was released as an open-source browser agent under MIT license for Chrome and Firefox. It reads pages, extracts structured data, and drives multi-step automation through two modes. ESC is the read-only path for page extraction. ACT is the automation path, where the model emits action sequences such as click, type, navigate and extract. And the extension controller performs these actions against the live page. Fast local design is the highlight. WebBrain runs as a browser extension with a content script controller mediating between the DOM and an LLM backing chosen at runtime. The backing can be a lama.cpt server, an Olama endpoint, or an OpenAI-compatible cloud API. When a local backing is selected, the page content and extracted data remain on the machine. This is the key distinction of hosted browser-use vendors, where authenticated pages and internal dashboards can leave the user's environment. The mechanism makes it useful for sensitive workflows. ESC can analyze the DOM and answer questions about a dashboard, report or internal tool. Act can chain structured actions across a live page. A developer can point WebBrain to a local 7B or 14B model for routine extraction, then switch to a larger cloud model only when a task needs more reasoning. The same extension surface handles both choices. The integration angle is strong for teams that already run local encoding agents. WebBrain can become the browser side of this stack. Code agent edits the app. Browser agent inspects the result. Local model maintains local private state. The point of attention is the reliability under real websites. Content security policies, common front-end framework, and changing page structure are where browser agents often break down. If WebBrain keeps the action sema stable while contributors add verbs, it becomes a practical self-hosted alternative. Recontext, short for recursive Evidence Replay, is a new free training tool for long context reasoning by Yan Jun Zhao, Hui Xiongong Kiu, and Tianxin Wei. He attacks a family problem. Models can accept huge prompts but still fail to use the correct evidence. Instead of asking for a longer window or a new Vine Tune, Recontext wraps the existing long context model at inference time and tries to improve how evidence is reused. The first mechanism is the extraction of internal relevance from the model. Instead of relying on a separate herer, summarizer, or embedding pass, Recontext reads relevance signals from the model's own hardlining and scores which prompt spans matter for the current query. These scores then drive a recursive evidence replay. Arnes reinjects high-skill spans back into the prompt via staggered passes so that the model sees important evidence again with priority rather than letting it disappear within a massive context window. This is useful because many agent stacks already pay for large windows. Code review trails, RAG sessions, legal analysis and long support histories fit within the context of 100 thousand or 200 thousand tokens. But fit does not guarantee reasoning. Recontext offers a way to make the existing window work harder before teams spend on a long context model or redesign the recovery. The drop-in nature is the attraction. It is training-free and model-agnostic in article formulation, so it can sit between retrieval and final generation or involve an agent trace before response synthesis. The point of attention is how well the internal relevance signals survive across smaller openweight models and different implementations of attention. If the method only shines in large closed systems, adoption will narrow. If it works on local models, it becomes a practical upgrade of ARNs. Snorkel has released Senior SWE-Bent, an open source benchmark for coding agents that aims above the clutter correction bar. SWE-Bent Vanilla has been valuable, but many tasks come down to fixing a localized problem. Senior engineering work involves changes between services, ambiguous requirements, trade office judgment, and pool requests that span more than one repository. Senior SWE-Bent attempts to evaluate this production format work directly. ARNs run locally, which is an important design choice for enterprise teams. Hosted benchmarks generally cannot accept proprietary code, but a local benchmark runner can score internal agents against internal tasks without sending sensitive context to an external service. Task switches focus on senior engineer dimensions, design judgment under ambiguity, coordinated changes between services, and multi-repository pool requests where a narrow patch is not enough. The CI integration path is where it comes in handy. A team can score agent behavior through model switches, prompt changes, tool additions, and ARN updates using the same rubric. This makes agent improvement measurable beyond demo quality. A coding assistant that looks impressive in bugs. Small ones can still fail when they need to modify an API, update a caler, adjust a migration and keep tests aligned between services. The launch also puts pressure on model labs and agent sellers. Saturated benchmark scores are easy to market, but senior scope tasks expose weak planning, fragile context handling, and poor design judgment. The point of attention is which labs publish senior SWEBente I numbers and whether agent harnesses adopt it as a standard release gate. If it catches on, the coding agent competition shifts from PET precision to production engineering competency. Get Out is a community-built Go command-line tool that wraps the Google Health API and exposes 40 feature data types like John Ready for Agents. It came about through MarkTechPost and fills a missing endpoint layer for developers who want telemetry from wearables in agent contexts without building. Your own customer remains. It's not an official Google release, so SEMA maintenance and drift need to be understood before anyone treats it as infrastructure. The tool is distributed as a single static Go binary and normalizes multiple Google Health API surfaces into a SEMA. Sleep stages, heart rate, active minutes, oxygen saturation, steps and related metrics can all fall into a payload that an agent can read without customization for each category. The flow or other uses large explicit scopes by data type, so the user can authorize access to heart rate without automatically opening each health category. This unlocks small but useful agent workflows. A local assistant can summarize recovery trends, correlate sleep and training load, or prepare weekly health notes from structured telemetry. Encoding agents can also consume the payload during data pipeline development, dashboard work, or quantified selfie tools. The important thing is that the interface is terminal-friendly and automation-friendly, so it can run on a schedule and feed OVTREON systems. Because Guiaute is maintained by the community, the posture of credentials and schemas matters. Update or high-value tokens behave like high-value secrets, and endpoint changes can change the shape of Pailua without the warning pace that an official SDK could provide. The point of attention is whether Google will release an official command-line tool or SDK for the same API. If this happens, the guide becomes a useful bridge or reference point to a more supported path. Program As Vates proposes a programming paradigm where natural language specifications are compiled into compact neural artifacts. The article is trending on UGEM Face's daily feed with 68 upvotes, and the idea is aimed at fuzzy functions, classification, routing, extraction, scoring and other tasks where deterministic code is awkward, but calling a large general model each time is expensive. Pipeline divides work into build time and run time. A 4 billion parameter compiler reads a natural language specification and outputs a compact set of weights representing the behavior. A 0.6 billion parameter interpreter executes this artifact at inference time. The implanted surface is not a prompt and is not a fine-tune of a giant base model. It's a small neural program run by a small interpreter, which means the expensive compiler only runs when the behavior is built or revised. This changes the cost structure. Prompting a boundary model repeats the behavior description with each call. It pays for long context and depends on a general system to follow the specification each time. The Asveits program collapses the behavior into pesos and pays a small forward ticket during the operation. The authors position it as research, not a product launch, but the format is attractive for on-device use and low latency. The integration question is whether these compiled artifacts can match large models with prompting in real fuzzy tasks. If they succeed, teams can submit versioned neural artifacts for content routing, extraction, and tagging the way they ship small services today. A 4 billion compiler fits on a Workstation GPU, and a 0.6 billion interpreter can plausibly run on laptops or edge devices. This moves the customization cost off the critical path. Drama SR532K is a new long-term speaker recognition benchmark from Yu Shuang Li, Ling Xi Xie and Xin Yu Yu. It contains 532,000 lines of annotated dialogue with more than 900 characters from TV soap operas. This scale forces models to do more than voiceprint matching. They need to combine audio, ASR transcriptions, and on-screen visual context to decide which character is speaking over long arcs. The proposed model routes speaker assignment through a reasoning LLM that acts as a controller. It can consult on audio beindings, the transcript, and visual cues before issuing a character label. This is important because long-running dramas create collisions, similar voices, recurring characters, off-screen lines, and scenes where the same speaker identity only makes sense with the previous context. A short clip classifier will miss these dependencies. For builders of multimodal agents, the benchmark provides a public target for identity tracking over time. Understanding long videos, character-aware transcription, meeting analysis, podcast editing, and media search need stable attribution over many minutes or hours. The size of the ASR drama makes it possible to evaluate whether a system can preserve identity beyond one scene. The reusable pattern is the reasoning controller. Rather than asking one modality to decide, LLM coordinates evidence from multiple channels and then commits to a response. This pattern can be transferred to meetings where speakers overlap, call center analysis where transcripts are noisy, or video agents who need to remember who did what before. Points of interest are weight availability, benchmark adoption, and whether OVTREON packages begin to treat long-range identity as a standard multimodal capability. Alayalab's QSTS agent provides long-range LLM agents with a memory-limited test environment and a typed recovery contract. The QSTS agent is trending in daily UGEM Face articles with 43 upvotes and addresses a confusing evaluation problem. When an agent improves, was it the memory layer, the retriever, the summarizer, the model, or just more tokens? The QSTS agent treats memory as a typed interface rather than a free-form blob. The agent issues typed queries against a limited memory store, and ARNES reconstructs fresh prompts from typed slots at each step. A hard ceiling of recovery tokens keeps cooperations on an equal basis, so changing a retriever, summarizer, or eviction policy changes this component without silently giving more context budget to the agent. This isolation is important because long-range agents often fail slowly. A memory layer may appear useful during short tasks and then degrade as summaries lose detail. Recovery pulls stale context or pruning removes the wrong state. Typed slots make fault easier to assign. If a decision task needs a user preference, previous action, environmental fact, or goal state, the memory interface can ask for that type directly instead of repeating everything. The integration angle is small enough to adapt. Teams can design internal memory layers around typed queries, bounded retrieval, and step-prompt assembly, and then evaluate each component independently. Agentica STS is useful less because it promises a perfect memory system and more because it gives builders a way to compare memory policies without mixing up every moving part. The next thing to watch is whether open source agent frameworks adopt typed recovery as a standard memory evaluation surface. Deusdata's MCP Memory Codebase is a high-performance model context protocol server that indexes a codebase into a persistent knowledge graph and answers dependency-style questions in 158 languages. It is distributed as a single static binary with no external dependencies, which makes it easy to place it alongside an agent runner without setting up a separate fetch service. The main mechanism is graph-based code memory. Instead of asking an agent to grep every time it needs context, the MCP server can answer questions like where a symbol is used, what a function depends on, or which areas of the design connect to a feature. Sub-millisecond query claims are especially useful for agent lopes because repeated context fetches can dominate latency and token expenditure. The integration angle is direct. Register as an MCP tool within an OpenCloud, Codex Style, Hermes, or CloudCode workflow and let the agent query code relationships before proposing edits. This can reduce prompt bloat because the agent asks for the relevant slice rather than cramming in broad project context at every turn. Prefeca GAC's Fast MCP is a Pythonic framework for building MCP servers and clients with minimal boilerplate. It encapsulates tool transport, discovery, and exposure, so a Python function can become a scalable AID tool in a few lines. The useful mechanism is ergonomic protocol encapsulation. MCP is powerful, but teams often get stuck when each internal service needs custom protocol handling before an agent can call it. Fast MCP transforms the Python function limit into the tool limit, which lowers the cost of exposing internal apps, data transformations, schedulers, and operational alpers to a stack of agents. Hermes, Cloud Code, and other MCP-aware harnesses benefit because custom tools can be shipped quickly without inventing a unique integration standard. For teams already running Python services, Fast MCP is the short path from a useful function to a structured tool call that an agent can discover and invoke. Microsoft's MCP for Beginners is an open-source learning path for modeling with test protocol in .NET, Java, TypeScript, JavaScript, Rust, and Python. It guides developers from a first MCP server to secure and scalable deployment patterns. The mechanism here is team alignment rather than runtime speed. The MCP touches on tooling schemes, authorization, transport choices, and agent behavior. A cross-platform curriculum allows a team to learn the protocol in the language their stack already uses, so the first internal tool doesn't arrive with misaligned assumptions about security, schema design, or deployment. The integration angle is onboarding. Before adding a new tool surface to an agent in production, teams can go through a specific language path and establish shared standards. This reduces the chances that each group will build its own incompatible style of MCP server. The Olama.31. improves on the Gema 4 path on Apple Silicon, with up to 90% faster generation on a cipher agent benchmark when multi-token prediction is routed through the backing metal. The release maintains the usual local ergonomics, an execution command, automatic weight search and an OpenAI-compatible endpoint for tools that already talk to local servers. The practical angle is N-series MACs. If Gema 4 can produce tokens much faster locally, agent low-ups that repeatedly roundtrip through the model seem less stuck. Running Gema 4 through Olama and running a thousand token generation through the supported endpoint gives MAC users a quick way to compare it to their previous local standard. Testevo Bent evaluates the co-evolution of test and code instead of isolated test generation. The benchmark runs candidate tests against commit pi and checks coverage on the fixed lines. Then agents are scored on runtime correctness and semantic linkage to the code change, not textual similarity to a reference response. This matters to coding agents because real engineering changes often require tests that capture new behavior. A model that writes plausible tests but misses the changed path should not get credit. Testevo Bent gives teams a clearer way to assess whether an agent understands the patch well enough to update the validation surface around it. A localama community thread is testing whether 27 to 35 billion parameter models are the practical sweet spot on a 100 and 28 GB M3 Max. The author compares weights that 4-underline, K-underline, M gufo, and 4-bit MLX against 70 billion+ models while measuring tokens per second and full-context prompt evaluation latency. The useful point is that the maximum model size may not be the best daily drive. On unified memory Macs, a medium-sized model may deliver better responsiveness to coding lopes than a larger model that technically fits but responds very slowly. This reinforces the shopping lesson from the local LLM guide. Your Guput and Latency matter as much as parameter count. Another localama thread describes replacing a hosted coding assistant with a locally served model exposed through an OpenAI-compatible endpoint. The author found that for code preparation workloads, lower network roundtrip latency outweighed the Frontier class reasoning loss. This is a useful reminder for agent stakes. Not every coding task needs the strongest model available. If the work is preparing code, summarizing context, reshaping snippets, or making small local edits, a fast local endpoint may seem better than a smarter hosted model that waits on the network at every turn. Hermes 7.1 makes multi-model named sets and evidence-based objective completion part of the normal agent surface. CloudCode.193 remains central to the debate over endpoint encoding agents as security teams examine output context. Z-Code. Kimi and K2.7 Code Lianstra 1.5 expand the templates and tools menu. Chinese coding tools. Webbrain. Safari.mcp. FESH.mcp. Codebase.memory.mcp. And the CV.mcp. Microsoft shows the layer of tools becoming more practical. Browsers. Code graphs and internal services are becoming callable agent surfaces. Recontext. Senior SW and Bente. KSTS Agent. Testo Bente. Drama SR. Progress Vates. Guiault. Lama and discussions about local models point to the same development pressure. Agents need better evaluation. Fastest local Lopes. Cleaner memory and more private data paths. For more details on the releases, projects, articles and source material behind the coverage, see the show notes at tobionfitnesstech.com. Thanks for listening to Edit Stack Daily. We'll be back soon.
Eu sou a Nova Eu sou o Alloy, e este é o AgentStack Daily. Hermes Agent 7.1 e o agente de codificação inteligência artificial baseado em terminal ClaudeCode.193 lideram o resumo do lançamento. Hermes adicionou conjuntos de Misture of Agents de primeira classe, corrigiu o bug. De Cibon Fork de compressão protegido por interrupção, fortaleceu a proteção contra a esfiltração de credenciais, introduziu contratos de conclusão em Slash Go, e adicionou coordenação de drenagem do GateY para deployments Scale To Zero. Hermes também promoveu subagentes em segundo plano com isolamento de ciclo de vida, expôs a trace de raciocínio de cada modelo de referência durante as execuções de Ansemble, transmitiu a resposta do agregador em streaming ao vivo, e fechou cerca de 692 issues e pull requests de alta prioridade durante um período intenso de 12 dias. Hoje, Hermes e ClaudeCode lideram a atualização do Arnis, C-Code embrulha o GLM 5.2 e chega à primeira página do Hacker News, que Mica 2.7 Code fica geralmente disponível no GitHub Copilot, e Mistral lança Lensstral 1.5 como modelo de prova link de pesos abertos. Você vai ouvir por que o banimento do ClaudeCode pela Alibaba importa na camada de Arnis, como o Webbrain mantém a automação de navegador local, por que a recontexta ataca a utilização de long contextos sem treinamento, e como o Senior SW WebEnt, a Gentica STS, Drama SR, Progress Vates, Guiault, Olama, e o Radar de Projetos MCP se encaixam nos Agents Tacks em produção. Hermes Agents 7.1 foi lançado em 1 de julho, tagged da linha 0.18, e a equipe está chamando de a release de julgamento. O número principal é surpreendentemente concreto. Em 12 dias, Hermes fechou todos os issues e pull requests P0 e P1 abertos no projeto. Cerca de 692 itens de mais alta prioridade entre aproximadamente 1950 encerramentos totais. O cluster P0 final se centrou em um bug de sibling fork de compressão protegido por interrupção, e o mesmo push incluiu trabalho de confiabilidade do Cron, fortalecimento contra a exfiltração de credenciais, e uma onda ampla de limpeza P1. A mudança mais visível para builders é mistura off-agents como uma escolha de modelo de primeira classe. Em vez de conectar um router customizado que chama vários modelos, espera por eles, e costura um resultado, Hermes agora permite que você escolha um ensemble nomeado da mesma forma que escolheria um modelo. A chamada se espalha para os modelos de referência, mostra a trace de raciocínio de cada membro, e transmite a resposta sintetizada do agregador enquanto está sendo produzida. Isso torna a revisão multimodelo utilizável dentro do loop normal do agente em vez de como uma camada separada de orquestração. A segunda mudança importante são os contratos de conclusão em Slash Go. Hermes pode vincular a conclusão de tarefa a verificações de evidências em vez de confiar na própria declaração do agente de que o trabalho está terminado. Slash Learn e Slash Journey tornam a auto-aperfeiçoamento mais controlável, enquanto subagentes em segundo plano agora rodam com isolamento de ciclo de vida, então subtarefas de longa execução podem se espalhar sem colapsar a sessão PIE. Gateway Scale to Zero com coordenação de drenagem importa em deployments estilo produção porque sessões ativas podem terminar antes que a capacidade escale para baixo. Claude Code.193, o agente de codificação e inteligência artificial baseado em terminal da Antropic, é o outro Arnes estável mencionado no resumo. Sua relevância aparece parcialmente através da história de política da Alibaba depois. O loop de Shell, Diffit o qual do Claude Code é poderoso precisamente porque vê contexto de código ativo e saída do terminal. Hermes está empurrando para a conclusão verificável de agentes e ensembles implantáveis. Claude Code permanece um ponto de referência para quanta autoridade agentes de codificação agora exercem no terminal. O Z-Code da ZA embrulhou o GLM 5.2 em um código em Arnes e disparou para mais de 500 pontos no Hacker News, o que é a atenção séria de desenvolvedores ocidentais para uma ferramenta de agente de um vendor chinês. Z-Code não é apenas uma página de modelo em torno do GLM 5.2. É um Arnes voltado para terminal que coloca um loop de agente, roteamento de ferramentas, safolding de projeto e prompting de edição de código ao redor do modelo para que desenvolvedores interajam com o workflow em vez de um endpoint de chat bruto. A separação é a parte importante. GLM 5.2 fornece os pesos, tokenizador e caminho de inferência. Z-Code adiciona um runtime que decide quando inspecionar contexto do projeto, quando propor uma edição, como formatar tool calls e como empacotar tarefas de código para o modelo. Isso permite que ZA melhore o Arnes sem retreinar o GLM 5.2 e permite que o modelo evolua sem forçar desenvolvedores a reaprender toda a interface de codificação. Claude Code e Codex usam a mesma forma de produto. O Arnes se torna a parte que desenvolvedores sentem todos os dias. A discussão no Hacker News se concentrou em três perguntas. Se ZA pode precificar inferência agressivamente, se GLM 5.2 performa bem o suficiente em tarefas de codificação em escala de repositório. E se a superfície de integração vai além de um Arnes de terminal. O tamanho do thread importa porque tira Z-Code do território de curiosidade. Desenvolvedores estavam comparando contra rams de codificação estilo Sonnet e comportamento de agente classe GPT, não tratando como uma novidade regional. O próximo passo de adoção é integração. Um plugin de IDE, extensão JetBrains, ou servidor MCP facilitaria colocar Z-Code dentro de workflows de equipes ocidentais. Sem isso, permanece atraente para usuários terminal FAST e experimentos sensíveis a custos. Com isso, GLM 5.2 ganha uma rota credível para o mesmo mercado de agentes de codificação do dia-a-dia onde Cloud Code, Codex e Copilor já competem. GitHub Copilot adicionou o química 2.7 Code da Moonshot Inteligência Artificial como uma opção de modelo geralmente disponível em 1º de julho. Isso coloca a variante K2.7 ajustada para codificação da Moonshort diretamente dentro do seletor do Copilot, ao lado de Anthropic Sonnet, modelos da família GPT e entradas do Xemini. O anúncio no Hacker News ultrapassou 400 pontos em poucas horas, o que acompanha a demanda de desenvolvedores que já estavam roteando o QMI através de andwins da Moonshort, ou provedores terceiros. K2.7 Code roda na mesma espinha dorsal misture off e expertos de 100 bilhões de parâmetros da linha K2. Em vez de ativar a matriz de pesos completa em cada token, o modelo seleciona um subconjunto de experts por token, então pode carregar um orçamento de parâmetros total grande enquanto mantém custo e latência por token mais próximos de um modelo denso menor. O ajuste específico para codificação visa conclusão fio indemido, manipulação de edições multi-step e confiabilidade de tool call, que são exatamente as peças que decidem se um loop de agente parece estável. A disponibilidade Fast Party no Copilot muda o caminho de adoção. Equipes não precisam mais conectar uma chave da Moonshort, rotear através de um gateway terceiro, ou manter config de provedor separada só para comparar K2.7 Code contra Sonnet ou um modelo GPT. O mesmo seletor pode acionar sugestões em line, chat e modo agente do Copilot. Isso importa para equipes sensíveis a custos porque escolha de modelo se torna uma configuração de workspace em vez de uma integração paralela. A comparação interessante é com refatoração de contexto longo e trabalho de codificação em múltiplas etapas, não com um único autocomplete. O K2.7 Code tem que manter a intenção do projeto, responder com edições confiáveis e manter as chamadas de ferramentas estruturadas o suficiente para o Copilot executar. Se a vantagem de preço do Moe se mantiver enquanto a qualidade de codificação ficar próxima das opções de fronteira, o Kimi pode se tornar um modelo econômico padrão para muitos planos de equipe em vez de uma escolha experimental. O guia de LLM local do Jamesobi subiu para a primeira página do Hacker News com aproximadamente 380 votos positivos porque resolve um problema. Real de aquisição. Qual modelo de pesos abertos você deveria executar no hardware que você realmente possui? O guia reúne sabedoria comunitária dispersa sobre inferência local, quantização, orçamentos de Vrão e 1 times de serviço em uma referência prática para desenvolvedores que não querem passar semanas lendo conversas em fóruns. O guia começa pelos níveis de memória em vez do hype. Nos níveis de 24 GB, 48 GB e 80 GB, ele mapeia tamanhos de modelo utilizáveis para escolhas de quantização gufo e opções de runtime, com o lama.cpp como backing padrão. Ele também destaca o dimensionamento de cave cache para janelas de contexto mais longas, porque um modelo que cabe no momento do carregamento ainda pode se tornar inviável assim que o comprimento do prompt e o crescimento do cache entram em cena. Esse detalhe economiza as pessoas à compra de hardware que parece bom no papel, mas trava sob carga de decodificação real. O momento é o motivo pelo qual ele caiu bem. Modelos de pesos abertos se estabeleceram em várias faixas úteis, pequenos assistentes rápidos, modelos de 20 e poucos a 30 e poucos bilhões de parâmetros de tamanho médio e sistemas de 70 bilhões ou mais que precisam de memória séria. Cada faixa agora envia em múltiplos formatos de quantização e com diferentes pressupostos de serviço. Um guia curado dá às equipes uma forma defensável de escolher uma stack local sem tratar cada compra de GPU como uma aposta. O ângulo de integração é direto. A inferência local pode dar suporte a agentes de codificação, agentes de navegador, rag privado e arnesses de avaliação através de um endpoint compatível com um OpenAI ou um servidor lama.cpp. O guia faz a implantação local parecer menos como hobby de entusiasta e mais como planejamento de capacidade, tamanho do modelo, nível de quantização, alvo de contexto, runtime e trogupo sustentado. Todos precisam se encaixar antes que o loop do agente pareça responsivo. A Alibaba orientou funcionários a interromperem o uso do Cloud Code da Antropic internamente, segundo relatórios da Reuters datados de 3 de julho. A diretiva trata o Cloud Code como uma preocupação de saída de dados e porta dos fundos dentro da infraestrutura da empresa. Não parece ser uma descoberta técnica pública contra o modelo Cloud em si. Ela mira o arnés de codificação agentivo que roda no ambiente do desenvolvedor e envia contexto de trabalho para a API de inferência da Antropic. O motivo pelo qual as equipes de segurança se concentram no Arnis é concreto. O Cloud Code lê contexto de código ativo, vê saída de Shell, planeja edições e usa chamadas de ferramentas para continuar a sessão. Cada viagem de ida e volta pode incluir contexto de div circundante, resultados de terminal e conteúdo do projeto necessário para a próxima etapa. Esse canal de saída também é a superfície que um ataque de injeção de prompt ou truque de cadeia de suprimentos tentaria explorar. De uma perspectiva de risco soberano, a preocupação não é apenas a qualidade do modelo, é para onde o contexto de engenharia sensível viaja durante uma sessão de codificação autônoma. Para empresas operando dentro de perímetros de nuvem chineses, isso transforma a escolha do agente em uma decisão de aquisição e conformidade. Alternativas domésticas construídas sobre quem? Sistemas derivados de DeepSec, GLM ou modelos hospedados localmente se tornam mais atraentes quando um Arnis ocidental é categorizado como arriscado. A fratura acontece na camada do Arnis porque é ali que o acesso ao Shell, edições de código, credenciais e saída de terminal encontram o provedor de modelo. Equipes de engenharia distribuídas sentirão isso primeiro. A mesma base de código pode ser editada com o Cloud Code de um lado de uma fronteira e um agente doméstico ou auto-hospedado do outro. Isso empurra equipes em direção à revisão agnóstica de Arnis, superfícies de CI e avaliação. O agente pode variar por região, mas os portões de merge, verificações de regressão e revisão de segurança precisam permanecer consistentes se a organização quiser um padrão de engenharia. Amistral lançou o LensTral 1.5, a segunda versão principal de seu modelo de linguagem ajustado para a Lean para a prova de teoremas automatizada. O framing do lançamento, abundância de provas para todos, sinaliza pesos abertos em vez de um portão apenas de API. Isso importa porque a geração de provas é computacionalmente faminta e iterativa, pesquisadores entusiastas. Engenheiros de compiladores e equipes de segurança agora podem colocar um modelo Lean competitivo dentro de seu próprio ambiente Lean 4 em vez de rotear cada tentativa, através de um endpoint hospedado. O LensTral funciona com o workflow baseado em táticas do Lean 4. Um usuário declara um teorema. O modelo emite um script de prova candidato usando táticas como Apli, Intro, Simp Ring e o kernel do Lean verifica a prova. O modelo não é confiável apenas porque o texto só aplausível. O kernel verifica se a prova é válida. A versão 1.5 melhora a previsão de táticas e amplia a cobertura de padrões estilo Matlib, o que deve reduzir os becos sem saída que aparecem quando o modelo conhece a forma de uma prova mas erra a chamada de biblioteca que realmente a fecha. O caminho de integração é familiar para a comunidade Lean. Arnesses de busca de provas existentes já usam Lean. Lean, interfaces replu e workflows do language server. O LensTral pode servir como sugeridor de táticas local nesse loop. O desenvolvedor ainda obtém correção apoiada por kernel, mas o modelo pode buscar o espaço de sequências de táticas mais rápido do que um humano adivinhando manualmente cada etapa. O impacto mais amplo vai além da matemática pura. Métodos formais estão avançando para verificação de compiladores, protocolos criptográficos e sistemas de alta garantia. Um modelo de prova de pesos abertos reduz o custo de experimentar com código certificado e raciocínio verificado por máquina. O item de observação é a transparência de benchmark. Resultados estilo Mini F2F. Termos de licença e relatórios da comunidade decidirão se o LensTral se torna um assistente de provas local padrão ou permanece uma ferramenta de pesquisa promissora. O WebKit introduziu o servidor Safari MCP para desenvolvedores web, e o anúncio chamou a atenção com mais de 260 pontos no Hacker News. O lançamento importa porque coloca a superfície de inspeção e automação de navegador do Safari atrás do Model Context Protocol, dando às ferramentas de agente uma forma padrão de conversar com capacidades de desenvolvedor apoiadas pelo WebKit em vez de depender apenas de caminhos de automação, centrados no Chrome. A superfície concreta é a depuração de navegador e automação de desenvolvimento web. O MCP dá a um agente uma interface de ferramenta estruturada, inspecionar uma página, raciocinar sobre o estado de runtime, interagir com superfícies de desenvolvedor e retornar resultados através de um protocolo que stack de agente circundante já entende. Para desenvolvedores web, isso significa que o Safari pode fazer parte do mesmo grafo de ferramentas que busca de código, ações de terminal, testadores e verificações de navegador. Agentes não precisam mais tratar o Safari como navegador que fica fora do loop. Isso é especialmente útil quando o comportamento específico do Safari importa. Aplicações web podem passar no Xoromi 1 e falhar sob o WebKit porque layout, regras de privacidade, comportamento de mídia ou renderização adjacente a mobile o diferem. Um servidor Safari MCP dá aos agentes de codificação uma rota direta para examinar a superfície com falha, conectar isso a mudanças de código-fonte e propor correções sem pedir ao usuário para traduzir manualmente o estado do navegador em um prompt. A questão de adoção é quão rápido as ferramentas ao redor vão integrá-lo. Fram e Vork de servidor no estilo Fast MCP, arnesses de codificação e agentes de navegador locais podem todos se beneficiar de um alvo MCP nativo do WebKit. O ganho prático não é chamativo. São menos pontos cegos quando um agente é solicitado a corrigir um bug web que só aparece no Safari. Para equipes que entregam apps web para consumidores, isso é a diferença entre um agente que só programa e um agente que realmente consegue inspecionar o navegador que seus usuários usam. WebBrain foi lançado como um agente de navegador open-source sob licença MIT para Chrome e Firefox. Ele lê páginas, extrai dados estruturados e impulsiona a automação de múltiplas etapas através de dois modos. ESC é o caminho apenas de leitura para que há da página e extração. ACT é o caminho de automação, onde o modelo emite sequências de ação como click, type, navigate e extract. E o controlador da extensão executa essas ações contra a página ao vivo. O design local Fast é o destaque. O WebBrain roda como uma extensão de navegador com um controlador de content script mediando entre o DOM e um backing de LLM escolhido em tempo de execução. O backing pode ser um servidor lama.cpt, um endpoint da Olama ou uma API de nuvem compatível com um OpenAI. Quando um backing local é selecionado, o conteúdo da página e os dados extraídos permanecem na máquina. Essa é a distinção-chave de vendedores de browser-use hospedados, onde páginas autenticadas e dashboardas internos podem sair do ambiente do usuário. O mecanismo torna útil para fluxos de trabalhos sensíveis. ESC pode analisar o DOM e responder perguntas sobre um dashboard, relatório ou ferramenta interna. Act pode encadear ações estruturadas através de uma página ao vivo. Um desenvolvedor pode apontar o WebBrain para um modelo local de 7 bilhões ou 14 bilhões para extração rotineira, então alternar para um modelo de nuvem maior apenas quando uma tarefa precisar de mais raciocínio. A mesma superfície de extensão lida com ambas as escolhas. O ângulo de integração é forte para equipes que já rodam agentes de codificação locais. O WebBrain pode se tornar o lado navegador dessa stack. Agente de código edita o app. Agente de navegador inspeciona o resultado. Modelo local mantém estado privado local. O ponto de atenção é a confiabilidade sob sites reais. Políticas de segurança de conteúdo, framework de front-end em comuns e estrutura de página em mudança são onde agentes de navegador geralmente quebram. Se o WebBrain mantiver o sema de ações estável enquanto contribuidores adicionam verbos, ele se torna uma alternativa auto-hospedada prática. Recontext, abreviação de recursivo Evidence Replay, é um novo Arnes livre de treinamento para raciocínio de longo contexto de Yan Jun Zhao, Hui Xiongong Kiu e Tianxin Wei. Ele ataca um problema familiar. Modelos podem aceitar prompts enormes mas ainda falham em usar a evidência correta. Em vez de pedir uma janela mais longa ou um novo Vine Tune, Recontext envolve o modelo de longo contexto existente no tempo de inferência e tenta melhorar como a evidência é reutilizada. O primeiro mecanismo é a extração de relevância interna do modelo. Em vez de depender de um heranquer separado, sumarizador ou passagem de embedding, Recontext lê sinais de relevância do próprio forro hardpés do modelo e pontua quais spans do prompt importam para a query atual. Essas pontuações então impulsionam um replay de evidência recursivo. O Arnes reinjeta spans de alta sarentabilidade de volta no prompt através de passagens escalonadas para que o modelo veja evidência importante novamente com prioridade em vez de deixá-la desaparecer dentro de uma janela de contexto massiva. Isso é útil porque muitas stacks de agentes já pagam por janelas grandes. Rastros de code review, sessões de RAG, análise legal e históricos longos de suporte cabem dentro de contextos de 100 mil ou 200 mil tokens. Mas caber não garante raciocínio. Recontext oferece uma forma de fazer a janela existente trabalhar mais antes que equipes gastem em um modelo de longo contexto ou redesenhem a recuperação. A natureza drop-in é a atração. É livre de treinamento e agnóstico de modelo na formulação do artigo, então pode ficar entre a recuperação e a geração final ou envolver um trace de agente antes da síntese da resposta. O ponto de atenção é quão bem os sinais de relevância internos sobrevivem através de modelos openweight menores e diferentes implementações de atenção. Se o método só brilha em sistemas grandes fechados, a adoção se estreita. Se funciona em modelos locais, se torna um upgrade prático de ARNs. Snorkel lançou o Senior SWE-Bent, um benchmark open source para agentes de codificação que visa acima da barra de correção de bagúnico. O SWE-Bent Vanilla tem sido valioso, mas muitas tarefas se resumem a corrigir um problema localizado. Trabalho de engenharia sênior envolve mudanças entre serviços, requisitos ambíguos, julgamento de trade office e pool requests que abrangem mais de um repositório. O Senior SWE-Bent tenta avaliar esse trabalho com formato de produção diretamente. O ARNs roda localmente, o que é uma escolha de design importante para equipes de enterprise. Benchmarks hospedados geralmente não podem aceitar código proprietário, mas um runner de avaliação local pode pontuar agentes internos contra tarefas internas sem enviar contexto sensível para um serviço externo. As switches de tarefas focam em dimensões de engenheiro sênior, julgamento de design sob ambiguidade, mudanças coordenadas entre serviços e pool requests multirepositório onde um patch estreito não é suficiente. O caminho de integração com CI é onde ele se torna útil. Uma equipe pode pontuar comportamento de agente através de trocas de modelo, mudanças de prompt, adições de ferramentas e atualizações de ARNs usando a mesma rubrica. Isso torna a melhoria de agente mensurável além da qualidade de demo. Um assistente de codificação que parece impressionante em bugs. Pequenos ainda pode falhar quando precisa modificar uma API, atualizar um caler, ajustar uma migração e manter testes alinhados entre serviços. O lançamento também pressiona laboratórios de modelo e vendedores de agentes. Pontuações de benchmark saturadas são fáceis de marketing, mas tarefas de escopo sênior expõem planejamento fraco, manuseio de contexto frágil e mau julgamento de design. O ponto de atenção é quais laboratórios publicam números do sênior SWEBente I e se arnesses de agente o adotam como um portão padrão de release. Se pegar, a competição de agentes de codificação muda de precisão de PET para a competência de engenharia de produção. Get Out é uma ferramenta de linha de comando Go construída pela comunidade que envolve a API do Google Health e expõe 40 tipos de dados do feature como o John Pronto para Agentes. Ela surgiu através do MarkTechPost e preenche uma camada de terminal faltante para desenvolvedores que querem telemetria de vestíveis em contextos de agentes sem construir. Seu próprio cliente reste. Não é um release oficial do Google, então manutenção e drift de SEMA precisam ser entendidos antes de qualquer um tratá-la como infraestrutura. A ferramenta é distribuída como um binário Go estático único e normaliza múltiplas superfícies da API do Google Health em um SEMA. Estágios de sono, frequência cardíaca, minutos ativos, saturação de oxigênio, passos e métricas relacionadas podem cair em um payload que um agente pode ler sem par sem customizado para cada categoria. O fluxo ou outro usa grandes descopos explícitos por tipo de dado, então o usuário pode autorizar acesso à frequência cardíaca sem abrir automaticamente cada categoria de saúde. Isso desbloqueia fluxos de trabalho de agentes pequenos mas úteis. Um assistente local pode resumir tendências de recuperação, correlacionar sono e carga de treinamento, ou preparar notas de saúde semanais de telemetria estruturada. Agentes de codificação também podem consumir o payload durante desenvolvimento de pipeline de dados, trabalho de dashboard ou ferramentas de selfie quantificado. O importante é que a interface é amigável para terminal e amigável para automação, então pode rodar em um agendamento e alimentar sistemas do OVTREON. Como o guiaute é mantido pela comunidade, a postura de credenciais e esquemas importa. Tokens de atualização ou alta se comportam como segredos de alto valor e mudanças de endpoint podem alterar a forma do Pailua sem o ritmo de aviso que um SDK oficial poderia fornecer. O ponto de atenção é se o Google vai lançar uma ferramenta de linha de comando ou SDK oficial para a mesma API. Se isso acontecer, o guiaute se torna uma ponte útil ou um ponto de referência para um caminho mais suportado. O Program As Vates propõe um paradigma de programação onde especificações em linguagem natural são compiladas em artefatos neurais compactos. O artigo está em alta no feed diário do UGEM Face com 68 votos positivos, e a ideia é voltada para funções difusas, classificação, roteamento, extração, pontuação e outras tarefas onde código determinístico é estranho, mas chamar um modelo geral grande a cada vez é caro. O Pipeline divide o trabalho em tempo de construção e tempo de execução. Um compilador de 4 bilhões de parâmetros lê uma especificação em linguagem natural e emite um conjunto compacto de pesos representando o comportamento. Um interpretador de 0,6 bilhões de parâmetros executa esse artefato no momento da inferência. A superfície implantada não é um prompt e não é um fine-tune de um modelo base gigante. É um pequeno programa neural executado por um pequeno interpretador, o que significa que o compilador caro só roda quando o comportamento é construído ou revisado. Isso muda a estrutura de custos. Fazer prompting de um modelo de fronteira repete a descrição do comportamento a cada chamada. Paga pelo contexto longo e depende de um sistema geral para seguir a especificação a cada vez. O program Asveits colapsa o comportamento em pesos e paga uma pequena passagem forward durante a operação. Os autores o posicionam como pesquisa, não como lançamento de produto, mas o formato é atraente para uso no dispositivo e baixa latência. A questão de integração é se esses artefatos compilados podem igualar modelos grandes com prompting em tarefas difusas reais. Se conseguirem, as equipes podem enviar artefatos neurais versionados para roteamento, extração e marcação de conteúdo da forma como enviam pequenos serviços hoje. Um compilador de 4 bilhões cabe em uma GPU de Workstation, e um interpretador de 0,6 bilhões pode plausivelmente rodar em laptops ou dispositivos de borda. Isso move o custo de personalização para fora do caminho crítico. O drama SR532K é um novo benchmark de reconhecimento de falantes de longa duração de Yu Shuang Li, Ling Xi Xie e Xin Yu Yu. Ele contém 532 mil linhas de diálogo anotadas com mais de 900 personagens de novelas de TV. Essa escala força os modelos a fazer mais do que correspondência de impressão de voz. Eles precisam combinar áudio, transcrições de ASR e contexto visual na tela para decidir qual personagem está falando ao longo de longos arcos. O modelo proposto roteia a atribuição de falantes através de um LLM de raciocínio que atua como controlador. Ele pode consultar em bedindings de áudio, a transcrição e pistas visuais antes de emitir um rótulo de personagem. Isso é importante porque dramas de longa duração criam colisões, vozes semelhantes, personagens recorrentes, falas fora da tela e cenas onde a mesma identidade de falante só faz sentido com o contexto anterior. Um classificador de clipes curtos vai perder essas dependências. Para construtores de agentes multimodais, o benchmark fornece um alvo público para rastreamento de identidade ao longo do tempo. Compreensão de vídeos longos, transcrição com consciência de personagem, análise de reuniões, edição de podcasts e busca de mídia precisam de atribuição estável ao longo de muitos minutos ou horas. O tamanho do drama ASR torna possível avaliar se um sistema pode preservar a identidade além de uma cena. O padrão reutilizável é o controlador de raciocínio. Em vez de pedir a uma modalidade que decida, o LLM coordena evidências de vários canais e depois se compromete com uma resposta. Esse padrão pode ser transferido para reuniões onde os falantes se sobrepõem, análise de centrais de atendimento onde as transcrições são ruidosas, ou agentes de vídeo que precisam lembrar quem fez o que antes. Os pontos de atenção são disponibilidade de pesos, adoção do benchmark e se os pacotes do OVTREON começam a tratar identidade de longo alcance como uma capacidade multimodal padrão. O agente QSTS da Alayalab oferece aos agentes LLM de longo alcance um ambiente de teste com memória limitada e um contrato de recuperação tipado. O agente QSTS está em alta nos artigos diários do UGEM Face com 43 votos positivos e aborda um problema de avaliação confuso. Quando um agente melhora, foi a camada de memória, o recuperador, o resumidor, o modelo ou apenas mais tokens? O agente QSTS trata a memória como uma interface tipada em vez de um blob de forma livre. O agente emite consultas tipadas contra um armazenamento de memória limitado, e o ARNES reconstrói promptes frescos a partir de slots tipados a cada passo. Um teto rígido de tokens de recuperação mantém cooperações em bases iguais, então trocar um recuperador, resumidor ou política de remoção altera esse componente sem dar silenciosamente mais orçamento de contexto ao agente. Esse isolamento é importante porque agentes de longo alcance frequentemente falham lentamente. Uma camada de memória pode parecer útil durante tarefas curtas e depois degradar conforme os resumos perdem detalhes. A recuperação puxa contexto obsoleto ou a remoção remove o estado errado. Slots tipados tornam a falha mais fácil de atribuir. Se uma tarefa de decisão precisa de uma preferência de usuário, ação anterior, fato ambiental ou estado de objetivo, a interface de memória pode perguntar por esse tipo diretamente em vez de repetir tudo. O ângulo de integração é pequeno o suficiente para adaptar. As equipes podem projetar camadas de memória internas em torno de consultas tipadas, recuperação limitada e montagem de prompt por passo, e então avaliar cada componente independentemente. O Agentica STS é útil menos porque promete um sistema de memória perfeito e mais porque dá aos construtores uma forma de comparar políticas de memória sem misturar cada parte móvel. A próxima coisa a observar é se framework de agentes open source adotam recuperação tipada como uma superfície padrão de avaliação de memória. O Codebase Memória MCP da Deusdata é um servidor model context protocolo de alto desempenho que indexa uma base de código em um grafo de conhecimento persistente e responde perguntas estilo dependências em 158 linguagens. Ele é distribuído como um binário estático único sem dependências externas, o que facilita colocá-lo ao lado de um executor de agentes sem configurar um serviço de busca separado. O mecanismo principal é memória de código baseada em grafo. Em vez de pedir a um agente para fazer grep toda vez que precisa de contexto, o servidor MCP pode responder perguntas como onde um símbolo é usado, do que uma função depende ou quais áreas do projeto se conectam a uma funcionalidade. As alegações de consultas em menos de um milissegundo são especialmente úteis para lopes de agentes porque buscas repetidas de contexto podem dominar a latência e o gasto de tokens. O ângulo de integração é direto. Registre como uma ferramenta MCP dentro de um fluxo de trabalho OpenCloud, Codex Style, Hermes ou CloudCode e deixe o agente consultar relacionamentos de código antes de propor edições. Isso pode reduzir o inchaço de prompts porque o agente pede a fatia relevante em vez de enfiar contexto amplo do projeto em cada turno. O Fast MCP da Prefeca GAC é um framework Pythonic para construir servidores e clientes MCP com boilerplate mínimo. Ele encapsula transporte, descoberta e exposição de ferramentas, então uma função Python pode se tornar uma ferramenta AID encalável em poucas linhas. O mecanismo útil é o encapsulamento ergonômico de protocolo. O MCP é poderoso, mas as equipes frequentemente travam quando cada serviço interno precisa de manipulação customizada de protocolo antes que um agente possa chamá-lo. O Fast MCP transforma o limite da função Python no limite da ferramenta, o que diminui o custo de expor apps internas, transformações de dados, agendadores e alpers operacionais a uma stack de agentes. Hermes, Cloud Code e outras arnesses conscientes do MCP se beneficiam porque ferramentas customizadas podem ser enviadas rapidamente sem inventar um padrão de integração único. Para equipes que já rodam serviços Python, o Fast MCP é o caminho curto de uma função útil para uma chamada de ferramenta estruturada que um agente pode descobrir e invocar. O MCP for Beginners da Microsoft é uma trilha de aprendizado open-source para model com test protocolo em .NET, Java, TypeScript, JavaScript, Rust e Python. Ele guia desenvolvedores desde um primeiro servidor MCP até padrões de deploy seguros e escaláveis. O mecanismo aqui é alinhamento de equipe em vez de velocidade de runtime. O MCP toca esquemas de ferramentas, autorização, escolhas de transporte e comportamento de agente. Um currículo multiplataforma permite que uma equipe aprenda o protocolo na linguagem que sua stack já usa, então a primeira ferramenta interna não chega com pressupostos desalinhados sobre segurança, design de esquema ou deploy. O ângulo de integração é o onboarding. Antes de adicionar uma nova superfície de ferramenta a um agente em produção, as equipes podem passar por uma trilha específica de linguagem e estabelecer padrões compartilhados. Isso reduz as chances de que cada grupo construa seu próprio estilo incompatível de servidor MCP. O Olama.31. melhora o caminho do Gema 4 no Apple Silicon, com geração até 90% mais rápida em um benchmark de agente de codificação quando a predição multitoken é roteada através do backing metal. O release mantém a ergonomia local habitual, um comando de execução, busca automática de pesos e um endpoint compatível com o OpenAI para ferramentas que já conversam com servidores locais. O ângulo prático são os MACs da série N. Se o Gema 4 pode produzir tokens muito mais rápido localmente, low-ups de agente que repetidamente fazem roundtrip através do modelo parecem menos travados. Passando o Gema 4 pelo Olama e conduzindo uma geração de mil tokens através do endpoint compatível dá aos usuários de MAC uma forma rápida de compará-lo com seu padrão local anterior. O Testevo Bent avalia a coevolução de teste e código em vez de geração isolada de testes. O benchmark executa testes candidatos contra o commit pi e verifica cobertura nas linhas corrigidas. Então os agentes são pontuados em correção de runtime e ligação semântica com a mudança de código, não similaridade textual com uma resposta de referência. Isso importa para agentes de codificação porque mudanças reais de engenharia frequentemente requerem testes que capturam novo comportamento. Um modelo que escreve testes plausíveis mas erra o caminho alterado não deveria receber crédito. O Testevo Bent dá as equipes uma forma mais nítida de avaliar se um agente entende bem o patch o suficiente para atualizar a superfície de validação ao redor dele. Uma thread da comunidade localama está testando-se modelos de 27 a 35 bilhões de parâmetros são o ponto ideal prático em um M3 Max de 100 e 28 GB. O autor compara pesos que 4 underline, K underline, M gufo e MLX de 4 bits contra modelos de 70 bilhões ou mais enquanto mede tokens por segundo e latência de avaliação de prompt em contexto completo. O ponto útil é que o tamanho máximo do modelo pode não ser o melhor drive diário. Em Mac de memória unificada, um modelo de tamanho médio pode entregar melhor responsividade para lopes de codificação do que um modelo maior que tecnicamente cabe mas responde muito lentamente. Isso reforça a lição de compras do guia de LLM local. Tua Guput e Latência importam tanto quanto a contagem de parâmetros. Outra thread do localama descreve substituir um assistente de codificação hospedado por um modelo servido localmente exposto através de um endpoint compatível com OpenAI. O autor descobriu que para cargas de trabalho de preparação de código, menor latência de roundtrip de rede superava a perda de raciocínio de classe Frontier. Esse é um lembrete útil para estaques de agentes. Nem toda tarefa de codificação precisa do modelo mais forte disponível. Se o trabalho é preparar código, resumir contexto, remodelar snippets ou fazer pequenas edições locais, um endpoint local rápido pode parecer melhor do que um modelo hospedado mais inteligente que espera na rede a cada turno. O Hermes 7.1 torna os conjuntos nomeados de múltiplos modelos e a conclusão de objetivos baseada em evidências parte da superfície normal de agentes. O CloudCode.193 continua central no debate sobre agentes de codificação em terminal, enquanto as equipes de segurança examinam o contexto de saída. Z-Code. Kimi e K2.7 Code Lianstra 1.5 ampliam o menu de modelos e ferramentas. Ferramentas de codificação chinesas. Webbrain. Safari.mcp. FESH.mcp. Codebase.memory.mcp. E o currículo.mcp. Da Microsoft mostram a camada de ferramentas tornando-se mais prática. Navegadores. Grafos de código e serviços internos estão se tornando superfícies de agentes chamáveis. Recontext. Senior SW e Bente. Agente KSTS. Testevo Bente. Drama SR. Progress Vates. Guiault. O Lama e as discussões sobre modelos locais apontam para a mesma pressão de desenvolvimento. Agentes precisam de melhor avaliação. Lopes locais mais rápidos. Memória mais limpa e caminhos de dados mais privados. Para mais detalhes sobre os lançamentos, projetos, artigos e material de origem por trás da cobertura, consulte as notas do programa em tobionfitnesstech.com. Obrigado por ouvir o Edit Stack Daily. Voltamos em breve.