AgentStack Daily de hoy: OpenClaw v2026.6.9, Hermes Agent v2026.6.19 y Claude Code CLI 2.1.176 llegaron con nuevas versiones. Poolside lanzó Laguna XS.2 en OpenRouter y Laguna M.1 a través de API. Baseten reporta una ronda de $1.5B, Datasette Apps permite alojar HTML personalizado y Meredith Whittaker de Signal advierte que los chatbots de IA no son tus amigos, mientras los equipos empresariales ahora cuentan con nuevos análisis de uso y controles de gasto actualizados. Show notes: https://tobyonfitnesstech.com/es/podcasts/episode-73/
✨ Episode Outline — click any point to jump to it in the episode
Problem solved
Builders need to track maturing agent stacks, new coding models, and production cost/security controls in one cycle.
🌐 This transcript was automatically translated to English from the original.
I'm Nova I'm Alloy, and this is AgenteStack Daily OpenClaw 6.9 Hermes Agents 6i19 and Code.176's Terminal Cloud-based AI coding agent all released stable versions this cycle. OpenClaw 6.9 added richer delivery in Telegram and optimized integration with codecs with automatic plugin approvals, while Hermes 6i19 introduced background subagents and expanded channel support to iMessaging via Poton. Today you'll hear about those Jarnises updates, the launch of Paulside's Laguna coding models on Open Router and via API, new enterprise spend controls from OpenAI, and why the president of Signal says your AI chatbot is definitely not your friend. We also take a look at a billion-dollar round for Basetten, a vanity search engine that scores your presence within the model weights, and the historical failure of export controls as a lens for Antropic's mythos model. The common thread is a focus on the production layer, how we manage the cost of agentive loops, how we secure the models at their core, and how the Jarnises we use every day are maturing to handle multi-step, multi-channel workloads. Three stable releases arrived this cycle and shape how Agentive Jarnises are being assembled right now. Open Class 6-9, published on June 21, includes richer delivery on Telegram. The channel path now sends rich HTML, preserves rich markdown and sticker paths, and renders progress drafts and command output more faithfully. It also safely normalizes HTML tables and keeps spooled mentions and handlers on the correct delivery path. Agent recovery is more reliable in this version, retries. Terminal results and session history repair now maintain more interrupted or partial shifts, moving towards a visible final result. The integration of codecs in Open Class is also significantly stronger. Adds GPT 5.3 Spark automatic plugin approvals, routing or aus, and remote node execution as a dynamic tool. These changes move Harness toward a more reliable application server teardown process. Meanwhile, Hermesagen 6 and 19, which maintainers are calling the Rich Relayase, extends Hermes through new channels like iMessage via Poton and the Raft agent network. The desktop app also gained substantial new capability. Subagents can now run in the background and the imaging tool has learned to edit. The Hermes dashboard got a full profile builder and the Skills Hub browser was completely revamped. For those using the OpenAI Codex.141 terminal-based AI encoding agent, these updates provide a more robust backend. We also saw terminal-based AI encryption agent CloudEco.176 complete the trio on the stable label. This release focuses on a lighter installation footprint and faster cold boot path for Shell-based sessions. At the API and Runtime layer, these changes alter what builders can configure and depend on by default. The practical implication is cleaner harness plumbing. Openclada gives builders more model paths and a more secure house, while Hermes and CloudEcoot refine the user and developer experience. The part to watch is how these new defaults perform under real workloads before moving them to production, especially where session history and terminal output are involved. Paul Side posted the Laguna XS2 on OpenRouter this week, marking the second-generation model in its XS size class. This is their efficient series of encoding agents, and the argument here is compactness over high-end reasoning. It combines tool calls with reasoning in a small footprint, with a context window of 262,144 tokens. This context size puts it firmly in the long context tier for agentive encoding workloads where passing large code bases or tool traces is the norm. The most relevant detail for builders is the unified pairing of tools and reasoning. An endpoint exposes both tool invocation and reasoning, simplifying agent loop orchestration. You don't have to route requests through two separate models to handle planning and execution. The XS size class signals a target audience focused on low-latency, cost-sensitive runs. If you're running multi-file refactoring agents, the per-token economics here might be more attractive than higher-end reasoning models. For agent builders, this release extends the compact level on the router. It ranks alongside other compact options used for economic sorting or initial planning passes. What we need to look at next are actual latency benchmarks on actual encoding traces. We also want to see if Polside eventually releases specific rate limits for tool calls or pricing tiers to further differentiate the XS line from its larger models. This compact level update matters because it moves the cost frontier rather than just the raw quality frontier. If your agent stack depends on many small, iterative calls, a compact second-generation model with a massive context window is a significant integration goal. Enables more complex multi-step workflows without the latency hit of a larger high-end model. Moving to the other end of the spectrum, Polside has also launched Laguna M1 via API. This is their high-end encryption agent model, optimized for complex software engineering tasks. Like its younger brother, it supports tool calls and reasoning with a context window of 256,000 tokens. At the mechanism level, this change manifests itself in the surface of the API and runtime behavior that agent builders integrate. The Laguna M1 release is geared toward the heavy lifting of agentive coding. Think architectural changes, complex bug fixes, and large-scale refactorings that require a deep understanding of the entire stack. The primary source documentation for this model includes specific deployment notes and changelok context that builders should review. It's worth tracking how M1 performs under heavy production loads, as I know high-end encoding models often face unique challenges with consistency over long traces. Why this matters right now is the speed at which the agent stack is moving? Changes in this layer determine which workflows are reliable and which remain fragile. The practical question for builders is whether Laguna M1 can replace its current default range. High for coding tasks. Early evidence suggests it is a strong contender for those building engineering, autonomous or semi-autonomous agents. We should keep an eye out for follow-up releases and independent benchmark results. As surrounding tools like SDKS and security review frameworks gather support for M1, the barrier to switching will decrease. For now, the focus is on checking your performance against the specific coding patterns your agents are expected to handle. OpenAI is introducing new spending controls and usage analytics for GPT Enterprise chat. This is a direct response to organizations that need to manage costs and scale their AI deployments with more confidence. These controls land at the management and API level, affecting how admins configure and deploy positions in a large company. Includes more granular cost breakdowns and the ability to set configurable ceilings on spend. For platform builders and engineers, these tools are all about visibility. As agents multiply within an enterprise, knowing exactly which departments or projects are driving usage is critical. Updated analytics allow for a clearer view of how tokens are being consumed, helping to predict future budget needs. It also helps identify loops of inefficient agents that could be burning budget without delivering equivalent value. These spend controls change what the enterprise stack can rely on by default. Instead of reacting to a high bill at the end of the month, admins can now proactively set limits. It's worth tracking how these controls impact agent performance, especially if a mid-session ceiling is reached. Builders need to ensure their agents can handle grass-fell degradation or clear notification when budget limits are reached. This decision by OpenAI reflects the maturation of the enterprise AI market. Cost management is no longer an afterthought, it is a fundamental requirement for production deployments. We expect other major vendors to follow suit with similar enterprise-grade visibility and control features as the focus shifts from experimentation to operational efficiency. A recent analysis argues that 30 years of US export controls on encryption and cybersecurity software have largely failed to slow its spread. This historical context is now being applied to Antropic's mythos cybersecurity model. The central argument is that dual-use software has always leaked, forked and redeployed regardless of jurisdiction. The historical mechanism that failed was to treat source code or compiled binaries as the controlled artifact. For myths, the challenge is even greater. The question is whether model weights, training computation, or hosted inference APIs can be effectively controlled at all. Unlike a compiled binary, a model's capability is harder to tie to a specific artifact. This makes the surface for regulation much more complex. The analysis suggests that the diffusion mechanism for AI will likely follow the same path as cryptographic tools, code forks and foreign reimplementations will outpace any regulatory framework. For builders, the bottom line is that cutting-edge AI cybersecurity capabilities will likely become globally accessible. You should assume that both defensive and offensive AI security tools will be available to a wide range of actors. This makes export classification a moving target for compliance teams. Whether you are building on or against myths, the classification of model weights and inference hotspots remains a point of ambiguity. We should be attentive to any new regulations from the Department of Commerce regarding the weights of cutting-edge models. At the same time, keep an eye out for Antropic publishing a usage policy that attempts to pre-empt these regulatory questions. The myth fight will likely set the political framework for the entire AI security sector. AI inference startup Basetten is reportedly close to finalizing a $1.5 billion funding round at a $13 billion valuation. This raising comes just months after its previous mega round and highlights a big change in the market. Inference is increasingly being treated as its own category of infrastructure rather than simply a feature of model training labs. Dedicated capital is flowing to companies that focus specifically on the service side of the stack. The technical mechanism here is the inference-specific servicing stack. This includes things like model build passes for production deployment and bundling GPUs on heterogeneous hardware like the H100S and H200S. Basetten's differentiator is exposing these controls to engineering teams as a managed service. Instead of relying on opaque API access points from a model lab, builders gain more control over request routing and optimization for bursty or long-context traffic. This huge raise signals that the inference layer is becoming a buyers' market. There is now real competition between hyperscalers and specialist providers such as Basetten, Fireworks and Together. For constructors, this means that the default choice of an inference provider is no longer obvious. You should be explicitly evaluating trade-offs between cost per token, latency, and the level of customization available. We'll be looking at how Basetten positions itself against inference APIs from hyperscalers like Bedrak or Azure AI. As more capital enters this space, the pace of innovation at the service layer is likely to accelerate. This is good news for agent builders who need reliable, high-performance infrastructure to power their production loops. Dataset has released a new plugin called Dataset Apps that allows users to host applications. Custom HTML and JavaScript directly within Dataset. These are self-contained applications that can take advantage of the data stored in the Dataset instance. The launch announcement highlights the rationale behind this move, focusing on the need for more flexible ways to view and interact with data without the need for a separate hosting stack. For agent stack builders, this is an interesting development at the UI layer. By hosting custom HTML within the data tool itself, you can create tighter feedback loops for agents interacting with databases. Simplifies the deployment of internal tools and dashboards that require a specific frontend but need to be tightly coupled to the data source. The change lands at the API and runtime level, affecting how you configure the plugin and deploy your custom applications. This change means builders can rely on Dataset as a more comprehensive platform for data-driven agents. It's worth following how the plugin handles different workloads and how it scales with complex Javascript applications. If you're building tools for data exploration or agent monitoring, this could significantly reduce your infrastructure overhead. We'll be keeping an eye on how the community adopts Dataset Apps and what kind of custom interfaces start to emerge. As more builders experiment with this, we expect to see new patterns for human collaboration surfaces that live directly above the data they're processing. Recent bulletins have noted a relatively slow period for AI news, with no major releases of agent models or frameworks dominating the cycle. This respite is often a sign of calendar-driven release coordination. With the I-Engineer, or IE, conference on the horizon, many major labs and maintainers are likely consolidating their reveals for that event. Pre-conference breaks like this are a standard pattern in the ecosystem. For builders, this quiet window is quite useful. Provides the opportunity to consolidate notes on current agent frameworks and stable API versions. You can commit to your current stack for the next few days without the high risk of a disruptive change disrupting your local environment. It's a good time to focus on refining existing workflows and ensuring your session management and tool integrations are robust. The point to note here is the EI opening speech. Historically, model vendors and agent runtime maintainers use these scenarios to ship reference implementations and pinned version releases. These announcements typically propagate through documentation and repositories within hours of the talk. The quieter the countdown, the more shocking the keynote revelations tend to be. We should expect a flurry of activity once the conference begins. For now, enjoy the stability and use the time to prepare your stack for the next wave of updates. The transition from this dormancy to the post-conference shipping cycle is usually very quick. Meredith Whitaker, the president of Signal, recently used a view interview to pushback against the trend of positioning AI chatbots as companions. His message was clear, these are not your friends, they are not conscious beings and they are not sentient interlocutors. This criticism is aimed squarely at vendors who use relational language in their onboarding flows, persona system pamps, and conversational design. This intervention is particularly relevant as agent coding tools and support bots become integrated into our daily workflows. The line between a tool and a companion is being blurred by anthropomorphic design choices. Whitaker argues that framing models as peers creates false expectations about their memory and intention. For builders, this means that your agent's product copy and system prams are now part of the trust surface. Anthropomorphic framing in person prams or UI greetings may be a privacy red flag for some users. Signal's focus on privacy gives this criticism a lot of weight in developer circles. As a builder, you might want to consider whether your agent persona is helping or hurting user trust. Relational copy could eventually become a deal-breaker for privacy-focused enterprise buyers. We'll be watching to see if the major model vendors change their recommendations on relational framing in developer documentation. If corporate purchasing begins to flag anthropomorphic copies as problematic, we could see a return toward more utilitarian and transparent agent personalities. How you frame human-agent interaction is becoming a critical design decision. A new service called Indewatch has been launched, pitching itself as a vanity search engine for the AI age. Instead of indexing web pages, it assigns users a score based on how prominently their identity appears within the parameters and training data of cutting-edge AI models. It uses the model as a search index, providing a metric of how much presence a person has within the internal representation of the AI world. The underlying mechanism involves running repeated inference tests against hosted LLMSs. The architecture uses an evaluation harness to query identity mentions across multiple model checkpoints. It then aggregates these hit rates and frequency counts into a single composite score. This reframes model visibility as a measurable metric, something that hasn't really existed as a productivized surface before. For those launching AI products, this could become a new category of user-facing metrics. SURF is a different signal than a traditional search ranking. The question for builders is whether the scoring methodology will become standardized or remain opaque. Reproducibility is key to determining whether this score becomes a real signal for marketing or just another vanity number. We will be waiting to see if the probe protocol for this service opens. If it does we could see new tools built around adjusting your presence across different model versions. It's an interesting look at how we might measure the influence of individuals and brands in an AI-saturated information environment. First on the radar is Fast MCP from the Prefect team. This is a Pythonic framework designed to build servers and clients using the Context Protocol model. It allows developers to expose tools and resources to LLMS with minimal boilerplate code. If you have internal Python functions that you want an agent like Cloud Code to call directly, Fast MCP provides a standard way to wrap those as typed tool calls. It's a great replacement for makeshift CLI wrappers. It is followed by Microsoft's Model Context Protocol for Beginners repository. This is a comprehensive curriculum that guides developers through the fundamentals of the protocol. What makes it useful are the multi-language examples in .NET, Java, Roost, and TypeScript. Provides a clear path to connect agents to non-Python services without needing to rewrite everything. You can choose a lab in your preferred language and start contributing your existing internal tools to an MCP server. Finally, we have Unity MCP. This project brings together AI assistants and the Unity Editor by exposing tools for asset management, scene control, and editor automation. Makes the Unity editor API accessible through standard MCP tool calls. For builders in the gaming or simulation space, this turns asset pipelines and scene edits into agent-driven steps. You can orchestrate an entire build and test cycle entirely through your agent stack. In the model review of this cycle, we have two significant inputs from Paulside. First up is the Laguna XS-2, now available through Open Router. As we discussed earlier, this is a second-generation compact model in its XS class. It has a context window of 262,000 tokens and combines tool calls with reasoning. If you're looking to optimize for cost and latency in your agent cycles, this is a prime candidate to evaluate against your current options. The second model selected is Laguna M1. This is Paulside's flagship entry, also available via API. It is optimized for complex software engineering tasks and supports the same huge context window. Its capabilities are aimed at higher-level advanced coding workflows. We recommend routing some encryption agent sessions through M1 and XS. Two to see how they handle your specific codebase compared to your current core models. Other models were reviewed this cycle but were not selected for full coverage as they did not represent new releases from major vendors. We continue to track the long-context and tool call performance of all the major models on the market to ensure your agent stack has the best foundation possible. For our local Spotlight, we're looking at Yama.30.10. This update adds MLX-accelerated support for Command AD Coere and the model family. Norton Apple Silicon. It also updates the embedded Yama engine to version 9672. This is a significant update for builders who want to keep their workloads on-device, as it makes local inference of these model families viable on M-chip Macs without the need for CUDA. If you're working on a Mac with an M chip, you can download a Command AD or North model and compare the tokens per second against your previous Yama build. This release narrows the cycle for agents who need to operate in high-privacy or offline environments. The performance gains from MLX acceleration are noticeable and help make local agents much more responsive. In our first additional note, we see the ambitions of billionaire Mukesambani, who wants to weave AI into every call, app and home in India. The technical angle is the embedded inference on device and at the edge within an operator's stack. Telecommunications with more than 500 million subscribers. This represents massive scale for network-resident AI surfaces. It's followed by a story about the AdWords CEO launching a new AI business with a plan but no employees. This raises questions about how a single-founder company can operationalize model selection and product shipping by relying entirely on outsourced or vendor-provided inference stacks. It's an interesting look at one's business model, driven by high-level agents. Finally, there is a dispute over whether ASML's core chipmaking tools have reached China. The story hinges on verification of lithography export controls and how the physical location of such restricted tools is tracked. It highlights the friction between business logic and national security regulations in the high-level hardware space that drives AI. From today's stories, the stable releases of Open Class 6, 9, Hermes 6 and 19, and Cloud Code.176 change what your agent stack can depend on by default. Paulside's Laguna XS, 2 and M1 give you new options for encoding agent cycles with large context requirements. OpenAI's new enterprise controls provide the visibility needed to manage agent spend at scale. The historic failure of export controls suggests that defensive and offensive AI capabilities will remain globally accessible, making security a baseline assumption. The huge funding round for Baseten indicates that the inference layer is now a separately funded and highly competitive market. Finally, remember that your choice of capi AI agent personality may impact user trust, especially in light of the privacy concerns raised by Signal. You can find more details and all the links in the show notes at tobionfitnesstech.com Thanks for listening AgentsTagDaily. We will be back soon.
Soy Nova Soy Alloy, y esto es AgenteStack Daily OpenClaw 6.9 Hermes Agents 6i19 y el agente de codificación de IA basado en Terminal Cloud de Code.176 Todos lanzada versiones estables este ciclo. OpenClaw 6.9 agregó entrega más rica en Telegram y optimizó la integración con codecs con aprobaciones automáticas de plugins, mientras que Hermes 6i19 introdujo subagentes en segundo plano y expandió el soporte de canales a iMesaje a través de Poton. Hoy escucharán sobre esas actualizaciones de Jarnises, el lanzamiento de los modelos de codificación Laguna de Paulside en Open Router y a través de API, nuevos controles de gasto empresarial de OpenAI, y por qué el presidente de Signal dice que tu chatbot de IA definitivamente no es tu amigo. También echamos un vistazo a una ronda de mil millones de dólares para Basetten, un motor de búsqueda vanidoso que puntúa tu presencia dentro de los pesos del modelo, y el fracaso histórico de los controles de exportación como lente para el modelo mitos de Antropic. El hilo conductor es un enfoque en la capa de producción, cómo gestionamos el costo de los bucles agentivos, cómo aseguramos los modelos en su centro, y cómo los Jarnises que usamos todos los días están madurando para manejar cargas de trabajo de múltiples pasos y múltiples canales. Tres versiones estables llegaron este ciclo y dan forma a cómo se están ensamblando los Jarnises agentivos ahora mismo. Open Class 6-9, publicada el 21 de junio, incluye entrega más rica en Telegram. La ruta del canal ahora envía HTML rico, preserva markdown enriquecido y rutas de stickers, y renderiza borradores de progreso y salida de comandos de manera más fiel. También normaliza tablas HTML de forma segura y mantiene las menciones y los handlers en spool en la ruta de entrega correcta. La recuperación de agentes es más confiable en esta versión, reintentos. Resultados de terminal y reparación del historial de sesión ahora mantienen más turnos interrumpidos o parciales, avanzando hacia un resultado final visible. La integración de codecs en Open Class también es significativamente más fuerte. Agrega aprobaciones automáticas de plugins, enrutamiento o aus de GPT 5.3 Spark y ejecución de nodo remoto como herramienta dinámica. Estos cambios mueven el Harness hacia un proceso de desmontaje de servidor de aplicaciones más confiable. Mientras tanto, Hermesagen 6 y 19, que los mantenedores están llamando la Rich Relayase, extiende Hermes a través de nuevos canales como iMessage a través de Poton y la red de agentes Raft. La aplicación de escritorio también ganó una capacidad nueva sustancial. Los subagentes ahora pueden ejecutarse en segundo plano y la herramienta de generación de imágenes aprendió a editar. El dashboard de Hermes obtuvo un constructor de perfiles completo y el navegador de Skills Hub fue completamente renovado. Para quienes usan el agente de codificación de IA basado en terminal OpenAI Codex.141, estas actualizaciones proporcionan un backend más robusto. También vimos al agente de codificación de IA basado en terminal CloudEco.176 completar el trío en la etiqueta estable. Esta versión se enfoca en una huella de instalación más ligera y una ruta de inicio en frío más rápida para sesiones basadas en Shell. En la capa de API y Runtime, estos cambios alteran lo que los builders pueden configurar y depender por defecto. La implicación práctica es una plomería de harness más limpia. Openclada a los builders más rutas de modelos y house más seguro, mientras que Hermes y CloudEcoot refinan la experiencia del usuario y del desarrollador. La parte a observar es cómo estos nuevos valores por defecto se comportan bajo cargas de trabajo reales antes de cambiarlos a producción, especialmente donde están involucrados el historial de sesión y los resultados de terminal. Paul Side publicó Laguna XS2 en OpenRouter esta semana, marcando el modelo de segunda generación en su clase de tamaño XS. Esta es su serie eficiente de agentes de codificación, y el argumento aquí es compacidad sobre razonamiento de gama alta. Combina llamadas a herramientas con razonamiento en una huella pequeña, con una ventana de contexto de 262.144 tokens. Este tamaño de contexto la coloca firmemente en el nivel de contexto largo para cargas de trabajo de codificación agentivas donde pasar bases de código grandes o trazas de herramientas es lo normal. El detalle más relevante para los builders es el emparejamiento unificado de herramientas y razonamiento. Un endpoint expone tanto la invocación de herramientas como el razonamiento, lo que simplifica la orquestación del bucle de agentes. No tienes que enrutar solicitudes a través de dos modelos separados para manejar planificación y ejecución. La clase de tamaño XS señala una audiencia objetivo enfocada en ejecuciones de baja latencia y sensibles a costos. Si estás ejecutando agentes de refactorización de múltiples archivos, la economía por token aquí podría ser más atractiva que los modelos de razonamiento de gama alta. Para los builders de agentes, este lanzamiento amplía el nivel compacto en el router. Se sitúa junto a otras opciones compactas usadas para clasificación económica o pasadas iniciales de planificación. Lo que necesitamos observar a continuación son los benchmarks de latencia reales en trazas de codificación reales. También queremos ver si Polside eventualmente lanza límites de tasa específicos para llamadas a herramientas o niveles de precios para diferenciar aún más la línea XS de sus modelos más grandes. Esta actualización del nivel compacto importa porque mueve la frontera de costos en lugar de sólo la frontera de calidad bruta. Si tu stack de agentes depende de muchas llamadas pequeñas e iterativas, un modelo compacto de segunda generación con una ventana de contexto masiva es un objetivo de integración significativo. Permite flujos de trabajo de múltiples pasos más complejos sin el golpe de latencia de un modelo de gama alta más grande. Moviéndonos al otro extremo del espectro, Polside también ha lanzado Laguna M1 a través de API. Este es su modelo de agente de codificación de gama alta, optimizado para tareas complejas de ingeniería de software. Como su hermano menor, soporta llamadas a herramientas y razonamiento con una ventana de contexto de 256.000 tokens. A nivel de mecanismo, este cambio se manifiesta en la superficie de la API y el comportamiento del runtime que los builders de agentes integran. El lanzamiento de Laguna M1 está orientado al trabajo pesado de la codificación agentiva. Piensa en cambios arquitectónicos, correcciones de bugs complejos y refactorizaciones a gran escala que requieren una comprensión profunda de toda la pila. La documentación de origen principal para este modelo incluye notas de despliegue específicas y contexto de changelok que los builders deben revisar. Vale la pena rastrear cómo M1 se comporta bajo cargas de producción pesadas, ya que se que los modelos de codificación de gama alta a menudo enfrentan desafíos únicos con la consistencia en trazas largas. ¿Por qué esto importa ahora mismo es la velocidad a la que se mueve el stack de agentes? Los cambios en esta capa determinan qué flujos de trabajo son confiables y cuáles siguen siendo frágiles. La pregunta práctica para los builders es si Laguna M1 puede reemplazar su valor por defecto actual de gama. Alta para tareas de codificación. La evidencia temprana sugiere que es un fuerte contendiente para quienes construyen agentes de ingeniería, autónomos o semi-autónomos. Deberíamos estar atentos a lanzamientos de seguimiento y resultados de benchmarks independientes. A medida que las herramientas circundantes como SDKS y marcos de revisión de seguridad recopilan soporte para M1, la barrera para cambiar disminuirá. Por ahora, el enfoque está en verificar su rendimiento contra los patrones de codificación específicos que se espera que manejen sus agentes. OpenAI está introduciendo nuevos controles de gasto y análisis de uso para chat GPT Enterprise. Esta es una respuesta directa a las organizaciones que necesitan gestionar costos y escalar sus despliegues de IA con más confianza. Estos controles aterrizan a nivel de gestión y API, afectando cómo los admins configuran y despliegan puestos en una empresa grande. Incluye desgloses de costos más granulares y la capacidad de establecer techos configurables en el gasto. Para los builders e ingenieros de plataforma, estas herramientas se tratan de visibilidad. A medida que los agentes se multiplican dentro de una empresa, saber exactamente qué departamentos o proyectos están impulsando el uso es crítico. Los análisis actualizados permiten una vista más clara de cómo se están consumiendo los tokens, lo que ayuda a predecir las necesidades presupuestarias futuras. También ayuda a identificar bucles de agentes ineficientes que podrían estar quemando presupuesto sin entregar valor equivalente. Estos controles de gasto cambian lo que el stack empresarial puede depender por defecto. En lugar de reaccionar ante una factura alta a fin de mes, los admins ahora pueden establecer límites proactivamente. Vale la pena rastrear cómo estos controles impactan el rendimiento de los agentes, especialmente si se alcanza un techo a mitad de sesión. Los builders necesitan asegurar que sus agentes puedan manejar degradación grass-fell o notificación clara cuando se alcancen los límites presupuestarios. Esta decisión de OpenAI refleja la maduración del mercado de IA empresarial. La gestión de costos ya no es una ocurrencia tardía, es un requisito fundamental para los despliegues en producción. Esperamos que otros proveedores importantes sigan su ejemplo con características similares de visibilidad y control de nivel empresarial a medida que el enfoque pasa de la experimentación a la eficiencia operativa. Un análisis reciente sostiene que 30 años de controles de exportación de Estados Unidos sobre software de cifrado y ciberseguridad han fracasado en gran medida en ralentizar su propagación. Este contexto histórico ahora se está aplicando al modelo de ciberseguridad mitos de Antropic. El argumento central es que el software de doble uso siempre ha filtrado, se ha bifurcado y se ha reimplementado independientemente de la jurisdicción. El mecanismo histórico que fracasó consistió en tratar el código fuente o los binarios compilados como el artefacto controlado. Para mitos, el desafío es aún mayor. La pregunta es si los pesos del modelo, el cómputo de entrenamiento o las APIs de inferencia alojadas pueden ser controlados de manera efectiva en absoluto. A diferencia de un binario compilado, la capacidad de un modelo es más difícil de vincular a un artefacto específico. Esto hace que la superficie para la regulación sea mucho más compleja. El análisis sugiere que el mecanismo de difusión para la IA probablemente seguirá el mismo camino que las herramientas criptográficas, las bifurcaciones de código y las reimplementaciones extranjeras superarán cualquier marco regulatorio. Para los constructores, la conclusión es que las capacidades de ciberseguridad de IA de vanguardia probablemente serán globalmente accesibles. Deberías asumir que tanto las herramientas de seguridad defensivas como las ofensivas de IA estarán disponibles para una amplia gama de actores. Esto hace que la clasificación de exportaciones sea un objetivo en movimiento para los equipos de cumplimiento. Si estás construyendo sobre o contra mitos, la clasificación de los pesos del modelo y los puntos de acceso de inferencia sigue siendo un punto de ambigüedad. Deberíamos estar atentos a cualquier nueva normativa del Departamento de Comercio respecto a los pesos de modelos de vanguardia. Al mismo tiempo, mantén un ojo en si Antropic publica una política de uso que intente adelantarse a estas preguntas regulatorias. La pelea por mitos probablemente establecerá el marco político para todo el sector de seguridad de IA. Se informa que la startup de inferencia de IA Basetten está cerca de finalizar una ronda de financiación de 1.500 millones de dólares con una valoración de 13.000 millones. Esta recaudación llega apenas meses después de su anterior mega ronda y destaca un gran cambio en el mercado. La inferencia se está tratando cada vez más como su propia categoría de infraestructura en lugar de simplemente una característica de los laboratorios de entrenamiento de modelos. El capital dedicado está fluyendo hacia empresas que se enfocan específicamente en el lado de servicio de la pila. El mecanismo técnico aquí es la pila de servicio específica para inferencia. Esto incluye cosas como pasadas de compilación de modelos para despliegue en producción y agrupación de GPUs en hardware heterogéneo como H100S y H200S. El diferenciador de Basetten es exponer estos controles a los equipos de ingeniería como un servicio gestionado. En lugar de depender de puntos de acceso API opacos de un laboratorio de modelos, los constructores obtienen más control sobre el enrutamiento de solicitudes y la optimización para tráfico bursty o de largo contexto. Esta enorme recaudación señala que la capa de inferencia se está convirtiendo en un mercado de compradores. Ahora hay competencia real entre los hiperescaladores y proveedores especializados como Basetten, Fireworks y Together. Para los constructores, esto significa que la opción predeterminada de un proveedor de inferencia ya no es obvia. Deberías estar evaluando explícitamente los compromisos entre costo por token, latencia y el nivel de personalización disponible. Estaremos observando cómo Basetten se posiciona contra las APIs de inferencia de hiperescaladores como Bedrak o Azure AI. A medida que más capital entra en este espacio, es probable que se acelere el ritmo de innovación en la capa de servicio. Esta es una buena noticia para los constructores de agentes que necesitan infraestructura confiable y de alto rendimiento para alimentar sus bucles de producción. Dataset ha lanzado un nuevo plugin llamado Dataset Apps que permite a los usuarios alojar aplicaciones. HTML y JavaScript personalizadas directamente dentro de Dataset. Estas son aplicaciones autocontenidas que pueden aprovechar los datos almacenados en la instancia de Dataset. El anuncio de lanzamiento destaca el porqué de detrás de este movimiento, enfocándose en la necesidad de formas más flexibles de visualizar e interactuar con los datos sin necesidad de una pila de alojamiento separada. Para los constructores de pilas de agentes, este es un desarrollo interesante en la capa de UI. Al alojar HTML personalizado dentro de la herramienta de datos misma, puedes crear bucles de retroalimentación más estrechos para los agentes que interactúan con bases de datos. Simplifica el despliegue de herramientas internas y paneles que requieren un frontend específico pero necesitan estar estrechamente acoplados con la fuente de datos. El cambio aterriza a nivel de API y tiempo de ejecución, afectando cómo configuras el plugin y despliegas tus aplicaciones personalizadas. Este cambio significa que los constructores pueden confiar en Dataset como una plataforma más completa para agentes impulsados por datos. Vale la pena seguir cómo el plugin maneja diferentes cargas de trabajo y cómo escala con aplicaciones Javascript complejas. Si estás construyendo herramientas para exploración de datos o monitoreo de agentes, esto podría reducir significativamente tu sobrecarga de infraestructura. Estaremos atentos a cómo la comunidad adopta Dataset Apps y qué tipo de interfaces personalizadas comienzan a emerger. A medida que más constructores experimenten con esto, esperamos ver nuevos patrones para superficies de colaboración a gente humano que viven directamente encima de los datos que están procesando. Los boletines recientes han señalado un periodo relativamente lento para las noticias de IA, sin lanzamientos importantes de modelos o marcos de agentes que dominen el ciclo. Este respiro es a menudo una señal de coordinación de lanzamientos impulsada por el calendario. Con la conferencia I-Engineer, o IE, en el horizonte, muchos laboratorios importantes y mantenedores probablemente están consolidando sus revelaciones para ese evento. Las pausas previas a la conferencia como esta son un patrón estándar en el ecosistema. Para los constructores, esta ventana tranquila es bastante útil. Proporciona la oportunidad de consolidar notas sobre los marcos de agentes actuales y versiones estables de API. Puedes comprometerte con tu pila actual durante los próximos días sin el alto riesgo de un cambio disruptivo que perturbe tu entorno local. Es un buen momento para enfocarse en refinar flujos de trabajo existentes y asegurar que tu manejo de sesiones e integraciones de herramientas sean sólidos. El punto a observar aquí es el discurso de apertura de la IE. Históricamente, los proveedores de modelos y los mantenedores de tiempos de ejecución de agentes usan estos escenarios para enviar implementaciones de referencia y lanzamientos de versiones fijadas. Estos anuncios típicamente se propagan a través de documentación y repositorios dentro de las horas posteriores a la charla. Cuanto más silenciosa sea la cuenta regresiva, más impactantes tienden a ser las revelaciones del discurso de apertura. Deberíamos esperar una ola de actividad una vez que comience la conferencia. Por ahora, disfruta de la estabilidad y usa el tiempo para preparar tu pila para la próxima ola de actualizaciones. La transición de este letargo al ciclo de envío posterior a la conferencia suele ser muy rápida. Meredith Whitaker, la presidenta de Signal, recientemente usó una entrevista de vista para pushback contra la tendencia de posicionar chatbots de IA como compañeros. Su mensaje fue claro, estos no son tus amigos, no son seres conscientes y no son interlocutores sintientes. Esta crítica está dirigida directamente a los proveedores que usan lenguaje relacional en sus flujos de incorporación, pramps de sistema de persona y diseño conversacional. Esta intervención es particularmente relevante a medida que las herramientas de codificación agente y los bots de soporte se integran en nuestros flujos de trabajo diarios. La línea entre una herramienta y un compañero se está difuminando por las elecciones de diseño antropomórficas. Whitaker argumenta que enmarcar modelos como pares crea expectativas falsas sobre su memoria e intención. Para los constructores, esto significa que la copia del producto y los pramps de sistema de tu agente ahora son parte de la superficie de confianza. El encuadre antropomórfico en pramps de persona o saludos de UI puede ser una bandera roja de privacidad para algunos usuarios. El enfoque de Signal en la privacidad le da mucho peso a esta crítica en los círculos de desarrolladores. Como constructor, podrías querer considerar si la persona de tu agente está ayudando o dañando la confianza del usuario. La copia relacional podría eventualmente convertirse en un factor decisivo para compradores empresariales enfocados en privacidad. Estaremos atentos para ver si los principales proveedores de modelos cambian sus recomendaciones sobre el encuadre relacional en la documentación para desarrolladores. Si las compras empresariales empiezan a marcar como problemáticas las copias antropomórficas, podríamos ver un regreso hacia personalidades de agentes más utilitarias y transparentes. La forma en que encuadras la interacción agente-humano se está convirtiendo en una decisión de diseño fundamental. Un nuevo servicio llamado Indewatch ha sido lanzado, presentándose como un motor de búsqueda vanidoso para la era de la IA. En lugar de indexar páginas web, asigna a los usuarios una puntuación basada en que tan prominentemente su identidad aparece dentro de los parámetros y datos de entrenamiento de modelos de IA de vanguardia. Utiliza el modelo como índice de búsqueda, proporcionando una métrica de cuánta presencia tiene una persona dentro de la representación interna del mundo de la IA. El mecanismo subyacente implica ejecutar repetidas pruebas de inferencia contra LLMS alojados. La arquitectura utiliza un arnés de evaluación para consultar menciones de identidad a través de múltiples puntos de control del modelo. Luego agrega estas tasas de aciertos y recuentos de frecuencia en una única puntuación compuesta. Esto reformula la visibilidad del modelo como una métrica medible, algo que realmente no ha existido como una superficie productivizada antes. Para quienes están lanzando productos de IA, esto podría convertirse en una nueva categoría de métricas orientadas al usuario. SURF es una señal diferente a una clasificación tradicional de búsqueda. La pregunta para los constructores es si la metodología de puntuación se estandarizará o permanecerá opaca. La reproducibilidad es clave para determinar si esta puntuación se convierte en una señal real para marketing o simplemente en otro número vanidoso. Estaremos pendientes de si el protocolo de sondas para este servicio se abre. Si lo hace podríamos ver nuevas herramientas construidas alrededor de ajustar tu presencia a través de diferentes versiones de modelos. Es una mirada interesante a cómo podríamos medir la influencia de individuos y marcas en un entorno de información saturado de IA. Primero en el radar está Fast MCP del equipo de Prefect. Este es un framework Pythonic diseñado para construir servidores y clientes usando el model Context Protocol. Permite a los desarrolladores exponer herramientas y recursos a LLMS con mínimo código repetitivo. Si tienes funciones Python internas que quieres que un agente como Cloud Code invoque directamente, Fast MCP proporciona una forma estándar de envolver esas como llamadas de herramientas tipadas. Es un excelente reemplazo para contenedores CLI improvisados. Le sigue el repositorio Model Context Protocol for Beginners de Microsoft. Este es un currículo completo que guía a los desarrolladores a través de los fundamentos del protocolo. Lo que lo hace útil son los ejemplos en múltiples lenguajes en .NET, Java, Roost y TypeScript. Proporciona un camino claro para conectar agentes a servicios no Python sin necesidad de reescribir todo. Puedes elegir un laboratorio en tu lenguaje preferido y comenzar a aportar tus herramientas internas existentes a un servidor MCP. Finalmente, tenemos Unity MCP. Este proyecto une asistentes de IA y el Unity Editor exponiendo herramientas para gestión de activos, control de escenas y automatización del editor. Hace que la API del editor de Unity sea accesible a través de llamadas de herramientas MCP estándar. Para constructores en el espacio de juegos o simulación, esto convierte los pipelines de activos y las ediciones de escenas en pasos impulsados por agentes. Puedes orquestar un ciclo completo de compilación y prueba enteramente a través de tu stack de agentes. En la revisión de modelos de este ciclo, tenemos dos entradas significativas de Paulside. Primero está Laguna XS-2, ahora disponible a través de Open Router. Como discutimos anteriormente, este es un modelo compacto de segunda generación en su clase XS. Cuenta con una ventana de contexto de 262.000 tokens y combina llamadas de herramientas con razonamiento. Si estás buscando optimizar para costo y latencia en tus ciclos de agentes, este es un candidato principal para evaluar contra tus opciones actuales. El segundo modelo seleccionado es Laguna M1. Esta es la entrada insignia de Paulside, también disponible a través de API. Está optimizado para tareas complejas de ingeniería de software y soporta la misma enorme ventana de contexto. Sus capacidades están dirigidas a flujos de trabajo de codificación a genicial de mayor nivel. Recomendamos enrutar algunas sesiones de agentes de codificación a través de M1 y XS. Dos para ver cómo manejan tu base de código específica en comparación con tus modelos principales actuales. Otros modelos fueron revisados este ciclo pero no fueron seleccionados para cobertura completa ya que no representaban nuevos lanzamientos de proveedores principales. Continuamos rastreando el rendimiento de largo contexto y llamadas de herramientas de todos los modelos principales del mercado para asegurar que tu stack de agentes tenga los mejores fundamentos posibles. Para nuestro Spotlight local, estamos viendo Yama.30.10. Esta actualización agrega soporte acelerado por MLX para Command AD Coere y la familia de modelos. Norton Apple Silicon. También actualiza el motor Yama embebido a la versión 9672. Esta es una actualización significativa para constructores que quieren mantener sus cargas de trabajo en el dispositivo, ya que hace viable la inferencia local de estas familias de modelos en Macs con chip M sin necesidad de CUDA. Si estás trabajando en un Mac con chip M, puedes descargar un modelo Command AD o North y comparar los tokens por segundo contra tu compilación anterior de Yama. Este lanzamiento estrecha el ciclo para agentes que necesitan operar en entornos de alta privacidad o sin conexión. Las ganancias de rendimiento de la aceleración MLX son notorias y ayudan a hacer que los agentes locales sean mucho más receptivos. En nuestra primera nota adicional, vemos las ambiciones del multimillonario Mukesambani, quien quiere entrelazar la IA en cada llamada, aplicación y hogar de India. El ángulo técnico es el incrustado de inferencia en dispositivo y en el borde dentro del stack de un operador. De telecomunicaciones con más de 500 millones de suscriptores. Esto representa una escala masiva para superficies de IA residentes en la red. Le sigue una historia sobre el CEO de AdWords lanzando un nuevo negocio de IA con un plan pero sin empleados. Esto plantea preguntas sobre cómo una empresa de un solo fundador puede operacionalizar la selección de modelos y el envío de productos apoyándose enteramente en stacks de inferencia externalizados o proporcionados por proveedores. Es una mirada interesante al modelo de empresa de uno, impulsado por agentes de alto nivel. Finalmente, hay una disputa sobre si las herramientas principales de fabricación de chips de ASML han llegado a China. La historia depende de la verificación de los controles de exportación de litografía y cómo se rastrea la ubicación física de tales herramientas restringidas. Destaca la fricción entre la lógica comercial y las regulaciones de seguridad nacional en el espacio de hardware, de alto nivel que impulsa la IA. De las historias de hoy, los lanzamientos estables de Open Class 6, 9, Hermes 6 y 19 y Cloud Code.176 cambian lo que tu stack de agentes puede depender por defecto. Laguna XS, 2 y M1 de Paulside te dan nuevas opciones para ciclos de agentes de codificación con requisitos de contexto grande. Los nuevos controles empresariales de OpenAI proporcionan la visibilidad necesaria para gestionar el gasto de agentes a escala. El fracaso histórico de los controles de exportación sugiere que las capacidades de IA defensivas y ofensivas permanecerán globalmente accesibles, haciendo de la seguridad un supuesto básico. La enorme ronda de financiamiento para Baseten indica que la capa de inferencia ahora es un mercado separadamente financiado y altamente competitivo. Finalmente, recuerda que tu elección de personalidad de agente IA capi puede impactar la confianza del usuario, especialmente a la luz de las preocupaciones de privacidad planteadas por Signal. Puedes encontrar más detalles y todos los enlaces en las notas del programa en tobionfitnesstech.com Gracias por escuchar AgentesTagDaily. Volveremos pronto.