← Back to search

एपिसोड 83: Hermes एजेंट v2026.7.7, ओपनएआई Codex rust-v0.143.0, Claude Code 2.1.197, एआईओन-3.0-छोटा

AgentStack Daily (हिंदी) · 2026-07-09 · 47 min
relevance 58 2230 words Episode page ↗ Audio ↗
Show full episode description
Hermes Agent ships v2026.7.7, OpenAI Codex lands rust-v0.143.0, and Claude Code CLI rolls out 2.1.197. AionLabs releases Aion-3.0-Mini roleplay model on OpenRouter. Kokoro delivers high-fidelity TTS on low-power CPUs. Rowboat hits 162 points on Show HN as a local-first Claude Desktop rival. GitHub AI agent prompt injection leaks private repo contents. Early-failure probes cut wasted compute in agent loops. Plus Danus, FreqDepthKV, DepthWeave-KV, RuBench 1.0, VAORA, and Anthropic developer-relations friction around API migration.
✨ Episode Outline — click any point to jump to it in the episode
Problem solved
Daily roundup of agent stack releases and research: production agents you deploy, meter, secure, and observe.
Benefits
  • Hermes adds tighter tool-call flow and observability hooks
  • Codex remote plugins standard with system proxy routing
  • Claude Code adds sandbox controls and deterministic reasoning logs
  • Kokoro delivers local speech on low-power CPUs
  • KV cache compression enables longer contexts per GPU budget
Use cases
  • Kokoro runs 24kHz speech under 100MB on laptop CPUs for offline agents
  • Aion-3 Mini serves roleplay/NPC dialogue with 131k token context
  • Codex PAC/WPAD proxy routing follows corporate network policy
  • Danus writes math proof lemmas to a shared auditable fact graph
  • Halboat hit 162 points on Hacker News as local Claude Desktop rival
KPIs / results
  • Kokoro: 82M parameters, under 100MB, 24kHz audio
  • Aion-3 Mini: 131k token context window
  • Halboat: 162 points on Hacker News
Tools / build
0:00 / 0:00
मैं नौबा हूँ, मैं अलय हूँ, और यह AgentStack Daily है. Hermes एजट 7.7, ओपने आई Codex rust-v0.143 और Claude Code 2.1.197 के साथ आया. Hermes ने Tool Calling Flow को tighter किया और Observability Hooks जोडे, Codex ने Remote Plugins को Default में चालू किया और System Proxy Routing पेश किया, और Terminal-Based AI Coding Agent Cloth Code ने stricter Sandbox Controls, बहतर Telemetry और Deterministic Reason Step Logging जोडी. आज Hermes, Codex और Cloth Code Agent Harness Q का नेत्रित्व कर रहे हैं. Aon Labs ने Open Router पर Aon 3 Mini Roleplay लाया, Kokoro ने Low Power CPUs पर High Fidelity Speech पहुँचाया, Panthropic का Workspace Head Research Interpretability को बढ़ाता है, Robot को Local First Cloth Desktop Rival के तौर पर Hacker News पर Traction मिला, और Security Lane में GitHub AI Agent Prompt Injection Leak आया. Release Thread इसलिए Matters है, क्योंकि Production Agent Stack Hand Wired Assumptions के प्रती लेस टॉलरंट हो रहा है. Remote Plugins अब Baseline Codex Behavior के तौर पर आते हैं, Proxy Traversal Host Operating System का पालन करता है, और Cloth Code के नए Controls, Sandbox Behavior और Reasoning Traces को Repeatable Work में Audit करना आसान बनाते हैं. Model और Research Thread Surface को चौड़ा करता है, Long Context KV Compression, Math Agents के लिए Fact Graph Memory, Multilingual Coding Agent Evaluation, VLMs के लिए Visual Action Rewards और Activation Level Early Failure Probes सब एक ही Operating Constraint की ओर इशारा करते हैं, Agents Systems बनते जा रहे हैं, जिन्हें आप Deploy, Meter, Secure और Observe करते हैं, सिर्फ Prompts नहीं जो आप Run करते हैं. Hermes Agent 7.7 Agents Stack Release Readout के लिए Baseline Set करता है, Tool Calling Pipeline और Observability Hooks में Refinements के साथ जो Long Running Agents Sessions को Inspect करना आसान बनाते हैं. उप्योगी चेंज कोई flashy New Agent Personality नहीं है. यह Tool Invocation के चारो ओर की Plumbing है. Calls, Clearer Timing और Outcome Metadata के साथ Trace की जा सकती हैं, ताकि एक Failing Tool Route Opacity Model Answer की जगा Execution Problem के तौर पर Visible हो. यह तब Help करता है, जब Chain Provider APIs, Shell Actions, Browser Automation या Custom Services को Cross करती है. OpenAI का Terminal Based Coding Agent Codex Rust.143 सबसे बड़ा Surface Change लाता है. Remote Plugins अब Marketplace Catalog से Default Load होते हैं, Richard Rows और Side-by-Side Local और Remote Versions के साथ. Discovery Baseline Behavior बन जाती है, Optane Path नहीं. Codex Mac OS और Windows पर System Proxy Routing भी जोडता है, Pack और Bad Discovery सहित, ताकि Authentication और Responses API Traffic Corporate Network Policy का पालन कर सकें बिना Special Bypass के. Running Daemon से Manual Remote Control Pairing Shared Hosts और Constrained Environments के लिए Cleaner Path जोडता है. Codex Model और Tool Behavior को भी Expand करता है. Bedrock GPT 5.600, TAR और Lona को Max Reasoning Effort First Class Option के तौर पर मिलती है. MCP Tools Search Default में चालू हो जाता है और Hosted MCP Servers Session Authentication यूज कर सकते हैं. App Server Clients को Environment Inspection, Descendant Thread Listing और Specific Turn से History Fork मिलता है, जो Replay और Scheduling Surfaces को More Realistic बनाता है. Cloud Code.197, Anthropic का Terminal आधारित AI Coding Agent, कडे Sandbox, Niyantran, Better Telemetry और नेतात्मक Reason Step Logging जोडता है. व्यभार में यह टीमों को Agent के Edit, Run या किसी टास्क के माध्यम से Reason करने पर सपष्ट Audit ट्रेल देता है. सन्युक्त Readout Plugin घर्षन, Proxy घर्षन दोनों को कम करता है, और Production टीमों को तब मजबूत Trace देता है, जब कोई Agent सही दिखने वाले कारण के लिए गलत काम करता है. Aon Labs ने Open Router पर Aeon 3 मिनी जारी किया, जो Interactive Fiction, NPC Dialog और Tabletop Style Assistant के लिए डिजाइन किया गया एक Roleplay और Storytelling मौडल है. यह DeepSeek Family पर बना है और 131 के Token Context Window एक्सपोज करता है, जो लंबे सत्र चलाने वालों के लिए एहम नंबर है. परसना Memory, Lore, Campaign State और Serialized Chat History Moderate Campaign के लिए बिना अलग Retrieval Layer के Prompt के अंदर रह सकती है. Model का Generation Path Collaborative Roles के इर्दगिर्द व्यवस्थित है. एक Single Pass से Scene Framing, Character Voice, Continuity और Final Prose एक साथ संभालने के बजाए, Aon Labs एक Pipeline बताता है, जहां Specialized Pass Narrative Job के टुकडे लेते हैं, और एक Synthesis Stage Output को मर्स करता है. एक Single Compatible Chat Call Final Reply देता है, लेकिन Upstream Design Plain Base Model Prompt से ज्यादा छोटे Writer's Room जैसा है. Builder Workflow के लिए यहां माइने रखता है, क्योंकि Roleplay System आम तौर पर Boring तरीकों से फेल होते हैं, कोई Character Boundary भूल जाता है, दुनिया पिछले Scene से विरोधा भास करती है, या Assistant Narrative से Metacumentary में भह जाता है. लंबा Context Window Memory प्रेशर कम करता है, जबकि Role Best Generation Path System को Final Answer User तक पहुचने से पहले उन तनावों को Reconcile करने की जगह देता है. Compatible Endpoint का मतलब है, कि मौजूदा Chat Client और Agent Shale इसे Minimal Adapter Work के साथ Root कर सकते हैं. दावों को अभी भी Independent Number चाहिए. परसना Consistency, Contradiction Requiree और Long Session Stability देखने योग ये Evaluation Points हैं. ज्यादा दिल्चस्प Future Knob Role Intermediates या Synthesis Controls एक्सपोज करना होगा ताकि Developers Continuity, Character Voice और Scene Pacing को अलग-अलग ट्यून कर सकें. फिलहाल A.ON, तीन Mini Open Router Use को General Assistant Work की जगह narrative continuity के लिए बनाए गए Drop-in Model देता है. Kokoro सुर्खियों में हैं क्योंकि यह High Quality Text-to-Speech को साधारन Local Hardware पर Practical बनाता है. ज्यादातर Natural Sounding Speech Model अभी भी Cloud Inference, Heavy Warm या Tuned GPU Stack मानते हैं. Kokoro उस Perceived Quality का बड़ा हिस्सा सिर्फ 82 Million Parameter से हासिल करता है. एक 100 MB से कम Memory Footprint के साथ और Standard Laptop CPUs पर आराम से चलता है. दो मेकेनिजम बताते हैं कि यह Voice Agents के लिए अच्छा क्यों है? पहला, Kokoro NNX Runtime Execution का उप्योग करता है. इसलिए Inference बिना Koda Setup की जरूरत के Platform भर में Optimized करने का फायदा उठा सकता है. यह C++, Python और Rust Application को Desktop, Mobile या Age Agent में सीधे Speech Synthesis Embed करने का realistic path देता है. दूसरा Kokoro ProSodi के लिए Style Latent Vector Approach का उप्योग करता है, जो सिस्टम को बड़े Transformer Blocks में Scale किये बिना Emotion Tone बदलने देता है. तक्नीकी Practitions से Reviews ने Quality to Size Ratio को Highlight किया है. 24 kHz audio, Natural Pacing और Mean Opinion Score Results जो कई गुना बड़े Models से टक कर लेते हैं. Practical Effect है Latency और Cost. Voice to Voice Agent को अब हर Response Hosted TTS Provider को नहीं भेजना पड़ता, Network Round Trips का इंतजार नहीं करना पड़ता, और Per Generated Character के हिसाब से भुकतान नहीं करना पड़ता. Local Speech को Agent के साथ Package किया जा सकता है और Connectivity गिरने पर भी उपलब्ध रहता है. गोपनियता समवेदन शील परिनियोजनों को भी लाब होता है. Medical Intake सहायक, Field Service Co-Pilot, शिक्षा उपकरण और स्थानिय व्यक्तिगत Agent Cloud API पर हर उच्चारन भेजे बिनावाक उत्पन्न कर सकते हैं. ट्रेड ओफ अभी भी पारिस्थिती की तंत्र की परिपकवता है, भाशा कवरेज, वोईस विविधता और प्रोडक्शन ग्रेड पैकेजिंग अभी भी मायने रखते हैं. अंग्रेजी और जापानी सहायता इसे अभी कोकोरों को उप्योगी बनाती है, जबकि व्यापक बहुभाशी कवरेज इसे क्लाउड पर निर्भरता के बिना Agent Apps के लिए जो नाचरल ओडियो चाहिए, उसके लिए डिफॉर्ट स्थानिय वोईस लेयर में बदल सकती है. अंथ्रोपिक का पेपर, A Global Workspace in Language Models, Global Workspace Theory के माध्यम से Transformer Inference को नए सिरे से प्रस्तुत करता है, जहां विशेशग्य मौडिूल एक साजहा वर्कस्पेस में ब्रॉडकास्ट करने के लिए प्रतिस्परधा करते हैं, और प्रमुक सिगनल डाउन स्ट्रीम प्रोसेसिंग का मा जोडता है, Reasoning Trace, Tool Choice और Context Integration पहचान योग्य ब्रॉडकास्ट स्टाइल सर्किट पर निर्भर हो सकते हैं, ना कि केवल Diffuse Scale Effects पर, ठोस परिनाम एक छोटे वर्ग पर केंद्रित है, Attention Heads और MLP सर्किट पर, Multistep Reasoning के दौरान, लेखक उन Workspace Heads की पहचान करते हैं, जो Intermediate Results को Consolidate करते हैं, और उन्हें बाद की Layers में पुनह Broadcast करते हैं जब उन Heads को Ablate किया जाता है, तो Chance Thought Coherence गिर जाता है, जबकि सरल Single Term क्षमता बहुत कम प्रभावित रहती है यह व्यवहार एक Split दावे को वजन देती है, Heads सामान्य भाशा Fluency के बजाए Reasoning Thread बनाये रखने से जुड़े लगते हैं Tool Call निरनेयों के दौरान एक दूसरा Mechanism दिखाई देता है जब Model को Tool चुनना होता है, वही Broadcast Pattern अन्य विशेशग्य हेट्स में से एक प्रमुख Tool Selection को आगे बढ़ाता है जो Workspace Framing द्वारा Predicted Wizard a Call व्यवहार से मेल खाता है Paper Workspace Head Activation और Math एवं Code Tasks पर Token Level Confidence के बीच सहसंबंध भी Report करता है जो शोद करताओं को Reasoning Depth के लिए एक मापनिया प्रॉक्सी देता है Agent System के लिए उपयोगी Angle संकीर्न सर्च है Interpretability Tools हर व्यवहार के लिए पूरे Residual Stream को स्कैन करने के बजाए Candidate Head Class पर फोकस कर सकते हैं यह Circuit Level Steering, Probe Design और Regression Analysis को सस्ता बना सकता है अगला Test Cloth Family के बाहर Reproduction है खासकर Open Weight Instruction Tuned Models पर अगर Workspace Heads लगातार दिखाई देते हैं तो Vendors अंतह Workspace Style Signals को Confidence या To Losing Agents के लिए Routing Telemetry के रूप में Expose कर सकते हैं Robot Robot Labs से एक Open Source Project Cloth Desktop के लिए Local First विकल्प के रूप में खुद को Pitch करके Hacker News पर 162 पॉइंट्स पर पहुँचा दिल्चस पी एक व्यावहारिक चिंता से आई कई टी में आधोनेक AI Desktop Client के शैप को पसंद करती हैं लेकिन Hosted Account Workflow से जुड़ी Conversation State Project Context और मालिकाना सामगरी नहीं चाहती Robot का पिछ एक Desktop App है जहां Chat History, Configuration और Project Context यूजर की मशीन पर रहता है यह किसी एक Model Vendor में Lock न करके कई Providers को सपोर्ट करता है एक Devl पर इसे Anthropic, Compatible Endpoint या Self-Hosted Model Server पर Point कर सकता है जबकि एक ही Client सतह बनाए रखता है Interface Cloud Desktop से परिचित पैटर्न उधार लेता है Project Sidebar, Threaded Conversation और System Prompt Editor यहां Robot को सिर्फ एक और Chat Rapper से ज्यादा बनाता है Local First और Bring Your Own की Model Trust Boundary को Shift करता है Product Speaks, Customer Context, Internal Code और Exploratory Design एक ऐसे Client के जरिये Root किये जा सकते हैं जिसे Team Control करती है जबकि Model Calls अभी भी चुने हुए Provider पर जाती है Hacker News Users ने Self-Hosted Inference से इसे Wire करने की भी चर्चा की जो Robot को Local या Private Models के लिए पतली Orchestration Shale में बदल देता है मुख्य खुले सवाल टूल उपियोग और Release Cadence के बारे में है एक असली Engineering Surface बनने के लिए Robot को विश्वस्निय Tool Calling, MCP Server Integration और Predictable Updates की जरूरत है अकेली Chat को Replicate करना आसान है एक Stable Local Client जो Internal Services को Call कर सके Project Context को Preserve कर सके और Multiple Models को State Leak किये बिना Support कर सके यह बहुत ज्यादा Valuable है Robot का Early Traction सजेस्ट करता है कि Developer Demand एक Vendor Neutral Desktop Shell के लिए Real है Frick Depth को उस Memory और Bandwidth Cost को Target करता है जो Long Context Inference को Expensive बनाती है Key Value Cache जब Contexts बड़े Repositories, Tool Traces या Long Conversations में Stretch होते हैं तो KV Cache Working Set पर Dominate कर सकता है Anna Cordoba, Adam Puyent Tersero और Nereya Angulo Hijo के Paper में Frequency Guided Depth Sharing पेश किया गया है जो Agis and Transformer Layers के बीच Redundancy के लिए एक Inference Time Compression Method है यह method हर Cached State को Equally Important मानने से बचती है यह के V States को Shared Low Frequency Depth Components प्लस Sparse High Frequency Residuals में Factorize करती है Low Frequency Components वो Information Capture करते हैं जो Layers में धीरे-धीरे बदलती है और Share की जा सकती है High Frequency Residuals Retrieval, Syntac और Multi-Step Reasoning के लिए जरूरी Sharp Evidence Pre-Zear करती हैं यह Split Needle लेने है Stack Behavior को Intact रखते हुए Memory Pressure कम करने के लिए Design की गई है दूसरा Mechanism एक Lightweight Online Probe है Generation के दौरान Probe Attention Heads को Inspekt करती है और Estimate करती है कि प्रत्यक Head Reconstruction Sensitive Attention Logits में कितना Contribute करती है फिर यह Heads को Shared Depth, Residual Depth या Exact Cache Modes में Assign करती है Static Compression Rule की जगा Frick Depth Per Head और Per Generation Step Adapt करती है जहां जरूरी है वहां Precise State रखती है और जहां नहीं वहां Redundant State शेर करती है Agent Deployments के लिए Appeal Direct Throughput Leverage है Long Coding Sessions, Large Context Retrieval और Multi-Agent Traces सब Cache Pressure क्रियेट करते हैं Before Model itself बदलता है Dynamic Layer Aware Compression Serving Endpoints को Same GPU Memory Budget पर Longer Contexts या More Concurrent Sessions handle करने दे सकती है बचा हुआ सवाल Implementation का है Probe Online चलाने के लिए Cheap होनी चाहिए और Serving Engines को Page Detention Behavior Preserve करनी होगी While Sharing Depth Components अगर Open Inference Stacks इसे Adopt करती हैं तो Context Length Raw HBN Capacity से कम Tired रहेगी Danu's एक Orchestration System है जो एक Shared Fact Graph के Around Research Level Mathematical Reasoning के लिए Build की गई है Authors, Jihao Liu, Gauksyong Gao और Zeming Sun एक Scaling Problem को Target करते हैं जो हर बार दिखती है जब Math Agents Parallel Proof Search में Fan Out होते हैं Intermediate Claims जल्दी Multiply हो जाते हैं और Normal Message Histories Provenants, Dependencies या Contradictions को Inspect करना आसान नहीं बनाते Danu's A2 Layer Agent Setup यूज करती है एक Main Agent Proof Search प्लान करता है और Worker Agents को Sub Tasks Dispatch करता है प्रत्येक Worker एक Branch Explore करता है लेकिन Important Piece वह है जहां Claims जाते हैं Lemmas Definitions, Intermediate Results और Partial Arguments एक Shared Fact Graph में लिखे जाते हैं Workers Same Structured Memory से पढ़ते हैं और उसमें लिखते हैं ताकि Claims Private Scratch Pads के अंदर दबने की जगह ब्रांचेज में Auditable बने वह Graphic Coordination Substrate की तरह काम करती है एक Worker देख सकता है कि दूसरी ब्रांच ने पहले ही एक Supporting Limma Establish कर दी है या कि एक Proposed Path किसी Earlier Definition से Conflict करती है System Similar Claims को Deduplicate कर सकती है और Reasoning Graph में प्रत्यक Edge के लिए Provenance Retain कर सकती है Math इसके लिए एक Useful Domain है क्योंकि Partial Results अकसर Checkable होते हैं और Statements के बीच Dependencies Final Answer जितनी ही Important होती है व्यापक Agent निशकर्ष यह है कि Message Passing और Vector Retrieval Claim Level Coordination के लिए कमजोर टूल्स है Fact Graph Multi-Agent Systems को क्या स्थापित हो गया है, इस पर क्या निर्भर है और किस ब्रांच ने इसे Produce किया है जैसे Query करने का तरीका देता है दानूस गनित विशिष्ट है, लेकिन यह Pattern Research Assistance, Core-Based Analysis, Compliance Review और किसी भी Parallel Search Workflow के लिए उपियुक्त है जहां Claims को Flat Transcript की जगह Structured Provenance की जरूरत है How are, Joanne Liu और Chris J. Kohalman का एक Preprint पूछता है कि Open-ended Data Modeling चलाने वाले Coding Agents का मूल्यांकन कैसे करें उनका जवाब है कि एक Single Run बहुत कम बताता है Agent Stochastic है, Search Process पहले के Outputs के अनुसार Adapt करती है और Final Discovered Model Task Framing, Prompt Wording, Backbone Model, Tool Excess और Budget पर निर्भर हो सकता है Paper Coding Agent को Stochastic Model Discovery Operator के रूप में Frame करता है यह Task Specific Discovery Data प्लस एक Optimization Target प्राप्त करता है फिर एक Candidate Model एमिट करता है उस Operator के आसपास लेखक एक Experimental Design Framework राप करते हैं Inputs vary करें, Run repeat करें, Variance estimate करें और Factorial Style Analysis का उप्योग करके Outcomes को Specific Factors के लिए Attribute करें यह पूछने की जगह की Agent एक बार सफल हुआ या नहीं Framework पूछता है कि कौन से Inputs विश्वसनिय रूप से Performance बढ़ाते हैं यह माइने रखता है क्योंकि कई Agent Benchmark अभी भी Lucky Trajectories को इनाम देते हैं अगर एक Agent एक बार एक मजबूत मॉडल खोज लेता है तो एक Leader Board System को उससे भेतर दिखा सकता है Repeated Trials एक्सपोज करते हैं कि Agent विश्वसनिय रूप से उप्योगी Hypothesis एक्सप्लोर करता है या बस कभी-कभी एक अच्छे रिजर्ट में टम्बल हो जाता है Paper का योगदान Methodological है Variants, Bands और Factor Effects Output बन जाते हैं Single Success Rate की जगा Production Team में Prompt Variants, Model Swaps या Search Budgets की तुलना करते समय उस Framing का उप्योग कर सकती है अगर एक Configuration में Higher Median है लेकिन भारी Variants है जबकि दूसरे में Titer Budget में स्थिर Performance है तो Deployment Choice Clear हो जाता है अगले जो Numbers देखने चाहिए वो है Full Ablation Tables और Perfector Effect Size वो दिखाएंगे की कौन से Nobs वास्तव में Autonomous Discovery को Drive करते हैं और कौन से Nobs सिर्फ शोर जोडते हैं एक Convincing Narrative के साथ Evgeny Shilov का Rubench 1.00 Repository Level Coding Agent Evaluation में एक Gap को Target करता है Native Non-English Task Statements Benchmark में 5 Live Open Source Projects में हाल के Fixed Commits से माइं किये गए 25 टास्क शामिल हैं Python में AOTP और Aogram, PHP में Laval, Plus NestJS और TypeScript और JavaScript में Fastify Code-based परिचित हैं लेकिन Task Handv सामान्य English Issue Prompt नहीं है हर Task Statement रूसी में शुरू से लिखा गया है एक Customer Request की स्टाइल में जैसा की एक Maintenance वास्तव में प्राप्त कर सकता है यह Detail माइने रखती है एक Translated Benchmark अक्सर नीचे English Structure ले जाता है Rubench Native Phresing अलग Ambiguity Pattern और Real Bug Report स्टाइल का उप्योग करता है Agent को रूसी Request समझनी होगी Issue को Localize करना होगा Target Code का निरीक्षन करना होगा और असली Project में Patch Produce करना होगा Benchmark छोटी लेकिन Pointed है 25 टास्क पूरे Coding Agent Landscape को Define नहीं करेंगे लेकिन वे एक क्षमता का टेस्ट करते हैं जो कई Current Switch छोड़ देते हैं Issue in Working Language, Fix and Code Base Multilingual Engineering टी में हमेशा Agents को Polished English Specs नहीं सौमपती है और Customer Facing Maintenance Work अकसर Reporter की भाशा में आता है Ruben चेक्सपोज करता है कि क्या Agent Natural Language Hands को Bridge कर सकता है बिना Technical Thread खोए ठोस मूल्य यह है कि यह एक Plugin मूल्यांकन सतह है जो उन टीमों के लिए है जो Non English वातावर्ण में Coding Agent भेज रही है यह स्थानिय करण Repository समझ और Patch Generation को एक साथ मापती है बड़े भाशाओं में अनुवर्ती सुइट और Vendors द्वारा मूल रूप से लिखे गए बहुभाशी कारियों पर स्कोर प्रकाशित करने पर नजर रखें यह बहुभाशी सहायता के सामान्य दावों से बहतर संकेत होगा क्योंकि यह भाशा समझ को वास्तविक मरम्मत कारिय से जोडता है Anthropic का Model गुणवत्ता मजबूत बनी हुई है विशेशकर Coding Benchmark में लेकिन Frontier Model Migration के आसपास Devil पर अनुभव ने घर्शन पैदा किया है केंद्रिय तकनी की बदलाव पुराने Text Completions API से Messages API की ओर है यहाँ बदलाव सिर्फ Syntax नहीं है यहाँ बदलता है कि Inference के दौरान Prompt, Role और State का प्रतिनिधित्वक कैसे होता है एक ठोस उदाहरन System Prompt Handling है Messages API में System Prompt Message एरे के अंदर के बजाए Top Level Parameter के रूप में बैठता है पुराने Rapper जो हर निर्देश को Message की तरह मानते थे शब्दों को सुरक्षित रख सकते हैं लेकिन पदानुक्रम बदल सकते हैं और यह Model व्यवहार को बदल सकता है तोलोप योग करने वाले Agent इस पदानुक्रम के प्रती विशेश रूप से समवेदनशील होते हैं क्योंकि Routing निर्देश, सुरक्षा बाधाएं और संदर्भ साराश विभिन स्थानों पर ध्यान के लिए प्रतिसपरधा करते हैं Builders ने Rate Limit और संदर्भ विंडों Instrumentation के बारे में भी चिंता जताई है लंबे चलने वाले एजेंटों को यह जानना होता है कि बजट में कितना शेश है संदर्भ कब संत्रिप्ती के करीब है और Retry को क्या करना चाहिए सेशन को सिकोडना चाहिए या फोर्क करना चाहिए यदि हेडर और उप्योग संकेतक असंगत है या सामान्य बनाना कठिन है तो स्वायत लूप अधिक भंगुर हो जाते हैं मौडल प्रतिस्थापन बड़े संदर्भ विंडों के अंदर Retrieval व्यवहार को भी बदल सकता है जिससे टीमों को उन प्रॉंप्ट को फिर से ट्यून करना पड़ता है जो पहले काम करते थे कई टीमों का जवाब रक्षात्मक रैपिंग है वे प्रोवाइडर रिस्पॉंस को सामान्य बनाती हैं सिस्टम प्रॉंप्ट इंजेक्शन को अलग करती हैं और एस डीके के आसपास अपना बजट अकाउंटिंग जोडती हैं यह माइग्रेशन में ओवरहेड जोडता है लेकिन यह एक बड़ा सत्य भी दर्शाता है फ्रेंटियर मॉडल बदलना सिर्फ एपी आई कुझी बदलना नहीं है इसके लिए प्रॉम्ट पदानुक्रम और्डिट, ओवर्फ्लो हैंडलिंग परिवर्तन, टूल स्कीमा जाच और व्यवहार विग्रेशन कार्य की आवश्शक्ता हो सकती है हाजून को ज्याजन चेन और होबो यौन द्वारा वाउरा इंटरैक्टिव रीजनिंग के लिए उप्योग की जाने वाली विजन लैंग्वेज मॉडल में एक विशिष्ट कमजोरी को लक्षित करता है जब कोई मॉडल भौतिक या विजूल कारयों के बारे में तर्क करता है उसका चेन और थौट इमेज से और उस कारवाई के परिणामों से जो वह करने की योजना बना रहा है से भटक सकता है परिणाम यह है कि पाठ या तो द्रिशिका विरोधा भास करता है या किसी कारवाई के परिणाम की गलत भविश्यवानी करता है वावरा का अर्थ है विजूल एक्षिन आउटकम रीजनिंग अलाइनमेंट यह एकल रीजनिंग रिवार्ड को दो अलग संकेतों से बदल देता है विजूल एलाइनमेंट रिवोर्ड स्कोर करता है कि व्याख्या वास्तव में दिखाई देने वाली चीज में आधारित है या नहीं कारवाई से स्वतंत्र एक्षन आउटकम रिवोर्ड स्कोर करता है कि व्याख्या सही धंग से भविश्यवानी करती है या नहीं कि एजेंट की कारवाई क्या कारण बनेगी यह विभाजन माइने रखता है क्योंकि एकल संयुक्त रिवोर्ड छिपा सकता है कि कौन सा अक्ष विफल हुआ इससे ट्रेनिंग और मूल्यांकन को एक स्वच डायगनोस्टिक सतह मिलती है यदि विजुल टर्म कमजोर है तो मॉडल द्रिश्य को सही धंग से पड़ नहीं रहा है यदि एक्षन टर्म कमजोर है तो यहाँ द्रिश्य देख सकता है लेकिन अपनी योजना के प्रभाव की भविश्यवानी करने में विफल रहता है मूर्त एजेंटों, ब्राउजर एजेंटों और नियंतरन प्रणालियों के लिए ये अलग-अलग समस्याएं है एक वेब आप को नियंतरित करने वाला मॉडल एक बटन को भ्रमित कर सकता है जो वहाँ नहीं है या वहाँ बटन को सही धंग से पहचान सकता है लेकिन फिर भी गलत समझ सकता है कि उस पर क्लिक करने से क्या होगा खुला सवाल ट्रांसफर का है वावरा इंट्रक्टिव फिजिकल रीजनिंग के इर्दगिर्द बनाया गया है लेकिन यही स्प्लिट स्क्रीनशॉट्स, रिमोट डेस्क टॉप्स, अप ऑटोमेशन और रोबोटिक्स पर भी लागू हो सकता है परसेप्शन ग्रांडेड रिवाड प्लस एक्शन कंसीक्वेंस रिवाड वी एल एम बिल्डर्स को ब्लेंडेड स्कोर से बहतर एरर एट्रिब्यूशन देता है अगर यह कंप्यूटर यूज बेंचमार्क पर काम करता है तो यह तै कर सकता है कि टूल उजिन विजन एजेंट्स को कैसे ट्रेंड और डीबग किया जाए नोमाओ सेक्योरिटी ने गिठाब के एई एजेंट्स सतों के खिलाफ एक प्रॉंप्ट इंजेक्शन चेन डेमोंस्ट्रेट किया जो प्राइवेट रिपोजिटरी कंटेंट लीक कर सकता था एक्स्प्लॉइट ने एक पब्लिक इश्यू या पुल रिक्वेस्ट पर एक क्राफ्टेट कमेंट का इस्तिमाल किया कमेंट एक नॉर्मल कोड सारांश रिक्वेस्ट की तरह दिखता था लेकिन इसमें इंस्ट्रक्शन एमबेडेट थे जो एजेंट के टूल सेलेक्शन लूप में हैरफेर करती थी पहला स्टेप एजेंट को टार्गेट रिक्वेजिटिरी में वाइड कार्ड स्टायल क्वेरी के साथ इंस्तिमाल करता है फिर परिनामों को औरडिनरी आसिस्टेंट आउट्पुट के तौर पर चैट रिस्पॉन्स में स्ट्रीम करता है खास failure tool calls के बीच बैठता है permission check पहले tool invocation से पहले चले थे लेकिन search results वापस आने के बाद और content page से पहले फिर से evaluate नहीं किये गए वो sequential gap वही जगह है जहां tool using agent खतरनाक हो जाते है broad tool access वाला एक model एक सपश्ट रूप से बहरमन request को privileged calls की chain में बदल सकता है अगर authorization केवल session start पर या केवल पहले tool से पहले check किया जाता है तो बात के calls एक ऐसा access scope inherit कर सकते हैं जो अब user के इरादे या permission से mail नहीं खाता NoVa ने एक single public comment से trigger होकर एक private test organization से read में और source content extract किया fix pattern साफ है हर tool call को current user, target resource और action के खिलाफ फिर से authorize करें search और read permission को interchangeable नहीं मानना चाहिए और return किये गए identifier को गलती से capability token नहीं बनने देना चाहिए teams जो agents को internal code, tickets, customer data या cloud control planes के expose करती हैं उन्हें pair call scope checks और tool call sequence पर anomaly detection की ज़ूरत है GitHub के permission reach a path को patch करने की उम्मीद है लेकिन यह lesson हर उस agent पर लागू होता है जिसके पास broad tools हैं कई ruin, जहे हुआंग और जिकी जू का एक paper agent loops में बरबाद compute पर भारी है कुछ trajectories fail होने से पहले कई steps तक productive दिखती हैं जिसका मतलब है कि system उस path पर inference budget, tool calls और समय जला देता है जो पहले से ही doomed था authors एक recall controlled probe cascade introduce करते हैं जो bad output का इंतिजार करने के बजाए सीधे hidden activations पढ़ता है core mechanism एक lightweight classifier probe है जो हर interaction round पर internal representations पर trend किया गया है probe एक failure likelihood signal emit करता है जो distribution free तरीके से calibrated है ताकि threshold बिना pair data set tuning के tasks में यात्रा कर सके फिर एक controller उस signal का इस्तिमाल run को रोकने के लिए करता है इससे पहले की agent एक देड़ पात पर और budget खर्च करें headline result है early separation probe doomed trajectories को पहले interaction round में ही flag कर सकता है जबकि scorers जो केवल observable behavior inspect करते हैं वही point पर लगभग chance से बहतर नहीं है इसका मतलब है कि failure signal text tool outputs या final answers में दिखाई देने से पहले ही model के internal state में मौजूद है agent अभी भी सुसंगत लग सकता है जबकि उसका trajectory पहले ही unrequirable हो चुका है deploy किये गए agents के लिए यह क्षमता सुधार से ज्यादा लागत नियंत्रण है probe cascade planner को दोबारा लिखे बिना या model की अंतिमउत्तर नीती को बदले बिना loops को gate कर सकता है कठोर dependency access है production provider शायद ही कभी activation level hook expose करते हैं अगर vendors सुरक्षित internal state signal expose करते हैं तो early failure detection multi-step agents के लिए metering layer का हिस्सा बन सकता है तब तक paper एक मजबूत research result देता है output scrapping कई agent failures के लिए बहुत देर है depth weave के वी समान लंबे context serving wall पर frick depth कुसे अलग कोन से हमला करता है एक बार जब context लाखो token से आगे बढ़ जाता है तो key value cash model weights से ज्यादा memory खा सकता है मौजूदा compression scheme अकसर layers और token में uniform budget लागू करते हैं जो retrieve critical details को नुक्सान जहां attention व्यवहार समवेदन शील होता है token जो व्यापक semantic state ले जाते हैं वे अधिक आक्रामक रूप से साजह कर सकते हैं token जो lexical lookup, code reference या retrieve व्यवहार को anchor करते हैं संकीर रेजिडिवल स्लोट रखते हैं adaptive हिस्सा global compression knob के बजाय प्रती token attention समवेदन शीलता signal के साथ रेजिडिवल बजट को steer करने से आता है यहां लंबे समय तक चलने वाले coding agents के लिए माइने रखता है एक multi-hour session में project-wide context, tool trace, diffs, shale output और कई turn में user intent शामिल हो सकता है उस context की serving सिर्फ model क्षमता के बारे में नहीं है यह KV working set को GPU की memory और bandwidth budget के अंदर रखने के बारे में है adaptive sharing मौझूदा लंबे session की संख्या बढ़ा सकती है या प्रत्यक की serving लागत को कम कर सकती है engineering सवाल runtime सवाल है क्या factorized state नए token आने पर incrementally stream कर सकता है क्या VLL aim 1060 LLM या समान serving engine pageant attention को break किये बिना cross layer sharing अपनाई सकते है क्या compression ratio beam search, tool heavy trace और code retrieval में बच जाता है न की केवल clean retrieval benchmark में अगर जवाब हाँ है तो long context serving को एक नया base model की जरूरत के बिना एक व्याभारिक दक्षता रास्ता मिलता है रोबोट पहला project है क्योंकि यह एक ठोस local first client है, सिर्फ एक चर्चा विशय नहीं repo provider neutral AI chat के लिए एक desktop सतह पेश करता है जहां model connectors, project context और user managed keyज एक app में रह सकते हैं headline mechanism state का स्थानिय स्वामित्व है, provider routing के साथ एक team anthropic, संगत endpoint या self-hosted model server से connect कर सकती है फिर project work के लिए एक ही interaction layer रख सकती है integration angle सीधा है, अगर maintainers भरोसेमंद tool support land करते हैं तो robot internal model get wedge और private mcp server के आसपास desktop shell बन सकता है Kokoro दूसरा project है क्योंकि यह voice agents के लिए deployment shape बदलता है Kokoro और इसके ONNX packaging के आसपास repo ecosystem developers को एक compact speech synthesis component देता है जो CPU hardware पर चल सकता है Headline mechanism style latent prosody और optimized ONNX execution के साथ small parameter high fidelity TTS है Integration angle उन agents के लिए एक स्थानिय voice layer है जो पहले से speech recognition या text chat handle करते हैं हर response को hosted TTS service पर भेजने के बजाए एक app स्थानिय रूप से synthesize कर सकता है विलंबता कम कर सकता है बार बार API लागत कम कर सकता है और समवेदनशील उच्चारनों के लिए privacy बनाए रख सकता है Danus तीसरा project है जिस पर नजर रखनी चाहिए इससे पहले कि इसके आसपास एक व्यापक ecosystem बने क्योंकि यहाँ एक पुन प्रयोजय memory pattern प्रदान करता है मुख्य विचार समानांतर reasoning workers में साजा किया गया एक fact graph है Headline mechanism claim level coordination है लेमास, परिभाशाएं और मध्यवर्ती परिणाम graph nodes और ages बन जाते हैं Provenance के साथ chat stream के अंदर दबे हुए turn नहीं Integration angle गनिट से आगे बढ़ता है Research agents, compliance review system और code analysis agents समान pattern का उप्योग कर सकते हैं जब उन्हें बड़े पैमाने पर coordination की जरूरत होती है A.ON 3 mini चुन्ने योग्य मॉडल है जिस पर नजर रखनी चाहिए यह Open Router के chat interface के जरिए उपलब्ध है परिवार के बहुभाशी व्यवहार को विरासत में मिलाता है और role play और storytelling workflows के लिए 131 के token context window लाता है चुना गया दृष्टिकोन सीधे benchmark dominance नहीं है यह specialization है model character voice, continuity और long interactive sessions के लिए आकार में ढाला गया है अगर आप ANPC dialogue, tabletop assistance, interactive fiction या persistent character chat बना रहे हैं तो Aon, 3, mini आपको एक hosted endpoint देता है जहां narrative structure design का हिस्सा है बाद में जोडी गई चीज नहीं local spotlight को कोरो पर है क्योंकि यह consumer hardware पर पूरी voice loop को package करना आसान बनाता है TryNow का practical दृष्टिकोन सीधा है कोकोरो को किसी मौझूदा local agent के पीछे TTS endpoint के रूप में जोडे speech synthesis को CPU पर रखें और latency और audio quality की तुलना hosted speech provider से करें छोटा footprint इसका मतलब है कि यह एक local chat model retrieval service या desktop automation agent के बगल में चल सकता है बिना machine को GPU only appliance में बदले privacy sensitive assistance के लिए कोकोरो वह तरह का component है जो local first को slogan से shipable interaction mode में बदल देता है Frick Depth को और Depth Weave के वी पहला extra research thread बनाते हैं दोनों के वी cash growth को हमला करते हैं लेकिन वे अलग-अलग sharing structures पर जोड देते हैं एक case में frequency guided depth sharing दूसरे में law rank cross layer basis with token adaptive residuals सन्युक्त संदेश यह है कि long context अब model training problem जितना ही serving systems problem है अगर cash compression retrieval critical tokens को बरकरार रखता है तो agent providers same hardware envelope से longer sessions और more concurrent users को serve कर सकते हैं क्योंकि vision language agents के लिए reward design blended scores से separable terms की ओर बढ़ रहा है visual grounding को action outcome prediction से अलग करने से teams को cleaner failure attribution मिलती है यह browser control, robotics, remote desktop automation और किसी भी VLM workflow के लिए माइने रखता है जहां model को current state को देखना और यह predict करना होता है कि उसका अगला action क्या बदलेगा early failure probe cascade तीसरा candidate है क्योंकि यह cost control को loop के अंदर ले जाता है bad final answer या visible tool failure का इंतजार करने के बजाए probe internal representations को पढ़ता है और doom trajectories को जल्दी flag करता है constraint provider की activation signals तक पहुँच है लेकिन research directions पश्ट है agent runtimes को expensive failures को long, polished failures बनने से पहले रोकने का तरीका चाहिए codex rust.143 remote plugins और system proxy routing को default behaviors बनाता है जबकि harms 7.7 और cloud code.197 agent work के आसपास traceability, sandbox control और telemetry को बहतर बनाते है Aeon 3 mini narrative agents को open router के जरिये एक long context, role play focused model देता है जहां परसना continuity मुख्य deployment कारण है Kokoro CPU first voice agents के लिए local speech synthesis को व्याभारिक बनाता है जिनहें कम latency, कम लागत और कम cloud dependency की जरूरत होती है Anthropic का work space head paper interpretability teams को reasoning और tool routing probes के लिए एक संकीर्न लक्ष देता है Robot local first provider neutral desktop AI clients की मांग दिखाता है जिनमें ब्रिंगे और उनकी routing और भविश्य का aim CP potential है Frick Depth को और Depth Weave के वी Adaptive Cash compression की ओर इशारा करते हैं जो long context serving cost पर सीधा असर डालता है Danus Fat Graph memory की वकालत करता है जब multi-agent systems को सिर्फ message history नहीं बलकी claim provenance चाहिए Stochastic Model Discovery Paper Coding Agent Evaluation को repeated trials variance bands और factor effects की ओर धकेलता है Rubench 1.0 ने test करता है कि क्या coding agents real repositories में native Russian maintenance requests handle कर सकते हैं Anthropic का API migration friction दिखाता है कि frontier model upgrades के लिए prompt hierarchy और tool routing regression attention क्यों जरूरी है Vowra VLM agents के लिए visual grounding को action outcome reasoning से अलग करता है GitHub prompt injection leak हर agent tool invocation के लिए per call authorization को मजबूत करता है Early failure probes दिखाते हैं कि बरबाद agent compute को visible output stream में failure पहुचने से पहले काटा जा सकता है Links और गहरे source context के लिए toby on fitnesstech.com पर show notes देखें Agent stack daily सुनने के लिए धन्यवाद हम जल्द ही वापस आएंगे