← Back to search

[0531 | AI Daily] OpenAI error correction rate plummets/MiniMax launches A-share IPO/Step Star 198B programming model released

AI圈儿 · 2026-05-30 · 20 min
relevance 0 253 words Episode page ↗ Audio ↗
Show full episode description
☀️早安! 欢迎加入听友群获取每日【播客内容文稿】以及【AI技术干货】。 另外,苹果用户可以直接设置Siri唤醒我们的节目啦! Hey Siri, 打开AI圈日报” 也欢迎添加+vx:KyroMa(管理员),加入听友群 获取每日【播客内容文稿】以及【AI技术干货】。 今天是2026年5月31日,星期日 欢迎查收你的每日AI资讯速递!今日内容如下: ⏰【AI时间线】 今天的时间线我们来“盘”一下MCP协议的发展时间线。 👉【今日重点新闻】 新闻一:OpenAI升级GPT-5.5 Instant模型,幻觉率骤降52.5% OpenAI对ChatGPT的GPT-5.5 Instant模型进行了升级。这一次升级的重点不是让AI变得更快或者更强,而是让AI变得更"诚实"。根据官方数据,在医学、法律、金融这些高风险领域,模型的幻觉率大幅下降了52.5%。与此同时,AI回复的排版也改了,不再是大段大段的列表,而是变成了有层次、有结构的自然段落,读起来更像一个人在跟你说话。另外,升级后GPT-5.5 Instant和GPT-5.5 Thinking将不再提供Canvas功能,付费用户可以在过渡期继续使用。 新闻二:英伟达发布LocateAnything模型,检测速度比竞品快11倍 英伟达发布了一款名为LocateAnything的智能检测模型,主打高速、高精度目标检测。这个模型使用了英伟达自研的Parallel Box Decoding技术,可以让电脑一次性预测出对象的位置边框,不需要反复计算。在单张H100显卡上运行时,处理速度达到每秒12.7个检测框,比Qwen3VL快了约11倍。在高精度测试中,LocateAnything在LVIS测试集上得分31.1,远超RexOmni的20.7分。这个模型可以应用在机器人导航、智能助手自动操作等场景。 新闻三:MiniMax签署辅导协议,正式启动A股IPO进程 人工智能大模型企业MiniMax五月二十九日与中信证券签署辅导协议,正式启动A股上市计划。值得注意的是,这家企业今年一月刚刚登陆港交所,发行价165港元,上市首日涨幅达到111.39%。按当前汇率换算,MiniMax市值约为2634.54亿港元,折合人民币约2280.06亿元。行业分析认为,此时启动A股IPO,意味着MiniMax希望在资本市场获得更多发展机遇。 🙇‍♀️【AI资讯简报】 05:14 1. OpenAI 更新 GPT-5.5 Instant 模型,AI 回复更自然、易读 06:20 2. 英伟达推出 LocateAnything,主打 AI 高速、高精度检测对象 08:03 3. LLMShare 攻击披露:ChatGPT 共享页变恶意入口,通过谷歌搜索精准投毒 09:29 4. 缓解亏损压力,消息称 Meta 明年将推 AI 吊坠寻找新收入 10:24 5. 英伟达清华团队提出Gamma-World:世界模型从「一个人玩」到「多人共处」 11:02 6. 阶跃星辰发布 Step 3.7 Flash:一款面向编程智能体与搜索工作流的 198B MoE 视觉语言模型 13:17 7. NVIDIA 推出 X-Token:投影引导的跨Tokenizer知识蒸馏,在 Llama-3.2-1B 上平均分超越 GOLD +3.82 14:24 8. Hermes Agent 为 MCP 推出工具搜索功能:Anthropic 评测显示 Opus 4 准确率提升 49% 至 74% 15:53 9. MiniMax 签署辅导协议,正式启动 A 股 IPO 进程 🤔【AI深一度】 17:08 MiniMax港股上市不到半年,又冲刺A股,表面上是融资扩张,背后是AI赛道的资本逻辑正在重构。 大模型是极度消耗资本的业务——训练一次千亿参数模型,电费动不动几百万美元起跳。算力、研发、数据,每一环都在烧钱,速度越来越快。MiniMax虽然账面上有2600多亿港元市值,但市值是二级市场的预期,而预期最怕两件事:一是长时间没有正向现金流,二是竞争加剧到资本开始犹豫。 更残酷的是行业正在高速新陈代谢——OpenAI九十天后移除o3,三十天移除GPT-4.5,连自己都在快速淘汰自己。这意味着没有人能躺在功劳簿上。IPO不是终点,是另一场比赛的开始。 🔍 【找到我们】 社交媒体: 小红书 , 抖音 音频平台: 苹果播客 , 喜马拉雅 在小宇宙查看该单集文稿
0:00 / 0:00
🌐 This transcript was automatically translated to English from the original.
Good morning, this is the AI ​​circle, and I will understand AI with a group of people. I am the new news announcer. OpenAI has just thrown out the king bomb, and the illusion of new models has dropped by half. Will there be less and less serious nonsense in AI in the future? The long-dormant AI unicorn suddenly announced that it will return to the A-share market. How much patience does the capital behind the migration of market value have? A domestically produced large model with 198B parameters suddenly appeared, and its programming capabilities are comparable to Cloud Opus. 4.0, but the cost is only one-ninth of the latter. Is the wolf really coming in this price war? In the AI depth at the end of the show, we will talk about AI companies rushing to go public. At the end of the capital story, what are they fighting for? There is more AI information. Let’s pay attention together. Today is May 31, Sunday. Let’s take a look at today’s AI timeline. Let’s start with an easily overlooked news. Hermis Agent has just launched a tool search function for the MCP protocol. You heard it right, MCP, the protocol that allows AI to control various tools, has long been occupied by Anthropic, Cloud, and OpenAI. Anthropic's internal evaluation data shows that after turning on this function, the accuracy of Cloud Opus 4 jumped directly from 49% to 74%, an increase of 25 percentage points in one breath. The consumption of tool-defined tokens has also been reduced by 85%. In other words, the tool list that was given to the model in the backend every time was like a dictionary, and now it has become a business card. But what’s really interesting is not just the number itself. Think about it, the MCP protocol essentially allows the AI to grow hands and feet and call external tools to work. The more tools there are, the stronger the AI. But when there are too many tools, the model is overwhelmed and the context window explodes. Hermis Agent’s solution is: Don’t stuff all the tools and schema into the model when they are not needed. Just load them on demand. Sounds simple, right? 但它背后折射出一个行业底层逻辑 AI赛道现在的竞争 不只是比谁模型更强 更是在比谁能把资源消耗这件事件压得更低 谁能把成本打下来 谁就能在价格战中活到最后 好,说到成本 今天的另外几条新闻都跟这个逻辑有关 除了AI公司的成本与效率 今天还有这些事值得重点关注 新闻一 OpenAI升级GPT 5.5 Instant模型 幻觉率骤降52.5% OpenAI对Chatt GPT的GPT 5.5 Instant模型进行了升级 这一次升级的重点不是让AI变得更快或者更强 而是让AI变得更诚实 根据官方数据 在医学、法律、金融这些高风险领域 模型的幻觉率大幅下降了52.5% 与此同时 AI回复的排版也改了 不再是大段大段的列表 而是变成了有层次、有结构的自然段落 读起来更像一个人在跟你说话 另外,升级后 GPT 5.5 Instant和GPT 5.5 Thinking 将不再提供Canvas功能 付费用户可以在过渡期继续使用 新闻2 英伟达发布Locate Anything模型 检测速度比竞品快11倍 英伟达发布了一款名为 Locate Anything的智能检测模型 主打高速、高精度目标检测 这个模型使用了英伟达自研的 Parallel Box Decoding技术 可以让电脑一次性预测出 对象的位置边框 不需要反复计算 在单张H100显卡上运行时 处理速度达到每秒12.7个检测框 比宽3VL快了约11倍 在高精度测试中 Locate Anything在LVIS测试级上 得分31.1 远超REXOMNI的20.7分 这个模型可以应用在机器人导航 智能助手自动操作等场景 新闻3 Minimax签署辅导协议 正式启动A股IPO进程 人工智能大模型企业 Minimax 5月29日与中信证券签署辅导协议 正式启动A股上市计划 值得注意的是 这家企业今年1月刚刚登陆港交所 发行价165港元 上市首日涨幅达到111.39% 按当前汇率换算 Minimax市值约为2634.54亿港元 折合人民币约2280.06亿元 行业分析认为 此时启动A股IPO 意味着Minimax 希望在资本市场获得更多发展机遇 接下来是今天的AI资讯速递 OpenAI公司发布新消息 对ChatGPT的GPT5.5 Instant模型进行了升级 这次升级让AI回复变得更自然 更好读 结构也更清晰 不再有长长的列表 在医学、法律和金融这些高风险领域 升级后的模型出错率大幅下降 幻觉减少了52.5% 同时数学、科学和视觉推理能力 也得到了显著提升 升级后 GPT5.5 Instant和GPT5.5 Thinking 不再提供Canvas功能 用户现在可以直接在聊天回复中 使用文字块和代码块来输入文字和代码 付费用户可以在旧模型停用前的过渡期 继续使用Canvas功能 另外 OpenAI还宣布将逐步淘汰 使用率较低的旧模型 O3模型将在大约90天后移除 GPT4.5将在大约30天后移除 英伟达最近发布了一个叫Locate Anything的智能检测模型 这个模型可以帮助机器人和电脑程序 快速找到图片或截图里的指定对象 就像给机器人装上了一双会找东西的眼睛 这个模型最厉害的地方是检测速度非常快 因为它使用了一种叫Parallel Box Decoding的新技术 可以让电脑一次性预测出对象的位置边框 而不用反复计算 Locate Anything提供了三种工作模式 分别是Fast Mode Slow Mode和Hybrid Mode Fast Mode适合安装在机器人身上 强调快速反应 Slow Mode适合用来做标注和精度评估 Hybrid Mode则是默认快速运行 遇到复杂情况时 会自动切换到更仔细的检测方式 研究团队还准备了包含1200万张图片的超大训练数据集 帮助模型学习各种找东西的场景 在实际的性能测试中 Locate Anything表现非常出色 在单张H100显卡上运行时 它的处理速度能达到每秒12.7个检测框 这个速度比宽3VL快了约11倍 也明显超过了Rexomi 在高精度的检测任务中 它的得分也更高 比如在LVIS测试级上得到了31.1分 比Rexomi的20.7分高出不少 这个模型可以应用在机器人导航 智能助手自动操作 识别图片 文字等多种需要快速定位的场景中 网络安全研究人员最近发现了一种新型网络攻击 攻击者利用ChatGPT平台的内容分享功能实施诈骗 研究人员将这种攻击命名为LLMShare 攻击者先在ChatGPT上创建一个看似正常的页面 页面显示网站因为访问量太大 暂时无法使用 诱导用户下载桌面应用继续使用 用户点击下载按钮后 会被带到一个模仿OpenAI官方下载页面的假冒网站 技术人员分析发现这个假冒网站使用了特殊的隐藏技术 当安全检测工具访问时会显示一个无害的AR VR公司网站 而真实用户访问时才会看到恶意下载页面 网站还提供Windows和MacOS两个版本 下载的程序会检测运行环境是否虚拟机 从而判断是否为安全研究人员 研究人员还在部分客户环境中发现了针对Cloud平台的类似攻击变种 说明攻击者可能在测试不同的AI平台和欺骗话术 这种攻击的特殊之处在于 恶意内容完全通过ChatGPT自身渲染 并且托管在其官方域名大大增加了欺骗性 据多方报道 Meta正在研发一款名为AI吊坠的可穿戴设备 计划明年上市 旨在寻找新收入 以缓解公司近期的亏损压力 该吊坠外观小巧 可佩戴在胸前 内置麦克风、扬声器和摄像头 能够通过AI助手实现语音交互 及时翻译、内容生成和健康监测等功能 用户佩戴后 可以轻松使用Meta旗下的社交平台 进行消息发送、语音通话和直播 并与Lama等生成模型进行互动 行业分析认为 这款设备若以大众化的价格出售 有望吸引年轻用户群体 为公司提供除广告之外的收入来源 不过 目前Meta尚未正式确认 该产品的发布时间和具体功能 英伟达与清华大学 联合提出了Gamma World框架 旨在让世界模型 从单一智能体操作 升级为多智能体协同交互 当前大多数世界模型只能让一个人工智能同时操作 Gamma World通过模拟真实世界中多人共处的场景 让多个智能体能够同时观察环境 规划行动并彼此协作 该研究已发布相关技术文档 并提供了Gamma World Bench测试基准 供研究者使用 接月星辰发布了Step 3.7 Flash 这是一款198B参数的西书MOS视觉语言模型 由196B参数的语言主干网络 和1.8B参数的视觉编码器组成 虽然总参数庞大 但每次只激活约11B参数进行推理 这使得计算成本保持在合理水平 该模型是Step 3.5 Flash的升级版本 新增了原生图像理解能力 而前代产品仅支持文本处理 Step 3.7 Flash 支持低、中、高三种推理深度模式 用户可以根据任务复杂程度灵活选择 在编程智能体测试中 该模型在SYBench Pro上 获得56.26%的成绩 在Terminal Bench 2.1上 获得59.55%的成绩 均有明显提升 特别值得注意的是 模型在不同代码框架下的表现更加稳定 之前代产品在各框架上的得分差异较大 现在则收敛到更窄的范围内 该模型还推出了Advisor Mode功能 在执行编程任务时 自动判断是否需要调用更大的模型 来处理复杂决策 从而节省成本 据报道 使用该功能后 模型性能可达到Cloud Opus 4.6%的97% 而费用仅为后者的九分之一 在视觉能力方面 模型配备了两种视觉工具调用模式 一种用于识别训练数据中少见的物体或新概念 得分达到79.16% 另一种用于处理高分辨率图像的精细分析 得分达到95.29% 在手机界面操作任务测试中 该模型得分领先于多个竞品 Step 3.7 Flash采用Apache 2.0开源许可 已在Hugging Face平台上公开模型权重 支持BF16 FP8 NVFP4等多种精度格式免费下载 NVIDIA研发X-Token 实现跨瓷表模型间的知识迁移 传统蒸馏要求瓷表相同 GOLD把词分为相同与不同两类 对相同词用KL散度 对不同词用排名匹配 但不同词常被抑制 导致数学题成绩下降 X-Token建立投影矩阵 W把学生词映射到老师词 并采用两种损失 PKL和HKL 系统先检查关键词 如多位数是否在相同集合 若不在则选PKL 再则选HKL 使用Quin34B做老师时 PKL让LAMA3 21B在GSM8K上 从2.56提升至15.54 平均分比够得高3.82 若加入FICE Mini做第二位老师 分数还能再提高约1.3 W在训练前根据磁符 字符串构件 可随时细掉 NOS Research推出了 开源Hermes Agent的Tool Search功能 这个功能主要解决一个实际问题 当连接多个MCP服务器时 所有工具的JSON schema 都会在每次对话时被发送到模型 导致上下文窗口消耗巨大 在一个典型的5服务器 34个工具的部署中 每次对话的令牌开销 约为45,000个 其中大约一半 用于工具S schema本身 Anthropic的数据显示 工具定义在优化前 可以消耗多达13.4万个令牌 Tool Search 通过三个桥接工具 实现按需加载 Tool Search用于搜索工具目录 Tool Describe用于加载完整schema Tool Call用于调用实际工具 底层使用BM25检索算法 匹配工具名称 描述和参数名 Anthropic内部评估显示 开启该功能后 Cloud Opus 4在MCP任务上的准确率 从49%提升到74% Opus 4.5从79.5%提升到88.1% 同时 工具定义令牌使用量减少了85% 默认的AUTO模式 会在工具Schema 超过上下文窗口10%时 自动启用 人工智能大模型企业 Minimax近期传来重要消息 这家名为西域科技的公司 已经正式启动A股上市计划 据披露 MiniMax在5月29日 与中信证券签署辅导协议 标志着其IPO进程正式开启 值得关注的是 这家企业在今年1月 已经成功登陆港交所上市 MiniMax在港交所的发行价格 为165港元每股 上市首日股价表现十分强劲 涨幅达到111.39个百分点 按照目前的汇率换算 MiniMax当前市值约为2634.54亿港元 折合人民币约2280.06亿元 作为国内人工智能领域的重要企业 MiniMax此前已推出M3系列等多款大模型产品 并获得华为升腾等技术平台的支持 此次启动A股IPO进程 意味着这家AI新兴企业将在资本市场 获得更多发展机遇 好了 AI资讯速递就到这里 接下来进入今天的AI深一度 Minimax港股上市不到半年 又冲刺A股 AI公司扎堆上市背后 资本的耐心到底还剩多少 如果只看数据 MiniMax的成绩很亮眼 港股首日涨111% 市值超过2600亿港元 现在又准备回A股 但 Here comes the question. Why are you going to A-shares not long after it was listed? The answer may be simple. Funding pressure. Large models are essentially an extremely money-burning business. Training models, purchasing computing power, R&D investment, each link requires continuous input, and the two things that the capital market is most worried about are no cash flow and increasingly fierce competition. To understand MiniMax's return to A-shares, you must also understand the difference between the two markets. Hong Kong stocks focus more on fundamentals. A-shares are more liquid and have greater financing space. So returning to A-shares not only means more funds, but also means higher attention. But the deeper reason is that AI competition has changed. Now the competition is not just about technology, but about whose capital chain is more stable. OpenAI is backed by Microsoft Anthropic, Google, Baidu, Alibaba, and Byte, all of which have their own ecological support. However, independent companies like MiniMax have no natural closed business loop and can only continue to raise funds, commercialize, and continue to prove their value to the capital market. At the same time, the patience of capital is shortening. Even OpenAI is quickly phasing out old models, which shows that the iteration speed of this industry is so fast that no one can. Being able to rest on its past achievements and look at it from a positive perspective A-share IPO can bring more funds to Minimax to support subsequent development. But IPO is also a double-edged sword. Every quarter's performance after listing will be scrutinized under the microscope. Once growth slows down, market pressure will be quickly transmitted back, so IPO is not the end, but the beginning of a new round of competition. Minimax reflects the reality of the entire AI industry. Technical progress is far faster than commercial realization. OpenAI has revenue and giant support. MiniMax also has a financing window, but more small and medium-sized AI companies may have neither revenue. There are no new sources of funding, and it is quietly leaving the market. So when an AI unicorn announces that it is going to be listed on the A-share market, what we should really focus on is not necessarily how much money it can raise, but how long its capital chain can last. In this arena, surviving is often more important than living well. The above is all about the AI circle. We will see you tomorrow.