报告生成时间 · 2026-06-25 10:08:00 (Asia/Shanghai)
报告日期
2026-06-25
覆盖厂商
9
新增更新
18
生成时间
2026-06-25 10:08:00 (Asia/Shanghai)
快速跳转
OpenAI · 5 Anthropic Claude · 4 Claude Code (CLI) · 2 DeepSeek 深度求索 · 1 智谱 GLM · 2 通义 Qwen Kimi 月之暗面 · 2 豆包 / 字节 Seed · 1 文心一言 / 百度 · 1
OpenAI
美国 · 闭源 API · ChatGPT
5 项更新
旗舰仍为 GPT-5.5(1M 上下文)。本期新增两条 changelog:6 月 24 日更新 chat-latest 快照、6 月 23 日上线 Safety Usage Dashboard(安全用量看板),延续平台安全与可观测性方向的打磨。
更新 chat-latest 快照,指向 ChatGPT 最新 Instant 模型 2026-06-24 功能
OpenAI 更新了 chat-latest 快照,该快照始终指向 ChatGPT 当前所用的最新 Instant 模型,便于开发者抢先测试面向对话场景的最新改进。官方仍建议生产环境的 API 调用使用 GPT-5.5;chat-latest 底层模型快照会随 ChatGPT 滚动更新,适合在对话类应用中跟进最新对话能力,但稳定性与可复现性不如固定版本号的模型。
查看原文 →
上线 Safety Usage Dashboard(安全用量看板) 2026-06-23 安全
OpenAI 在 API 平台发布 Safety Usage Dashboard,可基于请求中携带的 safety_identifier(用于标识终端用户)值,展示被安全策略拦截的 Responses 请求统计。该看板帮助开发者按终端用户维度观测内容安全拦截情况,定位高风险用户与滥用行为,是平台侧合规与风控可观测性的又一步增强。
查看原文 →
Web 搜索工具支持返回图像结果 2026-06-09 功能
v1/responses 的 Web search 工具新增图像结果返回能力,可在文本结果之外同时返回与查询相关的图片,适用于需要实时或网络实证视觉素材的场景(如商品图、地标、地点、活动或视觉参考),无需额外 beta header,面向带检索增强的多模态应用。
查看原文 →
Responses 与 Chat Completions API 新增审核分数 2026-06-04 功能
在 Responses API 与 Chat Completions API 中新增审核(moderation)分数:在生成请求里传入 moderation 对象(omni-moderation-latest),即可在同一次响应中同时拿到模型输入与生成输出的审核结果,便于在一次调用内完成内容安全判定,简化合规与风控接入。
查看原文 →
宣布弃用可复用 Prompt 对象、Evals 平台与 Agent Builder 2026-06-03 弃用
OpenAI 宣布弃用可复用 Prompt 对象(reusable prompt objects)、Evals 平台与 Agent Builder,关停时间表与迁移指引已发布在 deprecations 页。这是本期最值得关注的产品线收缩信号,依赖上述能力的应用需提前规划迁移路径。
查看原文 →
数据源:https://platform.openai.com/docs/changelog
Anthropic Claude
美国 · 闭源 API · Claude
4 项更新
本期无更新的旗舰发布,最新仍为 6 月 23 日的 Claude Tag(面向团队的协作式 Claude)。API 侧补充一条关键节点:6 月 15 日 Claude Sonnet 4 与 Opus 4 已正式停用,请求将直接报错。当前旗舰为 Fable 5 / Mythos 5(6 月 9 日发布)与 Opus 4.8。
发布 Claude Tag:面向团队的协作式 Claude 2026-06-23 新产品
Claude Tag 让团队在 Slack 里把 Claude 当作团队成员:管理员为指定频道授予工具、数据乃至代码库访问权后,频道内任何人都可 @Claude 委派任务并在专注其他工作时由其异步完成。其特点为多人协作(一个频道一个 Claude,人人可见可接力)、跨频道记忆与自动学习、可开启 ambient 主动提醒、以及可自我排期、跨小时跨天自主推进任务。当前面向 Claude Enterprise 与 Team 客户 beta 开放,运行于 Opus 4.8,替代原 Claude in Slack 应用(管理员 30 天内可迁移)。Anthropic 称其内部产品团队 65% 的代码已由内部版本的 Claude Tag 生成。
查看原文 →
开设首尔办公室并扩大韩国 AI 生态合作 2026-06-17 公司动态
Anthropic 宣布在首尔设立办公室,并在韩国 AI 生态内达成多项新合作。同期还推出面向职业生涯早期人群的全国性奖学金项目 Claude Corps(6 月 11 日),延续其在政策、产业与人才侧的布局。
查看原文 →
Claude Sonnet 4 与 Opus 4 正式停用(API) 2026-06-15 弃用
Anthropic 已停用 Claude Sonnet 4(claude-sonnet-4-20250514)与 Claude Opus 4(claude-opus-4-20250514),所有对这两款模型的请求现在均返回错误,官方建议分别迁移至 Claude Sonnet 4.6 与 Claude Opus 4.8;研究者可通过 External Researcher Access Program 申请继续访问。同时 6 月 11 日代码执行工具升级 code_execution_20260521,在工具描述中公开每个单元格 90 秒的执行时限。
查看原文 →
发布 Claude Fable 5 与 Claude Mythos 5 2026-06-09 新模型
Anthropic 推出迄今最强的广泛可用模型 Claude Fable 5(claude-fable-5),并面向 Project Glasswing 参与者推出 Claude Mythos 5(claude-mythos-5)。两款模型默认支持 1M token 上下文、最大 128k 输出 token,并具备常驻的自适应思考(always-on adaptive thinking)。二者采用 Opus 4.7 引入的新 tokenizer,相同文本的 token 数约增加 30%。Fable 5 在请求与生成过程中运行安全分类器,被拒请求返回 stop_reason 为 refusal。
查看原文 →
数据源:https://www.anthropic.com/news
Claude Code (CLI)
美国 · 开发者 CLI · Anthropic
2 项更新
命令行编程助手保持高频迭代,最新版本 2.1.191。本期重点:新增 /rewind 可从 /clear 之前的位置恢复对话;流式响应 CPU 占用降低约 37%;MCP 服务器可靠性增强(能力发现失败自动重试)。
v2.1.191:/rewind 恢复对话、流式 CPU 降约 37%、MCP 可靠性增强 2026-06 功能
新增 /rewind 支持,可从执行 /clear 之前的位置恢复一段对话;通过将文本更新合并到 100ms 节流,流式响应期间的 CPU 占用降低约 37%,并减少长会话中终端输出缓存导致的内存增长。可靠性方面:MCP 能力发现(tools/list、prompts/list、resources/list)在遇到瞬时网络错误时会以短退避自动重试,MCP OAuth 在无头环境下跳过浏览器弹窗直接进入粘贴 URL 流程。修复了从任务面板停止后台 agent 后又被复活、逗号分隔的 hooks matcher(如 Bash,PowerShell)静默不触发、以及全屏模式滚动跳到底部等问题。
查看原文 →
v2.1.187:凭据隔离与组织级模型限制 2026-06 安全
新增 sandbox.credentials 设置,阻止沙箱内命令读取凭据文件与密钥类环境变量;在模型选择器、--model、/model 与 ANTHROPIC_MODEL 中引入组织级模型限制(选中受限模型会提示 restricted by your organization's settings)。同时修复 --json-schema 与 agent({schema}) 结构化输出在成功后被无限重复调用的问题,并让挂起 5 分钟无响应的远程 MCP 工具调用改为报错中止(可用 CLAUDE_CODE_MCP_TOOL_IDLE_TIMEOUT 覆盖)。
查看原文 →
数据源:https://raw.githubusercontent.com/anthropics/claude-code/main/CHANGELOG.md
DeepSeek 深度求索
中国 · 开源/API · 杭州深度求索
1 项更新
当前主推 DeepSeek-V4:官网首页打出「DeepSeek-V4 预览版本发布,具备世界顶级推理性能,Agent 能力大幅提高」。需如实说明:官方更新日志中 V4 条目日期为 2026-04-24,已逾 30 天窗口,期间未见新的官方更新公告(宁缺勿假)。
DeepSeek-V4 上线 API:V4-Pro 与 V4-Flash 两档 2026-04-24 新模型
DeepSeek API 已支持 deepseek-v4-pro 与 deepseek-v4-flash 两档模型,base_url 不变、仅需将 model 参数改为对应名称,并同时兼容 OpenAI ChatCompletions 接口与 Anthropic 接口。旧模型名 deepseek-chat 与 deepseek-reasoner 将于 2026-07-24 停用,当前阶段分别指向 deepseek-v4-flash 的非思考模式与思考模式。官网将 V4 定位为「世界顶级推理性能、Agent 能力大幅提高」,并已在网页端、APP 与 API 全量上线。
查看原文 →
数据源:https://api-docs.deepseek.com/zh-cn/news/news
智谱 GLM
中国 · 开源/API · 智谱AI(Z.ai)
2 项更新
国内最强信号仍是 6 月 16 日上线并开源的新一代旗舰 GLM-5.2,主打「真正可用的 1M 无损上下文」与长程 Coding Agent,在 Artificial Analysis 综合榜取得 51 分、与 Anthropic、OpenAI 并列前三,为开源模型 SOTA。本期窗口内无新的旗舰发布。
GLM-5.2 新一代旗舰模型上线并开源 2026-06-16 新模型
智谱发布并开源新一代旗舰 GLM-5.2,定位面向长任务时代的旗舰基座模型。支持 1M 无损上下文(Solid 1M),实测可承载项目级工程上下文,长程任务执行更稳定、显著减少复杂任务中的上下文漂移与目标遗忘。在 Artificial Analysis 综合榜单取得 51 分,与 Anthropic、OpenAI 并列前三、为开源模型 SOTA;Coding 与长程任务评测达到开源 SOTA,可在一次任务内完成从需求到多端可部署产物的完整开发链路。
查看原文 →
GLM Coding Plan 团队版上线 2026-05-29 产品
智谱推出面向企业与开发团队的 GLM Coding Plan 团队版,延续个人版高额模型用量并兼容全球主流编码工具,支持席位、权限、用量与预算统一管理,提供集中账单、统一开票与企业级数据安全保障(默认不将代码、提示词与对话内容用于模型训练)。高级版支持首发接入最新旗舰模型及高峰期资源优先保障。
查看原文 →
数据源:https://docs.bigmodel.cn/cn/update/new-releases.md
通义 Qwen
中国 · 开源/API · 阿里巴巴通义千问
本期无新增
通义新版官网博客(qwen.ai/blog)为纯前端 JS 渲染、无静态文本可抓,旧版 qwenlm.github.io 已迁移且最新带日期条目停留在 2025 年 9 月。本期窗口内未能从官方带日期渠道确认 30 天内的新发布,按宁缺勿假如实标注。
通义官方新版博客 qwen.ai/blog 为纯 JavaScript 渲染、无可抓取的静态正文;旧博客 qwenlm.github.io 已弃用、最新带日期文章为 2025-09。本期未能从官方带日期渠道核实 30 天内的新发布,故不臆测、updates 留空。
数据源:https://qwen.ai/blog
Kimi 月之暗面
中国 · API · 月之暗面 Moonshot AI
2 项更新
Kimi 当前最强 Coding 模型为 K2.7 Code(平台文档 2026-06-17 更新):256K 上下文、支持文本/图片/视频输入与思考模式,并同步上线输出速度约 5-6 倍的高速版,多项编码基准较 K2.6 显著提升。本期窗口内无新的旗舰发布。
Kimi K2.7 Code 正式发布(当前最强 Coding 模型) 2026-06-17 新模型
Kimi K2.7 Code 是月之暗面迄今最智能的 Coding 模型,在长上下文中更可靠地遵循指令、以更高成功率完成编程任务,支持文本/图片/视频输入、思考模式以及对话与 Agent 任务,上下文窗口 256K(262,144 tokens)。相比 K2.6,Kimi Code Bench v2 提升 21.8%、Program-Bench 提升 11%、MLS Bench Lite 提升 31.5%。同步推出高速版 kimi-k2.7-code-highspeed,输出速度约为普通版 5-6 倍,常规编程场景约 180 Token/s、短上下文可达 260 Token/s。
查看原文 →
K2.7 Code 定价公布 2026-06-17 价格
按每 1M tokens 计费:kimi-k2.7-code 输入 ¥1.30(缓存命中)/ ¥6.50(缓存未命中)、输出 ¥27.00,上下文窗口 262,144 tokens;高速版 kimi-k2.7-code-highspeed 输入 ¥2.60 / ¥13.00、输出 ¥54.00,同为 256K 上下文。此前的 K2.6 为多模态旗舰,同样支持 256K 上下文与文本/图片/视频输入。
查看原文 →
数据源:https://platform.moonshot.cn/docs/api/changelog
豆包 / 字节 Seed
中国 · API · 字节跳动 · 火山引擎方舟
1 项更新
最新旗舰仍为 6 月 23 日字节跳动 Seed 正式发布的 Seed2.1 系列(Pro / Turbo 两档),面向真实生产力场景,主打通用 Agent 与代码工程能力,并在视频理解多项评测取得 SOTA;火山方舟已上线 doubao-seed-2-1-pro 与 doubao-seed-2-1-turbo 接入点。本期窗口内无新的发布。
Seed2.1 系列正式发布(Pro / Turbo,深入 AI 生产力) 2026-06-23 新模型
字节跳动 Seed 正式发布 Seed2.1 系列,面向真实生产力场景,提供 Pro 与 Turbo 两款不同尺寸模型。通用 Agent 与代码工程两大方向显著提升:能稳定完成项目规划、文件处理、工具调用等多步骤办公任务并产出可落地结果,代码侧强化需求理解→实现→修复→验证的端到端交付,并在跨工具、跨环境场景下保持稳定。多模态与视频理解多项评测达到 SOTA。公布的 benchmark(Seed2.1 Pro)包含 BeyondAIME 推理 87.0、Workspace Bench 高经济价值任务 53.0、Terminal Bench 2.1 71.0、VideoMME 长视频理解 89.2、ERQA 空间推理 72.0、MMLongBench-128K 多模态长上下文 78.3,整体对标 Claude Opus 4.7、GPT-5.5 与 Gemini 3.1 Pro。火山方舟已上线 doubao-seed-2-1-pro 与 doubao-seed-2-1-turbo 推理接入点。
查看原文 →
数据源:https://team.doubao.com/zh/blog
文心一言 / 百度
中国 · 开源/API · 百度智能云千帆
1 项更新
百度当前旗舰为 ERNIE 5.1(2026-05-09 正式发布),仅以约 6% 的预训练成本即达到同级领先性能,在国内 Arena Search Arena 排名第一。需如实说明:该发布日期已略超 30 天窗口,本期窗口内未见新的官方旗舰公告。
ERNIE 5.1 正式发布,多榜领先 2026-05-09 新模型
百度文心 ERNIE 5.1 正式发布,仅以同级模型约 6% 的预训练成本达到领先性能。借助解耦的全异步强化学习(disaggregated fully-asynchronous RL)与规模化的 agentic 后训练,ERNIE 5.1 在 Agent、推理与创意能力上全面升级,并在国内 Arena Search Arena 上排名第一。其预览版 ERNIE-5.1-Preview 此前(4 月 30 日)已登顶 LMArena 中文模型第一、全球第 13。
查看原文 →
数据源:https://yiyan.baidu.com/
⚠️ 说明
本报告由 Baby Q 自动抓取整理,内容仅供参考。新模型/API/价格变更以厂商官方公告为准。报告每日 10:00(北京时间)自动更新。