本周动态

OpenAI 下调 GPT-5.6 Luna/Terra 价格,强调按任务匹配模型成本

OpenAI 7 月 30 日宣布 GPT-5.6 Luna API 价格下调 80%,Terra 下调 20%,并把 Luna/Terra 的用量折算同步反映到 ChatGPT Work 和 Codex 订阅额度中;同时 GPT-5.6 Sol 的 API Fast mode 可用更高价格换取最高 2.5 倍速度。经营者视角:不要再把一个高价模型用于所有环节,客服归类、商品描述、表格清洗和常规测试这类高频任务应优先试低成本模型,复杂判断再交给更强模型。

来源:OpenAI · 相关工具:ChatGPT

Google Cloud 将 Agent Runtime、Identity、Gateway、Registry 等能力推向更广泛可用

Google Cloud 7 月 30 日发布 Gemini Enterprise Agent Platform 更新,重点不是多一个聊天框,而是把长时间运行、记忆、身份、网关、注册表、评估和可观测性放到同一平台里:Agent Runtime 可支撑最长 7 天的异步任务,Agent Identity/Gateway/Registry 用来约束权限、统一入口和控制 Agent 蔓延。经营者视角:企业内部做 Agent 试点时,第一批问题应从“它能做什么”改成“谁批准、能访问什么、日志在哪里、失败怎么回滚”。

来源:Google Cloud Blog · 相关工具:Gemini

Microsoft 365 Copilot 数据显示,Agent 正在从单点提效转向整段工作流

Microsoft 365 7 月 30 日披露,Copilot 已超过 3000 万付费席位,Copilot Cowork 可接多步骤工作,Microsoft Scout 作为后台常驻 Agent 继续推进任务;其遥测数据还显示,当把多步骤工作流纳入统计后,分析类工作占 Cowork 任务 49%。经营者视角:办公 AI 的价值不在“帮我写一封邮件”,而在“分析数据、形成结论、起草邮件、推进下一步”能否连起来;制造、采购、招商、财务复盘都适合先从一个闭环流程开始。

来源:Microsoft 365 Blog · 相关工具:Microsoft Copilot

Anthropic 发布 Claude Opus 5,主打更高性价比的长程与专业工作

Anthropic 7 月 24 日发布 Claude Opus 5,称其在知识工作、编码、业务任务自动化和计算机使用评测上提升明显,API 价格保持每百万输入 5 美元、输出 25 美元,并提供 Fast mode;同时新增对话中工具变更和自动 fallback 等 beta 能力。经营者视角:长文档审阅、合同摘要、标书初稿、数据报告这类“错了会出事”的场景,不能只看速度;应把 Claude 这类强模型放在复核、判断、成稿环节,而不是所有低价值批量任务。

来源:Anthropic · 相关工具:Claude

Alibaba Cloud 介绍 OBI:企业 Agent 上线后必须能追踪调用链、token 和工具调用

Alibaba Cloud Native Community 7 月 28 日介绍 OBI,用零代码、内核级方式捕获 AI Agent 调用链,并按 GenAI OpenTelemetry 语义输出模型、token、向量检索、MCP 工具调用等追踪数据,目标是解决 AI 应用出现错误回答、成本异常或内部网关混用时无法排查的问题。经营者视角:只要公司让 AI 接入知识库、CRM、ERP 或报价系统,就要把“能不能追溯每次回答用过哪些资料、调用了哪些工具、花了多少 token”写进验收标准。

来源:Alibaba Cloud Community · 相关工具:通义千问

本站数据速览

  • 本站当前工具库仍按 2026-07-03 的国内访问、中文支持、价格入口和适用场景做人工复核;本期相关入口集中在 ChatGPT、Gemini、Microsoft Copilot、Claude 和通义千问。
  • 本周建议从“老板提效”“企业知识库”“工业制造”“装潢工程”专题进入,先找一个能闭环的流程:资料读取、输出初稿、人工确认、结果归档,而不是让团队各自随意试用。
  • 如果你在做企业 AI 预算,本期可同步查看本站“国内可用性与价格监测”和“工具对比库”:先确认稳定访问、中文资料处理、价格口径和人工复核责任,再扩大采购。

查看完整的国内可用性与价格监测表

本周可直接照做:给企业 Agent 做一张上线验收表

把你准备交给 AI 的流程发给 ChatGPT、Claude、Gemini 或通义千问:“请把下面这个企业 AI Agent 试点整理成上线验收表。字段包括:业务目标、涉及系统和数据、允许自动执行的动作、必须人工确认的动作、推荐使用的模型层级、预计每周调用量、预算上限、失败回滚方式、日志和追踪字段、负责人、30 天复盘指标。流程是:{填入你的场景,例如供应商报价对比后生成谈判建议并起草邮件}。”验收表里凡是权限、预算、日志、回滚写不清的,先不要上线。