8月6日,Cloudflare 发布 2026 年 Q2 财报。营收 6.961 亿美元,同比增长 36%——数字很漂亮,但 CEO Matthew Prince 在电话会上说的另一件事才是真正的拐点:
我们原本预计非人类流量会在 2027 年下半年超过人类流量,实际在 2026 年 5 月就发生了。
AI Agent 等非人类流量占比首次突破 50%。 互联网的主要访问者,已经从「人」变成了「程序」。
Cloudflare 赌的下一件事是:当程序成为互联网的主要用户,云的形态也会跟着变。刚结束的 Agents Week 2026 就是这个赌注的集中展示——一周之内密集发布十几项面向 AI Agent 的新产品,从底层推理、记忆存储、搜索、版本控制到安全防护,几乎把「Agent 需要什么」从头到尾铺了一遍。
财报硬数据
| 指标 | Q2 2026 | 同比变化 |
|---|---|---|
| 营收 | $6.961 亿 | +36% |
| 年消费 $10万+ 客户数 | 4,698 家 | +27% |
| 季度净增大客户 | 986 家 | 历史新高 |
| 净收入留存率 (NRR) | 120% | 环比+2,同比+6 |
| 毛利率 | 73.1% | 8个季度来首次环比改善 |
| 自由现金流 | $5,640 万 | +69% |
Prince 说得很直白:「开发者正在涌向 Cloudflare,因为我们的 Workers 平台给了他们构建 Agent 未来所需的一切。」
Cloudflare 自己就是这套平台的第一个重度用户:通过 AI Gateway 路由的请求达到 2,000 万次,处理的 token 达到 2,410 亿个,在 Workers AI 上运行推理,为 3,683 名内部用户提供服务。 自己的狗食自己先吃,吃到这个体量再对外卖产品。
一周发布了什么
按功能层划分:
| 层级 | 产品 | 解决什么 |
|---|---|---|
| 推理层 | Unweight 张量压缩 | 前沿 LLM 无损压缩 22%,推理更快更便宜 |
| 记忆层 | Agent Memory | 给 Agent 一个能记住重要事、忘掉不重要事的长期记忆 |
| 搜索层 | AI Search | Agent 专用搜索原语,动态建实例、混合检索 |
| 存储层 | Artifacts | 给 Agent 用的 Git 兼容版本化存储,能创建千万个仓库 |
| 执行层 | Dynamic Workers | 基于 Isolates 的沙箱,毫秒级启动执行 Agent 生成的代码 |
| 功能控制 | Flagship | 亚毫秒级特性开关,专为 AI 时代的灰度发布设计 |
| 可观测性 | Agent Tracing | 每个 Agent turn 的模型调用、工具执行、token 用量全链路追踪 |
| 成本/安全 | AI Gateway User Insights | 组织级 AI 花费可视化 + 异常使用检测 |
| 支付 | Cloudflare Wallets | 给 Agent 一个能自己花钱的钱包(8月4日单独发布) |
不是每一项都同等重要。挑几件真正改变游戏规则的说。
Agent Memory:给健忘的 Agent 一个大脑
这一周最关键的发布。
目前绝大多数 Agent 都是「金鱼记忆」——每轮对话结束,上下文就没了。跨会话记住用户偏好、记住之前做过的事、记住哪些信息重要哪些可以忘掉,这些能力几乎没有现成方案。
Cloudflare Agent Memory 是一项托管服务,定位很明确:
让 AI Agent 能够记住重要的信息,忘记不重要的信息,并且随着时间推移变得更聪明。
重点不是「能存」——能存的数据库有一万个。重点是「知道该记什么、该忘什么」。Agent Memory 内置了重要性评分、遗忘曲线、跨会话检索,而不是简单地把所有历史堆进向量库。
对构建真实世界 Agent 的团队来说,这意味着不用再自己写一套记忆管理系统。这跟两年前 Serverless 数据库出现时,团队不再需要自己管扩容是同一个逻辑。
值得注意的是,腾讯云也在差不多的时间开源了 TencentDB Agent Memory,走的是另一条路——四层语义金字塔(L0 原始对话 → L1 原子事实 → L2 场景知识 → L3 用户画像),强调记忆的治理而非存储。两者一个托管、一个开源,面向不同人群。
AI Search 接入三大 Agent 框架
7月30日 Changelog 更新:AI Search 可以直接从主流 Agent 框架调用了。覆盖三个生态:
Vercel AI SDK(ai@^6)——新出了 ai-search-provider npm 包,把 instance.chat() 传给 generateText 或 streamText,返回结果直接带检索到的 sources,也可以把 instance.search() 暴露成 Agent loop 里的一个 tool。
LangChain——langchain-cloudflare 包新增了 CloudflareAISearchRetriever,标准 LangChain Retriever 接口。单独用、包一层 create_retriever_tool 当 Agent 搜索工具、丢进 RAG chain 里都行。
Cloudflare Agents SDK——新增完整指南,教你做一个有状态聊天 Agent,自己创建搜索实例、自己索引内容、再通过 tool 调用去搜索。
这件事的意义不在于多了三个 SDK,而在于 RAG 的「检索」这一步,终于从手动调 REST API 变成了 Agent 框架里的一等公民。
Dynamic Workers:Agent 生成的代码有地方跑了
4月13日进入公开测试的 Dynamic Workers,到 Agents Week 已经配套了完整的工具链。
它解决的问题是:AI Agent 生成的代码,你到底放哪儿执行?
大多数团队现在用容器。但容器启动慢、内存占用大,为了避免冷启动你又得预热容器池,结果多个任务复用同一个容器,隔离性被削弱。
Cloudflare 的方案是 V8 Isolates——Chrome 浏览器用的沙箱技术,也是 Cloudflare Workers 跑了八年的底层。官方数据:Isolates 数毫秒启动,只占几 MB 内存,启动速度比容器快约 100 倍,内存效率高 10-100 倍。
这意味着你可以为每一段 Agent 生成的代码,按需创建一个全新的 Isolate,执行完立刻销毁,不复用。 不复用,就没有跨任务的状态泄漏。
配套的三个 npm 库已可用:@cloudflare/codemode(简化 AI 工具生成代码的运行)、@cloudflare/worker-bundler(运行时 npm 依赖解析与打包)、@cloudflare/shell(虚拟文件系统,支持事务批量写入、SQLite/R2 持久化)。
这个方向跟 Cloudflare 之前提出的 Code Mode 理念一脉相承:AI Agent 不应该一轮一轮调工具 API,而应该直接写强类型代码完成任务。Cloudflare 自己的数据——把 MCP 服务器转成 TypeScript API 让 Agent 写代码,相比传统工具调用模式,Token 消耗减少了 81%。
Unweight:无损压缩 22%
在边缘网络上跑大模型,最大的瓶颈不是算力不够,而是 GPU 内存带宽——把模型权重从显存喂到计算单元的那条路,堵了。
Unweight 是一个无损推理时点压缩系统:在不损失精度的前提下,把前沿 LLM 的体积减小高达 22%。不是精度换速度的 trade-off,是无损。同样的显存可以放更大的模型,或者同样的模型推理更快、更便宜。
这种基础设施层面的优化,用户不会直接看到一个新按钮,但会通过 Workers AI 的定价和延迟间接惠及每一个跑在 Cloudflare 上的 Agent。
可观测性:终于能看清 Agent 在干什么
8月4日和5日连续两条更新,是 Agent 从玩具走向生产的最后一块拼图。
Agent Tracing——用 Agents SDK 构建的应用现在可以开启 Trace,每个 Agent turn 完整记录模型调用、工具运行、人工审批、token 用量、Workers 运行时操作。Wrangler 配置里打开 observability.traces.enabled = true 就有。
AI Gateway User Insights——成本失控是团队上 AI 应用最怕的事。User Insights 基于每个用户过去 30 天 p95 会话成本做基线,超出基线 + 超出组织级阈值的会话会被标出来——凭据泄露或 Agent 跑飞,往往先表现为某个用户的花费突然跳涨。与 Cloudflare Access 集成后,认证后的用户 ID 直接带进日志、路由、花费控制,不用在客户端代码里手动传 user_id。
不是产品列表,是一张正在成型的栈
把这些产品放在一起看,Cloudflare 画的图很清楚:
| Agent 需要什么 | Cloudflare 给什么 |
|---|---|
| 记住事情 | Agent Memory |
| 搜索知识 | AI Search |
| 存代码和数据 | Artifacts |
| 执行生成的代码 | Dynamic Workers |
| 跑模型 | Workers AI + Unweight |
| 花钱买东西 | Cloudflare Wallets |
| 看清自己在干什么 | Agent Tracing + AI Gateway |
| 控制成本和安全 | User Insights + Access |
每一层都是托管服务,不需要你管服务器。 组件之间走内网,延迟低、没有跨云带宽费。
这不是把几个独立产品摆在一起,是从 Agent 的需求倒推出来的一张完整的栈——这张栈的每一个组件都跑在同一张全球边缘网络上。
诚实的问题
Cloudflare 的优势和短板同样明显:
- 优势:边缘位置带来的低延迟、Serverless 粒度的按量付费、整条链路统一的身份和安全模型、没有冷启动负担
- 短板:Workers AI 的模型目录还是精选制(50+ 模型),跟 AWS/Azure 那种几百个模型的市场不能比;Agent Memory 是新服务,SLA 和性能数据需要时间验证;Dynamic Workers 目前还是公测,面向付费 Workers 用户
另外绕不开的是 Isolates 沙箱的安全边界。Cloudflare 自己承认:基于 V8 Isolates 的沙箱,攻击面比硬件虚拟机更复杂,V8 漏洞比 hypervisor 漏洞更常见。应对措施包括几小时内把 V8 安全补丁部署到生产、自定义二级沙箱、MPK 硬件级防护、跟学术研究者合作的新型 Spectre 防御。对绝大多数非国家级对抗场景够用,但处理最高机密级别数据时可能还是倾向于硬件级隔离的传统 VM。
写在最后
Agents Week 2026 最值得记住的,不是任何一个单独的产品,而是 Cloudflare 开始用一个统一的视角回答一个问题:当 AI Agent 成为互联网的主要用户,基础设施该怎么变?
过去十年的云计算,围绕「人类用户 + 移动端 + Web 应用」设计。下一个十年,会围绕「AI Agent + 边缘 + 有状态交互」重新设计。计算要跑到离 Agent 最近的地方,计费要细到毫秒,代码执行环境要能按需创建即时销毁,安全模型要从「防人」扩展到「防 Agent 生成的代码」。
谁先为 Agent 造好云,谁就吃下下一个十年的增量。
参考链接:
- Agents Week 发布汇总:cloudflare-cn.com/agents-week/updates/
- Agent Memory 介绍:blog.cloudflare.com/introducing-agent-memory
- AI Search Agent SDK 集成:developers.cloudflare.com/ai-search/agent-sdks/
- Dynamic Workers 文档:developers.cloudflare.com/dynamic-workers/
- Unweight 技术博客:blog.cloudflare.com/unweight-tensor-compression
- Cloudflare Wallets(同期发布):阅读我们的另一篇报道
- 往期相关:Cloudflare Workers AI 指南|Workers + Astro 部署实战