全世界有超过 10 亿人在使用 Gemini。该服务每分钟处理 220 亿个 token。
然而在过去几个月里,开发这项服务的公司却得到了一个奇怪的评价:被认为在 AI 竞争中落后了。
如果你曾在搜索框中搜索过任何内容,那么你其实就已经在使用这家公司的服务了。即使你使用 Gmail、安卓手机或看过 YouTube,情况也一样。这篇文章要讨论的公司下一步决定做什么,比基准测试排行榜更贴近你的日常生活。
图片: StockCake (CC0, 免费使用)
落后的证据
落后的证据出现在三个方面。
最先显露的信号是产品本身。顶级模型 Gemini 3.5 Pro 在开发者大会上预告“下个月发布”。然而下个月过去了,又过了几个月。期间发布的绝大多数都是轻量且快速的“Flash”模型。
随之而来的信号来自开发者的钱包。在编码工具市场的支出份额中,Anthropic 的 Claude Code 占据 42%,OpenAI 的 Codex 占据 21%。谷歌的份额远不及这两者。
编程不仅仅是一种技能。它意味着拆解问题、自主调用工具并修复错误的能力。在这种能力上落后,意味着几乎等于放弃了下一代 AI 助手市场的主导权。
第三个信号是人才。Noam Shazeer 和 John Jumper 离开了公司。入职 27 年的 Jeff Dean 也为了创业而离职。
Demis Hassabis 转任 DeepMind 董事长,开始专注于新药开发。空缺的位置由负责产品化和商业化的副总裁 Koray Kavukcuoglu 接手。虽然 DeepMind 的名字还在,但实权已经易手。
一个在同一家公司工作了 27 年的人选择主动离开,从头开始。这并非个例,而是组织重心正在转移的典型表现。
每分钟 220 亿 token 是一个难以想象的数字。换算成秒约为 3.6 亿个。如果填满一张 200 字的原稿纸大约需要 150 个 token,那么这家公司每秒钟处理的文字量相当于 240 万张原稿纸。
既然拥有如此规模,为什么这家公司在基准测试第一名的竞争中看起来总是处于劣势?
改变规则的物种
生物学中有一个概念叫“生态位构建(niche construction)”。自然选择通常被解释为最适应环境的个体才能生存的过程。但有些物种采取了不同的策略:与其适应环境,不如直接改变环境。
海狸不会去竞争谁的牙齿最锋利。相反,它们会筑坝。通过改变河流流向并创造池塘,使池塘成为对自己有利的栖息地。获胜的不是啃木头最厉害的个体,而是改变了整条河流地形的个体。
现在 OpenAI 和 Anthropic 之间的竞争,更像是“谁的牙齿更锋利”。
基准测试的第一名每隔几周,最长几个月就会更换一次。如果不能赢得这场竞争,融资和生存都难以保障。因为创造模型本身就是业务的全部。
谷歌站在不同的位置。搜索、安卓、YouTube、Workspace——它已经拥有了整条河流。这家公司需要的不是最锋利的牙齿,而是让河流朝着对自己有利的方向流动的堤坝。
纵观技术产业史,这种模式并不陌生。并非最优秀产品的制造者,而是拥有分销网络和生态系统的公司最终吸收了市场,这种案例反复出现。制造最好的产品,与拥有人们每天落脚的土地,是两种不同的游戏。
筑坝的方式
堤坝正在四个方面同时建立。
第一点是模型本身的重新设计。谷歌不再为所有问题投入最大的模型,而是按任务单元拆解模型。它将性能超越上一代顶级模型、速度快四倍且成本低得多的“Flash”模型作为默认设置。只有在遇到真正困难的问题时,才会启用笨重的模型。
第二点是芯片设计。从第 8 代 TPU 开始,将“训练用”和“推理用”完全分开。这一决定本身就是一种宣言。它宣告了 AI 竞争的胜负点已从耗时数月的大规模训练,转向了每天重复数十亿次的日常响应——即推理阶段。
第三点是产品的形态。以“Gemini Spark”为代表的方向超越了回答问题的聊天机器人。其目标是成为 24 小时代理(Agent),有机地连接 Gmail、云端硬盘、日历、YouTube 和 Chrome,代替用户处理实务。
例如:读取邮箱中收到的会议请求,找到日历中的空闲时间并发送回复,从云端硬盘中找到相关文档并预先整理好。用户不再需要多次开关聊天机器人,服务会在后台持续工作。
最后一点,或许是最聪明的地方。谷歌在搜索 AI 模式的回答中植入了定向广告。对于贷款或保险等购买意向明确的问题,广告植入率超过 50%。
对竞争对手而言,回答变长意味着 token 成本增加。对谷歌而言,回答变长意味着植入广告的位置增加了。
这种变化对消费者产生了两方面影响。一是能更长时间、更广泛地使用免费或廉价的 AI 服务。二是广告正以更加自然的形式融入回答之中。
图片: StockCake (CC0, 免费使用)
但是,筑坝是有条件的。
“性能相当但价格更便宜”是创新。而“性能下降但价格便宜”只是低端模型。谷歌的整个策略都建立在这行字上。如果 Flash 模型无法真正完成工作、代理无法真正代替实务的前提崩溃,剩下的就只有“廉价货”的评价。
更根本的问题在于:顶级研究人员为何选择实验室?无论是 Noam Shazeer、John Jumper 还是 Jeff Dean,最终都是在追逐前沿。立志打造世界顶级模型的组织,才能汇集世界顶级人才。对于优先考虑成本和效率的二等组织,在那些人才的算盘里,它缺乏足够的吸引力。
编码代理市场中已经出现的差距也指向了同样的问题。无论基础设施配套多么完善,如果开发者每天使用的工具落后,那么该基础设施之上的代理市场本身就会拱手让给竞争对手。改变河流的地形,与让鱼儿持续在河里生活,是两个不同的问题。
再深究一步,就能看出谷歌为何不得不做出这个选择。
假设将超大型模型应用到 10 亿用户身上,地球上的计算资源是无法承受的。规模庞大既是自由,也是枷锁。
OpenAI 和 Anthropic 因为损失的用户相对较少,反而可以随心所欲地追求最高性能。而谷歌因为已经肩负了太多人的重任,不得不主动放弃那种自由。
10 亿用户,每分钟 220 亿 token。最初看到这个数字时,觉得它与谷歌“落后”的评价不符。
现在重新审视,有了不同的解读。这并非失败的数字,而是证明了它从一开始就在玩一种不同的游戏。
问题在于这场游戏的胜负尚未分晓。编码代理的完成度和服务生态系统的盈利能力,这两点将在未来几年内给出答案。究竟是打造最智能模型的公司会赢,还是为最多人提供每天都能使用的最廉价服务的公司会赢,目前尚未定论。
图片: StockCake (CC0, 免费使用)
下次在搜索框提问并得到长回答时,不妨思考一下。
这个回答变长,是因为努力变得更准确,还是因为需要更多植入广告的位置?
参考资料
- Axios 报道 — 谷歌 Gemini 3.5 Pro 发布延迟相关采访
- Fortune 报道 — 谷歌 AI 组织核心人才流失相关采访
- OpenRouter 编码工具支出份额数据 (Claude Code, Codex 等)
- 谷歌 DeepMind 组织架构调整及 Koray Kavukcuoglu 体制转换相关报道
- 谷歌 Gemini 用户指标 — 月活跃用户 10 亿,每分钟处理 220 亿 token
- 谷歌第 8 代 TPU 训练/推理分离架构相关发布
- Gemini Spark 代理产品方向相关资料
- 搜索 AI 模式广告结合及匹配率相关资料
- T-Times TV — 谷歌 AI 业务战略调整分析报告