六月底的一个饭局,坐我对面的是个囤卡的老板。
具体身份不方便说。几千张卡,H 系列和国产的都有,散在两三个城市的机房里,前些年做 IDC 攒下的家底,这两年一直在找出路。
酒过三巡,他把手机推过来,屏幕上是黄仁勋在 GTC 的照片。"你说实话,我这是不是坐在金矿上。"
他的账算得很顺:token 需求在爆炸,老黄说每个 token 都是收入。模型,DeepSeek 开源的,不要钱。推理引擎,vLLM、SGLang,开源的,也不要钱。卡,我有的是。三样拼在一起,我不就是一个 Token 工厂?躺着生产 token 卖钱。
他等我说"靠谱"。我们在推理这一层做了几年,他是把我当行内人问的。
我说:别开。
他愣了几秒:"你们自己天天干的就是这个,劝我别进?"
正因为天天干这个。那顿饭从七点吃到十一点,我把这门生意从头到尾给他拆了一遍。这篇是那晚的完整版:为什么三块开源积木拼不成一座工厂,以及为什么需求最火爆的文生视频,我们碰都不碰。
先把"工厂"这个词讲对
Token 工厂不是我发明的词。"AI 工厂"是黄仁勋的原话,GTC 2025 上他说数据中心只有一件工作:"生产这些不可思议的 token。"而"Token 工厂"这个更露骨的叫法,出自纳德拉。2025 年 10 月微软财报会上,他问自己团队的问题是:"我们这座行星级的 token 工厂,效率到底怎么样?"到 2026 年 3 月,英伟达自己的技术博客也把 token factory 写进了标题。今年 6 月台北 GTC,黄仁勋的说法干脆变成:"每一个 token 都是利润,每一个 token 都是收入。"
很多人听到"工厂",把它理解成一门能源生意、算力生意:有电、有卡,就能开工。
这是对这个词最大的误解。有设备只是门槛,工厂的本质,是把一整条生产链的效率拧到极致。Token 工厂往下拆,是三层技术叠在一起,每一层都藏着数倍到数十倍的效率杠杆。
第一层,芯片。 代际之间是数量级的跳变。英伟达官方口径,GB200 NVL72 对 H100,大模型推理快 30 倍;跑 DeepSeek R1,Blackwell 对 H200 每 token 成本降到十分之一。今年 3 月发布的 Vera Rubin,对 Blackwell 每 token 成本又是十分之一,6 月已经全面量产。黄仁勋在 GTC 上说过一句到处被引用的话:Blackwell 量产之后,Hopper 白送都没人要。他管自己叫"首席收入摧毁官"。
第二层,模型。 模型决定这座工厂能产出的智能上限,这个好理解。容易被忽略的是另一半:模型结构本身就决定推理效率。稀疏化怎么做、attention 怎么设计、参数怎么分布,同样的智能水平,结构不同,生产成本差好几倍。设计模型越来越像设计工业品:性能和可制造性,要在图纸上一起定稿。
第三层,推理系统。 软件加硬件结合的一整套技术,也是行业里最被低估的一层。同样的硬件、同样的模型,推理系统能拉开数倍的差距。vLLM 刚出来时,对当时最强的推理系统是 2 到 4 倍的吞吐提升;SGLang 首发宣称最高 5 倍。最极端的例子是英伟达的 Dynamo:同一套 GB200 NVL72 跑 DeepSeek R1,开不开这套系统,官方给的数字是每张 GPU 的 token 产出差 30 倍。同一套硬件,同一个模型,30 倍。
推理系统的威力有一个更出名的注脚。DeepSeek 在 2025 年 3 月把自己推理系统的账本晒了出来:GPU 租赁成本一天约 8.7 万美元,理论日收入约 56 万美元,理论成本利润率 545%。他们自己声明实际收入远低于这个理论值,但数字一出还是把整个行业吓了一跳。卡还是那些卡,是推理系统把每一张都榨到了极限。
三层叠起来,才叫工厂。芯片选代、模型结构、推理系统,每一层都站在最优解上,和"三块开源积木拼一起",中间隔着几十倍的生产效率。
我那位朋友的方案是什么?上一代的卡,默认参数的开源引擎,别人设计的模型。他不是要开工厂,是要在别人的工业区旁边支一个作坊。
标品市场,效率就是生死
作坊也能活,对吧?小餐馆不也活在连锁店旁边?
不行。因为 token 是标品。
我之前写过《Token 不是一种东西》,说 token 是智能档乘速率档的矩阵,不能混在一起算。但矩阵里的同一个格子——同一个模型、同一档 SLA——token 就是彻底的标品。你产的 DeepSeek V4 token 和我产的 DeepSeek V4 token,一个字都不差。买家只看两个数字:价格,速度。
标品生意的铁律,做过大宗商品的人都懂:卖价是市场定的,你能决定的只有成本。效率差距直接变成利润差距,没有品牌、体验、故事可以遮挡。
而且这个市场几乎是为充分竞争量身定做的。供给全球互联,没有地域保护,报价以天为单位在变。打开 OpenRouter 你现在就能看到,同一个开源模型,四五家供应商同时挂牌,输入价差出近 5 倍,速度也差出几倍,贵的快、便宜的慢,像极了大宗商品的盘口。今年 5 月,DeepSeek 干脆把 V4-Pro 降价 75% 的促销价改成了永久价。拉长看更吓人:同等能力的推理价格,a16z 在 2024 年底算的是每年降 10 倍,Epoch AI 最新的口径是一年约 40 倍。
在这样的市场里,假设你握着一个 50% 的效率优势,你有两个用法:价格不动,多出来的全是利润;或者降价,把别人的需求抢过来。利润厚了还能去上游锁更多的卡,把原材料也抢了。两头挤压,没有技术优势的玩家很快会发现:自己开工厂,不如把卡租给会开工厂的人。
这就是我劝他别开的核心理由。Token 工厂不会小而散,它会像所有标品产业一样走向高度集中。资本已经在给这个判断投票,就看过去这半年多:Fireworks 估值 175 亿美元,年收入破 10 亿、一天处理 40 万亿 token;Baseten 估到 130 亿;Together 83 亿;Cerebras 上市首日市值冲到 950 亿上下;英伟达干脆花约 200 亿美元把 Groq 的技术和核心团队收了。钱不会骗人,它们买的是同一样东西:把 token 生产效率做到极致的能力。
顺便说一句,这场集中在哪个领域跑得最快?AI 编程。OpenRouter 和 a16z 那份 100 万亿 token 的研究里,编程类消耗从 2025 年初的 11% 涨到年底的超过 50%。需求最标准、SLA 最清晰、买家最专业的地方,永远最先卷成工厂的形状。
1987 年,有人讲过一样的故事
饭吃到一半,他问了一个真正的好问题:模型公司自己就在卖 API,自己就是工厂,凭什么轮得到第三方?
我给他讲了台积电。
1987 年张忠谋创办台积电的时候,做了一个当时所有人都看不懂的决定:只做代工,不做设计,永远不和客户竞争。这句承诺后来几乎一字不差地写进了台积电每一年的年报。在那之前,芯片行业的常识是设计制造一体,英特尔那样才叫芯片公司。代工?那是苦活。
但正是"中立"这个承诺,凭空造出了一个新物种:fabless。设计公司从此不用砸几十亿美元建厂,画好图纸,产能找台积电。英伟达 1993 年成立的时候,一间厂房都没有,到今天也没有。
Token 的世界正在裂成同样的结构。
闭源巨头是苹果。OpenAI、Anthropic,模型不给你,推理技术自己磨,芯片跟供应商协同设计,从设计到零售全链条自营,利润空间自己定。这是一条自洽的路,前提是模型必须一直领先。
开源阵营是组团打仗。模型厂出设计,把权重开放出去,谁都可以生产。而三方 Token 工厂,就是这个阵营里的台积电。不做模型,不赌哪家赢,手里握着所有人都需要的东西:中立的、效率拉满的产能。
中立为什么值钱?想一个问题就明白了:A 模型公司的算力,能变成 B 模型公司的产能吗?不可能。这个月 B 家的模型突然登顶,A 家不可能把自己的集群腾出来帮死对头出货。模型公司的产能被自家模型锁死了:模型行,产能值钱;模型不行,产能陪葬。
三方工厂没有这个锁。谁的模型好,产能切给谁。切换速度快得超出直觉:去年 7 月 Kimi K2 发布,6 个小时内就有两家推理商挂牌上线;Groq 第三天上线,再过三天,实测速度干到月之暗面官方 API 的 40 倍。模型是别人的,产能是自己的,风口是大家的。
这个结构对模型公司同样是解药。现在做一个新模型公司,最重的负担是推理算力:训练咬咬牙还能租,推理得跟着用户涨,是个无底洞。但如果产能层是中立开放的,打法就完全变了:专心把模型训好,开源打开市场,然后回头去包产能。像苹果包下台积电 3nm 首发产能那样(据报道初期产能的九成归了苹果),像昇腾 950PR 全年 75 万颗被字节、阿里这些大厂们整整齐齐包圆那样。模型公司变成 fabless:轻资产,赌设计,产能交给中立工厂。新王者从出现到放量,可以压缩到几个月。
对工厂这边,中立还是唯一的抗风险姿势。模型公司的行情随代际怎么摆,最近 30 天就是教科书:6 月中旬智谱发 GLM-5.2,一周后股价盘中涨过 42%,市值破了万亿港币;就在昨天,月之暗面发布 Kimi K3,智谱盘中最深跌掉 30%,MiniMax 跟着跌 16%。同一家公司,一个月里天堂地狱各走一遭。把自己绑死在任何一家的生态里,都是在赌它每一代都赢。这种绑定有多脆,我在《顶尖智能,说断就断》里写过,连国家层面都会翻车。台积电从不赌哪家设计公司赢,它只赌一件事:世界永远需要芯片。Token 工厂赌的也只是:世界永远需要 token。
总会有下一条鲶鱼
听到这里他基本服了,但补了一个很尖的问题:这套逻辑全建立在模型开源上。哪天大家都不开了呢?
这个担心值得认真回答。我的判断是:回不去了。
复盘一下 2025 年那场多米诺。2024 年 12 月 26 日,DeepSeek V3 开源,训练刚收尾就把权重放了出来,效果贴着海外闭源旗舰,比国内所有闭源旗舰都好。这一下国内的闭源模型全尴尬了:最好的那个免费,你收费的凭什么?
多米诺倒得比所有人预期的都快。1 月 15 日,从没开源过旗舰的 MiniMax 抢先把 MiniMax-01 的完整权重放了出来——注意,这时候 R1 还没发布。1 月 20 日,R1 带着 MIT 协议炸场,按 AI 产品榜的统计,随后 7 天新增用户过亿,而 ChatGPT 当年破亿用了两个月。1 月 27 日,英伟达单日跌掉近 17%,5890 亿美元市值蒸发,创下当时美股史上最大单日市值蒸发纪录。然后是整个 2025 年:4 月智谱把 GLM 系列转成 MIT,6 月 MiniMax M1 用上 Apache 2.0,7 月 Kimi K2 挂着修改版 MIT、GLM-4.5 直接 MIT。一年之内,"旗舰必闭源"变成了"旗舰不开源都不好意思发布"。
驱动这一切的不是情怀,是一笔冷冰冰的营销账。你训出了一个好模型,怎么让全世界知道?买广告、办发布会,慢得要死,贵得离谱。把权重放出去,整个开源社区的传播机器立刻免费为你运转:下载、口碑、推理商抢着上架、benchmark 刷屏。7 天 1 亿用户,这个效果广告史上没有出现过,它只可能来自开源。
这场竞赛到今天也没有减速的意思。昨天把智谱砸跌 30% 的那颗炸弹,本身就是开源的最新一环:Kimi K3,2.8 万亿参数,直接开放权重,史上最大。
所以就算某天 DeepSeek 也不开了,一定会有下一个名不见经传的团队,在算力和牌桌位置都不如人的时候,把最好的东西直接开出来,因为这是落后者掀桌子最高效的方式。只要有一条鲶鱼这么干,所有人就都得跟着卷。何况当下的格局里,中国模型已经占全球开源模型下载量的 17.1%,反超美国的 15.8%,这个飞轮停不下来。
开源在,配方就在;配方在,生产环节就在;生产环节在,Token 工厂的地基就在。
为什么我们不碰文生视频
最后说一个我们自己的决定,也是那晚聊到最后的问题:文生视频火成这样,Seedance 的需求满天飞,Token 工厂为什么不顺手做视频?
答案很简单:做不了。不是难,是这门生意在结构上不存在。
工厂开工的前提,是你手里有配方。文本这边,配方是开放的,所以长出了整条产业链。视频完全相反,需求最大的那几个模型全部闭源:字节的 Seedance,Google 的 Veo 和 Gemini,快手的可灵。Seedance 都迭代到 2.5 了,一次权重都没放过。更能说明问题的是万相:它曾是这条赛道最大的开源例外,Wan 2.1、2.2 挂着 Apache 2.0,下载量超 3000 万;可从 2.5 开始,阿里也把它收了回去,只留 API。需求越涨,攥得越紧。视频这条赛道上,连唯一的例外都消失了。模型是厂商的命根子,人家闭源经营,吃闭源的利润,凭什么给你?
配方不给你,你还想参与,就只剩一个角色:出租算力。厂商拿你的卡,自己部署、自己经营、自己定价,推理优化也是人家做。你引以为傲的那些推理技术,在这条链上没有一寸落脚的地方。没有生产环节,就没有效率差,也就没有超额利润。这不是生意,是收租。
所以每次有人问我们要不要做视频推理,我都用同一个问题挡回去,这也是我们内部判断一切新方向的第一问:
配方在谁手里?
写在最后
那顿饭的最后,老板问我:那我这几千张卡,到底怎么办?
我说了实话:趁行情热,把卡租给会开工厂的人,把回款投到你真正有效率优势的地方去。他后来怎么决定的,我还不知道。但我把那晚最后说的话,也写给读到这里的你。
这个行业每天都在制造"拥有资源"的幻觉:有卡的觉得自己有算力,有钱的觉得自己有入场券。可资源是全行业贬值最快的东西,卡三个月降一档,模型三个月出一代,今天的稀缺,半年后就是库存。真正能穿越周期的只有一样:把同样的资源用出比别人高的效率的能力。台积电创办那年,代工被全行业当成不体面的苦活;三十几年后,最骄傲的设计公司都得排队等它的产能。
位置比力气重要。找一个所有人都需要你、而你不赌任何一家输赢的位置,然后把效率磨到别人追不上。风口会换,王座也会换。
效率永远有人买单。
参考资料
Token 工厂概念
- 黄仁勋 GTC 2025 keynote 转录稿("AI factories … generating these incredible tokens")— Rev
- 黄仁勋 Computex 2025 演讲("You apply energy to it, and it produces … tokens")— NVIDIA 官方博客
- 纳德拉 "planet-scale token factory" — 微软 FY26 Q1 财报电话会转录
- NVIDIA 技术博客把 "Token Factory" 写进标题(2026-03-25)
- 黄仁勋 GTC Taipei 2026:"Every token is profitable. Every token is revenues."(转录稿)
芯片层
- GB200 NVL72 对 H100 推理 30 倍 — NVIDIA 官方产品页
- 黄仁勋:Blackwell 对 H200 跑 DeepSeek R1 每 token 成本 1/10 — NVIDIA FY2026 Q3 财报电话会
- "you couldn't give Hoppers away" — GTC 2025 keynote 转录稿
- Vera Rubin 平台发布:每 token 成本约为 Blackwell 的 1/10 — NVIDIA 官方新闻稿(2026-03-16)
推理系统层
- vLLM 首发博客:对 HF Transformers 最高 24 倍吞吐
- PagedAttention 论文:对当时 SOTA 系统 2-4 倍吞吐(SOSP 2023)
- SGLang 首发博客:最高 5 倍吞吐
- NVIDIA Dynamo:GB200 NVL72 跑 DeepSeek-R1 每 GPU token 产出提升超 30 倍(projected)— 官方新闻稿
- DeepSeek-V3/R1 推理系统概览:日成本 8.7 万美元、理论日收入 56.2 万美元、理论成本利润率 545% — DeepSeek 官方 GitHub(2025-03-01)
价格与市场
- a16z LLMflation:同等能力推理价格每年降约 10 倍
- Epoch AI:固定能力推理价格约每年降 40 倍(2026-02 更新口径)
- OpenRouter 同一模型多家供应商挂牌示例(Qwen3-Coder,6 家,价差近 5 倍)
- OpenRouter × a16z《State of AI: An Empirical 100 Trillion Token Study》:编程类从约 11% 涨到超 50%
- DeepSeek 将 V4-Pro 75% 折扣永久化 — 官方定价页
三方工厂:融资与产能切换
- Fireworks AI Series D:15.05 亿美元融资、估值 175 亿、ARR 破 10 亿、日处理 40 万亿 token(2026-07)
- Baseten Series F:15 亿美元融资、估值最高 130 亿(2026-06)
- Together AI Series C:8 亿美元融资、估值 83 亿(2026-07)
- Cerebras 纳斯达克 IPO:首日市值约 950 亿美元(CNBC,2026-05-14)
- 英伟达约 200 亿美元获得 Groq 核心技术与团队(CNBC,2025-12-24)
- Kimi K2 发布 6 小时内 Novita/Parasail 已上架 — OpenRouter 页面 Wayback 存档(2025-07-11 21:16 UTC)
- Groq 上线 Kimi K2(day-3,185 tok/s)
- Artificial Analysis 实测 Groq 跑 K2 超 400 tok/s,为月之暗面官方 API 40 倍
- 硅基流动联合华为云昇腾上线 DeepSeek R1/V3(2025-02-01,极客公园转载官方通稿)
- 华为昇腾 950PR 全年 75 万颗产能被字节/阿里/腾讯百度/政企锁定(东方财富)
开源多米诺
- DeepSeek V3 发布即开源(官方公告,2024-12-26)
- DeepSeek R1 权重仓库(MIT,2025-01-20)
- AI 产品榜:DeepSeek 7 天新增 1 亿用户(Web+App 累加不去重口径,新浪转载)
- ChatGPT 两个月达到 1 亿月活(Reuters,2023-02-01)
- 英伟达单日蒸发 5890 亿美元,创当时美股纪录(CNBC,2025-01-27)
- MiniMax-01 开源(官方公告,2025-01-15,早于 R1 五天)
- 智谱 GLM-4-32B-0414 系列转 MIT(2025-04-14)
- MiniMax-M1 开源(Apache-2.0,2025-06-16)
- Kimi K2 修改版 MIT 协议原文(2025-07-11)
- GLM-4.5 权重 MIT(2025-07-28)
- 中国开源模型全球下载量占比 17.1% 反超美国 15.8%(人民网,2025-12-08)
- 月之暗面发布 Kimi K3:2.8 万亿参数、史上最大开放权重模型;智谱当日盘中最深跌 30%(CNBC,2026-07-17)
代工模式与文生视频
- 台积电公司简介:1987 年开创专业晶圆代工模式 — TSMC 官网
- 台积电年报原句:"does not compete directly with its customers"
- 英伟达公司史:1993 年创立、无自有晶圆厂,首款芯片由 SGS-Thomson 代工 — FundingUniverse
- 据报道苹果拿下台积电 3nm 初期约 90% 产能(MacRumors 转述 DigiTimes,2023-05-15)
- 字节 Seedance 2.0 官方发布(2026-02-12,闭源)
- Seedance 2.5:原生 30 秒单段视频(The Decoder,2026-06)
- Artificial Analysis 文生视频榜单(2026-07 实查:头部模型均闭源)
- 通义万相官方:Wan 2.1/2.2 开源、下载量超 3000 万(2026-01);2.5 起未再开放权重
- GLM-5.2 发布后智谱市值破万亿港币,盘中涨 42%(Caixin Global,2026-06-23)
