跳转到主内容
博客
我用一顿饭劝退了一个想开 Token 工厂的算力老板

我用一顿饭劝退了一个想开 Token 工厂的算力老板

几千张卡、开源模型、开源引擎,拼起来不就是印钞的 Token 工厂?那顿饭我给他拆了三层账:芯片一代差 10 倍,同样的硬件和模型,推理系统还能再差 10 倍,标品市场里效率差一截就是生死。再讲了 1987 年只代工不设计的台积电,和为什么需求最火的文生视频,我们碰都不碰。

关嘉伟关嘉伟11 分钟阅读
分享:

六月底的一个饭局,坐我对面的是个囤卡的老板。

具体身份不方便说。几千张卡,H 系列和国产的都有,散在两三个城市的机房里,前些年做 IDC 攒下的家底,这两年一直在找出路。

酒过三巡,他把手机推过来,屏幕上是黄仁勋在 GTC 的照片。"你说实话,我这是不是坐在金矿上。"

他的账算得很顺:token 需求在爆炸,老黄说每个 token 都是收入。模型,DeepSeek 开源的,不要钱。推理引擎,vLLM、SGLang,开源的,也不要钱。卡,我有的是。三样拼在一起,我不就是一个 Token 工厂?躺着生产 token 卖钱。

他等我说"靠谱"。我们在推理这一层做了几年,他是把我当行内人问的。

我说:别开。

他愣了几秒:"你们自己天天干的就是这个,劝我别进?"

正因为天天干这个。那顿饭从七点吃到十一点,我把这门生意从头到尾给他拆了一遍。这篇是那晚的完整版:为什么三块开源积木拼不成一座工厂,以及为什么需求最火爆的文生视频,我们碰都不碰。

先把"工厂"这个词讲对

Token 工厂不是我发明的词。"AI 工厂"是黄仁勋的原话,GTC 2025 上他说数据中心只有一件工作:"生产这些不可思议的 token。"而"Token 工厂"这个更露骨的叫法,出自纳德拉。2025 年 10 月微软财报会上,他问自己团队的问题是:"我们这座行星级的 token 工厂,效率到底怎么样?"到 2026 年 3 月,英伟达自己的技术博客也把 token factory 写进了标题。今年 6 月台北 GTC,黄仁勋的说法干脆变成:"每一个 token 都是利润,每一个 token 都是收入。"

很多人听到"工厂",把它理解成一门能源生意、算力生意:有电、有卡,就能开工。

这是对这个词最大的误解。有设备只是门槛,工厂的本质,是把一整条生产链的效率拧到极致。Token 工厂往下拆,是三层技术叠在一起,每一层都藏着数倍到数十倍的效率杠杆。

第一层,芯片。 代际之间是数量级的跳变。英伟达官方口径,GB200 NVL72 对 H100,大模型推理快 30 倍;跑 DeepSeek R1,Blackwell 对 H200 每 token 成本降到十分之一。今年 3 月发布的 Vera Rubin,对 Blackwell 每 token 成本又是十分之一,6 月已经全面量产。黄仁勋在 GTC 上说过一句到处被引用的话:Blackwell 量产之后,Hopper 白送都没人要。他管自己叫"首席收入摧毁官"。

第二层,模型。 模型决定这座工厂能产出的智能上限,这个好理解。容易被忽略的是另一半:模型结构本身就决定推理效率。稀疏化怎么做、attention 怎么设计、参数怎么分布,同样的智能水平,结构不同,生产成本差好几倍。设计模型越来越像设计工业品:性能和可制造性,要在图纸上一起定稿。

第三层,推理系统。 软件加硬件结合的一整套技术,也是行业里最被低估的一层。同样的硬件、同样的模型,推理系统能拉开数倍的差距。vLLM 刚出来时,对当时最强的推理系统是 2 到 4 倍的吞吐提升;SGLang 首发宣称最高 5 倍。最极端的例子是英伟达的 Dynamo:同一套 GB200 NVL72 跑 DeepSeek R1,开不开这套系统,官方给的数字是每张 GPU 的 token 产出差 30 倍。同一套硬件,同一个模型,30 倍。

推理系统的威力有一个更出名的注脚。DeepSeek 在 2025 年 3 月把自己推理系统的账本晒了出来:GPU 租赁成本一天约 8.7 万美元,理论日收入约 56 万美元,理论成本利润率 545%。他们自己声明实际收入远低于这个理论值,但数字一出还是把整个行业吓了一跳。卡还是那些卡,是推理系统把每一张都榨到了极限。

三层叠起来,才叫工厂。芯片选代、模型结构、推理系统,每一层都站在最优解上,和"三块开源积木拼一起",中间隔着几十倍的生产效率。

我那位朋友的方案是什么?上一代的卡,默认参数的开源引擎,别人设计的模型。他不是要开工厂,是要在别人的工业区旁边支一个作坊。

标品市场,效率就是生死

作坊也能活,对吧?小餐馆不也活在连锁店旁边?

不行。因为 token 是标品。

我之前写过《Token 不是一种东西》,说 token 是智能档乘速率档的矩阵,不能混在一起算。但矩阵里的同一个格子——同一个模型、同一档 SLA——token 就是彻底的标品。你产的 DeepSeek V4 token 和我产的 DeepSeek V4 token,一个字都不差。买家只看两个数字:价格,速度。

标品生意的铁律,做过大宗商品的人都懂:卖价是市场定的,你能决定的只有成本。效率差距直接变成利润差距,没有品牌、体验、故事可以遮挡。

而且这个市场几乎是为充分竞争量身定做的。供给全球互联,没有地域保护,报价以天为单位在变。打开 OpenRouter 你现在就能看到,同一个开源模型,四五家供应商同时挂牌,输入价差出近 5 倍,速度也差出几倍,贵的快、便宜的慢,像极了大宗商品的盘口。今年 5 月,DeepSeek 干脆把 V4-Pro 降价 75% 的促销价改成了永久价。拉长看更吓人:同等能力的推理价格,a16z 在 2024 年底算的是每年降 10 倍,Epoch AI 最新的口径是一年约 40 倍。

在这样的市场里,假设你握着一个 50% 的效率优势,你有两个用法:价格不动,多出来的全是利润;或者降价,把别人的需求抢过来。利润厚了还能去上游锁更多的卡,把原材料也抢了。两头挤压,没有技术优势的玩家很快会发现:自己开工厂,不如把卡租给会开工厂的人。

这就是我劝他别开的核心理由。Token 工厂不会小而散,它会像所有标品产业一样走向高度集中。资本已经在给这个判断投票,就看过去这半年多:Fireworks 估值 175 亿美元,年收入破 10 亿、一天处理 40 万亿 token;Baseten 估到 130 亿;Together 83 亿;Cerebras 上市首日市值冲到 950 亿上下;英伟达干脆花约 200 亿美元把 Groq 的技术和核心团队收了。钱不会骗人,它们买的是同一样东西:把 token 生产效率做到极致的能力。

顺便说一句,这场集中在哪个领域跑得最快?AI 编程。OpenRouter 和 a16z 那份 100 万亿 token 的研究里,编程类消耗从 2025 年初的 11% 涨到年底的超过 50%。需求最标准、SLA 最清晰、买家最专业的地方,永远最先卷成工厂的形状。

1987 年,有人讲过一样的故事

饭吃到一半,他问了一个真正的好问题:模型公司自己就在卖 API,自己就是工厂,凭什么轮得到第三方?

我给他讲了台积电。

1987 年张忠谋创办台积电的时候,做了一个当时所有人都看不懂的决定:只做代工,不做设计,永远不和客户竞争。这句承诺后来几乎一字不差地写进了台积电每一年的年报。在那之前,芯片行业的常识是设计制造一体,英特尔那样才叫芯片公司。代工?那是苦活。

但正是"中立"这个承诺,凭空造出了一个新物种:fabless。设计公司从此不用砸几十亿美元建厂,画好图纸,产能找台积电。英伟达 1993 年成立的时候,一间厂房都没有,到今天也没有。

Token 的世界正在裂成同样的结构。

闭源巨头是苹果。OpenAI、Anthropic,模型不给你,推理技术自己磨,芯片跟供应商协同设计,从设计到零售全链条自营,利润空间自己定。这是一条自洽的路,前提是模型必须一直领先。

开源阵营是组团打仗。模型厂出设计,把权重开放出去,谁都可以生产。而三方 Token 工厂,就是这个阵营里的台积电。不做模型,不赌哪家赢,手里握着所有人都需要的东西:中立的、效率拉满的产能。

中立为什么值钱?想一个问题就明白了:A 模型公司的算力,能变成 B 模型公司的产能吗?不可能。这个月 B 家的模型突然登顶,A 家不可能把自己的集群腾出来帮死对头出货。模型公司的产能被自家模型锁死了:模型行,产能值钱;模型不行,产能陪葬。

三方工厂没有这个锁。谁的模型好,产能切给谁。切换速度快得超出直觉:去年 7 月 Kimi K2 发布,6 个小时内就有两家推理商挂牌上线;Groq 第三天上线,再过三天,实测速度干到月之暗面官方 API 的 40 倍。模型是别人的,产能是自己的,风口是大家的。

这个结构对模型公司同样是解药。现在做一个新模型公司,最重的负担是推理算力:训练咬咬牙还能租,推理得跟着用户涨,是个无底洞。但如果产能层是中立开放的,打法就完全变了:专心把模型训好,开源打开市场,然后回头去包产能。像苹果包下台积电 3nm 首发产能那样(据报道初期产能的九成归了苹果),像昇腾 950PR 全年 75 万颗被字节、阿里这些大厂们整整齐齐包圆那样。模型公司变成 fabless:轻资产,赌设计,产能交给中立工厂。新王者从出现到放量,可以压缩到几个月。

对工厂这边,中立还是唯一的抗风险姿势。模型公司的行情随代际怎么摆,最近 30 天就是教科书:6 月中旬智谱发 GLM-5.2,一周后股价盘中涨过 42%,市值破了万亿港币;就在昨天,月之暗面发布 Kimi K3,智谱盘中最深跌掉 30%,MiniMax 跟着跌 16%。同一家公司,一个月里天堂地狱各走一遭。把自己绑死在任何一家的生态里,都是在赌它每一代都赢。这种绑定有多脆,我在《顶尖智能,说断就断》里写过,连国家层面都会翻车。台积电从不赌哪家设计公司赢,它只赌一件事:世界永远需要芯片。Token 工厂赌的也只是:世界永远需要 token。

总会有下一条鲶鱼

听到这里他基本服了,但补了一个很尖的问题:这套逻辑全建立在模型开源上。哪天大家都不开了呢?

这个担心值得认真回答。我的判断是:回不去了。

复盘一下 2025 年那场多米诺。2024 年 12 月 26 日,DeepSeek V3 开源,训练刚收尾就把权重放了出来,效果贴着海外闭源旗舰,比国内所有闭源旗舰都好。这一下国内的闭源模型全尴尬了:最好的那个免费,你收费的凭什么?

多米诺倒得比所有人预期的都快。1 月 15 日,从没开源过旗舰的 MiniMax 抢先把 MiniMax-01 的完整权重放了出来——注意,这时候 R1 还没发布。1 月 20 日,R1 带着 MIT 协议炸场,按 AI 产品榜的统计,随后 7 天新增用户过亿,而 ChatGPT 当年破亿用了两个月。1 月 27 日,英伟达单日跌掉近 17%,5890 亿美元市值蒸发,创下当时美股史上最大单日市值蒸发纪录。然后是整个 2025 年:4 月智谱把 GLM 系列转成 MIT,6 月 MiniMax M1 用上 Apache 2.0,7 月 Kimi K2 挂着修改版 MIT、GLM-4.5 直接 MIT。一年之内,"旗舰必闭源"变成了"旗舰不开源都不好意思发布"。

驱动这一切的不是情怀,是一笔冷冰冰的营销账。你训出了一个好模型,怎么让全世界知道?买广告、办发布会,慢得要死,贵得离谱。把权重放出去,整个开源社区的传播机器立刻免费为你运转:下载、口碑、推理商抢着上架、benchmark 刷屏。7 天 1 亿用户,这个效果广告史上没有出现过,它只可能来自开源。

这场竞赛到今天也没有减速的意思。昨天把智谱砸跌 30% 的那颗炸弹,本身就是开源的最新一环:Kimi K3,2.8 万亿参数,直接开放权重,史上最大。

所以就算某天 DeepSeek 也不开了,一定会有下一个名不见经传的团队,在算力和牌桌位置都不如人的时候,把最好的东西直接开出来,因为这是落后者掀桌子最高效的方式。只要有一条鲶鱼这么干,所有人就都得跟着卷。何况当下的格局里,中国模型已经占全球开源模型下载量的 17.1%,反超美国的 15.8%,这个飞轮停不下来。

开源在,配方就在;配方在,生产环节就在;生产环节在,Token 工厂的地基就在。

为什么我们不碰文生视频

最后说一个我们自己的决定,也是那晚聊到最后的问题:文生视频火成这样,Seedance 的需求满天飞,Token 工厂为什么不顺手做视频?

答案很简单:做不了。不是难,是这门生意在结构上不存在。

工厂开工的前提,是你手里有配方。文本这边,配方是开放的,所以长出了整条产业链。视频完全相反,需求最大的那几个模型全部闭源:字节的 Seedance,Google 的 Veo 和 Gemini,快手的可灵。Seedance 都迭代到 2.5 了,一次权重都没放过。更能说明问题的是万相:它曾是这条赛道最大的开源例外,Wan 2.1、2.2 挂着 Apache 2.0,下载量超 3000 万;可从 2.5 开始,阿里也把它收了回去,只留 API。需求越涨,攥得越紧。视频这条赛道上,连唯一的例外都消失了。模型是厂商的命根子,人家闭源经营,吃闭源的利润,凭什么给你?

配方不给你,你还想参与,就只剩一个角色:出租算力。厂商拿你的卡,自己部署、自己经营、自己定价,推理优化也是人家做。你引以为傲的那些推理技术,在这条链上没有一寸落脚的地方。没有生产环节,就没有效率差,也就没有超额利润。这不是生意,是收租。

所以每次有人问我们要不要做视频推理,我都用同一个问题挡回去,这也是我们内部判断一切新方向的第一问:

配方在谁手里?

写在最后

那顿饭的最后,老板问我:那我这几千张卡,到底怎么办?

我说了实话:趁行情热,把卡租给会开工厂的人,把回款投到你真正有效率优势的地方去。他后来怎么决定的,我还不知道。但我把那晚最后说的话,也写给读到这里的你。

这个行业每天都在制造"拥有资源"的幻觉:有卡的觉得自己有算力,有钱的觉得自己有入场券。可资源是全行业贬值最快的东西,卡三个月降一档,模型三个月出一代,今天的稀缺,半年后就是库存。真正能穿越周期的只有一样:把同样的资源用出比别人高的效率的能力。台积电创办那年,代工被全行业当成不体面的苦活;三十几年后,最骄傲的设计公司都得排队等它的产能。

位置比力气重要。找一个所有人都需要你、而你不赌任何一家输赢的位置,然后把效率磨到别人追不上。风口会换,王座也会换。

效率永远有人买单。


参考资料

Token 工厂概念

芯片层

推理系统层

价格与市场

三方工厂:融资与产能切换

开源多米诺

代工模式与文生视频

推荐阅读

订阅博客更新

新文章发布时第一时间通知你,不会发送垃圾邮件。

仅用于博客更新通知,随时可以取消订阅。

评论

或匿名评论
0/2000