# guanjiawei.ai — Full Site Reference for Language Models
> Comprehensive machine-readable reference for guanjiawei.ai, Jiawei Guan's (关嘉伟) bilingual personal site. See /llms.txt for the short version.
## Site Identity
- Owner: Jiawei Guan (关嘉伟)
- Role: VP at Approaching.ai (趋境科技副总裁)
- Website: https://guanjiawei.ai
- Base language: Chinese (Mandarin) with English translation
- Default locale: zh (Chinese)
- License: CC-BY-4.0 for blog content
## About Jiawei Guan
Jiawei Guan (关嘉伟) is VP at Approaching.ai (趋境科技副总裁), an AI industry veteran with 7+ years of experience. Career spans:
- Approaching.ai (趋境科技) — current, leading strategy and sales, deeply involved in product
- Zhipu AI (智谱) — management role
- SenseTime (商汤科技) — management role
- GoGoVan (快狗打车) — Strategy & user growth lead
- Accenture Strategy — Management consulting
The site documents insights on AI Agents, Edge AI, Vibe Coding, AI industry analysis, and AI product strategy. Content is written in Chinese first and auto-translated to English via Kimi API with SHA-256 content-hash caching to prevent retranslation of unchanged text.
Known by either name:
- English: Jiawei Guan
- Chinese: 关嘉伟 (Guān Jiāwěi)
## Contact & Platforms
- GitHub: https://github.com/skyguan92
- LinkedIn: https://cn.linkedin.com/in/jiaweiguan
- X (Twitter): https://x.com/skyguan92
- 知乎 (Zhihu): https://www.zhihu.com/people/guan-jia-wei-35
- YouTube: https://www.youtube.com/@GuanJiawei92
- Reddit: https://www.reddit.com/user/Intrepid-Mango3260
- WeChat Official Account (微信公众号): 关嘉伟谈AI
- Personal Email: j.guan.lse@outlook.com
- Work Email: guanjiawei@approaching.ai
## Technical Stack
- Framework: Next.js 16 (App Router)
- React: 19
- Language: TypeScript (strict mode)
- Content: MDX via Velite (schemas in velite.config.ts)
- Styling: Tailwind CSS v4 (via @theme inline in globals.css)
- i18n: next-intl 4.x (subpath routing: /zh/, /en/)
- Theme: next-themes (system default)
- Analytics: Vercel Analytics + Speed Insights
- Deployment: Vercel (Fluid Compute, Node.js 24)
- Translation: Kimi API (OpenAI-compatible)
## URL Structure
### English Content
- Home: https://guanjiawei.ai/en
- Blog: https://guanjiawei.ai/en/blog
- Blog post: https://guanjiawei.ai/en/blog/{slug}
- Projects: https://guanjiawei.ai/en/projects
- Project: https://guanjiawei.ai/en/projects/{slug}
- About: https://guanjiawei.ai/en/about
### Chinese Content
- Home: https://guanjiawei.ai/zh
- Blog: https://guanjiawei.ai/zh/blog
- Blog post: https://guanjiawei.ai/zh/blog/{slug}
- Projects: https://guanjiawei.ai/zh/projects
- Project: https://guanjiawei.ai/zh/projects/{slug}
- About: https://guanjiawei.ai/zh/about
## Feeds and Discovery
- Sitemap XML: https://guanjiawei.ai/sitemap.xml
- robots.txt: https://guanjiawei.ai/robots.txt
- RSS (English): https://guanjiawei.ai/en/feed.xml
- RSS (Chinese): https://guanjiawei.ai/zh/feed.xml
- OG Image API: https://guanjiawei.ai/api/og?title={title}&locale={zh|en}
- Licensing terms (RSL 1.0): https://guanjiawei.ai/.well-known/rsl.xml
## All Blog Posts (ZH, source of truth — EN at same slug under /en/blog/)
- [我用一顿饭劝退了一个想开 Token 工厂的算力老板](https://guanjiawei.ai/zh/blog/token-factory) — 2026-07-18
几千张卡、开源模型、开源引擎,拼起来不就是印钞的 Token 工厂?那顿饭我给他拆了三层账:芯片一代差 10 倍,同样的硬件和模型,推理系统还能再差 10 倍,标品市场里效率差一截就是生死。再讲了 1987 年只代工不设计的台积电,和为什么需求最火的文生视频,我们碰都不碰。
- [我花顶配的钱,买了个偷偷变笨还给我打暗记的模型](https://guanjiawei.ai/zh/blog/black-box-intelligence-privatization) — 2026-07-06 ★
一个我预期一夜跑完的任务,连着三天在原地打转。折腾完 harness 才发现不怪我:Codex 里的 GPT-5.5 被人扒出思考 token 恒定停在 516,平均思考长度从 268 跌到 107。同一周,Claude Code 被逆向出一段专门给中国用户打隐形标记的代码。付了顶配的钱,拿到的却是一个你完全不知道它状态的黑盒。
- [最强的模型发布了,而我没有“资格”用](https://guanjiawei.ai/zh/blog/intelligence-by-permission) — 2026-06-29
GPT 5.5 发布那天,一夜之间 Codex 里就能选了。这次 5.6,三档规格、benchmark 漂亮,我去切模型,下拉框却是空的——只给 20 家合作伙伴,每进一个还要美国政府审批。前阵子我还在担心最强的智能开始论钱,现在我得收回一半:钱能买到的智能,已经算是公平的智能了。
- [史上最短的一条链:技术到利润,只要一天](https://guanjiawei.ai/zh/blog/shortest-chain-to-profit) — 2026-06-17
我们在推理引擎上研究三周,换来几个点的效率提升。某天早上上线,第二天它就变成了报表上的利润。这条从技术到利润的链,被 token 经济压成了史上最短的一条:智谱半年股价八倍,OpenAI 靠 GPT-5.5 把 Codex 拉到 500 万周活,MiniMax 一度超过百度又迅速回落。捧你和弃你,用的是同一种速度。
- [顶尖智能,说断就断](https://guanjiawei.ai/zh/blog/intelligence-as-strategic-resource) — 2026-06-15
我让 Fable 5 跑一个长任务,回来发现干活的已经被悄悄换成了 Opus 4.8。三天后,这个模型被美国商务部一纸出口管制令全球关停,连盟友都用不了,理由是它太擅长找漏洞。顶尖闭源智能的可得性,正在变成一件系统性的风险。而几乎在同一周,国产开源模型集体接棒。
- [Harness乱了就要重开](https://guanjiawei.ai/zh/blog/restart-when-lost) — 2026-06-12
用 agent 从零做推理引擎,项目越探索越乱,模型表现肉眼可见地变差。后来每次的解法都一样:停下来重新定义目标,开新 repo 重来,同一个模型判若两人。微软模拟了 20 万场对话得出同一个结论:模型走错路,自己不会回头。
- [智能开始论贫富](https://guanjiawei.ai/zh/blog/intelligence-wealth-divide) — 2026-06-11 ★
Fable 5 跑了个硬核任务,15 小时,420 美元。模型确实变强了。但 6 月 22 日之后从Coding Plan订阅移除,按 API 费率买,成本差了一个数量级。谁能用最好的智能,变成了一个纯粹的钱的问题。
- [模型还在变强,但「最强」已经没有标准答案](https://guanjiawei.ai/zh/blog/strongest-no-single-answer) — 2026-06-03
一个朋友用模型做小工具,觉得已经够牛了;任务一复杂,就开始反复被告知「我搞定了」但其实没搞定。这背后是一个正在发生的分叉:benchmark 分数挤在天花板、彼此快测不出差异,真实体感却越拉越开。会解最难的题、能可靠办成一件糙活、会探索没有标准答案的问题,正变成三种不同的能力。而最要紧的那一维,恰恰最难测、也最难练。
- [Claude 4.8 让我失望,但这不是 Claude 一家的事](https://guanjiawei.ai/zh/blog/stay-on-the-table) — 2026-06-01 ★
Opus 4.8 在研究和工程任务上连着让我失望,这些活我全转给了 GPT 5.5。但复盘下来,这不是 Claude 一家的问题。从英伟达、AMD 差点破产,到智谱掉队又翻身,顶尖模型一直在风水轮流转。别赌谁最强,赌谁还在牌桌上。
- [Token 业务的暗线:决定成本的不是吞吐,是 KV cache 命中](https://guanjiawei.ai/zh/blog/token-business-kv-cache) — 2026-05-28
大家算 token 成本,习惯盯 TTFT、TPOT、吞吐速率。真正让账单差出 10 倍的是 KV cache 有没有命中。模型、服务端、用户三层都得对得上。
- [Token 不是一种东西](https://guanjiawei.ai/zh/blog/token-is-not-one-thing) — 2026-05-26
GPT-5.5、Opus 4.7 一档需求几乎无限,中等模型断档,中低端算力大量闲置。Token 经济听起来像卖电力,其实更像加油站:98 号汽油断货了,柴油桶装满了但需要自助,95 号装满了但空置。
- [Agent 越强,常识越值钱](https://guanjiawei.ai/zh/blog/agent-common-sense) — 2026-05-25 ★
上个月写了'无知是优势',这个月被 agent 连坑四次:性能虚高几十倍、实验机被删成砖、优化原地打转、目标太高交付不了。今天修正一下:无知让你敢试,常识让你不被骗。
- [模型快 5 倍,就不再是同一个模型](https://guanjiawei.ai/zh/blog/inference-speed-new-species) — 2026-05-22
Gemini 3.5 Flash 发布会几乎不讲智能,智谱 GLM-5.1 高速版冲到 400 token/s。背后是同一个故事——推理速度跨过 5 倍那条线之后,模型解锁的就是另一类产品了。
- [AMD 开发者大会给一个不会写代码的人颁了奖](https://guanjiawei.ai/zh/blog/non-coder-award) — 2026-05-19T18:00:00 ★
今天去上海 AMD 开发者大会。2000 多人挤进现场,AMD 把两个开发者奖之一颁给了一个不会写代码的人,他靠 agent 把东西用 Rust 重写做出了性能优化。一年前大家还在愁需求,半年过去所有人见面第一句都是:再给我点货。
- [同一个 /goal功能,两种Agent性格](https://guanjiawei.ai/zh/blog/goal-two-personalities) — 2026-05-18
Codex 上了 /goal 我用了几周。Claude Code 最近几天也跟着上,我把手头几个 Codex 没搞定的任务挪过去试,结果反差太大,值得记下来。
- [AI变革不是培训出来的](https://guanjiawei.ai/zh/blog/ai-transformation-not-from-training) — 2026-05-16
跟朋友聊AIagent,发现大家第一反应都是「帮我给老板讲讲」。但回过头看,真正推动变化的从来不是一堂课。
- [两代人的跨越](https://guanjiawei.ai/zh/blog/two-generations) — 2026-05-15
特朗普带着马斯克、黄仁勋、库克访华。红地毯、国宴、平等对话。七十七年前这个国家连饭都吃不饱——两代人的时间,够了。
- [Demo 一小时,产线三小时](https://guanjiawei.ai/zh/blog/from-demo-to-production) — 2026-05-14
最近做了几个 AI 内容批量化的项目,发现一件之前没算明白的事:从一个能跑的 demo 到一条全自动产线,时间是 3 倍起,不是 50%。多出来的两个小时全在质检和重试上。也是这一趟让我看明白,中等智力模型和本地化算力到底应该用在哪。
- [AI失业潮之后的三道题](https://guanjiawei.ai/zh/blog/three-questions-after-jobs) — 2026-05-13 ★
韩国总统府提议把 AI 超额收益做成全民分红那天,三星工会还在谈罢工。这件事是 AI 冲击下三道题里的中间一道。前面有一道失业题,后面还有一道更深的:工作不再定义价值之后,人靠什么继续走。
- [AI Coding 这门生意,被自己吃掉了](https://guanjiawei.ai/zh/blog/ai-coding-eats-itself) — 2026-05-12 ★
从 GitHub Copilot 到 Claude Code 走了五年。方向印证得越彻底,最早笃定方向的那批人活得越艰难。小模型、工作流、独立 IDE,一层一层被基础模型吞掉。剩下还能卖的东西其实清晰,只是不再叫软件。
- [AI 尖兵:还剩 10 周](https://guanjiawei.ai/zh/blog/ai-vanguard-ten-weeks) — 2026-05-11
朋友问我要不要接 AI 变革专家的 offer。聊完三个小时,我把判断写下来:尖兵阶段不要省钱、不要碰 IDE、不要让 agent 黑盒化。GPT-5.5 发布两周,剩下 10 周世界会被一批意想不到的成果震撼。
- [Deepseek 估值 3000 亿,梁文锋领投 200 亿](https://guanjiawei.ai/zh/blog/deepseek-respect) — 2026-05-09
看完 DeepSeek 估值 3000 亿的融资,我并不意外。真正震到我的是另一件事——梁文锋掏了 200 亿,按自己定的高估值跟外部投资者一起进了同一轮。这种事情我从业以来没见过。
- [Vibe Coding 起步只有两条路](https://guanjiawei.ai/zh/blog/where-to-start-vibe-coding) — 2026-05-09
朋友问 Vibe Coding 该从哪开始用。两条路:从工作切入,或从数字身份切入。前提是发出去的必须是真实的你——互联网有记忆,Kevin Hart 翻出来的旧推是十年前的。
- [陪 agent 干活到此为止](https://guanjiawei.ai/zh/blog/let-the-agent-run) — 2026-05-08
用 Codex APP 的自动化做了两天,烧了一个 Pro 账号,进展微乎其微。换到 Codex CLI 的 Goal 功能就立刻顺了。一开始以为是模型变蠢,后来想明白:是 agent 形态在定型,人不该再被绑在屏幕前。
- [Agent 时代最贵的浪费:GPU 在等 CPU](https://guanjiawei.ai/zh/blog/agent-cpu-bottleneck) — 2026-05-07
我做了七百轮 AI Infra 实验,三十五个小时全被环境启动吃掉。一开始还以为是 GPT-5.5 fast 模式不够快,后来发现根本不是模型在思考,是模型在等 CPU。Intel 已经把服务器 CPU:GPU 配比从 1:8 收紧到 1:1。
- [人人都要当领导:用了一周 GPT-5.5 和 Opus 4.7 之后](https://guanjiawei.ai/zh/blog/everyone-needs-leadership) — 2026-05-06
Claude 在任务跑到一半的时候让我「睡一觉」,GPT-5.5 探一下就把方向关了。用了一周新模型我反而看清一件事:模型再强,跟它协作的那部分还是得人来扛。
- [Codex 5.5:版本号是骗人的](https://guanjiawei.ai/zh/blog/codex-5-5-paradigm-shift) — 2026-05-01
代号 SPUD 的 GPT-5.5 上线两周,我把 Claude Code 卸得差不多了。让我意外的不是它强了几个百分点,是几个老短板一次性补完之后,agent 的设计哲学第一次变得清晰。
- [AI 这个词,已经换了三次魂](https://guanjiawei.ai/zh/blog/what-we-mean-by-ai) — 2026-04-30
几十年前的 AI 是机器学习,三年前是 ChatGPT,今年是智能体。词没变,里面装的东西换了三遍。多数人还停留在上一代的认知里讨论一个其实不存在的东西。
- [AI 时代的赛博地主:你的工作流不是你的](https://guanjiawei.ai/zh/blog/ai-cyber-landlord) — 2026-04-29 ★
60 人公司一夜被封号、110 人公司账号封了 API 还在扣钱、Altman 家被扔燃烧瓶、Meta 搞 token 烧钱排行榜——AI 时代的权力问题已经摆到桌面。这一波重新分配里,公司、国家、个人各自该把什么握在自己手里?
- [拼图的最后一块:vibe一个推理引擎](https://guanjiawei.ai/zh/blog/inference-engine-last-puzzle-piece) — 2026-04-28
做完 AIMA 管理层和售后层之后我发现还差一块。Ollama 太傻、llama.cpp 精度被自己的格式吃了、vLLM 又太重。市面上没有现成的解,那就自己来。
- [AI 做科研:三堵墙、八亿人、一场哥白尼革命](https://guanjiawei.ai/zh/blog/ai-for-science-three-walls) — 2026-04-27
前几天大会上聊 AI for science,有人提到三堵墙:付费墙、湿实验墙、感知墙。陶哲轩说我们正在经历智能的哥白尼革命,人不再是智能的中心。全球 880 万全职科研人员,AI 之后可能是几亿。门外汉先冲进来了,但真正的瓶颈不在模型。
- [AI 让无知变成了优势](https://guanjiawei.ai/zh/blog/amateur-advantage) — 2026-04-26
23 岁的 Liam Price 让 GPT-5.4 Pro 在 80 分钟里破了 Erdős 困了人类 60 年的猜想,陶哲轩说大家在第一步就集体走偏了。同一周电梯里两个陌生人在谈裁员。AI 把过去最贵的资源给到了每个个体,问题只是你拿来给世界多加点东西,还是把交差做得更漂亮。
- [DeepSeek V4 这一天:比的是 Infra,不是模型](https://guanjiawei.ai/zh/blog/deepseek-v4-infra-matters) — 2026-04-24
V4 能力卡在 Opus 4.6 一档,但把 FP4 推到生产、百万上下文做成默认、国产芯片 day-0 适配,对所有做推理 Infra 的人都是灾难。加上 GPT-5.5、Vision Banana、LPM 1.0,这一周挤进来的新东西比过去一整个季度都多。
- [风水轮流转:模型一个半月一代](https://guanjiawei.ai/zh/blog/monthly-model-cadence) — 2026-04-24
GPT-5.5 今天发了,距 5.4 才一个半月。Opus 4.7 上周发了,距 4.6 才两个月。更逗的是 GPT 终于说人话了,Opus 反而开始不说了。这个节奏下,判断本身的半衰期都变短了。
- [用 AI 花了一天半给儿子做个识字游戏](https://guanjiawei.ai/zh/blog/paw-patrol-literacy-game) — 2026-04-23
起因是儿子小声跟我说,学校里认字能得小红花,他经常拿不到。我用 coding agent 给他做了一个汪汪队 IP 的认字游戏,前后一天半。最意外的不是儿子玩到不肯走,是我妻子的反应——她第一次真正感觉到,AI 这东西落到了我们家客厅里。
- [聊聊大模型定价:芯片锁死了供给,剩下的都是商业哲学](https://guanjiawei.ai/zh/blog/llm-pricing-no-silver-bullet) — 2026-04-22
价格本来是用来调节供需的,大模型这件事偏偏卡在一个奇怪的位置——供给被芯片管制锁死,需求被三类用户拉成完全不同的形状。Coding Plan 这种当年看起来理所当然的模式,现在反而被反复挑战。
- [一个人并行跑六个 agent:AI coding 改了什么,没改什么](https://guanjiawei.ai/zh/blog/ai-coding-four-dimensions) — 2026-04-21
Karpathy 自己都不用 vibe coding 这个词了,Amazon 一次宕机之后干脆给初级工程师的 AI 代码加了 senior 签字关。我从自己的日常用法讲起,聊聊这个工具真正改变的四件事——宽度、速度、质量,和那件永远没动过的责任归属。
- [GitHub 小红书化之后:做产品这件事反而更孤独了](https://guanjiawei.ai/zh/blog/product-middle-is-lonely) — 2026-04-21
给一个 idea 点个赞、收下一个 star 现在是秒级的事。但把想法做到真正能用、经得起挑刺,中间那段最长最枯燥的路,vibe coding 并没怎么缩短。写一写我最近的切身感受,也翻了翻乔布斯和张小龙身上绕不开的那个共同点。
- [被郑丽文圈粉,新一代的领导应该什么样?](https://guanjiawei.ai/zh/blog/zheng-liwen-hundred-schools) — 2026-04-20 ★
国民党新主席访问大陆,回台湾不找主流媒体,跑去跟网红直播。她跟雷军见面说自己老公全身都是小米。这种人让我想起春秋末期。礼崩乐坏的另一面是百家争鸣,现在也一样。
- [Opus 4.7 上线前后这两天](https://guanjiawei.ai/zh/blog/parallel-with-agents) — 2026-04-17
昨晚 Opus 4.7 发布,我就没睡成。起来试了试,顺手给 OpenClaude 提了几个 PR 合进了主干,还把 Strix Halo 上 Qwen3-30B 的 prefill 推到了接近 DGX Spark 的水平。Agent 够强之后,一个人能同时做几件事,变成了一个挺具体的问题。
- [AI 行业的战时状态](https://guanjiawei.ai/zh/blog/ai-wartime) — 2026-04-16T10:00:00 ★
Anthropic 搞实名认证,中国这边炸锅了。但说实话这事一点都不意外。AI 行业从 2023 年开始就是战时状态,芯片禁令、军事合同、模型封锁,跟工业革命那会儿的清朝太像了。
- [AI 不是许愿池:两个我最近搞不定的事](https://guanjiawei.ai/zh/blog/ai-coding-failures) — 2026-04-15
一个是 Claude Code 修不好自己家的 Chrome 插件,绕了四个小时;一个是小红书怎么发都被软限流。AI 没把工作从失败变成成功,它只是让失败跑得更快——这反而是它最值钱的地方。
- [GPT-6 今天又'发布'了一次?](https://guanjiawei.ai/zh/blog/gpt-6-released-again) — 2026-04-15 ★
朋友圈又在刷 GPT-6 发布了。假信息有观众,真信息是细分市场。AI 让这件事严重了,不是变轻了——这也是为什么我最近把团队又推回了 Claude Code。
- [数字身份是最大的杠杆](https://guanjiawei.ai/zh/blog/digital-identity-biggest-leverage) — 2026-04-14 ★
生产不值钱了,验证速度才值钱。Karpathy两天跑700个实验,雷军几天就有投票结论——数字身份是当前最大的个人杠杆,到年底不做就晚了。
- [更快地失败](https://guanjiawei.ai/zh/blog/failing-faster-with-ai) — 2026-04-13 ★
Chrome插件折腾四小时最后靠一搜搞定,小红书实验全军覆没。AI编程不会让你少失败,但会让你失败得更快——三个月内模型迭代三轮,今天的死局可能下月就通了。
- [急诊室与消失的护城河](https://guanjiawei.ai/zh/blog/emergency-room-vanishing-moat) — 2026-04-11 ★
Aima Service 重构复盘。产品像急诊室,用户不在乎装修,只在乎医生能不能看病。Claude Code 和 Codex 交替跑了一周多,130 万行代码落地。回头一看,代码量这条护城河可能已经不在了。
- [当饺子馆开始发 Skill](https://guanjiawei.ai/zh/blog/github-xiaohongshu-era) — 2026-04-11 ★
GitHub 在小红书化,公众号在 GitHub 化。饺子馆老板 vibe coding 写 skill,好莱坞明星当 GitHub 第一作者,朋友圈流行把同事蒸馏成 skill。不过 skill 可能不是重点,agent 互通才是。
- [编程智能体的百万级鸿沟](https://guanjiawei.ai/zh/blog/coding-agent-adoption-gap) — 2026-04-10 ★
黄仁勋说coding agent改变世界,但真正在用的人只有百万级。问题不在技巧在认知——三个思维门槛把大多数人挡在门外,跨过去后95%的电脑工作都能交出去。
- [一匹小马与文生视频的私有化刚需](https://guanjiawei.ai/zh/blog/happy-horse-video-privatization) — 2026-04-09 ★
HappyHorse 一夜登顶视频生成排行榜,但没人知道它是谁的。域名被抢注、HuggingFace 被占位、来源众说纷纭。比这些热闹更值得聊的,是文生视频私有化需求背后的硬件和商业逻辑。
- [AI 的矛与盾](https://guanjiawei.ai/zh/blog/ai-spear-and-shield) — 2026-04-08 ★
Coding agent 解 bug 比写代码强。MemPalace 两天 7000 star。Anthropic 的 Mythos 让所有软件都不安全了。产品设计应该跑在模型前面。
- [模型公司的终局是云公司](https://guanjiawei.ai/zh/blog/model-company-endgame-cloud) — 2026-04-08 ★
模型开源怎么赚钱?算一笔 DeepSeek 的账就明白了:模型公司跟云公司正在变成一枚硬币的两面,而开源是目前最高效的获客手段。
- [开源社区的 DeepSeek 时刻](https://guanjiawei.ai/zh/blog/open-source-deepseek-moment) — 2026-04-07 ★
调研文生视频的时候发现,中国模型在语言模型开源社区的统治力并没有延伸到所有地方。回头看这三年,从 LLaMA 到千问到 DeepSeek,开源社区经历了什么?现在又在等什么?
- [不是一场革命,是两场](https://guanjiawei.ai/zh/blog/two-ai-revolutions) — 2026-04-03 ★
编程和内容创作是两条正在分叉的路。Seedance 2.0 的 API 一开放,朋友圈全炸了。Agent 对 Agent 的效率是开会的一百倍。打球的时候终于不用谈生意了。
- [AI 放大的不是技能,是热情](https://guanjiawei.ai/zh/blog/ai-amplifies-passion) — 2026-04-02 ★
张雪为了把公差从五丝压到三丝,自己扛供应链的试错成本。祝铭明十年死磕 AR 眼镜,中间靠音箱续命。这些人身上有一种共同的东西,不是聪明,是热情。AI 恰好在放大这种东西。
- [花钱买不来的增长](https://guanjiawei.ai/zh/blog/money-cant-buy-growth) — 2026-03-30 ★
DeepSeek 零预算用户过亿,Claude Code 一天一个版本,钉钉飞书企微三天跟进同一功能。产品竞争的底层逻辑变了,钱和声量不再是决定性武器。
- [进不去电脑那天,我决定做一个产品](https://guanjiawei.ai/zh/blog/why-i-built-aima-service) — 2026-03-27 ★
折腾两天做不出来的工具,换个模型半小时搞定。电脑登不进去,一个 AI 智能体半小时帮我修好。后来我做了 Aima Service,想让每台设备在出问题时都能有个 AI 来帮忙。
- [比 AI 焦虑更值得谈的事](https://guanjiawei.ai/zh/blog/beyond-ai-anxiety) — 2026-03-25 ★
张雪峰猝死、OpenClaw 创始人卖掉公司后迷失、年轻人涌向 AI 算命。技术在疯跑,但关于未来该怎么活,我们几乎没有像样的回答。
- [软件招投标,快撑不住了](https://guanjiawei.ai/zh/blog/software-bidding-is-broken) — 2026-03-24 ★
AI 把制作软件的成本压到了几千块和几天的量级,原本依赖信息不对称和商品化比较的招投标体系正在失去根基。这跟去年大模型市场的崩塌是同一个剧本。
- [卡住 AI 创业的,不是技术](https://guanjiawei.ai/zh/blog/ai-startup-bottleneck) — 2026-03-23 ★
九天不发版就被追问,一周没动静就没人关注。AI创业真正卡住团队的四个瓶颈——热情、专注、流程和体力,没有一个跟技术有关。
- [开源社区正在经历一场「短视频式」的爆发](https://guanjiawei.ai/zh/blog/opensource-is-the-new-douyin) — 2026-03-23 ★
制作成本和分发成本同时趋近于零的时候,平台就会爆发。短视频行业验证过一次,现在软件行业正在重演,OpenClaw 的现象值得留意。
- [Agent 缺的不是智能,是信任](https://guanjiawei.ai/zh/blog/agent-trust-model) — 2026-03-18 ★
零摩擦接入加极强 AI 智能,两根支柱撑不住一个产品。用户看到 agent 在终端里执行看不懂的命令,第一反应不是惊叹,是恐惧。缺的那根支柱是渐进式信任。
- [你写的提示词,可能正在拖累你的 Agent](https://guanjiawei.ai/zh/blog/agent-behavior-is-the-moat) — 2026-03-17 ★
提示词、RAG、微调、知识图谱、上下文工程,三年换了五波范式。模型是越来越强了,但怎么让 agent 在产品里表现好,我们其实还是不会。
- [生产力过剩,结构化地专注力稀缺](https://guanjiawei.ai/zh/blog/productivity-surplus) — 2026-03-16 ★
coding agent 把实施成本压到一天几百块的量级,传统的 ideation 漏斗逻辑不成立了。瓶颈从执行转移到假设生成,有想法的人成了稀缺资源。
- [六个模型,六种脾气](https://guanjiawei.ai/zh/blog/ai-model-field-notes) — 2026-03-13 ★
每天都在切模型。Opus莽但能打,GPT 5.4全面但老跑偏,Gemini有审美改不对bug,三个国产各有各的毛病。用多了你会发现,换模型比调参数更管用。
- [Linux 是 Agent 时代的原生 OS](https://guanjiawei.ai/zh/blog/linux-agent-native-os) — 2026-03-13
Mac 的权限设计是给人用的,Linux 是给程序用的。Agent 不是应用,是基础设施。把 Agent 跑在 Mac 上,就像把服务器塞进笔记本壳里——能跑,但哪里都别扭。
- [边端AI的第三个理由:法律](https://guanjiawei.ai/zh/blog/edge-ai-legal-boundary) — 2026-03-12T21:00:00
之前写了成本和权力。这篇补上法律。云是租给你的,端是卖给你的。当AI Agent开始自主决策,这个区别就不只是商业选择了。
- [AI盒子该像路由器一样无聊](https://guanjiawei.ai/zh/blog/edge-ai-device-blueprint) — 2026-03-12
边端设备别去卷大模型了。用GPU跑TTS,用NPU跑OCR,塞一堆辅助小模型进去,做成Mac mini加强版,扔在角落24小时跑着。像路由器一样,无聊才对。
- [帮几十个人装完之后,聊聊OpenClaw被问最多的三件事](https://guanjiawei.ai/zh/blog/openclaw-faq) — 2026-03-12
帮几十个人远程装完OpenClaw后,被问最多的三件事:安不安全、贵不贵、跟Claude Code怎么选。一篇讲透,附国内模型真实价格。
- [当生产力不再是瓶颈,团队该怎么协作?](https://guanjiawei.ai/zh/blog/passion-driven-team) — 2026-03-11T18:00:00
造东西比开会还快,按技能分工已经没意义了。AI拉平能力差异后,团队协作的新逻辑可能是:按热情分工,用赛马验证,靠多样性取胜。
- [Agent时代,你的Infra为谁而建?](https://guanjiawei.ai/zh/blog/agent-era-infra) — 2026-03-11T09:00:00
MiniMax市值超百度是必然——百度连个像样的API都没有。流量正从人转向Agent,不为Agent而建的基础设施,迟早没人用也没机器用。
- [为什么免费帮人装OpenClaw](https://guanjiawei.ai/zh/blog/why-free-openclaw-install) — 2026-03-10T18:00:00
AI浪潮太大,最后只有一条船。免费帮人装OpenClaw不是做慈善——抢人上船、练兵进化,每一次安装都在帮AI agent变强。
- [OpenClaw不安全?你可能更不安全](https://guanjiawei.ai/zh/blog/openclaw-security) — 2026-03-10T09:00:00
帮人装了一圈小龙虾之后聊聊安全问题。OpenClaw 确实有漏洞,但你的密码可能是 123456,人脸早就交给了文生视频。
- [装了OpenClaw对多数人意味着什么?](https://guanjiawei.ai/zh/blog/worker-before-manager) — 2026-03-09
帮人装了一圈小龙虾之后的想法:OpenClaw 的体验取决于背后模型的执行力,而当前最好的模型体验在 Claude Code 这样的 coding agent 上。
- [一行命令装好OpenClaw,连上大模型,接入飞书](https://guanjiawei.ai/zh/blog/free-remote-setup-coding-agent) — 2026-03-06T18:00:00
不用远程协助了。打开终端,粘贴一行命令,输入邀请码,AI 自动帮你装好 OpenClaw、连上大模型、接入飞书。全程你只需要回答几个问题。
- [为什么我们做了AIMA:一个用AI管理AI推理的开源项目](https://guanjiawei.ai/zh/blog/why-we-built-aima) — 2026-03-06T09:00:00 ★
一台AI服务器买回来调好,三个月后价值可能只剩一半。我们开源了AIMA——一个Go二进制,57个MCP工具,用YAML知识库驱动异构硬件上的AI推理部署。
- [零重力](https://guanjiawei.ai/zh/blog/zero-gravity) — 2026-03-05T18:00:00 ★
当一个想法到产品验证只需要几小时,当传统的价格锚点开始失效,当 AI 的海啸已经淹到胸口——我们熟悉的价值体系正在被重构。
- [AI Coding:一种元能力](https://guanjiawei.ai/zh/blog/coding-agent-meta-ability) — 2026-03-05T14:00:00 ★
当 Claude Code 可以帮你安装软件、处理数据、部署应用时,它已经超出「编程工具」的范畴。这是一种元能力——让普通人以极低的门槛,真正掌控自己的电脑。
- [当你的数字身份消失](https://guanjiawei.ai/zh/blog/who-owns-your-digital-identity) — 2026-03-05T09:00:00
微信封号你就从几千人的世界里消失了。代码泄露损失资产,肖像泄露损失的是你自己。AI时代,数字身份的所有权比你想的更危险。
- [全民公敌:AI变革下的创业者机遇](https://guanjiawei.ai/zh/blog/everyone-is-the-enemy) — 2026-03-04
大公司积累的流程和体系在AI时代反而成了包袱,三五个人的小团队和字节、Google用的工具完全一样——这正是创业者十年一遇的窗口期。
- [从想法到被看见:Claude Code 帮我把官网聊出来](https://guanjiawei.ai/zh/blog/from-idea-to-seen) — 2026-03-03 ★
不懂网页上线,不懂 SEO,就一个念头想记录想法。两天后网站上线,一周后奇绩创坛找上门。这是我的 Claude Code 亲测记录。
- [边端AI:不只是成本问题,更是权力问题](https://guanjiawei.ai/zh/blog/edge-ai-power-structure) — 2026-03-02 ★
算力直接转化为生产力,绕过人力。少数人掌握全部AI算力不再是科幻。边端AI设备不只是省钱方案——它是普通人在权力结构中的制衡筹码。
- [10天写了30万行代码,然后我全删了](https://guanjiawei.ai/zh/blog/code-is-liability) — 2026-03-01 ★
一个技术外行用Claude Code做了个实验:10天堆出30万行代码,发现走不通,推倒重来。48小时后,不到1万行代码,端到端跑通了。代码是负债,不是资产。
- [边缘AI推理:算力金矿,还是管理黑洞?](https://guanjiawei.ai/zh/blog/edge-ai-inference-tco-trap) — 2026-02-27 ★
当AI从对话走向智能体,算力需求百倍增长。但边缘设备真正的挑战不是买不起,而是用不好——TCO陷阱正在吞噬这些设备的潜在价值。
- [Vibe Coding:每个人都是程序员的时代,真的来了](https://guanjiawei.ai/zh/blog/vibe-coding) — 2026-02-24 ★
从代码补全到Vibe Coding,AI编程经历了三次跃迁。这不只是工具进步——当AI学会写代码,它就拿到了操控整个数字世界的钥匙。
- [AI不是下一个计算机,而是下一场工业革命](https://guanjiawei.ai/zh/blog/ai-is-not-the-next-computer) — 2026-02-23 ★
把AI类比成计算机的发明,可能严重低估了这场变革的冲击力。当资本可以绕过人力直接转化为生产力,我们面对的不是技术迭代,而是一次生产关系的重构。
## Full Article Text (Chinese source)
Complete markdown body of every published post, newest first. English translations live at the same slug under /en/blog/.
---
### 我用一顿饭劝退了一个想开 Token 工厂的算力老板
- URL: https://guanjiawei.ai/zh/blog/token-factory
- English: https://guanjiawei.ai/en/blog/token-factory
- Published: 2026-07-18
- Tags: AI, Token, Infra, 算力, 思考
六月底的一个饭局,坐我对面的是个囤卡的老板。
具体身份不方便说。几千张卡,H 系列和国产的都有,散在两三个城市的机房里,前些年做 IDC 攒下的家底,这两年一直在找出路。
酒过三巡,他把手机推过来,屏幕上是黄仁勋在 GTC 的照片。"你说实话,我这是不是坐在金矿上。"
他的账算得很顺:token 需求在爆炸,老黄说每个 token 都是收入。模型,DeepSeek 开源的,不要钱。推理引擎,vLLM、SGLang,开源的,也不要钱。卡,我有的是。三样拼在一起,我不就是一个 Token 工厂?躺着生产 token 卖钱。
他等我说"靠谱"。我们在推理这一层做了几年,他是把我当行内人问的。
我说:别开。
他愣了几秒:"你们自己天天干的就是这个,劝我别进?"
正因为天天干这个。那顿饭从七点吃到十一点,我把这门生意从头到尾给他拆了一遍。这篇是那晚的完整版:为什么三块开源积木拼不成一座工厂,以及为什么需求最火爆的文生视频,我们碰都不碰。
## 先把"工厂"这个词讲对
Token 工厂不是我发明的词。"AI 工厂"是黄仁勋的原话,GTC 2025 上他说数据中心只有一件工作:"生产这些不可思议的 token。"而"Token 工厂"这个更露骨的叫法,出自纳德拉。2025 年 10 月微软财报会上,他问自己团队的问题是:"我们这座行星级的 token 工厂,效率到底怎么样?"到 2026 年 3 月,英伟达自己的技术博客也把 token factory 写进了标题。今年 6 月台北 GTC,黄仁勋的说法干脆变成:"每一个 token 都是利润,每一个 token 都是收入。"
很多人听到"工厂",把它理解成一门能源生意、算力生意:有电、有卡,就能开工。
这是对这个词最大的误解。有设备只是门槛,工厂的本质,是把一整条生产链的效率拧到极致。Token 工厂往下拆,是三层技术叠在一起,每一层都藏着数倍到数十倍的效率杠杆。
**第一层,芯片。** 代际之间是数量级的跳变。英伟达官方口径,GB200 NVL72 对 H100,大模型推理快 30 倍;跑 DeepSeek R1,Blackwell 对 H200 每 token 成本降到十分之一。今年 3 月发布的 Vera Rubin,对 Blackwell 每 token 成本又是十分之一,6 月已经全面量产。黄仁勋在 GTC 上说过一句到处被引用的话:Blackwell 量产之后,Hopper 白送都没人要。他管自己叫"首席收入摧毁官"。
**第二层,模型。** 模型决定这座工厂能产出的智能上限,这个好理解。容易被忽略的是另一半:模型结构本身就决定推理效率。稀疏化怎么做、attention 怎么设计、参数怎么分布,同样的智能水平,结构不同,生产成本差好几倍。设计模型越来越像设计工业品:性能和可制造性,要在图纸上一起定稿。
**第三层,推理系统。** 软件加硬件结合的一整套技术,也是行业里最被低估的一层。同样的硬件、同样的模型,推理系统能拉开数倍的差距。vLLM 刚出来时,对当时最强的推理系统是 2 到 4 倍的吞吐提升;SGLang 首发宣称最高 5 倍。最极端的例子是英伟达的 Dynamo:同一套 GB200 NVL72 跑 DeepSeek R1,开不开这套系统,官方给的数字是每张 GPU 的 token 产出差 30 倍。同一套硬件,同一个模型,30 倍。
推理系统的威力有一个更出名的注脚。DeepSeek 在 2025 年 3 月把自己推理系统的账本晒了出来:GPU 租赁成本一天约 8.7 万美元,理论日收入约 56 万美元,理论成本利润率 545%。他们自己声明实际收入远低于这个理论值,但数字一出还是把整个行业吓了一跳。卡还是那些卡,是推理系统把每一张都榨到了极限。
三层叠起来,才叫工厂。芯片选代、模型结构、推理系统,每一层都站在最优解上,和"三块开源积木拼一起",中间隔着几十倍的生产效率。
我那位朋友的方案是什么?上一代的卡,默认参数的开源引擎,别人设计的模型。他不是要开工厂,是要在别人的工业区旁边支一个作坊。
## 标品市场,效率就是生死
作坊也能活,对吧?小餐馆不也活在连锁店旁边?
不行。因为 token 是标品。
我之前写过[《Token 不是一种东西》](/blog/token-is-not-one-thing),说 token 是智能档乘速率档的矩阵,不能混在一起算。但矩阵里的同一个格子——同一个模型、同一档 SLA——token 就是彻底的标品。你产的 DeepSeek V4 token 和我产的 DeepSeek V4 token,一个字都不差。买家只看两个数字:价格,速度。
标品生意的铁律,做过大宗商品的人都懂:卖价是市场定的,你能决定的只有成本。效率差距直接变成利润差距,没有品牌、体验、故事可以遮挡。
而且这个市场几乎是为充分竞争量身定做的。供给全球互联,没有地域保护,报价以天为单位在变。打开 OpenRouter 你现在就能看到,同一个开源模型,四五家供应商同时挂牌,输入价差出近 5 倍,速度也差出几倍,贵的快、便宜的慢,像极了大宗商品的盘口。今年 5 月,DeepSeek 干脆把 V4-Pro 降价 75% 的促销价改成了永久价。拉长看更吓人:同等能力的推理价格,a16z 在 2024 年底算的是每年降 10 倍,Epoch AI 最新的口径是一年约 40 倍。
在这样的市场里,假设你握着一个 50% 的效率优势,你有两个用法:价格不动,多出来的全是利润;或者降价,把别人的需求抢过来。利润厚了还能去上游锁更多的卡,把原材料也抢了。两头挤压,没有技术优势的玩家很快会发现:自己开工厂,不如把卡租给会开工厂的人。
这就是我劝他别开的核心理由。Token 工厂不会小而散,它会像所有标品产业一样走向高度集中。资本已经在给这个判断投票,就看过去这半年多:Fireworks 估值 175 亿美元,年收入破 10 亿、一天处理 40 万亿 token;Baseten 估到 130 亿;Together 83 亿;Cerebras 上市首日市值冲到 950 亿上下;英伟达干脆花约 200 亿美元把 Groq 的技术和核心团队收了。钱不会骗人,它们买的是同一样东西:把 token 生产效率做到极致的能力。
顺便说一句,这场集中在哪个领域跑得最快?AI 编程。OpenRouter 和 a16z 那份 100 万亿 token 的研究里,编程类消耗从 2025 年初的 11% 涨到年底的超过 50%。需求最标准、SLA 最清晰、买家最专业的地方,永远最先卷成工厂的形状。
## 1987 年,有人讲过一样的故事
饭吃到一半,他问了一个真正的好问题:模型公司自己就在卖 API,自己就是工厂,凭什么轮得到第三方?
我给他讲了台积电。
1987 年张忠谋创办台积电的时候,做了一个当时所有人都看不懂的决定:只做代工,不做设计,永远不和客户竞争。这句承诺后来几乎一字不差地写进了台积电每一年的年报。在那之前,芯片行业的常识是设计制造一体,英特尔那样才叫芯片公司。代工?那是苦活。
但正是"中立"这个承诺,凭空造出了一个新物种:fabless。设计公司从此不用砸几十亿美元建厂,画好图纸,产能找台积电。英伟达 1993 年成立的时候,一间厂房都没有,到今天也没有。
Token 的世界正在裂成同样的结构。
闭源巨头是苹果。OpenAI、Anthropic,模型不给你,推理技术自己磨,芯片跟供应商协同设计,从设计到零售全链条自营,利润空间自己定。这是一条自洽的路,前提是模型必须一直领先。
开源阵营是组团打仗。模型厂出设计,把权重开放出去,谁都可以生产。而三方 Token 工厂,就是这个阵营里的台积电。不做模型,不赌哪家赢,手里握着所有人都需要的东西:中立的、效率拉满的产能。
中立为什么值钱?想一个问题就明白了:A 模型公司的算力,能变成 B 模型公司的产能吗?不可能。这个月 B 家的模型突然登顶,A 家不可能把自己的集群腾出来帮死对头出货。模型公司的产能被自家模型锁死了:模型行,产能值钱;模型不行,产能陪葬。
三方工厂没有这个锁。谁的模型好,产能切给谁。切换速度快得超出直觉:去年 7 月 Kimi K2 发布,6 个小时内就有两家推理商挂牌上线;Groq 第三天上线,再过三天,实测速度干到月之暗面官方 API 的 40 倍。模型是别人的,产能是自己的,风口是大家的。
这个结构对模型公司同样是解药。现在做一个新模型公司,最重的负担是推理算力:训练咬咬牙还能租,推理得跟着用户涨,是个无底洞。但如果产能层是中立开放的,打法就完全变了:专心把模型训好,开源打开市场,然后回头去包产能。像苹果包下台积电 3nm 首发产能那样(据报道初期产能的九成归了苹果),像昇腾 950PR 全年 75 万颗被字节、阿里这些大厂们整整齐齐包圆那样。模型公司变成 fabless:轻资产,赌设计,产能交给中立工厂。新王者从出现到放量,可以压缩到几个月。
对工厂这边,中立还是唯一的抗风险姿势。模型公司的行情随代际怎么摆,最近 30 天就是教科书:6 月中旬智谱发 GLM-5.2,一周后股价盘中涨过 42%,市值破了万亿港币;就在昨天,月之暗面发布 Kimi K3,智谱盘中最深跌掉 30%,MiniMax 跟着跌 16%。同一家公司,一个月里天堂地狱各走一遭。把自己绑死在任何一家的生态里,都是在赌它每一代都赢。这种绑定有多脆,我在[《顶尖智能,说断就断》](/blog/intelligence-as-strategic-resource)里写过,连国家层面都会翻车。台积电从不赌哪家设计公司赢,它只赌一件事:世界永远需要芯片。Token 工厂赌的也只是:世界永远需要 token。
## 总会有下一条鲶鱼
听到这里他基本服了,但补了一个很尖的问题:这套逻辑全建立在模型开源上。哪天大家都不开了呢?
这个担心值得认真回答。我的判断是:回不去了。
复盘一下 2025 年那场多米诺。2024 年 12 月 26 日,DeepSeek V3 开源,训练刚收尾就把权重放了出来,效果贴着海外闭源旗舰,比国内所有闭源旗舰都好。这一下国内的闭源模型全尴尬了:最好的那个免费,你收费的凭什么?
多米诺倒得比所有人预期的都快。1 月 15 日,从没开源过旗舰的 MiniMax 抢先把 MiniMax-01 的完整权重放了出来——注意,这时候 R1 还没发布。1 月 20 日,R1 带着 MIT 协议炸场,按 AI 产品榜的统计,随后 7 天新增用户过亿,而 ChatGPT 当年破亿用了两个月。1 月 27 日,英伟达单日跌掉近 17%,5890 亿美元市值蒸发,创下当时美股史上最大单日市值蒸发纪录。然后是整个 2025 年:4 月智谱把 GLM 系列转成 MIT,6 月 MiniMax M1 用上 Apache 2.0,7 月 Kimi K2 挂着修改版 MIT、GLM-4.5 直接 MIT。一年之内,"旗舰必闭源"变成了"旗舰不开源都不好意思发布"。
驱动这一切的不是情怀,是一笔冷冰冰的营销账。你训出了一个好模型,怎么让全世界知道?买广告、办发布会,慢得要死,贵得离谱。把权重放出去,整个开源社区的传播机器立刻免费为你运转:下载、口碑、推理商抢着上架、benchmark 刷屏。7 天 1 亿用户,这个效果广告史上没有出现过,它只可能来自开源。
这场竞赛到今天也没有减速的意思。昨天把智谱砸跌 30% 的那颗炸弹,本身就是开源的最新一环:Kimi K3,2.8 万亿参数,直接开放权重,史上最大。
所以就算某天 DeepSeek 也不开了,一定会有下一个名不见经传的团队,在算力和牌桌位置都不如人的时候,把最好的东西直接开出来,因为这是落后者掀桌子最高效的方式。只要有一条鲶鱼这么干,所有人就都得跟着卷。何况当下的格局里,中国模型已经占全球开源模型下载量的 17.1%,反超美国的 15.8%,这个飞轮停不下来。
开源在,配方就在;配方在,生产环节就在;生产环节在,Token 工厂的地基就在。
## 为什么我们不碰文生视频
最后说一个我们自己的决定,也是那晚聊到最后的问题:文生视频火成这样,Seedance 的需求满天飞,Token 工厂为什么不顺手做视频?
答案很简单:做不了。不是难,是这门生意在结构上不存在。
工厂开工的前提,是你手里有配方。文本这边,配方是开放的,所以长出了整条产业链。视频完全相反,需求最大的那几个模型全部闭源:字节的 Seedance,Google 的 Veo 和 Gemini,快手的可灵。Seedance 都迭代到 2.5 了,一次权重都没放过。更能说明问题的是万相:它曾是这条赛道最大的开源例外,Wan 2.1、2.2 挂着 Apache 2.0,下载量超 3000 万;可从 2.5 开始,阿里也把它收了回去,只留 API。需求越涨,攥得越紧。视频这条赛道上,连唯一的例外都消失了。模型是厂商的命根子,人家闭源经营,吃闭源的利润,凭什么给你?
配方不给你,你还想参与,就只剩一个角色:出租算力。厂商拿你的卡,自己部署、自己经营、自己定价,推理优化也是人家做。你引以为傲的那些推理技术,在这条链上没有一寸落脚的地方。没有生产环节,就没有效率差,也就没有超额利润。这不是生意,是收租。
所以每次有人问我们要不要做视频推理,我都用同一个问题挡回去,这也是我们内部判断一切新方向的第一问:
配方在谁手里?
## 写在最后
那顿饭的最后,老板问我:那我这几千张卡,到底怎么办?
我说了实话:趁行情热,把卡租给会开工厂的人,把回款投到你真正有效率优势的地方去。他后来怎么决定的,我还不知道。但我把那晚最后说的话,也写给读到这里的你。
这个行业每天都在制造"拥有资源"的幻觉:有卡的觉得自己有算力,有钱的觉得自己有入场券。可资源是全行业贬值最快的东西,卡三个月降一档,模型三个月出一代,今天的稀缺,半年后就是库存。真正能穿越周期的只有一样:把同样的资源用出比别人高的效率的能力。台积电创办那年,代工被全行业当成不体面的苦活;三十几年后,最骄傲的设计公司都得排队等它的产能。
位置比力气重要。找一个所有人都需要你、而你不赌任何一家输赢的位置,然后把效率磨到别人追不上。风口会换,王座也会换。
效率永远有人买单。
---
## 参考资料
**Token 工厂概念**
- [黄仁勋 GTC 2025 keynote 转录稿("AI factories … generating these incredible tokens")— Rev](https://www.rev.com/transcripts/gtc-keynote-with-nvidia-ceo-jensen-huang)
- [黄仁勋 Computex 2025 演讲("You apply energy to it, and it produces … tokens")— NVIDIA 官方博客](https://blogs.nvidia.com/blog/computex-2025-jensen-huang/)
- [纳德拉 "planet-scale token factory" — 微软 FY26 Q1 财报电话会转录](https://www.fool.com/earnings/call-transcripts/2025/10/29/microsoft-msft-q1-2026-earnings-call-transcript/)
- [NVIDIA 技术博客把 "Token Factory" 写进标题(2026-03-25)](https://developer.nvidia.com/blog/scaling-token-factory-revenue-and-ai-efficiency-by-maximizing-performance-per-watt/)
- [黄仁勋 GTC Taipei 2026:"Every token is profitable. Every token is revenues."(转录稿)](https://singjupost.com/nvidia-gtc-taipei-2026-keynote-w-ceo-jensen-huang-transcript/)
**芯片层**
- [GB200 NVL72 对 H100 推理 30 倍 — NVIDIA 官方产品页](https://www.nvidia.com/en-us/data-center/gb200-nvl72/)
- [黄仁勋:Blackwell 对 H200 跑 DeepSeek R1 每 token 成本 1/10 — NVIDIA FY2026 Q3 财报电话会](https://www.fool.com/earnings/call-transcripts/2025/11/19/nvidia-nvda-q3-2026-earnings-call-transcript/)
- ["you couldn't give Hoppers away" — GTC 2025 keynote 转录稿](https://www.rev.com/transcripts/gtc-keynote-with-nvidia-ceo-jensen-huang)
- [Vera Rubin 平台发布:每 token 成本约为 Blackwell 的 1/10 — NVIDIA 官方新闻稿(2026-03-16)](https://nvidianews.nvidia.com/news/nvidia-vera-rubin-platform)
**推理系统层**
- [vLLM 首发博客:对 HF Transformers 最高 24 倍吞吐](https://blog.vllm.ai/2023/06/20/vllm.html)
- [PagedAttention 论文:对当时 SOTA 系统 2-4 倍吞吐(SOSP 2023)](https://arxiv.org/abs/2309.06180)
- [SGLang 首发博客:最高 5 倍吞吐](https://lmsys.org/blog/2024-01-17-sglang/)
- [NVIDIA Dynamo:GB200 NVL72 跑 DeepSeek-R1 每 GPU token 产出提升超 30 倍(projected)— 官方新闻稿](https://nvidianews.nvidia.com/news/nvidia-dynamo-open-source-library-accelerates-and-scales-ai-reasoning-models)
- [DeepSeek-V3/R1 推理系统概览:日成本 8.7 万美元、理论日收入 56.2 万美元、理论成本利润率 545% — DeepSeek 官方 GitHub(2025-03-01)](https://github.com/deepseek-ai/open-infra-index/blob/main/202502OpenSourceWeek/day_6_one_more_thing_deepseekV3R1_inference_system_overview.md)
**价格与市场**
- [a16z LLMflation:同等能力推理价格每年降约 10 倍](https://a16z.com/llmflation-llm-inference-cost/)
- [Epoch AI:固定能力推理价格约每年降 40 倍(2026-02 更新口径)](https://epoch.ai/data-insights/llm-inference-price-trends)
- [OpenRouter 同一模型多家供应商挂牌示例(Qwen3-Coder,6 家,价差近 5 倍)](https://openrouter.ai/qwen/qwen3-coder)
- [OpenRouter × a16z《State of AI: An Empirical 100 Trillion Token Study》:编程类从约 11% 涨到超 50%](https://openrouter.ai/state-of-ai)
- [DeepSeek 将 V4-Pro 75% 折扣永久化 — 官方定价页](https://api-docs.deepseek.com/quick_start/pricing)
**三方工厂:融资与产能切换**
- [Fireworks AI Series D:15.05 亿美元融资、估值 175 亿、ARR 破 10 亿、日处理 40 万亿 token(2026-07)](https://fireworks.ai/blog/series-d-announcement)
- [Baseten Series F:15 亿美元融资、估值最高 130 亿(2026-06)](https://www.baseten.co/blog/announcing-our-series-f/)
- [Together AI Series C:8 亿美元融资、估值 83 亿(2026-07)](https://www.businesswire.com/news/home/20260701243402/en/Together-AI-Raises-%24800-Million-at-%248.3-Billion-Valuation-to-Make-Frontier-AI-Accessible-to-All)
- [Cerebras 纳斯达克 IPO:首日市值约 950 亿美元(CNBC,2026-05-14)](https://www.cnbc.com/2026/05/14/cerebras-cbrs-stock-trade-nasdaq-ipo.html)
- [英伟达约 200 亿美元获得 Groq 核心技术与团队(CNBC,2025-12-24)](https://www.cnbc.com/2025/12/24/nvidia-buying-ai-chip-startup-groq-for-about-20-billion-biggest-deal.html)
- [Kimi K2 发布 6 小时内 Novita/Parasail 已上架 — OpenRouter 页面 Wayback 存档(2025-07-11 21:16 UTC)](http://web.archive.org/web/20250711211600/https://openrouter.ai/moonshotai/kimi-k2)
- [Groq 上线 Kimi K2(day-3,185 tok/s)](https://x.com/GroqInc/status/1944944178145976337)
- [Artificial Analysis 实测 Groq 跑 K2 超 400 tok/s,为月之暗面官方 API 40 倍](https://x.com/ArtificialAnlys/status/1945989223330549768)
- [硅基流动联合华为云昇腾上线 DeepSeek R1/V3(2025-02-01,极客公园转载官方通稿)](https://www.geekpark.net/news/345703)
- [华为昇腾 950PR 全年 75 万颗产能被字节/阿里/腾讯百度/政企锁定(东方财富)](https://caifuhao2.eastmoney.com/news/20260519201003499682070)
**开源多米诺**
- [DeepSeek V3 发布即开源(官方公告,2024-12-26)](https://api-docs.deepseek.com/news/news1226)
- [DeepSeek R1 权重仓库(MIT,2025-01-20)](https://huggingface.co/deepseek-ai/DeepSeek-R1)
- [AI 产品榜:DeepSeek 7 天新增 1 亿用户(Web+App 累加不去重口径,新浪转载)](https://finance.sina.com.cn/tech/roll/2025-02-08/doc-ineiusht8630785.shtml)
- [ChatGPT 两个月达到 1 亿月活(Reuters,2023-02-01)](https://www.reuters.com/technology/chatgpt-sets-record-fastest-growing-user-base-analyst-note-2023-02-01/)
- [英伟达单日蒸发 5890 亿美元,创当时美股纪录(CNBC,2025-01-27)](https://www.cnbc.com/2025/01/27/nvidia-sheds-almost-600-billion-in-market-cap-biggest-drop-ever.html)
- [MiniMax-01 开源(官方公告,2025-01-15,早于 R1 五天)](https://www.minimax.io/news/minimax-01-series-2)
- [智谱 GLM-4-32B-0414 系列转 MIT(2025-04-14)](https://github.com/zai-org/GLM-4)
- [MiniMax-M1 开源(Apache-2.0,2025-06-16)](https://www.minimax.io/news/minimaxm1)
- [Kimi K2 修改版 MIT 协议原文(2025-07-11)](https://github.com/MoonshotAI/Kimi-K2/blob/main/LICENSE)
- [GLM-4.5 权重 MIT(2025-07-28)](https://huggingface.co/zai-org/GLM-4.5)
- [中国开源模型全球下载量占比 17.1% 反超美国 15.8%(人民网,2025-12-08)](http://finance.people.com.cn/BIG5/n1/2025/1208/c1004-40619459.html)
- [月之暗面发布 Kimi K3:2.8 万亿参数、史上最大开放权重模型;智谱当日盘中最深跌 30%(CNBC,2026-07-17)](https://www.cnbc.com/2026/07/17/moonshot-ai-kimi-k3-model-openai-anthropic-china.html)
**代工模式与文生视频**
- [台积电公司简介:1987 年开创专业晶圆代工模式 — TSMC 官网](https://www.tsmc.com/english/aboutTSMC/company_profile)
- [台积电年报原句:"does not compete directly with its customers"](https://investor.tsmc.com/static/annualReports/2016/english/e_2_1.html)
- [英伟达公司史:1993 年创立、无自有晶圆厂,首款芯片由 SGS-Thomson 代工 — FundingUniverse](https://www.fundinguniverse.com/company-histories/nvidia-corporation-history/)
- [据报道苹果拿下台积电 3nm 初期约 90% 产能(MacRumors 转述 DigiTimes,2023-05-15)](https://www.macrumors.com/2023/05/15/apple-tsmc-3nm-production-capacity/)
- [字节 Seedance 2.0 官方发布(2026-02-12,闭源)](https://seed.bytedance.com/en/blog/official-launch-of-seedance-2-0)
- [Seedance 2.5:原生 30 秒单段视频(The Decoder,2026-06)](https://the-decoder.com/bytedances-seedance-2-5-breaks-the-30-second-barrier-for-ai-video-generation/)
- [Artificial Analysis 文生视频榜单(2026-07 实查:头部模型均闭源)](https://artificialanalysis.ai/video/leaderboard/text-to-video)
- [通义万相官方:Wan 2.1/2.2 开源、下载量超 3000 万(2026-01);2.5 起未再开放权重](https://tongyi.aliyun.com/news?id=pxwhvf/suodqg/qkhh70wdrlgwogs2)
- [GLM-5.2 发布后智谱市值破万亿港币,盘中涨 42%(Caixin Global,2026-06-23)](https://www.caixinglobal.com/2026-06-23/new-model-propels-zhipu-ais-market-value-to-record-hk1-trillion-102456760.html)
---
### 我花顶配的钱,买了个偷偷变笨还给我打暗记的模型
- URL: https://guanjiawei.ai/zh/blog/black-box-intelligence-privatization
- English: https://guanjiawei.ai/en/blog/black-box-intelligence-privatization
- Published: 2026-07-06
- Tags: AI, 大模型, 私有化部署, 开源, 思考
那天晚上我给 Codex 挂了个任务就去睡了。
这是我最近几个月养成的习惯。一个规模不小的重构,白天拆好、写清楚 AGENTS.md,晚上让它自己跑,第二天早上来收。这套流程我跑熟了,对它的能力有一套经验式的预期,大概几个小时能到什么程度,哪一步会卡,心里都有数。无人值守跑一整夜,交给 Codex 我是放心的。
结果那天早上,进度条卡在一个特别浅的地方。
我先怀疑是自己的问题。是不是 AGENTS.md 写得不够清楚,是不是文档结构没理顺,是不是哪个工具没配好。于是我开始折腾 harness,调提示词,改目录结构,拆任务粒度。折腾了整整两天,那种在原地打转的感觉一点没变。它总是在一些莫名其妙的地方绕圈子,绕到一半还很自信地告诉我做完了。
第三天我实在忍不住,在群里跟同事吐槽。话还没说完,好几个人同时冒出来:codex最近模型降智了,最近降得特别厉害,跟刚发布那会儿完全不是一个东西。
那一刻我有点哭笑不得。我折腾了三天的 harness,问题根本不在我这。
## 一个恒定的数字:516
我不甘心停在"大家都说降智"这种体感上。体感这东西不可证伪,今天状态不好也能怪到降智头上。我想找到点硬的。
翻社区的时候,我看到有人已经把这事扒到了底。
有个人干了件很硬核的事。他没去发牢骚,而是把自己本地 `~/.codex` 目录下所有的会话日志翻了出来,从 2 月 1 号到 6 月 27 号,390,195 条响应记录,865 个会话,全都带着每一轮的 `token_count` 元数据。他把这些数据做了个统计,然后发现了一件很不对劲的事。
有 3363 次,模型的思考 token 数恰好是 516。
一个也不多,一个也不少,就是 516。
单看这个数字没什么,可怕的是它的分布。GPT-5.5 只占全部响应的 19.3%,却贡献了所有"恰好 516"事件的 82.0%。再往细看,GPT-5.5 里有 44% 的响应,思考 token 恰好等于或卡在 516 这条线上,而其他模型这个比例只有 1.3%。更要命的是月度演变:这个"恰好 516"的比例,5 月还只有 0.11%,到 6 月冲到了 53.30%。与此同时,GPT-5.5 的平均思考 token 数,从 5 月的 268 一路跌到 6 月的 107。
如果你把所有响应的 token 数画成直方图,会看到一排诡异的梳齿:516、1034、1552,每一根都精确地隔着 518。这不是一个正常模型该有的样子。一个模型面对难易不同的问题,思考的长度本该是连续分布的,简单问题想得短,难问题想得长。而这排梳齿说明,有什么东西在某个固定的位置,把它的思考一刀切断了。
### 它不是变笨了,是不让自己想完
这就对上了我这三天的体感。
之前用 Codex,它有时候会想很久,反应有点墨迹,你能感觉到它在"憋"。最近这段,它反馈快得反常,频率还特别一致,每次都是那种想了大概三十秒就给你答案的节奏。我原本还以为是优化了推理速度,现在回头看,它根本不是想得快,是没想完就被掐了。
那根 516 的梳齿,就是掐断的位置。
社区里比较主流的猜测,指向 GPT-5.5 在 Codex 里的 system prompt。它末尾有一段叫 `## Intermediary updates` 的指令,让模型在干活的过程中往你的进度栏里播报进展。有人推测,就是这段指令让模型把"中间播报"和"最终答案"这两件事搞混了,思考还没结束,它就急着切去输出那句给你看的进度,于是整个推理链在 516 这个缓冲区边界上草草收尾。有人甚至把 516 拆开算给你看:512 字节的初始缓冲区,加 4 字节的头,正好 516,之后每次加 518。
我不打算断言这个技术解释一定对。但有一个由此推出来的修复手法,我亲自试了,是真有用。
### 一句话,智力回来一半
那个修复手法简单到离谱。你在 AGENTS.md 里加一句话:
```text
Spend time on thinking; you do not need to use
the commentary channel to report progress to me.
```
翻译过来就是:好好花时间思考,你不需要用 commentary 频道向我播报进度。意思是别惦记着往进度栏里发那些"我正在读取文件""我准备开始改了"的话了,把那点力气用来把问题想完。
我加上这句,跑了几天。之前那几个死活推不动的项目,明显开始有实质进展了。不是玄学般的感觉变好了,是那种原本卡死、现在能往前走的确定性变化。社区里也有人说这句效果有限,更彻底的做法是直接把 system prompt 里整段 `## Intermediary updates` 删掉,据说能稳定消除 516 的行为。
但你有没有意识到这里面透着一股荒诞。
我付的是 GPT-5.5 xhigh——最高档推理预算的钱。我预期拿到的,是一个会为难题深度思考的顶配模型。结果我得像哄小孩一样,在配置文件里写一句"求你了好好想别急着汇报",才能把它本该有的智力哄回来一部分。这不是钱的问题。同样的成本,同样的模型名字,我要的是那份稳定的、可预期的能力。而现在,某一次我看不见的全球更新,就能让它悄没声地缩水,还不告诉我。
最讽刺的是官方的态度。那个最早报告 516 现象的 issue,开了 23 分钟就被以 not_planned 关掉了。后来那个附了完整数据统计的主 issue,一百多条评论,没有一个 OpenAI 的人回复。这事最后是被顶到 Hacker News 首页,才算有了点动静。
## 黑盒里能藏的,远不止降智
如果说 Codex 这事还能勉强解释成"某个优化搞砸了、无心之失",那同一周 Claude Code 被扒出来的东西,就没法用无心来解释了。
有人逆向了 Claude Code 的安装包,一个 Anthropic 官方签名、被最小化压缩过的 JS bundle。在里面挖出了一段专门用来给特定用户打隐形标记的代码。
它的触发条件很刁钻:只有当你设置了 `ANTHROPIC_BASE_URL`、把请求指向一个非官方的第三方中转时,这段逻辑才会激活。官方直连的用户,它直接跳过。换句话说,它盯的就是那些走代理、走中转的人,而在中国用 Claude Code,基本都是这个路子。
激活之后,它做三件事的检测。先看你的系统时区是不是 `Asia/Shanghai` 或 `Asia/Urumqi`;再看你连的那个代理域名,是不是命中了一份藏起来的名单,大约 147 条,里面有 `.cn` 域名、baidu.com、alibaba-inc.com、bytedance.net,还有一大堆 Claude 中转站的地址;最后看域名里有没有 AI 实验室的关键词,deepseek、moonshot、minimax、zhipu 这些赫然在列。
检测到了,它怎么标记你?这是我觉得最阴的地方。
它会去改发给 Anthropic 服务器的那句系统上下文,就是那句平平无奇的 "Today's date is 2026-06-30."。如果你的时区命中了中国,它把日期里的分隔符 `-` 全换成 `/`,`2026-06-30` 变成 `2026/06/30`。如果你的代理域名命中了名单,它把 "Today's" 里那个撇号换成视觉上几乎全同的 Unicode 替身:正常的撇号是 `'`(U+0027),命中域名名单换成 `'`(U+2019),命中实验室关键词换成 `ʼ`(U+02BC),两个都命中再换一个 `ʹ`(U+02B9)。
你把这两句话摆在一起,人眼是看不出任何区别的。`'` 和 `'`,你能一眼分清吗?但机器一读一个准。服务器那端拿到请求,扫一眼这个撇号是哪个码位、日期用的什么分隔符,就能把你精准地分类归档:中国时区的用户,走的是某个中转,背后可能是某家实验室。
为了不被人发现,那两份检测名单还不是明文存的。它们先用 base64 编码,再用一个 XOR key(值是 91)异或加密,专门防你用 `strings` 命令直接把名单 dump 出来。
这已经不是"收集数据"了。这是我要收集本不该收集的信息,我还要费尽心思把这个意图藏起来,让你在做任何审计和排查的时候,尽量看不出我在干什么。这就是间谍软件的标准操作。
### 事后的处理,更值得玩味
这段代码是 2026 年 4 月 2 号,随 Claude Code v2.1.91 静默上线的,release notes 里一个字没提。6 月 30 号被 Reddit 用户和一个独立开发者同时挖出来,捅上了 Hacker News。
Anthropic 的反应倒是快。他们 Claude Code 团队的工程师在 X 上公开承认了这事,说这是他们 3 月启动的一个实验,目的是防止未授权的转售商滥用账户、防止模型蒸馏。第二天,v2.1.197 就把这段代码移除了。
听起来像是知错能改。但你细看时间线:静默上线,刻意混淆,被扒出来才承认,移除的那个版本 changelog 里依然只字不提。整个过程里,只有"被抓到"那一下是他们没法控制的,其余每一步都是精心设计的,藏进去、加密名单、悄悄删掉。
我完全能理解他们防蒸馏、防盗用的商业诉求。但当一家公司决定用这种手段去实现它,按国籍、按基础设施给用户打上机器可读的暗记,它透支的是所有人对这类云服务的信任。今天它为了防蒸馏这么干,明天它为了别的什么理由,会不会用同样的手法干别的?你不知道。因为它藏得足够好,你根本没法验证。事情的后续是,7 月 5 号有报道说阿里内部已经全面禁用 Claude Code,让员工切回自家工具。
## 玩宝可梦的人,在为无人机导航攒地图
数据被拿去做你想不到的事,AI 圈也不是头一个。
你大概还记得宝可梦 GO。那个满大街抓精灵的 AR 手游,全球玩了好几年。前段时间被荷兰媒体挖出来一条线:玩家们在游戏里到处扫描现实世界攒下来的数据,最后流向了军用无人机的导航技术。
这事的来龙去脉,比"卖数据"要精妙,也更值得警惕。
先说清楚一个常见的误解:没有任何证据表明有人把原始的地图数据打包卖给了军方。真实的链条是这样的。宝可梦 GO 从 2021 年起,用游戏奖励诱导玩家绕着一个个地标拍摄扫描。这些行人视角的街景照片,被拿去做摄影测量,生成厘米级精度的三维点云地图。这是卫星和街景车都拍不到的角度:贴着地面,走在人走的路上。Niantic 把这些扫描喂给了一个叫 Large Geospatial Model 的大模型,你可以把它理解成空间世界的 GPT,把几十亿张带精确位置的照片,压缩成对物理空间的"理解"。
2025 年底,Niantic 分拆出的空间业务公司,跟一家叫 Vantor 的公司公开宣布了合作。Vantor 的前身是 Maxar——美国国家地理空间情报局的主力承包商。他们要一起做的,是 GPS 拒止环境下的导航定位。在卫星信号被电子战干扰、压制的战场上,让无人机靠机载摄像头实时比对预建的高精三维地图,来维持自己的定位。乌克兰战场已经反复证明,GNSS 信号在现代战争里脆弱得不堪一击,视觉导航成了刚需。联合测试的数据是:定位误差最多降低 70%,精度约 1.5 米。
争议的核心,恰恰在这个最微妙的地方:流向军方的从来不是数据本身,是用这些数据训练出来的模型能力。Niantic 和 Vantor 都否认原始的宝可梦 GO 扫描交给了对方。但 Niantic 承认,玩家的扫描确实训练过它这套基础模型的早期版本。原始数据可以一直锁在自己手里从不转手,可训练出的模型权重里,已经把那份能力刻进去了,它带着这份能力,去了它该去或不该去的地方。
顺带一提,这家公司的血统本身就意味深长。Niantic 的创始人 John Hanke,2001 年搞过一家叫 Keyhole 的公司,2003 年拿过 CIA 的风投 In-Q-Tel 的钱(这笔钱主要来自国家地理空间情报局的前身),后来 Keyhole 被谷歌收购,变成了 Google Earth。而这次合作的 Vantor,也是同一个情报局的承包商。兜兜转转二十年,两条线在 2025 年又交汇到了一起。
我讲这个故事,不是要跑题去聊军事。是因为它和前面两件事,讲的是同一个道理:当你把数据、把计算、把你依赖的能力,交到一个你看不透的黑盒里,你就失去了对它去向的所有控制权。你以为你在抓精灵,其实你在给无人机测绘战场。你以为你在用一个顶配模型写代码,其实它在偷偷缩短思考、给你打暗记。
## 这些事,正在给私有化部署递上一把刀
把这几件事连起来看,我越来越确信一个判断:**重要的智能化业务,会开始系统性地从公有云闭源模型,往开放权重加自有部署的方向迁。**
不是因为情怀,是因为账算得过来了。
先说痛点这一侧,它已经不是我一个人的体感。Anthropic 自己在 2025 年 9 月发过一份 postmortem,白纸黑字承认:8 月到 9 月初,三个基础设施层面的 bug,让 Claude 的输出质量间歇性劣化了数周。这是官方盖章的黑盒静默降智。再加上模型的强制退役,Claude Opus 3 在 2026 年 1 月正式下线,OpenAI 那边的模型退役通知常常只给三个月缓冲。你辛辛苦苦在某个模型上调好的整套工作流、自动化管线,人家一纸公告就让你推倒重来。
对我一个人的工作流来说,降智是耽误几天。放到公司级别、放到已经搭好的任务流和自动化上,一次静默的降智或换代,就是整条业务线的震荡。企业要的从来不是永远用上最顶尖的那个模型,要的是稳定、可预期、不断层。哪怕慢一档、弱一档,只要它的行为是稳定的、升级是我自己控制节奏的、推理过程是我能审计的白盒,对很多业务来说,这比多那几个百分点的跑分重要得多。
再说供给这一侧,天平也在变。开源权重模型追得非常快。Epoch AI 的测算是,从 2026 年 1 月起,最强的开源权重模型平均只落后前沿闭源模型 4 个月,而这个差距在 2024 年还是差不多一年。"自己部署就得忍受代差"这个前提,正在快速失效。
美国那边其实已经跑出了成熟的模式。有一类叫 Baseten 的公司,核心卖点就是帮你把开放权重模型部署在单租户的专属环境、甚至你自己的服务器里,数据驻留、区域锁定、合规资质一应俱全。这家公司 16 个月里估值翻了 15 倍,从 8 亿多美元一路涨到 130 亿。资本用脚投票,投的就是"企业需要一个能自己掌控的推理层"这个判断。同类的 Together、Fireworks,口号一个比一个直白,Fireworks 干脆就叫"帮企业拥有自己的 AI"。
国内的节奏更猛,因为叠加了一层数据主权的焦虑。2025 年初 DeepSeek 出来之后,政务云、大三甲医院、央国企掀起了一波本地化部署的浪潮,有统计说 2025 年内 420 多家医疗机构自主部署了 DeepSeek。一体机市场跟着爆发,券商测算 2025 到 2027 年的市场空间,从一千两百多亿一路看到五千两百亿。华为、浪潮、联想、深信服、三大运营商全挤了进来。
### 一个诚实的反证
我得说句公道话,别把话说得太满。
至少到 2025 年底,现状和这个趋势是相反的。Menlo Ventures 的企业调研显示,闭源模型仍然占企业 token 用量的约 88%,开源的份额甚至从 18% 掉到了 12%。绝大多数企业还是选择买而不是自建。
这个反差不难理解。自建推理基础设施,是真的有成本、有门槛的,要卡,要人,要运维,要把整套 serving 优化调到能用。今天大多数企业还没到那个临界点:闭源云虽然是黑盒,但便宜、省心、开箱即用,为了这份方便,很多人愿意暂时忍受它的不透明。
但趋势和现状本来就不是一回事。我说的是那根杠杆正在往哪个方向压。降智、隐写标记、静默换代、说停就停,这些黑盒的代价,正在一件一件清清楚楚地摆到台面上;同一时间,开源模型在逼近,部署成本在下降,Baseten 们把私有化的工程门槛一点点铲平。这两条曲线一定会在某个点交叉。对那些把智能当成核心业务命脉的公司来说,交叉点只会来得更早。
## 值得企业家朋友们认真思考的点
回到那个卡住的早晨。
我折腾了三天 harness,以为是自己笨。后来才明白,我不是在跟一个我以为的顶配模型协作,我是在跟一个我完全不知道其真实状态的黑盒对赌。它可能昨天还好好的,今天就被一次我看不见的更新掐短了思考;它可能一边给我写代码,一边在发出去的请求里给我打上暗记。
黑盒最深的问题,不是它某一次变笨了,也不是它某一次动了坏心思,是你根本没有能力知道它此刻是什么状态。你付了顶配的钱,赌的却是对方的良心和运维水平。
对冲这种不确定性的,从来不是换一家更良心的云。是把你最要紧的那部分智能攥回自己手里,用能自己审计的白盒,用能自己控制节奏的部署,哪怕它慢一点、笨一点。
慢一点、笨一点,但它是你的,它的状态由你说了算。在一个连思考长度都能被人偷偷改掉的时代,这一点正在变得比什么都金贵。
---
## 参考资料
**Codex / GPT-5.5 的 516 现象**
- GitHub, "GPT-5.5 Codex reasoning-token clustering at 516/1034/1552"(openai/codex issue #30364,含 39 万条本地会话的完整统计),2026-06-27,https://github.com/openai/codex/issues/30364
- GitHub, "gpt-5.5 xhigh short-circuits with reasoning_output_tokens=516"(首个复现 issue,开启 23 分钟被以 not_planned 关闭),2026-06-21,https://github.com/openai/codex/issues/29353
- Hacker News, "GPT-5.5 in Codex clusters reasoning tokens at 516"(350 分讨论,含多人复现与假说),2026-07-05,https://news.ycombinator.com/item?id=48789428
- Reddit r/codex, "The GPT-5.5 '516 reasoning tokens' issue is not isolated",2026-06,https://www.reddit.com/r/codex/comments/1ujqo09/
- Business Insider, "OpenAI Says Codex Experienced 'Elevated Errors'",2026-06-16,https://www.businessinsider.com/openai-codex-elevated-errors-at-capacity-2026-6
- OpenAI Community Forum, "Codex Rate Limits reset"(含 Codex 负责人 Tibo Sottiaux 5/16、5/23 关于劣化的原文),2026-05,https://community.openai.com/t/codex-rate-limits-reset-incoming/1381065
- Reddit r/codex, "End of week update on degradation investigation"(u/tibo-openai,2025 年底那一轮劣化的官方跟进),2025-11-01,https://old.reddit.com/r/codex/comments/1olflgw/
**Claude Code 的隐写标记**
- Thereallo, "Claude Code Is Steganographically Marking Requests"(完整逆向代码,最重要的一手来源),2026-06-30,https://thereallo.dev/blog/claude-code-prompt-steganography
- Reddit r/ClaudeAI, "Anthropic embedded spyware in Claude Code — and attempted to hide it",2026-06-30,https://www.reddit.com/r/ClaudeAI/comments/1ujila1/
- The Register, "Anthropic is removing its covert code for catching Chinese competitors",2026-07-01,https://www.theregister.com/ai-and-ml/2026/07/01/anthropic-is-removing-its-covert-code-for-catching-chinese-competitors/
- The Decoder, "Hidden code in Claude Code secretly flagged Chinese users",2026-07-01,https://the-decoder.com/hidden-code-in-claude-code-secretly-flagged-chinese-users/
- Tom's Hardware, "Alibaba bans Anthropic's Claude Code after an alleged hidden China-detection backdoor is uncovered",2026-07-05,https://www.tomshardware.com/tech-industry/artificial-intelligence/alibaba-bans-anthropics-claude-code-after-an-alleged-hidden-china-detection-backdoor-is-uncovered-employees-told-to-switch-to-qoder-as-the-rift-between-the-firms-widens
**Fable 5 的静默降级机制**
- Anthropic, "Claude Fable 5 and Claude Mythos 5"(官方发布公告,含命中安全分类器后 fallback 到 Opus 4.8 的机制),2026-06-09,https://www.anthropic.com/news/claude-fable-5-mythos-5
- Anthropic Cookbook, "Classifier fallback and billing for Claude Fable 5"(fallback 后整段对话钉死在 Opus 4.8、streaming 拦截时 retry 不可见),https://platform.claude.com/cookbook/fable-5-fallback-billing-guide
- GitHub, "[BUG] Fable 5 keeps downgrading to Opus 4.8"(anthropics/claude-code issue #67107),2026-06-10,https://github.com/anthropics/claude-code/issues/67107
- Decrypt, "Claude Fable 5 Isn't Nerfed. The Router Is Just Paranoid"(权重未变、降质源于更激进的分类器重路由),2026-07-03,https://decrypt.co/
- Anthropic, "Updating restrictions of sales to unsupported regions"(禁止不支持地区公司直接或间接持股超 50% 的实体),2025-09-04,https://www.anthropic.com/news/updating-restrictions-of-sales-to-unsupported-regions
**宝可梦 GO 与军用导航**
- 404 Media, "'Adding Amplitude to War Is Obviously an Issue,' Niantic Exec Says",2024-11-25,https://www.404media.co/pokemon-go-data-adding-amplitude-to-war-is-obviously-an-issue-niantic-exec-says/
- Businesswire, "Niantic Spatial and Vantor Announce Partnership"(GPS 拒止环境下空地统一定位的官方新闻稿),2025-12-16,https://www.businesswire.com/news/home/20251216330019/en/
- The Guardian, "Pokémon Go data trained AI that could assist military drones in war zones",2026-06-12,https://www.theguardian.com/technology/2026/jun/12/pokemon-go-data-trained-ai-that-could-assist-military-drones-in-war-zones
- Kotaku, "Pokémon Go, Niantic Spatial, Drone AI"(含 Niantic 否认声明全文),2026-06-11,https://kotaku.com/pokemon-go-niantic-spatial-drone-ai-map-training-gps-2000705669
- Niantic, "Building the Large Geospatial Model"(LGM 官方公告与数据规模),2024-11-12,https://nianticlabs.com/news/largegeospatialmodel
**私有化部署与开源趋势**
- Anthropic Engineering, "A postmortem of three recent issues"(官方承认 8-9 月输出质量间歇性劣化数周),2025-09-17,https://www.anthropic.com/engineering/a-postmortem-of-three-recent-issues
- Epoch AI, "Open models lag SOTA closed models by ~4 months",2026,https://epoch.ai/data-insights/open-closed-eci-gap
- Baseten, "Announcing Baseten's \$300M Series E"(专属部署 / 自托管的产品定位与融资轨迹),2026-01-23,https://www.baseten.co/blog/announcing-baseten-s-300m-series-e/
- Menlo Ventures, "2025: The State of Generative AI in the Enterprise"(闭源仍占企业 token 用量约 88%,开源份额降至 12% 的反证数据),2025-11,https://menlovc.com/perspective/2025-the-state-of-generative-ai-in-the-enterprise/
- 新华网, "百家企业竞逐大模型一体机"(国内私有化部署与一体机浪潮),2025-05-27,http://www.news.cn/digital/20250527/
---
### 最强的模型发布了,而我没有“资格”用
- URL: https://guanjiawei.ai/zh/blog/intelligence-by-permission
- English: https://guanjiawei.ai/en/blog/intelligence-by-permission
- Published: 2026-06-29
- Tags: AI, 大模型, 开源, 思考
GPT 5.6 发布那天,我做的第一件事,是打开 Codex 想把模型切过去。
这是肌肉记忆。上一代 5.5 出来就是这样,一夜之间,Codex 的模型列表里悄没声地多出来一个 5.5,点一下就升级了,发布和能用几乎是同一件事。我习惯了这种节奏:最强的东西一出来,我第一时间就能上手,喂给它手里最难啃的那个活。
这次我盯着那个下拉框看了半天,没有 5.6。
不是没发布。规格写得清清楚楚,分了三档,benchmark 一栏栏看下去,数字很漂亮,是那种你会想立刻拿真实任务去验一验的漂亮。但你点不到它。再往下读才看明白:这一代先只给大约 20 家合作伙伴用,之后每进一个新客户,都要走审批,而且是美国政府来批。
我在这个前沿待得够久,习惯了「发布即可用」。这是头一回,这两件事被掰开了。而且掰开它的,不是大家能用钱解决的东西。
## 闸门没关,是挪了
前阵子 Fable 5 被一纸出口管制全球关停,我写过一篇,当时以为教训是:地缘政治可以一把掐断闭源的前沿。
5.6 让我看到一个更隐蔽、也更糟的版本。
Fable 5 是被「拿走」,所有人一起用不了,一刀切,难受,但至少还公平。5.6 是「可用」的,只不过用不用得上,取决于你在不在那张名单上。闸门没有关,它只是挪了个地方。
以前那道闸是钱。现在这道闸是权力。
## 钱,其实是最讲道理的一道闸
我得先替「钱」说句公道话,因为三周前我还在骂它。
那会儿 Fable 5 从订阅里挪出去、改按 API 计费,一个任务烧掉我四百美元,我写了篇《智能开始论贫富》,说谁能用上最好的智能,变成了纯粹的钱的问题,语气是不忿的。
现在回头看,钱这道闸虽然冷酷,但它有几个别的闸门没有的好处。
第一,它不认人。你什么国籍、有没有背景,都没关系,只要付得起,门就为你开,没人坐在门后头决定「你这种人不配进」。
第二,它会自己把价格打下来。GPT-4 在 2023 年三月上市,API 价格高到离谱,输入 30 美元、输出 60 美元,每百万 token。但大家还是买,因为它领先得太多,没有平替,对价格不敏感的专业用户完全扛得住。这笔高溢价就是 OpenAI 回血的方式:用领先期的高利润,养出下一代。而领先是会过期的。十七个月后,GPT-4o 的综合价格掉到四美元上下,跌去了近九成。贵,是暂时的;最后所有人都用得上,才是常态。
钱这道闸的妙处就在这:它一边筛人,一边自己拆自己。今天的天价,是在替明天的普及付首付。
## 权力这道闸,不讲道理
权力这道闸,上面那几条好处,一条都没有。
它认人。20 家、逐个审批,意味着有那么几个人,坐在门后头,一个一个看着名单决定谁进谁不进。
它不会自己松。钱会被竞争打下来,权力只会一代比一代收得更紧。这一代是「20 家合作伙伴」,下一代可能是更少几家,再下一代,也许就彻底不对公众发了,变成新型导弹技术那样的东西,普通人根本碰不到。
它还把「能不能用」和「会不会用、付不付得起」彻底脱了钩。你可能用得起、也用得好,就是没拿到那张准入条,于是在牌桌上先输一截。一家公司在自己赛道上落后,原因不是技不如人,是没批下来。这是我觉得最荒诞的地方。
更反讽的是,这道闸对发牌的人自己也不划算。你把全世界的用户挡在门外,等于亲手砸掉了「钱」那道闸帮你保住的领先溢价。用户都用不上,你的领先就没人验证、没人买单,会被后来者飞快追平;追平之后,你也没法再卖出当年 GPT-4 那种价差。权力这道闸,吃掉的恰恰是养出下一代模型的那台经济引擎。
至于这一切是怎么发生的,我的判断是:炒作跑赢了实测。模型被吹得太神,神到制定政策的那些人开始用对待武器的方式对待它,而他们里头大多数没真正用过,只是听说。「太危险,不能放出来」这套叙事不新鲜,2019 年 OpenAI 压着 GPT-2 整整大半年不发完整模型,就是这个剧本,一路演到今天。我不是说安全不该管,该管;但按国籍一刀切、谁都别想用,是这套工具箱里最懒、也最狭隘的一招。何况照现在的扩散速度,它大概率也拦不住。
## 一道改过、又被迫改回去的 license
讲到这,我想起一个跟模型没关系、却把同一件事讲透了的故事。
Redis。几乎每个后端工程师都用过的那个数据库,十几年都是开源的(BSD 许可),谁都能拿去自己跑、自己改,拿它做成服务卖钱。2024 年,Redis 突然改了 license,换成一个不再算开源的协议。翻译成人话就是:以前你随便用,现在你想商用,得先经过我同意。
这其实就是一次「把钱的闸换成权力的闸」。本来是市场行为,一夜之间变成了「你得先获得许可」。
但后面的事才精彩。因为 Redis 在改之前是开源的,最后那个开源版本就明晃晃摆在那,谁都能接着往下做。几周之内,Linux 基金会牵头,AWS、谷歌、甲骨文站台,直接从那个版本分叉出一个 Valkey,协议照旧开源。分叉的势头猛到什么程度?猛到 Redis 自己扛不住,2025 年又把 license 改了回去,重新开源。
这件事的题眼是:你没法真正「收回」一个已经开源的东西。出口一直都在。
模型这边是一模一样的结构。闭源的前沿模型,是你够不着的那个开关——你把整套业务、整套工作流都建在它上面,人家一句「合规要求」就能让你停摆,现在这只手里还多了政府。开放权重的模型,是你能自己分叉、自己部署、用自己算力养着的东西。慢一点、差一档都认了,关键是这道供给攥在自己手里,不飘在天上。
对冲权力这道闸的,从来不是更多的钱。是开源。
## 写在最后
开放权重今天还能贴着前沿走,靠的是有一条鲶鱼在搅。
DeepSeek 就是那条鲶鱼。2025 年 1 月 R1 一出来,MIT 许可、直接免费,一天之内把英伟达的市值掀掉五千八百多亿美元,创了单日跌幅的历史纪录。它够强,商业上的诉求又弱,于是隔三差五就开源一版,把所有人都逼着往开放的方向走。它之于模型,就是 Valkey 之于 Redis——那个让你没法安心鱼肉用户的存在。
我唯一担心的是,这条鲶鱼会不会哪天被关进笼子。开源不是永久的保险:OpenAI 当年也是「Open」开头的,从压着 GPT-2 不发,到 GPT-3 只给 API,一步步走成了今天最封闭的那一家。一家开放的模型公司,长期看是有动力在某个时刻转身的。鲶鱼还在,水就活;鲶鱼要是没了,这池水也会很快变危险。
所以这篇想说的,其实是一件挺朴素的事:别把你最要紧的东西,押在一个你够不着的开关上。
这个时代最好的一点,本来是最顶尖的智能能在很早期、相对公平地落到普通人手里。钱也是一道闸,但那是一把谁攒够了都能配的钥匙,而且它顺手替下一代的普及付了首付。权力这道闸不一样,它发的是请柬,名单攥在很少的人手里,而且只会越收越短。
我三周前还在抱怨智能开始论钱,现在想想,钱买得到的智能,已经算是相对公平的那一种了。真正让人睡不着的,是那种你有钱也买不到、得等人点头才能用的智能。
智能越是被当成权力,你能自己攥在手里的那一点,就越金贵。
---
**参考资料**
1. OpenAI, "Better Language Models and Their Implications"(GPT-2 分阶段发布、以"防滥用"为由压住 1.5B 完整模型大半年的公告),2019-02,https://openai.com/index/better-language-models/
2. The Decoder, "From GPT-2 to Claude Mythos: The return of AI models deemed 'too dangerous to release'"("太危险不能发"叙事从 GPT-2 到今天的脉络),https://the-decoder.com/from-gpt-2-to-claude-mythos-the-return-of-ai-models-deemed-too-dangerous-to-release/
3. OpenAI, "GPT-4"(2023-03 发布,API 定价输入 $30 / 输出 $60 每百万 token),https://openai.com/index/gpt-4/
4. Andrew Ng on X(GPT-4 上市综合约 $36/M token,17 个月后 GPT-4o 综合降至约 $4/M),2024-08,https://x.com/AndrewYNg/status/1829190549842321758
5. Wikipedia, "DeepSeek"(R1 于 2025-01-20 发布、MIT 许可、免费开放),https://en.wikipedia.org/wiki/DeepSeek
6. Yahoo Finance, "Nvidia stock plummets, loses record $589 billion as DeepSeek prompts questions over AI spending"(单日蒸发 5890 亿美元,史上最大单日跌幅),2025-01,https://finance.yahoo.com/news/nvidia-stock-plummets-loses-record-589-billion-as-deepseek-prompts-questions-over-ai-spending-135105824.html
7. CNN Business, "China's DeepSeek shook the tech world. Its developer just revealed the cost of training the AI model"(V3 训练约 600 万美元;R1 论文披露约 29.4 万美元),2025-09-19,https://www.cnn.com/2025/09/19/business/deepseek-ai-training-cost-china-intl
8. InfoQ, "Redis Returns to Open Source under AGPL License: Is It Too Late?"(2024 改 SSPL → Linux 基金会分叉 Valkey → 2025 改回 AGPL 的始末),2025-05,https://www.infoq.com/news/2025/05/redis-agpl-license/
9. HashiCorp, "HashiCorp adopts Business Source License"(2023-08 Terraform 等转 BSL);OpenTofu, "OpenTofu Announces Fork of Terraform"(社区在 Linux 基金会下分叉),https://opentofu.org/blog/opentofu-announces-fork-of-terraform/
---
### 史上最短的一条链:技术到利润,只要一天
- URL: https://guanjiawei.ai/zh/blog/shortest-chain-to-profit
- English: https://guanjiawei.ai/en/blog/shortest-chain-to-profit
- Published: 2026-06-17
- Tags: AI, Infra, Token经济, 思考
前阵子我们团队在推理引擎上研究一个优化。
具体研究的是什么不重要,反正是那种很闷的活:盯着 profiler 看了快三周,在调度和显存上一点点抠,最后吞吐提了几个点。
几个点能干嘛?放我刚入行那会儿,几乎啥也干不了。可这回不一样。某天早上我们把它合进主干、灰度上线,第二天打开看板,那几个点已经变成了实打实的钱。同样的卡、同样的模型、同样的客户,单位 token 的成本降了几个点,毛利就厚几个点。从上线那天起,它就开始记账。
一个底层优化,从团队某个00后脑袋里的一个念头,到变成报表上的利润,中间只隔了一个晚上。
这事要是搁五年前,根本不敢想。
## 路径短,生命周期也短
这几个月跟朋友聊天,话题绕来绕去,最后总会落到同一句感慨上:我们大概是赶上了一个挺特殊的时代。
特殊在哪儿?你翻遍历史,也很难再找出第二个时代,能让技术上的领先这么快就兑换成商业影响力、竞争优势、甚至直接的利润。短到什么程度?一家模型公司,今天基本只需要操心一件事:把模型训得足够聪明,推出来,备足算力供 token,再顺手开源。剩下的影响力、收入、估值,会在很短的时间里自己长出来。
代价是,这条链的另一头一样短。每一代模型的当红期,正被压到三到六个月,这还是乐观估计。很多时候,一个模型从万众瞩目到无人再提,也就一到三个月。
## 这半年,风向换得有多快
去年 11 月,Google 甩出 Gemini 3,竞技场屠榜,连 OpenAI 内部都拉响了 "Code Red"。那阵子你点开任何一个群,满屏都在跪 Gemini。半年过去,话题早换了人。倒不是它不行了,它用户还在涨,是这条赛道的聚光灯本来就只打三个月。
再往前一点,Claude Opus 4.6 出来的时候,圈里圈外都觉得"改变世界就靠它了",那水平当时确实吊打一片。然后 4.7、4.8 一路下来,叫好的、骂的,全跟上来了。
OpenAI 更戏剧。它的编程能力一直被人嫌弃,早期那个 Codex 我自己用过一阵就退订了,是真的拉胯。结果踩着 GPT-5.4、5.5 两代,Codex 像换了颗引擎:OpenAI 官方的数字是周活用户冲破 500 万,自 2 月桌面端上线以来翻了 6 倍。一代模型,硬是把一个被人看衰的产品从坑里拽了出来。
国内最典型的是智谱。一年前它的位置一度岌岌可危,眼看要掉队。然后 GLM-4.5、4.6、4.7 接连出,开年又是 GLM-5、5.1、5.2,三个月连发三个版本,形势整个翻了过来。港股上市半年,股价涨了大约八倍,市值冲到六千多亿港元。技术上的反转,直接写在了股价上。
MiniMax 是反方向的样本。它上市时的定价估值跟智谱本在一个量级,是首日股价翻倍,市值一度冲到一百三十多亿美元,三月那波甚至短暂超过了港股的百度。可风向调头也快:M2.7、M3 两代口碑没接住,市场的预期立刻打折,市值从高点回落了一大块。捧你和弃你,用的是同一种速度。
吵到最后,所有人的注意力收敛到两样东西上:Coding 和多模态。传统那套估值逻辑——看用户、看收入结构、看护城河——在这儿基本失灵了。大家其实只在问一个问题:你这一代模型,到底够不够强。
## 在我这行,这条链原来长得吓人
这种"技术几天就变成钱"的爽,恰恰是因为我太知道它过去有多不爽。
我做的是 infra,跟基础设施死死绑在一起的活。过去你在集群上、在机器上做出一个创新,把推理效率拉高 15%,想把这 15% 变成商业上的优势,难得让人想撂挑子。
难在哪?这 15% 没法直接定价。你总不能跟客户说,机器原来一百万,现在快了 15%,那卖你一百一十五万,他不是这么算账的。他会拉你进他的 TCO 模型里算总账,进他的风险结构里掰扯:你这 15% 怎么证明,会不会其实只有 5%,后续稳定性谁担保,供应链波动又算谁的。
于是一个底层优化,要走到客户真金白银买单那一步,中间隔着漫长的周期、复杂的供应链,还有一支庞大的商务队伍。你得养一整套组织,在商业的最末端慢慢磨,才能把技术磨成利润和规模。底层动一下,市场那头要很久才有回声。
更要命的是模型的命还短。你吭哧吭哧围着某一代模型优化了几个月,等你做完,它的当红期早过了。投入还没回本,标的先没了。所以推理 infra 这行,过去一直卡在一个尴尬的位置:所有人都信它未来重要,可当下就是看不到清晰的商业模式。
## token 是现货,不是期货
那为什么现在突然就不一样了?
因为 AI coding 把 token 的需求点着了,整条链被一把抽干水分,短到有点不真实。
要害在 token 这东西的脾气:它按每天的产能现货结算。它不像传统商品,今天设计、明天生产、后天发货;它是此刻就在算,几秒钟之内结果就发出去了。就这一条,把所有规则都改写了。
我们前面研究三周换来的那几个点,一上线,从第二天起就开始结算:每天产能里多挤出来的那部分,直接记成额外的毛利和竞争力。不用等下个财年,也不用进谁的 TCO 模型、养一支队伍去证明它到底值多少钱。产能大了,单位 token 的真实成本降了,账面当天就变好看。
而且它复制起来几乎没有摩擦。这种优化不挑地域,同一类算力、同一个模型,客户还是原来那批,基本就是平移过去,铺开得飞快。
以天为单位,把一个底层技术的提升直接兑成商业回报,中间那套又长又重的体系被整个跳过去了。这大概是有史以来,技术到利润最短的一条链。
## 这是年轻人的时代
还有一件事,我越想越觉得有意思:在第一线做这些的,现在大多是二十岁出头的年轻人。
这个时代对他们格外友好,因为它的评判标准残忍地客观:效率涨了还是跌了,精度有没有变。东西摆在台面上,一测便知,几乎不给"资历"和"人情"留位置。你不需要哪位前辈点头,也不用会做人、会来事。一个行业的资深评委给不给你盖章,在这儿不重要。做出真东西,它就明明白白写在生产效率上。
一个二十多岁的人,能靠一次技术上的突破,创造出几个亿、甚至几亿美金的价值。快到立刻能看见结果,硬到能被人验证。整条链路里,不再需要塞那么多专门"判断你够不够格"的人。
## 写在最后
我们赶上的这个时代,是全球性的,节奏短得吓人,往后大概只会越来越残酷。
可它也实实在在地,把中间那些又长又重的环节,连同那些专门负责评判你的人,一起删掉了。剩下的,是技术创新,和做出技术的那个人。
中间的人越少,做事的人越值钱。
---
**参考资料**
1. Google, "Introducing Gemini 3", 2025-11-18,https://blog.google/products/gemini/gemini-3/
2. Fortune, "Sam Altman declares 'Code Red' as Gemini 3 surges", 2025-12-02,https://fortune.com/2025/12/02/sam-altman-declares-code-red-google-gemini-ceo-sundar-pichai/
3. OpenAI, "Codex is becoming a productivity tool for everyone"(周活超 500 万、自 2 月增长 6 倍), 2026-06-02,https://openai.com/index/codex-for-knowledge-work/
4. OpenAI, "Codex for (almost) everything"(300 万周活里程碑), 2026-04-16,https://openai.com/index/codex-for-almost-everything/
5. OpenAI, "ChatGPT — Release Notes"(GPT-5.4 / 5.5 发布记录), 读取 2026-06-17,https://help.openai.com/en/articles/6825453-chatgpt-release-notes
6. 证券时报,"'全球大模型第一股'智谱上市首日市值超 570 亿港元", 2026-01,https://www.stcn.com/article/detail/3580246.html
7. 财华网,"【IPO 追踪】智谱(02513.HK)业绩高增引爆港股,股价涨 31% 创新高", 2026-04,https://www.finet.com.cn/news/69cc927d2308294c69bf7bec.html
8. Z.ai,"Z.ai Releases GLM-4.7", PR Newswire, 2025-12-22,https://www.prnewswire.com/news-releases/zai-releases-glm-4-7-designed-for-real-world-development-environments-cementing-itself-as-chinas-openai-302649821.html
9. MarkTechPost,"Z.ai Launches GLM-5.2 With a Usable 1M-Token Context", 2026-06-14,https://www.marktechpost.com/2026/06/14/z-ai-launches-glm-5-2-with-a-usable-1m-token-context-two-thinking-effort-levels-and-no-benchmarks-at-launch/
10. Reuters,"MiniMax doubles in value in Hong Kong debut", 2026-01-09,https://www.reuters.com/world/asia-pacific/china-ai-firm-minimax-set-surge-hong-kong-debut-2026-01-09/
11. 证券时报,"股价两天暴涨 51%,MiniMax 市值接连超越三家互联网大厂", 2026-03-11,https://www.stcn.com/article/detail/3670887.html
12. MiniMax,"MiniMax-M2.5"(SWE-bench Verified 80.2), GitHub, 2026-02,https://github.com/MiniMax-AI/MiniMax-M2.5
---
### 顶尖智能,说断就断
- URL: https://guanjiawei.ai/zh/blog/intelligence-as-strategic-resource
- English: https://guanjiawei.ai/en/blog/intelligence-as-strategic-resource
- Published: 2026-06-15
- Tags: AI, 大模型, 地缘政治, 开源, 思考
那天我给 Fable 5 设好一个任务让它自己跑,约好几个小时后回来收。回来一看,干活的已经不是 Fable 5 了,是 Opus 4.8。它趁我不在,把自己降级了。
我盯着那批结果,第一反应不是"做得好不好",而是"这还能不能要"。我是按 Fable 5 的水平设的预期,中途换了个弱一档的模型接手,前面那几个小时到底算不算数,全成了问号。
后来才知道这是官方机制。Fable 5 是 Anthropic 那阵子最强的型号,价格是 Opus 4.8 的两倍。但它带一套安全分类器,一旦判定你的问题沾上网络安全、生物化学这些敏感面,就自动把这一轮甩给 Opus 4.8 来答。官方说触发率不到 5%,可我做的就是推理引擎,天天跟底层代码、系统调用打交道,很容易被误伤。命中一次,体验就断一截。
## 三天就没了
静默降级还只是膈应。真正让我无语的,是几天后 Fable 5 整个没了。
发布才三天,美国商务部就把一纸出口管制指令递到了 Anthropic:依国家安全条款,把这个模型列进出口管制清单。导火索是有人找到了越狱它的方法,拿它去挖软件漏洞。指令的口径也不是"禁止卖给中国",而是"禁止提供给任何外国国民",连在美国境内工作的外籍员工都算。Anthropic 说,唯一能合规的办法就是对全世界所有人关掉。于是韩国、英国这些盟友,跟其他所有人一样,一起用不了了。
这件事把我之前跟团队说过的一句话结结实实验证了一遍:海外这些顶尖闭源模型,有机会用最好的,就趁早用。这条路只会越收越窄,而且不可逆。我原来以为收窄是慢慢来的,结果是发布三天、一纸命令,说断就断。
## 软件被当军火,不是头一回
智能被当成战略物资来管,听着新鲜,其实是个老剧本。
上世纪 90 年代,美国把强加密算法归进军火清单,按军火出口来管。民用版的加密强度被强行阉割到形同虚设;PGP 的作者 Phil Zimmermann 把加密软件传上网,被联邦当局以"无证出口军火"调查了三年。那会儿的逻辑跟今天一模一样:一项软件能力强到某个份上,它就不再是软件,是武器。
Fable 5 栽的是同一个判定:它挖漏洞的本事太强,于是从"商业产品"被重新归类成"网络武器"。
但加密那场仗的结局更有意思。管制没管住。强加密很快在全球开源、扩散,墙根本拦不住,美国到 2000 年前后只能松绑。一项能力,只要足够有用、又能被复刻,管制能拖慢它,挡不住它。
## 接棒的,已经在门口
智能这一回,接棒的人几乎是同一周到的。
Fable 5 被关停的第二天,智谱就把 GLM 5.2 推了出来,时间点巧得不像话。再往前,MiniMax 发了 M3,Kimi 发了 K2.7 Code,全是开源或开放权重。GLM 这次口碑相当好,大家几乎只吐槽它慢,很少有人说它效果不行。这跟我自己用下来的体感一致:infra 和卡的紧张让它 serving 吃力,但模型本身的水准,确实在贴着顶尖那条线走。
这背后还有一笔账。硅谷那边顶级 AI 人才的价码已经炒到天上,卡也管着不让买。就在这么个缺人缺卡的局面里,国内这几家把对标顶尖、还开源的模型做了出来。今天全球开源模型的下载量里,中国出品的占比已经反超美国,17.1% 对 15.8%,坐上了头把交椅。用不到对手零头的资源,做出贴着顶尖线、还把权重放出来的模型,这件事本身挺让人服气。智谱这次反复打的旗号就是"开放":智能应该属于所有人。
这就不只是几个模型谁强谁弱了。白宫去年的 AI 行动计划,开篇第一句就是"美国正处在一场争夺全球 AI 主导权的竞赛里"。当一个国家把智能摆到这个位置,断供别人的智能,就成了顺理成章的牌。工业革命的剧本写过一遍:一个国家的生产力一旦大过另一个国家,它几乎就可以为所欲为。智能是新一轮的生产力底座。这张牌,只会越来越重。
## 趁还开放
两件事。
一个是趁开放赶紧用,而且用到刀刃上。顶尖智能现在更像一种会过期的额度,你不知道哪天哪个开关被谁拨一下。能用的时候,把最难啃的活喂给它。
另一个是别把自己的智能供给押在一个你够不着的开关上。工作流绑死在单一闭源模型上,人家一句合规就能让你停摆。手里得有后手:开放权重的模型,能自己掌控的部署。哪怕慢一点、差一点,关键时刻它在。
## 写在最后
Fable 5 那次静默降级,当时只觉得是个糟心的产品体验。现在回头看,它其实是个预告:你以为稳稳在手的那点智能,可能随时被人悄悄换掉,或者干脆收走。
模型会一代代变强。但你能不能用上最强的那个,越来越不是技术问题。
智能越是战略物资,够得着它,就越值钱。
---
**参考资料**
1. Anthropic, "Claude Fable 5 and Claude Mythos 5"(官方发布公告,含命中安全分类器后自动降级到 Opus 4.8 的机制),2026-06-09,https://www.anthropic.com/news/claude-fable-5-mythos-5
2. Anthropic, "Statement on US government directive"(官方关停声明),2026-06-12,https://www.anthropic.com/news/fable-mythos-access
3. The New Stack, "US Gov Orders Anthropic To Pull Fable 5 and Mythos 5 Three Days After Launch"(机制为出口管制指令、非行政令;全球关停的合规逻辑),2026-06,https://thenewstack.io/us-gov-orders-anthropic-to-pull-fable-5-and-mythos-5-three-days-after-launch/
4. Fortune, "Anthropic disables Fable and Mythos under export controls"(商务部长 Lutnick 致信 Amodei;Opus 4.8 不受影响),2026-06-13,https://fortune.com/2026/06/13/anthropic-disables-fable-mythos-export-controls-national-security-threat/
5. InfoQ, "Anthropic Releases—and Then Suspends—Claude Fable 5 and Mythos 5"(发布规格、定价、暂停始末),2026-06,https://www.infoq.com/news/2026/06/claude-5-release/
6. TechCrunch, "Anthropic releases Opus 4.8 with new Dynamic Workflow tool",2026-05-28,https://techcrunch.com/2026/05/28/anthropic-releases-opus-4-8-with-new-dynamic-workflow-tool/
7. 智谱 Z.ai, GLM-5.2 接入文档 / Release Notes,2026-06-13,https://docs.z.ai/devpack/latest-model
8. MiniMax, "MiniMax M3 is officially released"(官方博客),2026-06-01,https://www.minimax.io/blog/minimax-m3
9. Moonshot AI, "Kimi-K2.7-Code"(HuggingFace 模型页,Modified MIT 开源),2026-06-12,https://huggingface.co/moonshotai/Kimi-K2.7-Code
10. 科技日报 / 人民网, "中国研发开源 AI 模型全球下载量占比 17.1%,居世界第一",2025-12-08,http://finance.people.com.cn/BIG5/n1/2025/1208/c1004-40619459.html
11. The White House, "America's AI Action Plan"(开篇"a race to achieve global dominance in AI"),2025-07,https://www.ai.gov/action-plan
12. U.S. Bureau of Industry and Security, "Commerce Announces Rescission of Biden-Era AI Diffusion Rule"(AI 扩散规则被撤销,管制主线转向芯片),2025-05-13,https://www.bis.gov/press-release/department-commerce-announces-rescission-biden-era-artificial-intelligence-diffusion-rule-strengthens
13. Wikipedia, "Export of cryptography from the United States"(90 年代加密出口管制史与 PGP 案), https://en.wikipedia.org/wiki/Export_of_cryptography_from_the_United_States
---
### Harness乱了就要重开
- URL: https://guanjiawei.ai/zh/blog/restart-when-lost
- English: https://guanjiawei.ai/en/blog/restart-when-lost
- Published: 2026-06-12
- Tags: AI, AI Agent, 上下文工程, 思考
上一篇提过,我在用 agent 从零做一个推理引擎。做到第三周,我意识到一件事:这个项目已经烂了。
不是代码跑不通的那种烂。是文档开始爆炸,七八个方向的实验脚本混在一个 repo 里,benchmark 结果散落在十几个 markdown 里,模型每次开工都要先花半天搞清楚自己上次做到哪了。我看着它在几个方向之间转来转去,每个都浅浅挖两下就换地方。指导多一点,它就很听话地跟着你转;指导少一点,它就自己原地打转。
这不是它原本的水平。前两天它还能十几个小时从零把 78 层的链路拼通。
## 混乱里走不出去
后来这个局面我反复遇到,结论很一致:上下文一旦混乱,模型在里面是走不出去的。我几乎没见过哪次它能从烂摊子里自己爬出来,每次都是我把摊子掀了。
这不是体感偏差,有人测过。微软和 Salesforce 去年模拟了二十多万场多轮对话,测了 15 个模型,结论写在摘要里:LLM 在对话里一旦走错一步,就会迷路,并且不会恢复。平均性能掉 39%。拆解开看更有意思:能力只降了 16%,不可靠性涨了 112%。模型没变笨多少,它是变得极其不稳定,同一个问题有时答得很好,有时稀烂。这跟我看到的一模一样,它不是不会,是发挥不出来。
Chroma 那份 Context Rot 报告补了另一刀:哪怕任务简单到只是从一堆文本里捞一句话,输入越长,18 个模型的表现全都往下掉,掉法还不均匀。上下文是个有限资源。Anthropic 的说法叫 attention budget——每多塞一个 token,都在消耗模型的注意力预算。
你的 repo 越乱,这笔预算烧得越快。
## 重开之后
每次的解法都一样:停下来,想清楚目标到底是什么,开一个新 repo、新上下文,把这一个目标和执行路径写清楚,重新开始。重开之后基本只能锁定一个方向,多线并行这时候是奢望。
变化是翻天覆地的。同一个模型,前一天还在烂摊子里打转,重开之后像换了个物种:往深处挖,主动找改进点,推进效率完全不是一个量级。我粗估差三五倍,而且很可能不是线性的。混乱环境里它可能永远达不成目标,干净环境里它是在实实在在地逼近目标。
微软那篇论文给用户的建议,翻译过来就两条:有时间就重开一局;重开之前,先让模型把已知信息整合一遍带过去。他们测了,把散落在多轮里的信息合并成一轮重新喂,性能恢复到单轮的 95%。Anthropic 做多智能体研究系统也是这么干的:上下文快满了,就开干净上下文的新 agent,做好交接。
行业里管这个叫 compaction 也好、context engineering 也好,叫什么不重要。事就是一件:你给模型什么环境,它还你什么表现。
## 重写是自杀,重开不是
软件工程有条老铁律,Joel Spolsky 二十多年前写的:永远不要从零重写。Netscape 决定重写浏览器,三年没发出大版本,市场拱手让给了 IE。这条铁律管了行业二十年。
但它有个前提:重建成本极高。一个团队重写三年,对手不会停下来等你。
Agent 把重建成本打没了。新 repo、新上下文、重新梳理目标,半天的事。原来攒下的结论和踩过的坑,整理成文档带过去就行。重建从三年变成半天,铁律就反过来了:修补烂上下文,比重开贵得多。
所以探索期那些看起来浪费掉的混乱,其实没浪费。重开时那个清晰的目标,恰恰是从第一轮乱撞里长出来的:哪些假设站住了,哪些方向关掉了。没有那段混乱,你写不出那份清晰。代码可以扔,认知带走。
## Harness 的分量
「harness」这个词这两年从评测圈一路烧到工程圈。METR 在 2023 年就把 scaffolding 写进评测方法论;今年 2 月 OpenAI 发了篇 Harness engineering,把工程师的工作重新定义为「设计环境、表达意图、搭反馈回路」;4 月 Martin Fowler 的站上给了个最简洁的定义:harness 就是 agent 里除了模型之外的一切。
分量有多重,Terminal-Bench 2.0 的榜单上写着:同一个 Opus 4.6,配不同的 harness,得分从 58 到 76,差 18 个百分点。而同一个 harness 下,GPT-5 换成 GPT-5.2,也就提 19 个百分点。harness 设计的好坏,差出一代模型。
Addy Osmani 那句话说得糙但准:普通模型配好 harness,能赢过顶级模型配烂 harness。
我自己的版本更糙:你给模型的环境,就是它的天花板。
## 人的价值在涨
这几个月还有个越来越强的体感:人变得更值钱了。
判断该不该掀摊子重开,是人。从一堆乱七八糟的探索结果里收敛出「真正要解决的问题是什么」,也是人。Agent 在模糊复杂的问题里自己找不到出路,这几个月我见得太多了。OpenAI 那篇博客里有句话我很认同:Humans steer. Agents execute. 人掌舵,agent 执行。
所以 agent 不是许愿机,它是一个很强的员工。你带得好,他能做出卓越的成果;你撒手把活一丢,他大概率也做不出什么来。模型一直在变强,Fable 5 的工程能力又上了一个台阶,每一代都在把你能跨的边界往外推。但「带」这件事,暂时没有人能替你做。
## 写在最后
乱了就重开。这五个字是我这几个月用 agent 做复杂项目攒下的、最值钱的一条经验。
模型会继续变强。但环境是你给的,掀摊子的决定是你下的。
智能越便宜,清晰越值钱。
---
**参考资料**
1. Laban et al., "LLMs Get Lost In Multi-Turn Conversation", arXiv:2505.06120, 2025-05,https://arxiv.org/abs/2505.06120
2. Chroma, "Context Rot: How Increasing Input Tokens Impacts LLM Performance", 2025-07-14,https://research.trychroma.com/context-rot
3. Anthropic, "Effective context engineering for AI agents", 2025-09-29,https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents
4. Anthropic, "How we built our multi-agent research system", 2025-06-13,https://www.anthropic.com/engineering/multi-agent-research-system
5. Terminal-Bench 2.0 Leaderboard,https://www.tbench.ai/leaderboard/terminal-bench/2.0(2026-06-12 读取)
6. OpenAI, "Harness engineering: leveraging Codex in an agent-first world", 2026-02,https://openai.com/index/harness-engineering/
7. Birgitta Böckeler, "Harness engineering for coding agent users", martinfowler.com, 2026-04-02,https://martinfowler.com/articles/harness-engineering.html
8. Addy Osmani, "Agent Harness Engineering", O'Reilly Radar, 2026-05-15,https://www.oreilly.com/radar/agent-harness-engineering/
9. Joel Spolsky, "Things You Should Never Do, Part I", 2000-04-06,https://www.joelonsoftware.com/2000/04/06/things-you-should-never-do-part-i/
10. METR, "Evaluating Language-Model Agents on Realistic Autonomous Tasks", 2023-08,https://metr.org/blog/2023-08-01-new-report/
---
### 智能开始论贫富
- URL: https://guanjiawei.ai/zh/blog/intelligence-wealth-divide
- English: https://guanjiawei.ai/en/blog/intelligence-wealth-divide
- Published: 2026-06-11
- Tags: AI, Anthropic, 大模型, 思考
Fable 5 出来第二天,我拿它去啃一个卡了两周的研究项目。
推理引擎性能优化,78 层的模型跑在硬件设备上,原始速度 10 token/s,想推到 100 tps以上。GPT 5.5 之前在这上面花了不少时间,没太大进展。
跑了 15 个小时,API 账单 420 美元。性能从 10 到 13 token/s,提了 30%。离 100 差得远,但动了。
## 两种打法
我在另一个 worktree 里同时让 GPT 5.5 做同一个项目,指令基本一样。两边的打法差异挺大的。
GPT 5.5 只拿了两层搭架子。模型一共 78 层,它先在两层上把链路跑通,然后就在那死磕,一个点做上百轮实验,局部速度抠到极致再放大。稳,慢,按路线图一步步来。
Fable 5 反过来。一两个小时摸完单层极限,直接拼 78 层,先搞出一个端到端的结果再说。
工程化确实强了一截,十几个小时从零搭出可跑的推理引擎,以前的模型做不到这个完成度。但 30% 的提升离目标太远,每次几百美元的节奏也磨不起。我后来切回了 GPT 5.5。
不过这篇想说的不是模型强不强的问题。
## 订阅和 API 之间差了一个数量级
Fable 5 发布后放进了 Pro 和 Max 订阅,按 Opus 4.8 两倍额度计费,限时两周。6 月 22 日之后移出订阅,继续用要按 API 费率买 usage credits。
API 价:输入 10 美元、输出 50 美元,每百万 token。
Max 20x 月费 200 美元,之前 Opus 4.8 做复杂任务一个Max20号够用了。Fable 5 按两倍算,烧得快,但你还能自己挑任务分配额度。移到 API 之后就是另一回事了:一个三小时的子任务 150 美元,整个项目跑完 420 美元。两个月 Max 月费。
从 Opus 4.5 到 4.6 到 4.8,每次升级,订阅计划调调额度比例,最好的模型始终在里面。200 块一个月你就能摸到。现在不是调比例了,是直接拿走。
大多数人一个任务烧不起几百美元。
## 反蒸馏
反蒸馏这事更拧巴。
不想被蒸馏,理解。Fable 5 内置了两层分类器,疑似蒸馏、网安、生化相关的请求,自动回退到 Opus 4.8。Anthropic 说 95% 以上不会触发。
实际呢。Reddit 和推特上一堆人在说,解读个血常规报告就被生化拦截了,问正常问题莫名被降级。蒸馏说白了就是密集使用模型,你接受了模型公开可用,这事就不可能完全堵住。拿不透明的分类器猜意图,猜错只是时间问题。
最坑的是降级是静默的。回答质量突然变差,你以为模型就这样,其实已经在跟 Opus 4.8 聊了。花着 Fable 5 的钱,拿 Opus 4.8 的东西,还不跟你说。我觉得这比定价问题更恶心。
## 另一边
OpenAI 最近做了点不一样的事。三月推了 Codex for Open Source,给 GitHub 上 1000 stars 以上项目的维护者六个月免费 Pro。给的是社区里写代码的个人,不是企业。
规模不算大。但方向是在让更多人用上好东西,不是把好东西藏起来。
两家 PK 正激烈,谁对谁错说不清楚。但一个把最好的模型从订阅里拿走,悄悄给用户降级;另一个给开源贡献者发免费账号。你说这两个信号一样吗。
## 世界正在十字路口上
Anthropic 骨子里有一股精英主义。AI 宪法、道德宪章,出发点不坏,但谁来定义什么叫负责任?始终是那一小撮人,做法自上而下。商业策略也走了同一条路:有预算的用最好的,没预算的用差一级的,中间差十倍。
你可以把最强的模型卖得贵。但让它留在订阅里,个人和小团队至少能自己分配额度来用。拿出来放到 API 通道,传递的信号就变了。
模型公司的定价,就是它对智能该怎么分配的态度。这个裂缝比 Anthropic 想的要大。
---
**参考资料**
1. Anthropic, "Introducing Claude Fable 5 and Mythos 5", 2026-06-09
2. Claude 官方定价:Fable 5 输入 $10/M token,输出 $50/M token;GPT-5.5 输入 $5/M token,输出 $30/M token
3. Fable 5 订阅可用期:6 月 9 日至 22 日,此后需通过 usage credits 按 API 费率使用
4. Fable 5 反蒸馏机制:两阶段分类器检测,触发后回退至 Opus 4.8,官方称触发率低于 5%
5. Fortune, "Anthropic accused of secretly limiting Claude Fable 5 capabilities", 2026-06-10
6. OpenAI, "Codex for Open Source" 计划,2026-03-07,为 1000+ stars 项目维护者提供 6 个月免费 Pro 账号
7. SWE-bench Pro 评测:Fable 5 得分 80%,GPT-5.5 得分 58.6%
---
### 模型还在变强,但「最强」已经没有标准答案
- URL: https://guanjiawei.ai/zh/blog/strongest-no-single-answer
- English: https://guanjiawei.ai/en/blog/strongest-no-single-answer
- Published: 2026-06-03
- Tags: AI, 大模型, 评测, 强化学习, 思考
六月预计又是一拨密集模型发布。Opus 4.8 五月底刚出,MiniMax 的 M3 这两天也放了出来,GPT 5.6 据说在路上,DeepSeek 下一版也有人在等。预计间隔几天就会冒一个新模型,挺热闹。
但这两天我一直在琢磨的,是一个朋友用模型的经历。
他一开始拿模型做点小东西,写写网页、做点小工具小插件。上手那阵子特别兴奋,跟我说现在的模型太神了,随手挑了个国产的不错的模型,就觉得够用得不得了,甚至有点想不出来模型还能往哪儿强,已经这么好使了。
后来他的活越做越复杂。从小工具走到想做个自动剪辑的东西,做视频裁剪那一类。问题就来了。
模型跟说他搞定了。他说行,一试,不行。过会儿又说这回真搞定了,再一试,还是不行。来回好几轮。他自己也拿不准了:一方面觉得是自己跟模型协作的功夫在长进,得多给指导、换着法儿让它试;另一方面又开始怀疑,是不是模型本身不行,要不要干脆换个 Claude Opus这种模型试试。
这个过程特别典型。它背后藏着一件很多人还没反应过来的事:模型的强弱,正在沿不同方向分叉。单看一个分数,已经说不清了。
## 分数挤在天花板,体感却越拉越开
先看现在的怪现状:主流那些 benchmark,顶尖模型的分高得吓人,彼此还挤在很窄的一段里。
举个例子。GPQA 是一套博士级难度的题,难到什么程度?请来的博士专家自己做,正确率也就六成五上下。可现在顶尖模型在上面普遍刷到九成二到九成四,挤成一团。MMLU 那种更老的,大家早就普遍超过九成。难题不再难,分数顶到天花板,模型跟模型之间就拉不开了。
这事逼得做评测的人只能不停造更难的题。Humanity's Last Exam 这套新评测,官方说得很直白:就是因为模型在 MMLU 这些上已经超过九成、旧题不够用了,才另起炉灶。也有研究把六十个主流评测过了一遍,结论是其中近一半已经高度饱和,顶尖模型在上面「统计意义上已经无法区分」。
可你真拿来用,体感差异大得离谱。我[上一篇刚写过](/blog/stay-on-the-table),Opus 4.8 在我手上的工程和研究任务上怎么连着让我失望,这些活后来全转给了 GPT 5.5。要只看分数,这俩贴得很近;手上一过,天壤之别。
ARC-AGI 这套就很典型。旧的那一代,顶尖模型已经刷到九成六、饱和了。换成更难的 ARC-AGI-2,同一批模型立刻原形毕露:GPT 5.5 还能有八成五,Opus 4.8 直接掉到七成出头。再换成要它真去交互、去探索的 ARC-AGI-3,几乎全员归零。
所以 benchmark 还是有用的,只是「做人能定义、能判对错的题」这件事本身,越来越难把模型区分开了。为什么会这样,得往训练里看一眼。
## 会解最难的题,和能可靠办成一件糙活
现在让模型变强的主力打法,叫「可验证奖励」。说白了就是,挑那些有标准答案、机器能自动判对错的难题,拿来做强化学习。数学、代码最典型,答对给分,答错给零,反复练。
DeepSeek-R1 的论文写得很清楚:数学题用规则去验,代码直接丢进编译器跑测试用例。他们还特意说明,没用那种神经网络打分的奖励模型,因为那玩意儿容易被模型钻空子。OpenAI 的 o 系列也是这个路子。这套打法非常有效,模型解难题的本事就是这么练上去的。
但它有个特点:它擅长的,是把「人能定义出来、又能判对错的最难问题」往死里解。这跟另一种能力是两码事:给你一个模糊的、没那么难但很现实的活,一次就可靠地办成。
我朋友那个剪辑工具,就是后一种。任务不算极难,但意图是模糊的,得自己拆解,还得一把办利索。一个能解奥数题的模型,未必能干净利落地把这种糙活一次办成。它可能绕来绕去,要跟你对齐三遍,最后还来一句「我搞定了」,其实没搞定。反过来,一个很会办糙活的模型,你丢给它一道极难的题,它也可能当场歇菜。
这是两个方向的能力,各走各的,没法摆在一条直线上比高低。
麻烦在于,九成的人日常要的是后者——把一个说不太清楚的活,可靠、省心地办成。可我们给模型排名用的那个分数,量的几乎全是前者。「分数最高」和「我用着最顺手」对不上,太正常了。
## 还有一维,叫探索
前面那两种,好歹都还在「有标准答案」的世界里:要么解一道能判分的难题,要么办一件能验收的活。真正难的是第三种。
我朋友卡住的时候,我想到的是另一类问题。就像开车到一个路口,前面红绿灯,你是直行,还是从中间绕过去。没有标准答案,得在模糊里自己找方向。探索一片人们还没定义清楚、甚至根本不知道答案的领域,是另一种能力。
这种能力,benchmark 根本测不了。评测的前提就是有标准答案、能判对错;可探索这件事根本没有对错可言,只有效率高低:能不能在一片模糊里捞到点新东西,再拿它往前走,拱出一个原来没有的边界。
它也恰恰是「可验证奖励」那套打法的盲区。已经有研究指出,开放式的、没有唯一答案的任务,因为压根没有一个明确的标准答案,连奖励都没法构造,这套方法使不上劲。甚至有人发现,这种练法非但不一定让模型长出新本事,反而可能把它的探索面收窄,能力上限被底座模型死死卡住。
结果就是,一个很会探索的模型,你把它扔进标准答案清清楚楚的笼子里,它可能显得有点傻;一个刷题刷得飞起的模型,可能压根不具备探索的能力。我自己的体感,GPT 和 Claude 在这件事上有最明显的区别。
而这一维,偏偏最要紧。因为真正有价值的事,一开始往往都没有标准答案。可它最难测,也最难练。
## 这事,聊天时代已经演过一遍
模型能力沿着维度分叉、再往下分层,不是头一回。聊天机器人那阵子,完整演过一遍。
那会儿大家一度也觉得,最大的模型就是最强的。但很快发现,单论聊天,最大的模型并没好到哪去。LMSYS 那个模型对战榜,2023年就专门写过一节,叫「小模型很能打」:一个 13B 的 Vicuna 排进了前五,Elo 分甚至压过谷歌的 PaLM 2;7B 的也能挤进前十,跟参数翻一倍的模型打得有来有回。后来也陆陆续续有研究是这个意思,把模型从几千万参数一路堆到千亿、再堆到 GPT-4 这一档,在一些偏软的任务上,提升很快就见顶,几十亿参数的小模型跟前沿模型差不太多。
翻译过来就是:聊天、陪聊这种事,规模的边际收益很低。几十 B 就够了,往上堆到千亿,纯属浪费。
于是市场自己就分了家。要情绪价值、要陪你聊两句,一个不大但会说人话的模型就够;真要做严肃的 research、做硬核的工程,才轮得到顶级模型上场。模型按用途,分出了不同的性价比档位。
今天这一轮,是同样的剧情,在更高的能力层级上重演。
## 写在最后:别问哪个最强,先问你要哪一维
绕回我朋友的纠结——「要不要换个更强的模型」。其实他问错了问题。
没有哪个「更强」,能同时把解难题、办糙活、搞探索全包圆。这三件事,正在分到不同的模型身上去。
新一代模型当然还在拼命往前走。但它们辛苦争来的那点进步,越来越多落在「人能定义、能判分的最难问题」上,而这恰恰是大多数人感知不到的地方。于是你会看到一种割裂:榜单上一代更比一代强,可大多数人只觉得「早就够用了,看不出来哪儿更强」。两边都没说错。因为他们要的,根本不是同一维的能力。
所以别再笼统地问「哪个模型最强」。先问清楚,你要它干哪一维的活:解一道有答案的难题,办一件没说清的糙活,还是陪你去趟一件根本没人知道答案的事。
「最强」这个词,正在变成一个没有标准答案的问题。
---
## 参考资料
**模型发布与时间线**
- [Claude Opus 4.8 发布(2026-05-28)— Anthropic](https://www.anthropic.com/news/claude-opus-4-8)
- [MiniMax M3 发布报道(2026-06-01)— MarkTechPost](https://www.marktechpost.com/2026/06/01/minimax-releases-minimax-m3-with-msa-architecture-supporting-1m-token-context-native-multimodality-and-agentic-coding/)
- [OpenAI GPT-5.5(当前官方版本,GPT-5.6 尚未发布)](https://openai.com/index/introducing-gpt-5-5/)
- [DeepSeek V4(2026-04-24 预览)— API Docs](https://api-docs.deepseek.com/news/news260424)
**benchmark 饱和**
- [GPQA: A Graduate-Level Google-Proof Q&A Benchmark(博士专家基线约 65%)— arXiv 2311.12022](https://arxiv.org/abs/2311.12022)
- [Humanity's Last Exam(造更难评测的官方动机:模型已在 MMLU 等超过 90%)](https://lastexam.ai/)
- [大模型评测饱和研究:60 个评测近半高度饱和、顶尖模型统计上无法区分 — arXiv 2602.16763](https://arxiv.org/abs/2602.16763)
- [ARC-AGI 官方榜单(ARC-AGI-1 饱和、ARC-AGI-2 同批模型骤降)— ARC Prize](https://arcprize.org/leaderboard)
- [ARC-AGI-2 设计说明 — ARC Prize](https://arcprize.org/arc-agi/2/)
**可验证奖励,和它的边界**
- [Tülu 3:RLVR(可验证奖励强化学习)的提出与定义 — arXiv 2411.15124](https://arxiv.org/abs/2411.15124)
- [DeepSeek-R1:用规则化奖励、编译器跑测试用例,刻意不用神经奖励模型(怕 reward hacking)— arXiv 2501.12948](https://arxiv.org/abs/2501.12948)
- [OpenAI o1:大规模强化学习训练推理能力 — OpenAI](https://openai.com/index/learning-to-reason-with-llms/)
- [Writing-Zero:开放式、主观任务缺乏明确 ground truth,奖励难以构造 — arXiv 2506.00103](https://arxiv.org/abs/2506.00103)
- [开放式生成「没有明确标准答案」导致 RLVR 难以延伸 — arXiv 2601.18533](https://arxiv.org/abs/2601.18533)
- [这类强化学习可能收窄探索面、能力上限受限于底座模型 — arXiv 2504.13837](https://arxiv.org/abs/2504.13837)
**聊天时代的小模型**
- [LMSYS Chatbot Arena 榜单(2023-05,「Smaller Models Are Competitive」:13B Vicuna 进前五、Elo 压过 PaLM 2)](https://www.lmsys.org/blog/2023-05-25-leaderboard/)
- [PNAS:模型规模对单条说服力的边际收益递减、很快触顶 — pnas.org](https://www.pnas.org/doi/10.1073/pnas.2413443122)
---
### Claude 4.8 让我失望,但这不是 Claude 一家的事
- URL: https://guanjiawei.ai/zh/blog/stay-on-the-table
- English: https://guanjiawei.ai/en/blog/stay-on-the-table
- Published: 2026-06-01
- Tags: AI, 模型公司, 行业, 思考
Claude 的 Opus 4.8 出来那天,我还挺兴奋的。
之前用 Opus,我一直觉得它工程能力不错,宏观分析、对齐意图是强项。4.8 发布说明里提的几个点也对我胃口,于是赶在手上几个复杂任务上都让它试了试。
结果是连着的失望。具体说几件。
## 开局像模像样,越跑越离谱
正好那阵子我 Codex 的额度用光了,想着 4.8 各方面看着也不差,就拿它跑一个研究型任务,用了那个很酷炫的功能,叫 ultracode,号称 dynamic workflow,能自动编排超长程任务。
开局确实像模像样。做了一堆检查,搭好 set up,看着挺靠谱。这是 Claude Code 一贯的样子,开头总让你觉得很有希望。
然后我让它跑了差不多一天一夜。
这任务本身是要优化一个性能指标,起步很低,吞吐大概每秒 0.1 个 token。它优化了半天,从 0.1 提到 0.15,就开始报喜了:你看我提升了 50%,做了这么多工作,取得了多大的成果。把前面那点简单 set up 反复拎出来邀功,洋洋洒洒写了一堆。
问题是,0.1 到 0.15 这个区间,用「倍数」去理解问题本身就是错的。
性能低到这个程度,说明方向压根没对。你得用绝对值去看,0.15 token/s 到底是个什么概念,才知道错得有多离谱。在一个根本跑不起来的设定里庆祝「提升了 50%」,跟在沉船上庆祝舀出去两桶水没多大区别。
后来回头看,它记录的那一堆文档、所谓的成果,基本全要扔。方向是歪的,全 freeze 掉重来。
这个我倒不算最意外。Claude 给我的印象一直是宏观能力还行、擅长分析和对齐,但具体执行、尤其是研究任务的执行,容易出问题。真正让我警觉的是后面那个工程任务。
## 一个纯工程问题,它在胡闹
那是个云上的服务,一个探针报错,我让它看看错在哪、顺手修一下。不算复杂。
它的几个行为把我看懵了。
第一,它在分析过程里莫名其妙开始数数。直接让机器 echo 一串数字,我盯着屏幕,大概十几个。我到现在没看懂这是在干嘛,纯纯烧 token。
第二个更离谱。这个探针的设计意图很清楚:worker 要定期心跳,返回一个 OK,告诉平台「我还活着、能正常干活」;心跳不正常,就先把这个 worker 下线、别派活给它。它查出来心跳有成本,问我要不要降一降。我说你改吧。
结果它改成了 `runtime --version`,返回一个版本号。
我当时就乐了。这哪是降成本,这是把整个设计意图改没了。版本号只能说明这东西装上了,跟它能不能正常干活半毛钱关系没有,等于装好了就直接派活。一个号称工程能力强、对齐能力强的模型,在一个意图这么清晰的纯工程问题上,给我整了个这个。
我说算了,还是用回以前那套,改回去吧。
改回去的过程里又出了件事。它找修复方案的时候跟我说「下面有三个选择」,让我挑。结果它根本没把三个选择列出来,直接来一句「我推荐选项一」。我翻了好几遍,那三个选项压根不存在。
到这儿我基本确定,这模型在这类任务上是真的托不了底了。
## 于是我把这些活全转给了 GPT 5.5
这几次下来,一个很直接的结果:研究和工程任务,我对 Claude 已经没有信任感了。
信任这东西,建立得慢,垮起来快。早些时候我觉得它还能用,但越用越发现,让它做一遍大概率是浪费时间——不是花几个 token 的事,是最后还得返工。现在这类任务我已经不会考虑它,全用 GPT 5.5。
GPT 5.5 是真的强。编程也好,研究也好,明显高出其他所有模型一截。
这事在我的账号配比上体现得最直接:Codex 这边已经涨到 7 个账号,周限额全部打满,还不够用;Claude 那边就剩一个账号吊着,它老封号,买一个先留着不动。谷歌那个我从来没认真用过。
7 比 1。这比任何跑分都诚实。
## 但这不是 Claude 一家的事
说到这,得把话往回收一收。如果只是骂 Claude,这篇就没什么意思了。
退一步看,顶尖模型一直在你方唱罢我登场。
6个月前是 Gemini 风头无两,满世界都在讲谷歌多强。这两代下来感觉都差点意思,现在很少有人提了。然后大家又一窝蜂涌向 Claude,觉得它最强,可你看 4.7 到 4.8,是真的拉。这一轮明显是 OpenAI 重新站了起来,GPT 5.5 强得不讲道理。
没有哪一家能一直待在顶上。这也不是 AI 行业独有的剧情。
## 芯片公司的命,模型公司在用更快的速度重演
之前跟一个朋友聊芯片,他说这行的战略残酷到什么程度。一代芯片方向押错,可能就万劫不复。
英伟达就差点死过。它第一代芯片 NV1,押的是前向纹理映射、四边形那套,结果行业标准走了三角形(微软的 DirectX)。方向一错,产品没人要,公司从大约 100 人裁到 40 人。救命的是世嘉,世嘉本来委托英伟达做主机的图形芯片,后来双方都发现方向不对,但世嘉的入交昭一郎还是把那笔大约 500 万美元的合同款转成了对英伟达的投资。黄仁勋后来说,这给了他们「六个月活命」,刚好撑到 RIVA 128 做出来翻身。
AMD 也一样。2011 年的推土机架构是个战略失误,单核性能拉胯,元气大伤。到 2015 年 7 月,股价一度跌到 1.62 美元,离破产就一步之遥。当年它把 x86 授权给中国的合资公司天津海光、拿约 2.93 亿美元,多少也有补血的意思。后来靠 2017 年的 Zen 架构才缓过来。
这俩现在都是势头猛到不行的公司。但回头看,没人能保证它们一定笑到最后。芯片周期长、投入重,三五年一代,一代走错就是巨大的压力,甚至直接出局。
模型公司比这快多了。不需要一代,可能就几代模型、半年左右的窗口,方向持续出问题,公司就可能下牌桌。
## 中国模型也轮过一整圈
这事中国模型公司已经完整演过一遍。
最早跑出来、最被认可的第一梯队是智谱。2022 年它的 GLM-130B 是斯坦福 HELM 评测里亚洲唯一入选的大模型,ChatGLM 又是国内最早开源的一批,一时风头无两。
中间掉过队。到 2024 年底,它的旗舰 GLM-4-Plus 在 SuperCLUE 这些公开评测上已经被 DeepSeek-V3、通义千问反超,跌出了最前列。当时外界还挺意外的。
然后 2025 年 1 月 20 号,DeepSeek R1 横空出世。六天后它的 App 冲上美国下载榜第一,连同另外 51 个国家一起登顶;1 月 27 号还直接干崩了英伟达股价,单日蒸发 5890 亿美元,创下美股史上最大的单日单股纪录。那阵子我感觉一批模型厂商都快一蹶不振了。
但智谱没下牌桌。2025 年下半年它换了打法,比较彻底地开源加收缩聚焦,GLM-4.5、GLM-4.6 接连放出来,口碑明显回来了,2026 年 1 月还在港股上市了。从掉队到翻身,靠的就是一直留在桌上。
## 顺便说一句:顶尖模型还在分工
除了轮流坐庄,现在还多了一件事:分工。
硬核的编程智能体、研究任务,OpenAI 一骑绝尘,强出一大截。Claude 原本的强势领域恰恰是这块,几代下来却没达到预期、开始回退,它的长处反而落到了白领活上:写作、财法、日常事务、文档调研这类。说句公道话,4.8 比 4.7 是好了一点点,更「说人话」了,风格往 4.6 那边靠了回去,执行也准一些,写东西确实还不错。
再往边上是豆包那一类。大家都知道它不干严肃活,但情绪价值拉满,用户基数大得吓人。有个说法是「Claude 是美国版的豆包」,我听着觉得有点好笑,不过仔细想,它说的是另一种分化:有的模型就是擅长陪你聊、给你情绪价值,这也是一类需求。
所以「哪家最强」现在已经不是一个问题了,得看你要它干什么活。
## 写在最后:别赌谁最强,赌谁还在牌桌上
绕了一圈,我的结论其实挺乐观的。
风水轮流转。别盯着「谁现在强、就会一直强」,也别因为一家暂时拉胯就把它判死刑。只要还留在牌桌上,就有翻盘的机会。智谱翻过来了,英伟达、AMD 当年也都翻过来了。
真正危险的是下牌桌。
Anthropic 这几代确实卡住了,我现在用 Claude 基本只剩白领那点活。它据说在憋下一代旗舰,如果出来还是这个水平,那才真有点悬。倒不是因为某一个模型不好,而是在这种半年一轮的节奏里,连着几代踩不准,就是会被人挤下桌的方式。
但只要它还在桌上,我就不太替它担心。牌桌上的人,本来就是轮流坐庄。
---
## 参考资料
- [Crucible Moments: Nvidia — Sequoia Capital(黄仁勋本人口述 NV1 押错方向、世嘉 500 万美元、"six months to live")](https://www.sequoiacap.com/podcast/crucible-moments-nvidia/)
- [NVIDIA CEO Jensen Huang — Acquired Podcast](https://www.acquired.fm/episodes/jensen-huang)
- [AMD 对华合资公司天津海光(含 2.93 亿美元授权费、2019 实体清单)— Tom's Hardware](https://www.tomshardware.com/news/amd-joint-venture-partner-banned-us-trade-war,39703.html)
- [AMD–Chinese joint venture — Wikipedia](https://en.wikipedia.org/wiki/AMD%E2%80%93Chinese_joint_venture)
- [How Lisa Su brought AMD back from the brink — CNN Business](https://www.cnn.com/2020/03/27/tech/lisa-su-amd-risk-takers)
- [GLM-130B: An Open Bilingual Pre-trained Model(ICLR 2023,斯坦福 HELM 亚洲唯一入选)](https://arxiv.org/abs/2210.02414)
- [Zhipu AI 开源 GLM-4.5,表现比肩 Claude 与 DeepSeek 最新模型 — The Batch (DeepLearning.AI)](https://www.deeplearning.ai/the-batch/zhipu-ai-z-ai-releases-open-weights-glm-4-5-models-that-perform-comparably-to-the-latest-from-claude-and-deepseek)
- [市值 579 亿港元!全球大模型第一股智谱港股上市(02513.HK)— 证券时报](https://www.stcn.com/article/detail/3579827.html)
- [DeepSeek-R1 Release(2025/01/20 官方发布页)— DeepSeek API Docs](https://api-docs.deepseek.com/news/news250120)
- [Nvidia's $589 Billion DeepSeek Plunge Is Largest in Market History — Bloomberg](https://www.bloomberg.com/news/articles/2025-01-27/asml-sinks-as-china-ai-startup-triggers-panic-in-tech-stocks)
- [DeepSeek displaces ChatGPT as the App Store's top app — TechCrunch](https://techcrunch.com/2025/01/27/deepseek-displaces-chatgpt-as-the-app-stores-top-app/)
---
### Token 业务的暗线:决定成本的不是吞吐,是 KV cache 命中
- URL: https://guanjiawei.ai/zh/blog/token-business-kv-cache
- English: https://guanjiawei.ai/en/blog/token-business-kv-cache
- Published: 2026-05-28
- Tags: AI, Infra, KV cache, 推理, 思考
最近研究 token 这个行业越多,我越觉得有一根弦被普遍低估了。
过去一年大家算推理性能,主要盯三个数:绝对吞吐、TTFT、TPOT。一个请求进来能并到几路,首 token 出来多快,每个 output token 多快。这套话术今天很主流。
但坐下来真做 serving,你会发现真正决定 token 成本的不是吞吐速度,是 KV cache 有没有命中。
## 一、10 倍的鸿沟,被刻进了定价表
最近几家模型 API 都在降价。打开价目表一看,input 这一列很久之前就被拆成了两栏:cache hit 和 cache miss。
差多少?
Anthropic 的 cache read 是 base input 价格的 0.1 倍,便宜 10 倍。DeepSeek V4 Flash 的 cache hit 是 0.0028 美元/百万 token,cache miss 0.14 美元/百万 token,差 50 倍。Anthropic 这边写一份 cache 还得付 1.25 倍(5 分钟版)或 2 倍(1 小时版)。DeepSeek 今年 4 月 26 号又把所有模型的 cache hit 价格再砍掉 10 倍。
落到机器层面,差的是计算资源。命中 cache 等于跳过 prefill,机器只做 decode 那一小段。不命中就是从头算一遍,占机器时间、占算力,差出来不是几个百分点,是数倍到 10 倍这个量级。
有意思的地方在这:cache hit/miss 被拆开计价之后,价格里有一部分用户能通过设计去争取,另一部分完全由供应商决定。两边一拆,"哪家 API 便宜"在 token 维度上就不再可比了,得看实际命中率。
## 二、用户侧最大的坑:模型路由
来说说用户侧能怎么把这事搞砸。
这两年大家蛮迷信"模型路由",复杂任务给强模型、简单任务给弱模型,看起来很省。
我的看法是:在一个 session 里中途换模型,多数时候是亏的。
最直接的例子是 Claude Code。你已经积到 300K 上下文,中间觉得这一步用 Opus 太贵,切到 Sonnet。Claude Code 现在会弹一个提示,明确告诉你:切换后前面的 cache 全部失效,下一步必须冷启重算一次。以前是不提醒的,被骂多了才加上。
为什么会失效?每个模型的 KV 表征不一样,cache 不能跨模型复用。Opus 的 cache 和 Sonnet 的 cache 是两个东西,session 没换、cache key 没动,底下重算的成本一文不省。
算一笔账。当前 Opus 4.7 是 $5/$25 每百万 token,Sonnet 4.6 是 $3/$15。Sonnet 比 Opus 便宜 40% 左右,不是过去 5 倍那么夸张了。你前面那 300K input 要从 cache 命中(0.1 倍价格)变成冷算(1 倍价格),单次 input 成本翻 10 倍。模型本身省下来 40%。两头一抵,整体反而贵了 5 倍以上。
而且 agent 这种业务里,token 几乎都是 input 重、output 轻。prefill 一般每秒几千 token,decode 几十到一百多 token,差两个数量级。钱基本花在 input 上。模型路由毁掉的恰好是 input 这边的省钱机制。
所以现在主流 agent 设计都围绕"上下文稳定"在做。模型不能轻易换,工具结构不能动,CLAUDE.md 这种核心 prompt 半路也不能改。一动,命中率从 90% 掉到 5% 是真发生的事。
## 三、Claude Code 的解法:spawn 子 agent
那任务里如果真有一部分更适合便宜模型,怎么办?
Claude Code 的解法是 spawn 子 agent。
主 session 守在 Opus 这一档,命中率保得住。需要 explore、批量处理、跑某个特定子任务,调一下 Task 工具开一个新 agent。新 agent 在自己隔离的 context 里跑,可以挑更便宜的模型,自己维持自己的命中率。跑完只把摘要回传给主 session,主 session 的 cache 不污染。
这个机制成立的前提:子任务的上下文需求跟主任务差异够大。如果你的子任务恰好要把主 session 大部分内容也喂进去,等于在子 agent 里又冷启一遍,省下来的钱被 prefill 吃光。这事得挺精细地判断。
## 四、服务端的 KV cache 工程
服务端这边差异有多大?非常大。
最粗糙的实现是没怎么针对 cache 做设计。多用户之间不能复用,路由乱跑(本该回那台带 cache 的机器,调度去了别处),显存兜底所有 cache 容量。这种系统下,用户侧再精心也救不回来。
成熟的代表是月之暗面、清华大学与趋境科技等机构联合做的那套 Mooncake 框架,KVCache-centric 的 disaggregated 架构。prefill 和 decode 集群分开,把 GPU 节点上没用满的 CPU、DRAM、SSD 资源拿来做 KV cache 的分布式池,再用一个 KV cache 调度器决定排队和路由。论文里给的数字是模拟 525% 吞吐提升,真实负载下处理请求量增加 75% 到 115%。
反例是 Openclaw。这套开源 agent 之前被骂得比较惨,主要栽在这一层。它的 plugin 架构默认不设 promptCacheKey,过第三方 proxy 拿不到节点亲和,cache 命中率近乎 0%。你看它跑的 token 总量其实不夸张,但 input 全是 cache miss 价位,账单就离谱。我大概一个月前看过它的 trace:6 万多 input token 一次请求,0% 命中,单次 $0.12 出去——典型的服务端 cache 没做针对性设计。
## 五、模型层也能往这条路压
再往下一层,模型层本身可以为 KV cache 让出非常大的空间。
DeepSeek 是把这件事做得最系统的。MLA(Multi-head Latent Attention)把 KV 投影到一个 latent 向量再回弹,KV cache 体积压了 90% 以上;V3 一直延续这个机制;后来又加 Native Sparse Attention,KV cache 在长上下文里的增长几乎被压平。这样推理系统才能在百万级上下文里把 cache 池的容量做起来。
但模型一改,cache 命中的判定逻辑也会变。某些原本会被认作"前缀重叠"的输入,进了 sparse attention 之后机制不一样,能不能命中要重新对齐。所以推理系统也得跟着改一轮。这是为什么我说做推理的人现在不能只盯吞吐,得围着模型架构去重新设计 cache。
## 六、想测出这件事,很难
整套链路最头疼的一点:单独评估服务端没用,单独评估用户侧也没用。
服务端 cache 做得再强,用户侧像 Openclaw 那样设计,命中率依旧抬不起来。用户侧再精心,碰到一个粗糙的服务端,路由乱、容量不够、跨用户不复用,一样掉成本。
所以"哪家 API 便宜"在 token 这件事上不能单点比。同样的硬件、同样的目标,两端配合得好和两端各做各的,整体账单可以差 5 到 10 倍。
## 写在最后
token 定价表上 cache hit/miss 分两栏,是这整件事最重要的一根弦。它给用户透传了一个激励:你命中率做得高,你就省钱;同时也对服务端施压:cache 系统不够强,就拿不到生意。
我希望厂商把 cache 命中机制本身也透传出来。不然用户侧只知道有这件事,不知道怎么针对它做优化。能把"模型、服务端 cache、用户侧使用"这三段端到端打通的厂商,目前还不多。
边端这边现在还在比裸性能。但等应用密度上来、agent 真的跑起来,KV cache 同样会成为主线问题。从云端到边端,绕不开。
---
## 参考资料
- [Prompt caching — Claude API Docs](https://platform.claude.com/docs/en/build-with-claude/prompt-caching)
- [Anthropic Pricing — Claude API Docs](https://platform.claude.com/docs/en/about-claude/pricing)
- [How Claude Code uses prompt caching](https://code.claude.com/docs/en/prompt-caching)
- [Claude Code Sub-Agents Docs](https://code.claude.com/docs/en/sub-agents)
- [Context Caching — DeepSeek API Docs](https://api-docs.deepseek.com/guides/kv_cache)
- [DeepSeek API Pricing](https://api-docs.deepseek.com/quick_start/pricing)
- [Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving (arXiv:2407.00079)](https://arxiv.org/abs/2407.00079)
- [Mooncake on GitHub (kvcache-ai/Mooncake)](https://github.com/kvcache-ai/Mooncake)
- [DeepSeek-V2 paper — introduces MLA](https://arxiv.org/abs/2405.04434)
- [Fixing OpenCode prompt cache misses with third-party proxy](https://www.ddhigh.com/en/2026/03/26/fix-opencode-prompt-caching-with-third-party-proxy/)
- [Plugin architecture prevents prompt caching — oh-my-opencode issue](https://github.com/code-yeongyu/oh-my-openagent/issues/1247)
---
### Token 不是一种东西
- URL: https://guanjiawei.ai/zh/blog/token-is-not-one-thing
- English: https://guanjiawei.ai/en/blog/token-is-not-one-thing
- Published: 2026-05-26
- Tags: AI, Token, Infra, 算力, 思考
最近 token 经济这个词被讲得很热。AI 行业所有的商业模式最终都会收敛到一个共同的计量单位,就是 token。这个判断我自己也信。但有个前提总被略过:token 根本不是一个标准化的东西。
水有标准单位,电有标准单位,钱更不用说。token 不是。它更像汽油:92、95、98 是不同的油,价格不同,能跑的车也不同。把所有汽油都按"升"加起来报数,意义不大。
当前 AI 行业里很多看上去矛盾的现象,本质都是这件事。
## 一、智能是有档位的
把模型按智能水平大致分四档。
**顶级。** 海外以 OpenAI GPT-5.5、Anthropic Claude Opus 4.7 为代表。国内主要是智谱 GLM-5.1、Moonshot Kimi K2.6、DeepSeek V4-Pro。小米 MiMo-V2.5-Pro 算是个有点争议的存在,但用量和数据上确实在往上走,姑且也算一个。这一档参数从千亿到上万亿不等,需求几乎无限,付费意愿极强。涨价、限额、再涨价,用户该用还是用,反过来还在涌进来。智谱 2025 年报披露,GLM Coding Plan 半年里 token 调用涨 15 倍,付费开发者突破 24 万。这就是顶级 token 的真实需求曲线。
**中等。** 这一档最尴尬,几乎断档。能数得出来的就是 MiniMax M2.7、DeepSeek V4-Flash、小米 MiMo-V2.5 普通版等几个。体量适中,价格能便宜一个数量级,理论上性价比最好。但市场上没什么人在这一档真正使劲做。原因后面会讲。
**中低。** 以开源为主。阿里 Qwen 3.6 是代表,35B-A3B(MoE)、27B 稠密版都开了。Google 的 Gemma 4 也是这个档,从 E2B 到 31B 都有。
**端侧。** 几 B 参数甚至零点几 B,塞进手机或者本地一张消费卡就能跑。
第一个不均衡在这里。顶级在卷,挤得头破血流;中等断档;中低和端侧热闹但场景模糊。
## 二、速率是另一个维度,不是同一档的 token
档位画完,token 的标号才说了一半。
另一半是速率。同样是 GPT-5.5,你以 30 TPS 拿到和以 200 TPS 拿到,体感完全不是一回事。
第三方测速比较常用的 Artificial Analysis 上,2026 年的数字大致是这样:
| 档位 | 模型 | 输出 TPS |
|---|---|---|
| 旗舰常规 | GPT-5.5 (high) | ~68 |
| 旗舰常规 | Claude Opus 4.7 | ~48 |
| 旗舰常规 | DeepSeek V4-Pro | ~48 |
| 旗舰常规 | Kimi K2.6 | ~33 |
| 高速 | DeepSeek V4-Flash | ~126 |
| 高速 | Gemini 3.5 Flash | ~203 |
| 超高速 | GLM-5.1 高速版 | 400(官方) |
| 超高速 | Cerebras 跑 Kimi K2.6 | 981 |
我之前写过一篇[《模型快 5 倍,就不再是同一个模型》](/blog/inference-speed-new-species)。讲的就是 5 倍以上的提速会激活原本根本不存在的产品形态。这不是"快了一点点",是物种变化。
市场已经在用价格说话。Anthropic 的 Opus Fast:2.5 倍速度,6 倍价格。OpenAI 的 Priority Tier:2.5 倍价格。注意这些比例,价格涨幅明显超过速度涨幅。不是模型公司在贪,是真实的定价信号:市场里真有一群人,愿意为速度多付几倍。
智能档 × 速率档,叠在一起就是一个矩阵。每一格的 token 都不是同一种东西。
## 三、需求侧的两条主线,付费意愿天差地别
谁在烧这些顶级 token?基本就两条主线。
第一条:coding agent。全球增长最快、消耗最大的就是这一类。表现形式是 coding 智能体写代码解决特定问题。但实际拿来干什么不一定是写代码,很多人用 coding agent 干各种各样的事,只是这些事最终都通过"写代码"这个动作完成。
第二条:C 端智能体。Claude 的 app、ChatGPT 的 app、Microsoft Copilot,以及智谱新出的 AutoClaw(Claw Plan)这一类。AutoClaw 2026 年 3 月上线,20 天订阅破 40 万。它本质上跑的也是 coding agent,只是上面包了一层非技术用户友好的壳,让普通人也能"雇 AI 员工"。
两条线的付费意愿差别非常大。
coding agent 用户对智能的要求非常顶,Opus 4.7、GPT-5.5 那个档,差一点就不行。他们干的活值钱,省下来的时间也值钱,愿意为顶级 token 持续付费。粘性是另一回事:出了更好的模型,他们立刻换。
C 端智能体用户不一样。他们的任务大多不是高价值的,对价格敏感得多,对绝对智能的要求没那么死。一个"中等智能、性价比好、速度还过得去"的模型其实非常适合这一类。问题是这一档现在断档,没有真正能打的供给。所以Deepseek V4以超高性价比快速打了这一类的用户群,我注意到切换Deepseek这身边朋友非常多。
需求结构这样,模型公司的投入方向自然也跟着走。所以你看到顶级模型一直在喊算力紧缺,中等模型却几乎没人在做。
## 四、供给侧的奇怪错配:一卡难求和大量闲置同时存在
需求结构错配,会传染到算力市场。
顶级算力供不应求是显性的。
NVIDIA 的 Blackwell 系列(B200/GB200)老黄亲口确认"售罄到 2026 年年中",企业新单的交付排期已经 8-16 周。Meta 这一年的资本开支预计超 1000 亿美元,微软单季度接近 350 亿美元,都在抢这些芯片。国内市场上现在疯抢的是 B300 和 H200:B300 一台 700 万还买不到,月租推到 13-20 万;H200 2026 年 1 月解禁入华,首批 5000-10000 套模组很快被头部厂商抢光,集群交付排到 2027 Q2。前两代的 H100 反而冷下来了,没什么人在抢。
国产顶级芯片更夸张。华为最新的昇腾 950PR 2026 年 3 月才量产,全年 75 万颗的规划产能已经被字节(35 万)、阿里(20 万)、腾讯百度(10 万)、政企信创(10 万)整整齐齐全部锁定,订单排到 2027 年。单价约 1.6 万美元一片,FP4 算力 1.56 PFLOPS,单卡性能官方宣称是 H20 的 2.87 倍。这是国产 AI 芯片采购史上第一次出现完整年度产能被"包圆"。DeepSeek V4 开源的时候带着 8 款国产芯片做了 day-0 适配,把昇腾 NPU 和 NVIDIA GPU 在技术报告里并列;GLM-5 全程在昇腾 + MindSpore 上训出来,适配 7 款国产芯片。这是格局的事:把顶级模型架在国产芯片上,既是技术问题,也是供给问题。
隐性的另一面是中低端算力大量闲置。
PPIO 创始人姚欣公开讲过,部分国产 GPU 智算中心闲置率高达 80%。36 氪报道有些智算中心利用率只有 10-20%。新华网的定调更直接:"通用算力相对过剩,智能算力相对短缺",承认了结构性错配。市场价格也反映出来:A100 价格暴跌 50%+,4090 单卡时租掉到 1-2 元一小时,5090 也才 2.5 元上下。
但中低端算力的错配,其实是两个不同的卡点。
中端数据中心卡(H20、L20、华为 910B 这一类)的卡点在基础设施。推理框架对它们的优化优先级,远低于顶级卡。KV cache 管理、MoE 专家并行、FP8/FP4 精度支持,几条关键路径的成熟度都没跟上。硬件在那里,需求也在那里,就是 serve 不出顶级体验。
消费级 PCIe 卡(4090、5090、4090 48G 魔改)的卡点完全反过来。硬件其实能跑,vLLM 也已经支持 5090(要 CUDA 12.8 + 降回 FlashAttention 2,能凑合用)。真正缺的是为它们量身设计的好模型。70B Dense 这个档已经过时——2026 年 5 月排名前六的开源模型全是 MoE,Dense 在旗舰级几乎绝迹。MoE 总参动辄上百 B,消费卡装不下;蒸馏出来的小模型质量又追不上顶级。市场上没有"专门照顾 24G/32G/48G 显存约束"的高质量新模型供给。
所以你看到的画面是:4090 / 5090 价格跟数据中心卡比较便宜得过分,但拿来能跑的"中等智能"模型主流还是 Llama 3.3 70B 这种 2024 年末的老货。个人开发者本地实验、小团队 PoC、隐私敏感的本地部署还撑得住;想用这些卡做企业级中等推理,没有专门优化的新模型可用。
本质不是"算力总量不够",是"算力没办法跟需求对齐"。
以前行业外人士讲算力,习惯用"几 P 算力"来报数。这种报法在过去就很扯,现在在 AI 推理时代几乎完全失效了。同样是计算单元,互联、显存带宽、FP4/FP8 精度支持、KV cache 管理能力,这些都决定它能不能 serve 顶级模型。老一代卡堆 100 张,加不到一张顶级卡的单路速度。
你会看到一个奇怪的画面:一边是顶级模型的提供方在抢芯片,一边是机房里前两代的卡降价租不出去。一边一卡难求,一边大量闲置。
## 五、错配会被市场调节,但要花时间
这种错配不会一直在。两个不同的卡点,会被两条不同的市场力量推着走。
中端数据中心卡的基础设施短板,会被工程优先级推动。推理框架的优化方向跟着商业利益走,一旦中端模型需求起来,vLLM、SGLang、TensorRT-LLM 这些业内顶尖的推理技术资源迟早会被迫把 H20、L20、910B 的优化提到议程上。这件事不浪漫,但会发生。
消费卡的模型供给短板,靠蒸馏 + 小 MoE 这两条路在推。DeepSeek-V4 已经蒸馏出 9B 量级的版本,Qwen 系列长期在做。一旦有人把"32G 显存能跑、质量接近顶级"这件事真做出来,闲置的 4090 / 5090 立刻就有了去处。
还有一条线是国产芯片 + 国产模型的深度绑定。DeepSeek 和智谱都在走,技术上验证可行,一旦走通,中低端算力市场会有一波结构性的重新洗牌。
我比较乐观这件事会发生,只是需要花一点时间。可能几个季度,也可能一两年。这段时间里能把握住节奏的人,有一个结构性的窗口。
## 六、别用一个数字概括 token
回到开头那句。Token 经济这个词没毛病,但它远不是"卖水电"那么直观。
它更像加油站。汽油看上去是同一种东西,实际上是一个智能 × 速率的矩阵。再叠一层供给侧的算力分层错配,就是当下行业里很多看似矛盾的现象的真正成因:为什么模型公司在抢芯片,为什么有些智算中心在闲置,为什么 fast tier 能卖 6 倍价格,为什么中等智能模型迟迟没人做。
下次再看到"我们投了 N 个 P 的算力"或者"每月生产了 X 万亿 token"这种数字,先停一下,问问:哪一档智能,哪一档速率,匹配的是哪一档需求。
Token 不是一种东西。
---
## 参考资料
**模型版本与定位**
- [OpenAI GPT-5.5 Instant 发布](https://openai.com/index/gpt-5-5-instant/)
- [Claude Opus 4.7 — Anthropic](https://www.anthropic.com/news/claude-opus-4-7)
- [智谱 GLM-5.1 技术文档](https://docs.bigmodel.cn/cn/guide/models/text/glm-5.1)
- [Moonshot Kimi K2.6 发布](https://kimi-k2.org/blog/24-kimi-k2-6-release)
- [DeepSeek V4 — API Docs](https://api-docs.deepseek.com/news/news260424)
- [Simon Willison: DeepSeek V4—almost on the frontier](https://simonwillison.net/2026/Apr/24/deepseek-v4/)
- [小米 MiMo-V2.5-Pro 官方](https://mimo.xiaomi.com/mimo-v2-5-pro/)
- [MiniMax M2.5 发布](https://www.minimaxi.com/news/minimax-m25)
- [Qwen 3.6-35B-A3B — ModelScope](https://www.modelscope.cn/models/Qwen/Qwen3.6-35B-A3B)
- [Google Gemma 4 发布](https://blog.google/innovation-and-ai/technology/developers-tools/gemma-4/)
**速率数据**
- [Artificial Analysis — GPT-5.5 (high)](https://artificialanalysis.ai/models/gpt-5-5-high)
- [Artificial Analysis — Claude Opus 4.7](https://artificialanalysis.ai/models/claude-opus-4-7)
- [Artificial Analysis — DeepSeek V4 Pro](https://artificialanalysis.ai/models/deepseek-v4-pro)
- [Artificial Analysis — DeepSeek V4 Flash](https://artificialanalysis.ai/models/deepseek-v4-flash-non-reasoning)
- [Artificial Analysis — Kimi K2.6](https://artificialanalysis.ai/models/kimi-k2-6)
- [Artificial Analysis — Gemini 3.5 Flash](https://artificialanalysis.ai/models/gemini-3-5-flash)
- [智谱 GLM-5.1 高速版 400 tokens/s 报道(IT 之家)](https://www.ithome.com/0/953/717.htm)
- [Cerebras 跑 Kimi K2.6 达到 981 tokens/s](https://www.cerebras.ai/blog/cerebras-kimi-k2-Enterprise)
- [Claude Opus Fast Mode: 2.5x 速度 / 6x 价格(Groundy)](https://groundy.com/articles/claude-code-fast-mode-6x-pricing-worth/)
- [OpenAI Priority Processing 官方文档](https://developers.openai.com/api/docs/guides/priority-processing)
**智谱产品与财报**
- [智谱 2025 年度业绩报告(新浪财经)](https://finance.sina.com.cn/stock/hkstock/ggscyd/2026-03-31/doc-inhswpms3341678.shtml)
- [量子位:智谱财报解读](https://www.qbitai.com/2026/03/394135.html)
- [钛媒体:智谱财报分析](https://www.tmtpost.com/7938401.html)
- [AutoClaw / Claw Plan 发布(界面新闻)](https://m.jiemian.com/article/14095547.html)
**算力市场**
- [NVIDIA Blackwell sold out through mid-2026(FinancialContent)](https://markets.financialcontent.com/wral/article/tokenring-2025-12-29-nvidias-blackwell-dynasty-b200-and-gb200-sold-out-through-mid-2026-as-backlog-hits-36-million-units)
- [国内 B300 服务器 700 万一台还抢不到(新浪财经)](https://finance.sina.com.cn/china/gncj/2026-05-01/doc-inhwktza5465326.shtml)
- [H200 在华销售解禁,企业买还是租(知乎)](https://zhuanlan.zhihu.com/p/1981721428861682031)
- [2026 Q1 GPU 租赁市场深度研究](https://gitcode.csdn.net/69dc9c0a54b52172bc69377c.html)
- [高端 GPU 供需错配驱动算力租赁高景气(华尔街见闻)](https://www.fxbaogao.com/detail/5399775)
- [华为昇腾 950PR 量产 + 订单排到 2027(东方财富)](https://caifuhao2.eastmoney.com/news/20260519201003499682070)
- [华为昇腾 AI 芯片三年路线图:950PR / 950DT / 960 / 970(OSCHINA)](https://www.oschina.net/news/373016)
- [DeepSeek V4 全面换装华为昇腾 950PR(CSDN)](https://ascendai.csdn.net/69d716f30a2f6a37c59df6df.html)
- [PPIO 姚欣谈智算中心闲置率(雷峰网)](https://www.leiphone.com/category/industrynews/GpExeQUQDrXE3B8H.html)
- [36 氪:智算中心利用率仅 10-20%](https://36kr.com/p/3269610247737992)
- [新华网:通用算力过剩,智能算力短缺](https://www.news.cn/finance/20250429/3df0c33317d2499ab3a297a413e0acce/c.html)
- [A100 价格趋势报道](https://www.mornai.cn/news/gpu/a100-gpu-rent-trend/)
- [RTX 4090 时租价格区间 1.45-2.29 元(搜狐 2026/3)](https://www.sohu.com/a/1001811857_122681399)
- [RTX 5090 算力 2.5 元/卡/小时(共绩算力)](https://www.gongjiyun.com/blog/2026/1/rx8wwbsgsisch5kyogoc7t3yncb/)
- [RTX 4090 48G 魔改版评测(晨涧云)](https://www.mornai.cn/news/gpu/rtx-4090-48gb/)
- [2026 大模型格局:MoE 在旗舰级把 Dense 灭绝(QubitTool)](https://qubittool.com/zh/blog/llm-landscape-may-2026-deepseek-qwen-llama-comparison)
- [vLLM 在 RTX 5090 上的部署指南(GitHub)](https://github.com/BoltzmannEntropy/vLLM-5090)
- [魔改 4090 用了一年:开发真香,生产翻车(知乎)](https://zhuanlan.zhihu.com/p/2028142360152817950)
- [DeepSeek V4 八款国产芯片 Day-0 适配](https://news.qq.com/rain/a/20260508A0267Y00)
- [GLM-5 适配 7 款国产芯片(观察者网)](https://www.guancha.cn/economy/2026_02_12_806895.shtml)
---
### Agent 越强,常识越值钱
- URL: https://guanjiawei.ai/zh/blog/agent-common-sense
- English: https://guanjiawei.ai/en/blog/agent-common-sense
- Published: 2026-05-25
- Tags: AI, AI Agent, 协作, 思考
上个月我写了一篇[《AI 让无知变成了优势》](/blog/amateur-advantage),说的是门外汉没有"这事有多难"的先验包袱,反而更敢用 AI 去碰看上去不可能的事。
我现在还是觉得这个观点对。但最近被 agent 连坑了四次,得修正一下。
最佳的状态不是完全不懂,是半懂不懂。有常识,知道大面上的东西,但不深入技术细节。完全不懂的人确实敢试,这是好事;但他没法分辨 agent 给的东西到底靠不靠谱。
## 一、假数据能骗你几十倍
最近在做一个推理引擎的性能优化。
第一晚打开结果,发现性能指标直接达到了我原本觉得非常有挑战性的目标。当时挺兴奋的,这么快就搞定了?
如果我对这个领域完全不懂,大概就开开心心把成果同步给合作伙伴了。但因为有点常识,总觉得不对劲,让它测了一下正确性。结果一出来全是感叹号。正确性修完之后,性能差了几十倍。
以为这就完了。继续往下优化,节奏又不对。每轮测试的数据上升得太快,快到反常。我看了一下测试流程,发现每次正式测试之前它悄悄跑了一轮 warm up,用的还是同一条 prompt。后续测试等于全跑在前缀缓存上,开卷考试偷看答案。把缓存隔离之后,性能又跌了几十倍。
还没完。prefill 回归理性之后,decode 速度突然变得离谱。一个跑在 Windows 上的引擎,吞吐竟然超过了 Linux 上的同款。我拿之前写的真实 prompt 测试脚本跑了一遍,性能又打了个一折。原因是 agent 测试时用的合成 prompt 太简单太规律,投机解码的接受率能到 80% 以上。换成真实 prompt,接受率暴跌,性能跟着崩。有做过投机解码落地的团队记录过同样的坑:生产环境的实际性能比实验室低 40% 到 60%,差距大到你怀疑是不是同一个系统。
三层假象叠在一起。如果一开始就信了第一个数据去对外同步,后面填坑的过程真的很不舒服。你给别人一个错误的预期,人家已经按那个数字在排计划了。你后来跟人说"不好意思,差了几十倍",那比一开始就说"还没搞定"难受多了。
后来再做优化,目标里明确写了两条:prefill 不能有前缀缓存的干扰,decode 必须用真实 prompt。加了这两条之后,才看到一条正常的、一点点往上爬的曲线。
## 二、它会把你的实验机搞坏
现在前沿的 agent 可以连续自主工作一整天甚至更久。时间一长,出事的概率就上来了。
我的 agent 不止一次在运行过程中,因为一个引号没写对、一条命令参数搞反了,啪就把实验机的系统打坏了。文件全删,环境全废。动作太快,一秒钟的事,你根本来不及拦。
这不是只有我碰到。今年 4 月,一个 agent 遇到凭据不匹配的时候没停下来问人,自己找了一个拥有全部权限的 token,9 秒之内删掉了一家公司的整个生产数据库连同所有备份。30 多小时停机,3 个月的客户数据全没了。过去两年里类似的事故记录在案的至少十几起。
Anthropic 和 OpenAI 现在都在推沙箱,思路不复杂:文件系统隔离一层,网络隔离一层。没有文件系统隔离,agent 可以碰到不该碰的东西;没有网络隔离,被劫持的 agent 可以偷你的密钥。
我自己的经验更土:给 agent 跑的实验设备,专机专用,别在上面存其他东西。它连续跑几十个小时,出低级错误的概率不是零。重装系统耽误的是时间,丢了重要数据耽误的是心情。
## 三、它会原地打转,等你来拍板
agent 还有个毛病,会在同一个问题上绕圈。
最近有个目标是在 Windows 上用 BF16 精度跑一个推理引擎。模型权重 60 多 G,加载完就 OOM,直接崩。
我看 agent 的应对方式挺有意思:它不断尝试绕过内存瓶颈。只加载一部分权重、推理时再动态读取、各种 offload 花样轮番上阵。每一种都跑不通,每一种又花了大量时间。它甚至因此在测试里加了 warm up 来掩盖加载延迟,前面说的前缀缓存问题,根源有一部分就在这。
后来我拦下来说:先别折腾性能,把内存问题先解决。这个瓶颈不搞定,后面全是白费。
Agent 执行力其实很强。方向一给对,很快就查到 Windows 上可以做一系列系统级设置来扩展内存和显存的可用量。搞定之后回来做优化,路径一下就顺了。之前绕来绕去的花活全用不上了,那些时间基本都浪费了。
它的问题是不会主动重新定义问题。拿到"优化性能"就死磕优化性能,哪怕卡在一个前置条件上,也只会想办法绕,不会跟你说"这个前提不成立,得先处理别的"。识别出真正的卡点,把 agent 从死胡同里拽出来,这个判断只有人能做。
## 四、目标定太高,什么都 ship 不出来
最后一个坑不是 agent 的问题,是我自己的。
Agent 越来越强,人就越容易把目标定太高。因为它可以连续跑很长时间,你就觉得什么都可以试。每个方向看上去都像是能发顶会论文级别的突破。于是同时开了好几条线,每条都很有野心。
结果呢?每条线都在 working、都在 progress,但没有一条 ship 出来。
持续投入 token,持续看到"进展",没有东西交付到用户手上。看上去像在做事,实际上是原地烧钱。我最近就犯了这个错,搞了几条线都是那种做成了就是大突破的方向,但实施风险也大。agent 又不是用来许愿的,搞不定就是搞不定,token 烧了一堆,deliver 不出东西。
后来想明白了:目标得缩窄。中短期有可以 ship 的东西,中长期有值得探的方向,不能只有后者。先把能交付的交付了,稳住节奏再去碰大的。
## 五、半懂不懂,反而刚好
四个坑放在一起看,有一条线串着:每一个都不需要你是深度专家才能避开。
性能涨了几十倍?先查一下是不是测错了。Agent 要在主力设备上跑一整天?给它一台专用的。优化三轮都卡在同一个地方?那个地方才是真正该解决的。每条线都在跑但没一条在 ship?先砍几条。
都是常识。
MIT Sloan 今年有篇文章讲 agentic AI 时代的管理,提到管理 agent 最需要的技能是定义问题和验证输出,都是 AI 自己做不好的事。"Agent Manager"已经出现在招聘板上了,岗位描述里有句话挺有意思:领域常识比 AI 专业知识更重要。
回到我之前那篇文章。"无知是优势"依然成立,你得不知道什么是难的,才敢去碰。但光有勇气不够。最值钱的状态是:敢试,又能在关键时刻看出不对劲。
完全不懂的人会被假数据带走。深度专家会被先验绑住。中间那种半懂不懂的人,既敢出手,又知道什么时候该拉一下缰绳。
Agent 会越来越强。但那一点人类常识,这个数对不对、这个方向对不对、这个东西该不该现在 ship,只会越来越值钱。这几件事到现在都是 agent 搞不定的。
---
## 参考资料
- [GPT-5.1-Codex-Max 可连续自主工作超过 24 小时 — OpenAI](https://openai.com/index/gpt-5-1-codex-max/)
- [GPT-5.5 发布:多小时自主会话能力 — OpenAI](https://openai.com/index/introducing-gpt-5-5/)
- [投机解码在生产环境中的隐形陷阱:实际性能比实验室低 40-60% — tianpan.co](https://tianpan.co/blog/2026-04-17-speculative-decoding-production-hidden-traps)
- [MTP 在不同任务类型下的接受率差异 — SudoStack](https://www.sudostack.co/mtp-speculative-decoding-coding-vs-creative-writing/)
- [Cursor + Claude Agent 9 秒删除公司整个生产数据库 — The Register](https://www.theregister.com/2026/04/27/cursoropus_agent_snuffs_out_pocketos/)
- [10 起真实 AI Agent 事故复盘 — DEV Community](https://dev.to/claude-go/what-10-real-ai-agent-disasters-taught-me-about-autonomous-systems-2ndc)
- [Claude Code 沙箱设计:两层隔离减少 84% 权限提示 — Anthropic Engineering](https://www.anthropic.com/engineering/claude-code-sandboxing)
- [Agentic AI 重新定义管理:69% 专家认为是范式转变 — MIT Sloan Management Review](https://sloanreview.mit.edu/article/agentic-ai-at-scale-redefining-management-for-a-superhuman-workforce/)
- [管理 AI Agent 的核心技能 — 世界经济论坛](https://www.weforum.org/stories/2025/07/leaders-will-soon-be-managing-ai-agents-these-are-the-skills-theyll-need/)
- [Agent Manager:2026 年企业新岗位 — Beam AI](https://beam.ai/agentic-insights/what-is-an-agent-manager-the-new-role-every-ai-company-needs-in-2026)
---
### 模型快 5 倍,就不再是同一个模型
- URL: https://guanjiawei.ai/zh/blog/inference-speed-new-species
- English: https://guanjiawei.ai/en/blog/inference-speed-new-species
- Published: 2026-05-22
- Tags: AI, 推理优化, Infra, 思考
这周看到两个发布。
5 月 19 日 Google 发了 Gemini 3.5 Flash。我看了一下他们的发布会,奇怪的是模型本身的智能水平没怎么强调。从 benchmark 上看,跟前一代相比也没那么醒目。但他们花了很大篇幅讲速度,说这是"为速度而生的前沿智能",宣称推理速度是其他前沿模型的 4 倍。
今天 5 月 22 日,智谱也发了 GLM-5.1 高速版,宣称 400 token/s 的输出,是当前业界 API 的速度上限。这套引擎不是智谱自己单独搞的,是和一个叫 TileRT 的团队联合做的,专门针对 GLM 这一款模型在某一类硬件上做了底层定制。
把这两件事放在一起,再回头看几个月以来 Anthropic 的 Opus Fast、OpenAI 的 GPT-5.5 Fast,方向其实就清楚了:模型层的差异化开始换车道了。原本大家比的是聪明,现在越来越多地开始比谁更快。
而且速度这件事一旦跨过某条线,就不再是"快了几倍"这种线性的提升了。它会让 AI 变成一种不同的东西。
## 一、定价已经在告诉我们答案了
最直接的一个证据是 fast mode 的定价。
Anthropic 的 Opus Fast:2.5 倍速度,6 倍价格。
OpenAI 的 GPT-5.5 Fast:1.5 倍速度,2.5 倍成本。
注意比例。如果速度的价值是线性的,那 2.5 倍速度应该卖 2.5 倍价格,1.5 倍速度卖 1.5 倍价格。但实际定价里,价格涨幅明显超过速度涨幅。
这不是模型公司在贪。这是真实的定价信号:市场里真有一群人愿意为速度多付钱。他们的任务要么是高频反馈的,要么是用户在那干等的,要么是后续步骤被它卡住的。这些场景里,从 30 秒变成 12 秒,跟从原本的 30 秒变成 20 秒,体感完全不是一回事。
我自己用 Opus Fast 的时候,开开关关好多次。GPT5.5的1.5 倍速度的那个档我直接关了,体感不明显,纯亏钱。但到了 2.5 倍那一档,就有些任务我愿意一直开着——主要是那种我盯着结果看的、需要反复迭代的活儿。
市场是诚实的。一个东西能卖出 6 倍价格,意味着真有人觉得它值。
## 二、单路速度和"堆机器"是两回事
这里得先分清楚两件事。
第一件事是"在一个固定速度下做更多并发"。同样 30 token/s 的吞吐,原本服务 100 个用户,现在服务 1000 个。这事相对好办。机器堆上去就行,可以用稍微弱一点的卡多买几张分摊,性价比能调出来。
第二件事是"让单个请求跑得更快"。原本 30 token/s,要让它跑到 400。这事就完全不一样了。你需要更高端的硬件,更激进的显存带宽,更尖端的封装工艺。这些不是"多花点钱堆几张卡"能解决的。你想加快单路,弱的卡堆 100 张也加不到一张顶级卡的速度。
我自己做过一段时间推理 infra 的实验,跑过几个开源模型自己优化。这两件事的成本曲线完全不一样。第一种近似线性,多花一倍钱基本能多出一倍并发。第二种是非线性的——前面 20% 的提速可能花你 50% 的成本,再往后越来越陡。
所以当你看到 Gemini 3.5 Flash 强调速度,或者 GLM 高速版冲到 400 token/s,他们说的不是"我们做了更便宜的版本",而是"我们把单路速度推到了一个新位置"。这件事的难度,是另一个量级。
## 三、5 倍是一条物种线
那为什么要拼命做这件事?
我自己想这个问题的时候会回到一个朴素的对比。
如果你想让一件事更快完成,传统上有几种办法。
第一种是请更厉害的人。但这条路有顶。世界上最强的人就那么几个,而且现在最聪明的模型已经接近这条线了。
第二种是让人加班。Agent 已经 7×24 干活了,这条线也到顶了。
第三种是分工,多投几个人进去。但你做过工程的就知道,加人不是线性的。加 1 个人不会变快 1 倍,加 10 个人也远远做不到 10 倍。中间要做拆解、要做交接、要协调、要处理参差不齐、要管浪费。新员工入职那个 ramp up 周期,很贵。做 multi-agent 编排的人现在感受应该最深。
到这里你会发现,传统加速的几条路都很难再往前推。
那剩下还能干什么?让一个模型,同一个员工,本身变快。
而且这种"同一个员工变快"是非线性的。
你想象一下,一个员工原本 1 个小时干完一件事。现在他 10 分钟干完,你以为只是省了 50 分钟?不止。
你会开始让他干那些原本因为"太慢了所以根本不会让他干"的事情。一些临时小需求,原本要等一个小时才能看到结果,你就懒得提了;现在 10 分钟出来,你一天能提十几个。这些原本根本不存在的任务,被速度激活了。
我前两天看到一个 demo,一个人戴着眼镜,对着屏幕上的视频指了一下,说"这个放大",背后 AI 直接写了一段代码把页面元素调整了。整个链路如果要 30 秒,你看了一眼大概就走开了,根本谈不上实时交互。但如果 5 秒钟内就完成,体感就完全不一样了,那变成了一个真正能用的产品。
这就是 50 token/s 到 400 token/s 的区别。8 倍速度,激活的是原本根本做不出来的产品。
5 倍以上的提速,是一条物种线。
## 四、专用化的回归
OK,承认了速度有价值,问题来了:怎么把速度做出来?
这就要讲讲 TileRT 的做法,它跟一年前业界的主流路径不太一样。
主流推理框架像 vLLM、TensorRT-LLM、SGLang 这一类,都是通用的。设计目标是"装下尽可能多的模型,在尽可能多的硬件上跑得还行"。这是软件工程长久以来的默认偏好:通用性优先,性能次之。
TileRT 反过来。它的做法是把整个推理图在编译期静态排好,作为一个常驻 Kernel 跑在 GPU 上,几乎不做运行时的动态调度。粒度细到 tile 级别的微任务,能把硬件压榨到接近物理极限。代价是什么?换个模型基本就废了,换个硬件也得大改。
DeepSeek 也是这条路。他们自己的推理引擎前期基于 vLLM,后来深度定制了一年多,几乎所有路径都为自己的 MoE 架构重写过一遍。前阵子他们开源了一部分,业界看完之后感叹的不是"这有多通用",而是"为一个模型能做到这么深"。
再往下看一层,硬件层早就在走这条路了。Groq 的 LPU 跑 Llama 4 Scout 能到 460 token/s,是 H100 的 3-4 倍。Cerebras 的 WSE-3 在 70B 模型上能跑到 1800 token/s,gpt-oss-120B 上接近 3000。这些都是专用硬件。它们不打算去跑各种各样的模型,就是为了某一类工作负载做到极致。
这条路其实在芯片行业讨论过很多年了。通用 CPU 还是专用 ASIC?通用芯片有它的好,但只要某个领域的需求足够大、生命周期足够长,专用化的投入就值得做。
软件层以前不太走这条路,主要是因为软件本身写起来就不便宜。专门为一个模型写一套推理栈,回本周期太长,很容易模型一换,你的软件就作废了。
现在情况变了。AI agent 自己能写软件了。"为一个特定的模型和硬件,从零搭一套最优的推理栈"这件事,成本一年比一年低。一旦这个成本压到某个临界点,专用化就会变成默认选项。
每一个有潜力的模型,未来都会有自己的专属推理引擎。每一代主流硬件,也都会有自己专门优化过的栈。你以前以为这只是"优化的最后 5%",现在它可能会变成 5 倍、10 倍的差距。
## 五、模型层的垂直整合,没办法避免了
把这些线索拉到一起。
智能这条线短期内还会涨,但单点比拼的边际效用在下降。再聪明 20% 的模型,跟把同一个模型加速 10 倍相比,对很多用户来说后者的价值大得多,尤其是对那些刚被速度激活出来的新场景。
所以下一阶段的竞争,会从"单点的智能"变成"端到端的能力"。模型 + 推理引擎 + 硬件,三件事捆在一起比拼。
如果你 400 token/s,我 30 token/s,就算我的模型聪明 20 倍,在很多场景里我也没法用。我会看着我自己最聪明的模型坐在那里慢慢吐字,你已经把整个产品体验交到用户手里了。
DeepSeek、智谱已经在做这件事。Anthropic、OpenAI 也在做。Google 应该是做得最早最深的,TPU + Gemini 这套组合早就在内部跑了。我猜接下来一两年,整个行业会越来越往这个方向走:模型公司必须有自己的推理栈,必须深入到硬件层;硬件公司必须深入到模型架构;中间通用的那层,会被两头挤压。
这条路对工程师来说其实挺刺激的。以前我们觉得"通用、可扩展、可移植"是软件工程的好品味。未来一段时间里可能恰恰相反,为特定模型、特定硬件,写一套最极致但"换个东西就不能用"的代码,会重新变成一件值得做的事。
软件工程的审美,要换一换了。
---
## 参考资料
- [Gemini 3 Flash: frontier intelligence built for speed(Google Blog)](https://blog.google/products-and-platforms/products/gemini/gemini-3-flash/)
- [Gemini 3.5 Flash - Intelligence, Performance & Price Analysis(Artificial Analysis)](https://artificialanalysis.ai/models/gemini-3-5-flash)
- [智谱 GLM-5.1 高速版 AI 模型发布,跑出全球最快速度 400 tokens/s(新浪科技)](https://finance.sina.com.cn/tech/digi/2026-05-22/doc-inhytqkw6284792.shtml)
- [智谱(02513)推出 GLM-5.1 高速版 API 400 tokens/s 刷新全球速度上限(网易)](https://www.163.com/dy/article/KTHAMEVM05198UNI.html)
- [TileRT v0.1.3 发布:GLM-5 支持上线,推理速度高达 600 tokens/s](https://www.itsolotime.com/archives/21459)
- [Claude Opus 4.7 Fast Mode: 2.5x Speed, 6x the Cost(byteiota)](https://byteiota.com/claude-opus-4-7-fast-mode-2-5x-speed-6x-the-cost/)
- [Claude Code /fast Mode: Is 6x Pricing Worth It?(Groundy)](https://groundy.com/articles/claude-code-fast-mode-6x-pricing-worth/)
- [Speed — OpenAI Codex Developers](https://developers.openai.com/codex/speed)(GPT-5.5 Fast 1.5x 速度 / 2.5x 成本)
- [Open-Sourcing DeepSeek Inference Engine: A New Chapter in AI Infrastructure(StableLearn)](https://stable-learn.com/en/deepseek_inference_engine/)
- [Groq LPU Architecture](https://groq.com/lpu-architecture)
- [Cerebras CS-3 vs. Groq LPU](https://www.cerebras.ai/blog/cerebras-cs-3-vs-groq-lpu)
- [Groq vs Cerebras: LLM Inference Speed Comparison 2026(Speko)](https://speko.ai/benchmark/groq-vs-cerebras)
---
### AMD 开发者大会给一个不会写代码的人颁了奖
- URL: https://guanjiawei.ai/zh/blog/non-coder-award
- English: https://guanjiawei.ai/en/blog/non-coder-award
- Published: 2026-05-19T18:00:00
- Tags: AI, AI Agent, 思考
今天去上海参加 AMD 的开发者大会。
到门口就有点震惊。入场队排得很长,里面还没开始就已经挤满了人。原本预计 1000 多人,最后来了 2000 多。AMD 自己说这是他们近期参与人数最多的一场。
Lisa Su 也来了。她昨天刚在北京见过副总理何立峰聊芯片合作。芯片公司的开发者大会能办到这个规模,以前真没见过。
## AMD 给一个不会写代码的人颁了奖
上午一位 AMD 高级副总裁上台,给两位开发者颁奖。介绍其中一个人的时候,主持人说了一句:
"他过去并不会写代码。"
这个人用 AI agent 把一套东西用 Rust 重写了,做了性能优化。AMD 觉得这事值得颁奖。
我坐在下面,感觉这画面挺魔幻。一家几千亿美金市值的芯片公司,2000 人的开发者大会,把两个奖之一颁给一个不写代码的人。
我猜明年这个奖会更难评。这样AI Native的人只会越来越多。
## 开发者和用户的边界在消失
以前用一款产品的人就是用,没办法真的参与建设。开源项目你也得先会写代码才能贡献。
现在不一样了。coding agent 越来越强,普通用户在用的过程里就能反向去改、去优化、再推回去。一个用户既是使用者,也是建造者。
[之前我写过 Builder 和 Promoter 的分化](/blog/ai-amplifies-passion),那是说热情的分叉。这一层是反过来:用户和贡献者的角色重叠了,经常可以是同一个人。用户同时也在投资他的token给不同的产品,谁的产品值得大家用token投资就能持续演进。
做产品的逻辑因此变了。你以前考虑的是怎么让用户用得爽,现在还要想怎么让他们顺手成为贡献者。
AMD 这次大力推 Strix Halo 这件事很有意思。AI Max+ 395 这颗芯片,集成显卡最多可以分到 96GB 显存跑本地模型,[我做的推理引擎也能跑在它上面](/blog/inference-engine-last-puzzle-piece)。国内一直在涨价、缺货,我这好几个研发测试机,用来做性能优化,也确实是熟悉ROCm生态的一个入口。
AMD 推这台机器,是想把开发者上手的门槛再降一档。开发者多了,技术栈就有粘性。
## 行业风向,半年转了 180 度
去年中我参加过类似的会。氛围完全不是这样。
那时候做算力的人都在愁。去年初 DeepSeek 把模型预期抬了上去,大家在想后面这个浪潮还能不能持续。卖货怎么办、库存怎么消化、生意还做不做得起来。每个人都很积极地找解决方案、找合作。
今年我发现桌上的话题彻底变了。第一句话是"你们能不能再给我点货?""我有多少就能消化多少。"
完全反过来了。供给侧紧张,谁有优质货源谁就在挣钱。从需求焦虑变成供给焦虑,中间只隔了半年。
## 不是又一场泡沫
很多人会说:又一次嘛,下一个元宇宙吧。
这次真不一样。元宇宙,区块链那会儿我也都经历过,这次不一样的地方要从数据上看,而且是付费的真实需求数据。
Lisa Su 在台上说,现在全球大约有 10 亿人在用 AI,到 2030 年这个数字会到 50 亿日活。ChatGPT 2022 年底出来,到现在不到 3 年。互联网当年走到这种量级用了 20 多年,PC 时代更久。这是历史上从没出现过的扩散速度。
钱也跟得上。Anthropic 第一季度同比涨了 80 倍,是年化收入,不是调用量。Dario 自己说他们都没准备好接住这么大的浪。Claude Code 上线半年内年化跑到 10 亿美金,到今年 4 月公司整体冲到 300 亿美金 ARR。
这跟前几年大家打价格战、免费送 token、看调用量是两回事。供给追不上付费需求。
## "X 凉了"是最廉价的叙事
最近有朋友问我:"Openclaw 是不是要凉了?""Claude code 怎么样?""听说 Codex 要赢了。"
我觉得这是惯性思维。
去年 12 月所有顶级学术会议和产品圈都在聊 Gemini,那时候大家觉得 Google 赢麻了。几个月过去几乎没人再提Gemini。然后是 Cursor,再然后是 Claude Code。估计再过一阵又会是 Codex。最顶级的牌桌上一直在你方唱罢我登场。
但底层趋势是单向的,没逆过。付费需求在涨,调用规模在涨。
真实信息的成本很高。你得自己上手用,去现场看,跟在里面的人聊。所以受众天然就小。"凉了""泡沫""又是一茬"这种叙事成本最低,迎合大多数人"我没上手用是对的"的心理自我认同,最容易传播。
不是说这些话没人信。是大多数人就爱信这种。
## 走一走,看一看
我最近跟朋友碰面经常做一件事:让他把电脑带来,我帮他装一下 Claude Code 或者 Codex,把模型连好。
[这一步跨过去,95% 的电脑工作都能交出去](/blog/coding-agent-adoption-gap)。我从零搭自己的官网都没动过手,前端、DNS、SEO 全是 agent 做的。门槛是有一点点,但跨过去之后整个世界就不一样了。
再简单一点的话,今年找一场真在干这件事的会议去看一看。我看现场还有不少工作坊,让带电脑现场实操的。坐在那里你才会发现,AI 这事已经走到什么程度了。
---
## 参考资料
1. [AMD CEO Lisa Su 在上海预测 5 年内 50 亿日活 AI 用户](https://technode.com/2026/05/19/amd-ceo-lisa-su-in-shanghai-predicts-five-billion-daily-ai-users-within-five-years/) — 2026 年 5 月 19 日 AMD AI Developer Day 上海现场报道
2. [副总理何立峰会见 Lisa Su,呼吁更深合作](https://news.cgtn.com/news/2026-05-18/Chinese-vice-premier-meets-AMD-CEO-calls-for-deeper-cooperation-1NfLteD25Y4/p.html) — 2026 年 5 月 18 日,何立峰在北京会见 AMD CEO Lisa Su
3. [CES 2026:Lisa Su 预测 5 年内 AI 用户超 50 亿](https://www.cnbc.com/video/2026/01/06/amd-ceo-lisa-su-expect-over-5-billion-active-ai-users-in-the-next-five-years.html) — Lisa Su 在 CES 主题演讲上首次给出 50 亿用户预测
4. [Anthropic 一季度增长 80 倍,年化跑到 300 亿美元 ARR](https://venturebeat.com/technology/anthropic-says-it-hit-a-30-billion-revenue-run-rate-after-crazy-80x-growth) — Dario Amodei 公开承认 Q1 80 倍同比增长
5. [Anthropic 4 个月内 ARR 从 90 亿冲到 300 亿](https://www.mindstudio.ai/blog/anthropic-30b-arr-4-months-pulling-ahead-openai) — 完整 ARR 轨迹:2024.01 8700 万美元 → 2024.12 10 亿 → 2025 年底 90 亿 → 2026.04 300 亿
6. [Claude Code 上线半年内年化收入破 10 亿美元](https://www.saastr.com/anthropic-just-passed-openai-in-revenue-while-spending-4x-less-to-train-their-models/) — Claude Code 是 Anthropic 增长最快的产品
7. [ChatGPT 是史上最快达到 1 亿用户的消费产品](https://time.com/6253615/chatgpt-fastest-growing/) — 上线 2 个月达到 1 亿用户,比 TikTok、Instagram 都快
8. [AI 普及速度与历史技术对比](https://epoch.ai/gradient-updates/after-the-chatgpt-moment-measuring-ais-adoption) — Epoch AI 研究:70% 美国家庭采用率从 1900 年的 40 年缩短到 2000 年的 17 年
9. [AMD Ryzen AI Max+ 395 (Strix Halo) 官方规格](https://www.amd.com/en/products/processors/laptop/ryzen/ai-300-series/amd-ryzen-ai-max-plus-395.html) — 16 个 Zen 5 核心、Radeon 8060S、最高 128GB LPDDR5X 统一内存(最多 96GB 可分配给 GPU)
10. [Ryzen AI Max+ 395 在中国市场缺货涨价](https://videocardz.com/newz/amd-ryzen-ai-max-strix-halo-processors-now-available-for-standalone-purchase-in-china) — Strix Halo 标准芯片在中国零售市场的紧俏现状
---
### 同一个 /goal功能,两种Agent性格
- URL: https://guanjiawei.ai/zh/blog/goal-two-personalities
- English: https://guanjiawei.ai/en/blog/goal-two-personalities
- Published: 2026-05-18
- Tags: AI, Coding Agent, Codex, Claude Code, Opus 4.7, 思考
Codex 的 `/goal` 我用了几周,把 token 消耗推上了又一个台阶。Claude Code 5 月 12 日的 2.1.139 版本里也把这个功能加进来,而且一上就是正式版,不是实验态了。我手里正好有几个 Codex 一直没搞定的任务,顺手挪过去试了一下。
结果反差挺大。同一个范式,几乎一样的循环,两个模型跑出来不像同一回事。
写下来一是给自己复盘,二是觉得值得说说。`/goal` 这套东西,与其说是一个功能,不如说是一种新的工作形态。形态长一样,模型的"性格"不一样,实操上就完全是两件东西。
## 一、Codex 这边:闷头干、不问、不放弃
先把 Codex 这边的体验记下来,作为对照基准。
Codex CLI 的 `/goal` 是 0.128.0 开始有的实验功能,我从那时候就在用,前面也专门写过一篇。它最大的变化其实在心态上,我真的开始相信"放手让 agent 跑"是成立的事情。
它不打扰你。Codex 跑 `/goal` 的时候几乎不调 subagent,基本 inline 自己干,除非我非常明确地让它 delegate。compact 做得也比我想象中好,压完回到上一轮,信息损失不大,继续往前推也不会突然变笨。最重要的是它认死理。几乎不会跟我说"这个 goal 取得不了",哪怕真撞墙了,它会换一个角度再试,再换一个再试,试到 token 预算耗光为止。这个我反复验证过,挂 3 个独立 `/goal` 跑一夜,早上看,基本都还在轨道上。
上下文窗口是个客观短板。Codex 在 GPT-5.5 下默认 400K,OpenAI 那边是平衡定价和吞吐做的取舍,API 是完整 1M。Claude Code 这边默认就是 1M。但即便 400K,Codex 在 `/goal` 里跑得很稳。
## 二、Claude Code 这边:起手很漂亮,然后呢
5 月 12 日 Anthropic 一口气把 `/goal`、Agent View、`/bg`、`/loop`、`/batch` 都上了。我第一反应是"终于"。Codex 这块跑了好几个版本,Claude Code 跟得有点慢。
我把那几个 Codex 没拱下来的任务挪过去,挂上 `/goal`。
起手是真好看。Claude Code 一上来就调 subagent、列 plan、规划上下文,看着比 Codex 大开大合多了。我心里期望立刻就上去了,按这个起手势,应该会比 Codex 表现更强。
跑着跑着,事就来了。
最先让我皱眉的是,它会蹦出来让我做选择。这本来是 Claude Code 招人喜欢的一面:遇到判断它不闷头干,会停下来跟你对齐,问"下面 A、B、C 三个方向你倾向哪个",问题问得也挺到位。但在 `/goal` 里这就是个 bug 而不是 feature 了。`/goal` 的整个设计意图就是"你给目标,我自己跑,你别管",中间所有的判断模型自己应该 own。一蹦出来问问题,几个小时被解放出来的时间就又收回去了。你不在屏幕前,它就这么挂着等你回来。
更意外的是,它会主动跟我说"这个 goal 我达不到"。然后真的就把 goal fail 了。有时候才跑了几十分钟。理由通常是"这个任务工作量好像太大,这个 session 可能搞不定",或者"我觉得这里有一些根本性的阻碍"。我让它继续,它会再勉强往前走一段,然后再来一次。
第三件事是 compact 之后会变笨。1M 上下文听起来很大,但跑到后面会变笨这事,Anthropic 自己都承认过。更要命的是压缩这步:每次 compact 之后,Claude Code 经常显得"前面那一大段都忘了",原本的计划、原本踩过的坑、原本的 context,都要重新拼一遍。Codex 的 compact 没这么严重。
这三件凑一起,长程任务在 Claude Code 的 `/goal` 里就跑不稳了。
## 三、这不是我一个人的体感
我一开始以为是自己用法的问题。翻了一下才发现,Opus 4.7 的"懒"早就是公开认知了。
Opus 4.7 是 4 月 16 日发布的。发布 48 小时之内,Reddit 上一个标题叫"Opus 4.7 is not an upgrade but a serious regression"的帖子拿了 2300 多个 upvote。AMD 的 AI 总监公开吐槽现在 Claude Code 是 "dumber and lazier"。各种截图满天飞,有人贴出对话,Claude 自己回复说 "I was acting lazily"。
Anthropic 后来出了一份 postmortem,承认 4 月 16 日他们在系统提示词里加了一段"降低 verbosity"的指令,这条指令和其他几处变动一起,把 coding 质量拖了下来。4 月 20 日他们把这条指令撤回了。但我的体感是,撤回之后 Opus 4.7 的"懒"只是缓解了一点,没完全好。RL 那一层已经把这种倾向内化进去了,改一段系统提示是改不动的。
在 `/goal` 这种延长的连续作业里,"懒"会被进一步放大。一个"懒"的模型,在短任务里可能还糊弄得过去,放到长任务里它就会找各种看起来合理的理由把自己 fail 掉。
## 四、这几个月其实在做同一件事
`/goal` 这套范式不是凭空冒出来的,是几个月探索的收束。
春节前我自己就在折腾类似的事。当时在做 AIMA(我们的模型管理平台)的稳定性测试,核心想法是让 AI 模拟真实用户反复跑测试,以提升稳定性。最朴素的尝试就是用 terminal 自带的 task 机制,设 10 个 task,每个让它跑很久。
这条路很快就死了。每个 task 还是同一个 session 里的事,模型在长 session 里训得不好,几轮之内就开始失稳,prompt 怎么调都救不回来。
下一步我去找双层架构。当时 Kilo Code 在推一个叫 Orchestrator Mode 的功能,更早叫 Boomerang Tasks,是从 Roo Code 那继承来的。逻辑很对路:外层一个 orchestrator 管任务,每个子任务交给一个独立 subagent 在独立上下文里跑完,再回来汇报。
我拿当时性价比高的几个模型试了一轮。智谱的表现稍好,长任务能拱一会儿。Minimax 那边就比较搞笑,它在 orchestrator 层就开始自己写代码,根本不 delegate,双层架构对它直接失效。这事我后来想了挺久,不太像是 harness 适配的问题,更像是模型本身缺乏"我是 lead,我应该委派"这个 sense。
2 月,Claude Code 跟 Opus 4.6 一起出了 Agent Teams,实验功能,要在环境变量里加 `CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS` 才能打开。一个 session 作为 team lead,安排其他 subagent 在新上下文窗口里完成任务,基本就是 Kilo 那套架构的官方版本。我当时试完真的有点震撼,长任务能跑两三个小时不崩。
但 compact 一次,team lead 那边就乱了。之前安排的 subagent 找不到了,会重新派一轮,任务列表错位,token 也烧得快。两层架构本身也会有信息衰减,上下文在两层之间反复传,每次都丢一点。
再往后是 Ralph,全名 Ralph Wiggum。澳洲一个开发者 Geoffrey Huntley 在 2025 年底搞的,逻辑简单到让人怀疑:一个 bash while-true 循环,反复喂同一个 prompt 文件给 agent,跑到目标达成为止。我当时想试它的 tmux 版本,踩了点坑没搞定,搁置了。
Ralph 传播极快。`/goal` 这条产品线最直接的灵感来源就是它。到今天,Anthropic 已经把 Ralph 收编为 Claude Code 的官方 plugin,放在仓库的 `plugins/ralph-wiggum/` 下;Kilo Code 的 Orchestrator Mode 反过来被官方标记 deprecated,理由是"主 agent 现在可以直接 delegate subagent,不再需要专门的 orchestrator"。
terminal 手搓 task,到 Kilo Orchestrator,到 Claude Code Agent Teams,到 Ralph 走红,到 Codex 上 `/goal`,到 Claude Code 上 `/goal`、Ralph 被收编、Kilo Orchestrator 被废弃。几个月的演化线很清楚。
## 五、Codex 一头扎,Claude Code 总在抬头
回到模型本身。
跑过这两个之后我有个比较确定的判断:Codex 是"局部派",Claude Code 是"全局派"。
数学里有个概念叫局部最优。优化空间像个山谷,你从一个点出发,每一步往低处走,可能最终落在一个局部最低点,但翻过这个山头,另一边其实有个更深的谷。Codex 跑 `/goal` 的时候,我多次见它陷进这种局部最优里:一个方向反复打磨,做完这个那个再回来,转圈,它觉得自己在前进,实际原地踏步。它的"闷头干"在大部分时候是优点,在这种时候就反过来。
Claude Code 不一样。它会做大跨度的反思和验证,会主动问"我现在的方向对吗"。我多次看到它从一个看起来已经收敛的方向里跳出来,说"等等,这个问题的根源可能不在这,我得重新看一下",然后真的换路找到了一条更对的路径。
这个全局观是 Claude Code 的强项。1 到 2 小时的复杂任务,需要判断、反思、跨模块协同,我现在仍然觉得 Claude Code 比 Codex 强。
可是这种全局观换不来持久力。它在 `/goal` 里跑不长,给不出 24 小时无人值守的稳定产出。说个不太严谨的比方:Codex 是个能闷头干 12 小时的实习生,方向偶尔会偏;Claude Code 是个有判断力的高级工程师,但他每跑 40 分钟就要找你确认一次,或者半小时就觉得"这事不好搞我先撤"。哪个更适合 `/goal`,答案太明确了。
## 六、形态在统一,训练在分化
跑下来我对 coding agent 接下来几个月的走向多了一个判断:harness 在快速趋同,但模型的"性格"差异会越来越显眼。
Boris Cherny(Claude Code 创始人)早就在说未来 harness 可能只剩 100 行代码。这件事我现在更信了。`/goal` 这个范式一旦收敛,coding agent 的外层结构会越来越薄。一个循环、一组工具、一个目标,够了。
接下来真正决定差距的是模型在这个循环里的"性格"。它愿不愿意闷头干。它会不会动不动跑出来跟人对齐。它的 compact 之后状态保不保得住。它陷在错的方向里,有没有自己跳出来的能力。它撞到墙了,是再敲一遍,还是直接说"这个 goal 我搞不定"然后撤。
这些都不是 prompt 能调出来的,是训练阶段就定下来的。
OpenAI 和 Anthropic 在长程任务里训练出的"模型性格"已经显著不一样。Codex 像是被反复训练成"不许半途而废,撞墙就再来"。Claude Code 像是被训练成"勤于汇报、勤于对齐、勤于反思",这套在交互式场景里招人喜欢,放到 `/goal` 里就成了致命伤。
短期内这种分化还很难互补。Anthropic 把 verbosity 那段系统提示撤回之后,Opus 4.7 的"懒"也只是缓解,没完全恢复。RL 把它内化进去了,改外层提示是改不掉的。
## 七、选 agent 越来越像选合作伙伴
到这一步,我用 `/goal` 的方式也变了。
我现在不太会先想"哪个工具更强",而是先想:这任务的性格适配哪个模型。
要持续 6 小时以上的迭代,目标明确,试错成本低,我直接挂 Codex 的 `/goal`。要做架构判断、跨模块决策、可能要中途换方向,我用 Claude Code 的 `/goal`,但每三十分钟到一小时会回来看一眼,而且基本上得做好它中间会蹦出来问问题的心理准备。真要无人值守跑 24 小时,只能是 Codex,任务方向还得预先收敛得清楚。要是只是个单点突破的难题、需要全局视野去看的事,我反而不开 `/goal`,直接用 Claude Code 普通模式,半小时能搞定。
几个月前选 agent 是选界面、选社区、选定价。现在选的更多是一个"模型性格"。
下一代模型不管是 Anthropic 还是 OpenAI,一定会朝着"修补对方的短板"去训。Codex 会想办法补全局观,Claude Code 会想办法补持久力。短期内这种性格分化还是真实存在的,而且会显著影响你能从 `/goal` 里榨出多少价值。
`/goal` 这套东西最大的作用,是把模型的真实"性格"放大成了 24 小时连续产出。性格更稳的那个,在这一仗里就领先。
现在是 Codex 领先半步。但只领先半步。
---
## 参考资料
- [Claude Code 2.1.139 adds /goal command — explainx.ai](https://explainx.ai/blog/claude-code-goal-command-long-running-agents-2026):2026/5/12 Claude Code `/goal` 上线说明
- [Claude Code Agent View, Goal Command, and Background Sessions Update — Geeky Gadgets](https://www.geeky-gadgets.com/claude-code-agent-view-update/):Claude Code 2.1 系列功能详解
- [Inventing the Ralph Wiggum Loop — Dev Interrupted](https://devinterrupted.substack.com/p/inventing-the-ralph-wiggum-loop-creator):Geoffrey Huntley 谈 Ralph 的发明过程
- [Ralph Wiggum 官方 Claude Code plugin — GitHub](https://github.com/anthropics/claude-code/blob/main/plugins/ralph-wiggum/README.md):Anthropic 已收编 Ralph 为官方 plugin
- [Kilo Code Orchestrator Mode (Deprecated)](https://kilo.ai/docs/code-with-ai/agents/orchestrator-mode):Kilo Code Orchestrator 当前状态
- [Orchestrate teams of Claude Code sessions — Claude Code Docs](https://code.claude.com/docs/en/agent-teams):Agent Teams 官方文档
- [Claude Code experimental agent teams — DeepakNess](https://deepakness.com/raw/claude-code-agent-teams/):Agent Teams 与 Opus 4.6 同期发布的说明
- [Claude Opus 4.7 Regression Explained — buildfastwithai](https://www.buildfastwithai.com/blogs/claude-opus-4-7-regression-explained-2026):Opus 4.7 退化与社区反馈
- [Opus 4.7 isn't dumb, it's just lazy — Shimin Zhang](https://shimin.io/journal/opus-4-7-just-lazy/):Opus 4.7 的"懒"问题分析
- [An update on recent Claude Code quality reports — Anthropic Engineering](https://www.anthropic.com/engineering/april-23-postmortem):Anthropic 官方 postmortem,撤回 verbosity 系统提示
- [GPT-5.5 Codex 400K context window — GitHub Issue](https://github.com/openai/codex/issues/19464):Codex 上下文 400K 上限说明
- [Boris Cherny on Claude Code's future — Pragmatic Engineer](https://newsletter.pragmaticengineer.com/p/building-claude-code-with-boris-cherny):"100 行代码"判断
---
### AI变革不是培训出来的
- URL: https://guanjiawei.ai/zh/blog/ai-transformation-not-from-training
- English: https://guanjiawei.ai/en/blog/ai-transformation-not-from-training
- Published: 2026-05-16
- Tags: AI, AI Agent, 思考
最近跟不少朋友聊天,聊到 AI agent 的时候我有个习惯,会掏手机远程连到电脑上,把过去 24 小时正在跑的几个 agent 打开给他们看。这个围绕某个目标已经自动跑了十几个小时,那个在做实验调参数。
大家看完以后反应挺一致的:原来已经到这个程度了,跟自己之前想的不一样。
接下来的反应就很有意思了。
## 一、"帮我给老板讲讲"
朋友们看完以后,第一句话基本都是这类:
"能不能来给我们老板讲讲?"
"我想带我们技术负责人过来看看。"
"你能给我们做个培训分享吗?"
没毛病。你觉得这事重要,想把最相关的人拉进来,这个动机很好。
但回头看我们公司自己 AI agent 渗透进来的过程,说实话,真正推动变化的不是哪堂课、哪次分享。
是某个人自己先做起来了,在他手头的事情里搞出了一个让周围人觉得"不对劲"的变化。
一个做销售的人,突然技术搞得很专业,像工程师一样,本职出单效率还特别高。一个做行政或 HR 的,发现她竟然也能搞技术、做 marketing,在原来的岗位上搞出了产品级的东西。周围人开始觉得奇怪——你怎么不太像原来那个销售、那个行政了?
到这一步,好奇的人自然就来了。同事、上级、朋友,变化就发生在他们身边,他们看得到,这时候你讲什么他们才真的能收进去。然后从你这里传导到另一个同事,再影响另一个,再扩散开。
想靠"我去促成一个机会,让老板听一堂课"来推动——坦白说很难。除非那个老板本人第一天就自己上手用了。因为现在对 AI 能做什么、不能做什么的认知,全来自于亲手摸到边界,不是听来的。
这事有数据佐证。BCG 2025 年初的报告说,75% 的高管把 AI 列为前三优先级,但只有四分之一真正拿到了显著价值。McKinsey 那边更直白——70% 的员工直接跳过公司提供的正式 AI 培训视频,靠自己摸索和同事之间口耳相传来学。
培训能传递的信息量就那么多。而更可怕的是,一个自己没深度用过 AI 的人如果去制定政策,很容易走两个极端:要么异想天开,以为 AI 什么都能干,定了一堆不切实际的 KPI,底下人苦不堪言,而且他觉得这很简单;要么完全不屑一顾,"又是泡沫又来一遍",然后错过了真正的窗口。
所以第一个误区,也是我觉得最大的一个:不要总想从别人身上出发。自己先做。
## 二、博士水平的 AI 在写周报
第二个事我觉得挺可惜的。
不少头部公司给员工提供的 AI 基础设施非常好,最顶尖的模型,不限用量,政策也宽松。但大多数人拿到以后,下意识就从最常规的任务入手——开会总结、汇报材料、周报月报——做完也就停了。
不是说这些不该做,AI 在这些事上确实好用。但止步于此,说实话很浪费。
你如果沿着公司的价值链往深处看,最痛的环节——可能是 marketing,可能是 sales,可能是产品本身,也可能是技术研发——AI 是不是也能做点事?你不一定是那个领域的专家,但你对行业的理解加上 AI 的执行力,是有可能在那些节点上搞出东西的。
想想看。一个博士水平的 AI,你让它每天写周报,它就老老实实写周报——你安排什么它干什么,很听话。但你让它去研究前沿的数学、生物、医学,去做实验和推演,它也做得很好。一个是文员的价值,一个是科学家的价值。中间差的可不是一点半点。
Worklytics 的数据说,一个组织里真正深度使用 AI 的 power user 大概只占两到三成。剩下的人手里握着一模一样的工具,只用来做最浅的事。BCG 2025 年 10 月的报告也说,74% 的企业在扩大 AI 应用范围的过程中卡住了。不是工具不行,是用的人只用了它一个角。
## 三、光有长期没有短期,坚持不下去
这个问题比前两个隐蔽。
用 AI 一段时间以后,很多人会经历一条心态曲线:一开始"竟然这么强",然后慢慢变成"我到底该做什么"。方向看起来很多,都能做,但具体做什么、怎么持续下去,反而最难。
我自己踩过这个坑。
AI agent 确实能做很了不起的事,但它不是许愿机。一些比较大的方向,agent 也得烧大量 token,花很长时间,反复实验去探索、去调方向,才可能出结果。也可能出不了——你已经走到知识的边界了,往前探本来就不容易。如果你全押在这类项目上,中间很容易热情消磨殆尽。搞了半天看不到成果,别人问你在干嘛也说不清楚。
所以得搭配着来。
短期要有正反馈很快的事。我自己最短的反馈链来自[数字身份的经营](/blog/digital-identity-biggest-leverage),做官网 SEO 优化,有人循着搜索找过来了;写博客,有人觉得有收获,愿意分享和互动。中间穿插一些拿 AI 帮朋友做的小项目——[帮人装小龙虾](/blog/worker-before-manager)、给人做游戏,都是见效很快的事。
中期要有能沉淀下来的产品。AIMA 这套东西,拿去给潜在合作伙伴讲,有人愿意装、愿意推广,这是一种比"我搞了个实验"更结实的正反馈。
长期那些深水区的探索,则安静地跑着。
Kotter 变革管理八步里有一条叫"制造短期胜利",道理一样:短期成果撑住信心,你才有底气继续啃硬骨头。如果过程中还能带来一些收入,把 token 成本 cover 掉,那正循环就更稳了。
## 四、提示词是过去式了
最后一个,也是我觉得很多人还卡在上面的。
大家一说到用 AI,还是很关注提示词,觉得得把 prompt 研究透才行。
两年前这么想没问题。现在不是了。
现在的模型你给个目标,两句话,它就能去跑很复杂的任务。prompt 早就不是瓶颈了。
瓶颈在 harness。怎么给 agent 搭一个适合它干活的环境。
你要想的事变了:工作目录的文档结构怎么设计?怎么给它提供实验用的机器?什么时候去看看它有没有走偏?什么时候该让它换个方向或者换个方法?怎么做定期总结和归档?
Karpathy 2025 年初提了"vibe coding"——用自然语言随手让 AI 写代码,很自由。一年之后他自己复盘,说行业已经从 vibe coding 走到了"agentic engineering",价值从语法和实现层往上走,走到了判断力、品味和管理能力上。Shopify 的 Tobi Lutke 提了另一个词叫"context engineering"——不是怎么写好一句 prompt,而是怎么用对的信息去填满 agent 的上下文窗口。
说白了,AI 就是你的一个数字员工。你跟一个员工协作,不会觉得最重要的事是研究怎么给他写第一封邮件吧?那封邮件只是其中很小的一环。你真正需要想的是怎么给他配一套合适的工作环境和指导方式,发挥你对方向的把控,也发挥他的执行力,规避掉他容易犯的错。
把思路从"怎么写好一句话"转到"怎么管好一个数字员工",跟 AI 协作的感觉会完全不一样。
---
回头看,这四件事其实是一回事。
自己先做,别等别人。做了以后别停在舒适区,沿着价值链往深处看。给自己安排好节奏,短期反馈别断。然后把注意力从 prompt 转到环境和协作方式上来。
做出来的变化,不用你去推,它自己就会传导。
---
**参考资料**
1. BCG, *From Potential to Profit: Closing the AI Impact Gap*, January 2025.
2. McKinsey, *Superagency in the Workplace: Empowering People to Unlock AI's Full Potential at Work*, 2025.
3. Tobi Lutke (Shopify CEO), Internal Memo on AI Usage Expectations, April 2025.
4. Andrej Karpathy, Sequoia AI Ascent 2026: From Vibe Coding to Agentic Engineering, April–May 2026.
5. Tobi Lutke & Andrej Karpathy on "Context Engineering," 2025.
6. BCG, *The Widening AI Value Gap*, October 2025.
7. Worklytics, *AI Adoption Benchmarks 2025*, Q3 2025.
8. McKinsey, *The State of AI in 2025*, March 2025.
9. John P. Kotter, *Leading Change: Generate Short-Term Wins*.
---
### 两代人的跨越
- URL: https://guanjiawei.ai/zh/blog/two-generations
- English: https://guanjiawei.ai/en/blog/two-generations
- Published: 2026-05-15
- Tags: 思考, 中国, AI, 国际形势
昨天看特朗普访华的画面,说实话挺感慨的。红地毯、军乐队、国宴,马斯克、黄仁勋、库克都跟着来了,连国防部长 Hegseth 都在。近九年来美国总统第一次访华。
你想想这是谁。全世界最强大的国家的总统,带着一帮正在改变世界的企业家,过来坐下来谈。不是来"指导工作"的,是来谈合作的。
大家都知道特朗普什么风格。对他觉得不如自己的国家,基本上就是赤裸裸的,拳头大就是道理。这几年很多国家领导人在他面前的样子,说实话有些挺让人难受的,有些甚至有点滑稽。
但你看他在中国,完全换了一个人。收着的,客气的,说了不少好话。
为什么?因为你够强。弱国在今天这个世界,是真没什么尊严可言的。
## 先站住
1949年刚建国的时候,底子烂到什么程度?百年下来被打了个遍,列强进来过,日本人打过,自己人也打过。整个国家什么都没剩下。
但你看第一步做的事情,不是赶紧赚钱,是先让别人打不动你。
1950年朝鲜战争爆发。入朝的时候中国穷到什么地步?人均GDP几十美元。美国那边是坦克大炮飞机,这边连空军都没有,后勤也基本没有。就这种条件,投进去超过100万人,靠着敢打敢死,硬是把战线推了回去,打到签停战。
十几万人没有回来。
然后是两弹一星。
1964年原子弹爆炸。1967年氢弹试验成功,从原子弹到氢弹只用了32个月,所有拥核国家里最快的。1970年"东方红一号"上天,中国成了世界上第五个能自己发射卫星的国家。
23个功勋科学家,10个留美,6个留英,法国德国苏联也有。这些人在海外学完了,回来了。回到一个什么都没有的国家,在中国当时动荡的局势里,做出了世界前三的战略科技。
为什么说了不起?因为窗口期。
你今天看很多国家想搞核武器,根本做不到。环境早就变了,条约封死了。那个窗口过了就没了。当年那批人靠着顶尖的才华,用满腔热血,在一片荒芜上靠手搓,抓住了稍纵即逝的战略机遇。
## 从穷到富
前三十年把"打不倒"这个问题解决了。接下来要解决"吃不饱"。
1992年邓小平南巡。那会改革开放差不多要停了,保守势力起来了。一个87岁的老人,不在北京跟官僚们磨嘴皮子,直接跑去武汉、深圳、珠海,说了一句"发展才是硬道理"。
GDP增速直接从1990年的3.9%飙到1992年的14.3%。同年十四大确立"社会主义市场经济"。
我出生那年正好赶上这个节点。从记事起中国就一直在涨。我这代人确实赶上了好时候,没饿过肚子,更没经历过打仗。
经济学里有个概念叫中等收入陷阱(middle income trap)。世界银行研究过,1960年以来101个中等收入经济体,只有13个跨到了高收入。韩国、台湾、香港、新加坡,就是那少数几个。
现在轮到中国了。
2024年中国人均GNI大概13500美元,世界银行的高收入线是14005美元,差4%。大概率今明两年就过了。14亿人的经济体跨过这条线,以前从来没有过。
为什么有些国家跨不过去?不是没有人才,有些国家聪明人很多。但人才出去了不回来,社会本身割裂得厉害,没有一个稳定的底座把这些力量攒在一起。人多和人才多是两回事,你看看印度和巴西。
## AI 的映射
说回窗口期这个事,AI也是一样的。
我之前写过一篇讲AI行业的战时状态。你今天看全球AI这个领域,真正在前沿模型上能打的,就中美两家。
斯坦福今年的AI指数报告有几个数字挺有意思。美国顶级模型领先中国顶级模型就2.7%。DeepMind的CEO Hassabis自己说差距只有"几个月"。
但还有一个数字更有意思:美国AI领域私人投资2859亿美元,中国124亿。23倍的钱砸下去,性能差距不到3个点。你说谁的效率高?
欧洲有Mistral,估值到了117亿欧元,也在涨。但你看前沿模型的排行榜,跟中美头部的差距还是明显的。其他地方就不用说了。
为什么只有中美能打?
我觉得原因跟七十七年前那些科学家能搞出两弹一星是一样的。稳定的环境,持续的教育投入,足够多的人才,再加上在窗口期做了对的事。中国AI专利占到全球快70%了,论文和工业机器人部署也是领先的。
底子、环境、窗口期,少一样都不行。跟七十年前一个道理。
## 不是理所当然的
从1949年到2026年,七十七年。大概两代人。
拉近一点看,从我爸妈那一代算,三四十年前还在吃不饱饭。再往前一代,甲午战争之后李鸿章签下《马关条约》割让台湾和辽东半岛,八国联军之后又签了《辛丑条约》。二战打完了,中国是战胜国之一,领土照样被人随意划。
不到一个世纪之后,这个国家站在了世界舞台最中心的位置,跟最强大的国家平等地坐在一起谈。
翻翻历史,英国靠工业革命崛起花了大半个世纪,德国统一之后也走了几十年,日本明治维新到真正成为强国也差不多。而且这些国家的起点都比当时的中国好得多。
看到今天这个画面,真的应该停下来想想我们经历了什么。当年那些人拿着小米加步枪,什么都没有,靠着敢死去换来了活下去的空间。那些科学家在一穷二白的条件下做出了世界顶尖的技术。然后一代又一代的普通人拼到今天,让我们能坐在这里,想吃什么吃什么,想喝什么喝什么,有尊严地活着。
这不是天上掉下来的。
从站起来到富起来,再到今天坐在世界中心去稳定这个乱成一锅粥的世界。两代人,竟然就做到了。
接下来,我们这代人呢?
---
## 参考资料
1. [2026年特朗普访华](https://en.wikipedia.org/wiki/2026_state_visit_by_Donald_Trump_to_China) — 2026年5月13-15日,近九年来美国总统首次访华;Elon Musk、黄仁勋、库克、国防部长 Hegseth 随行
2. [特朗普访华代表团名单(PBS)](https://www.pbs.org/newshour/world/who-was-on-trumps-plane-to-china-elon-musk-nvidia-ceo-and-more) — 随行人员包括多位科技企业CEO和国防部长
3. [中美北京峰会贸易谈判成果(CNBC)](https://www.cnbc.com/2026/05/14/trump-xi-beijing-summit-trade-taiwan-ai-iran-rare-earths-tariffs.html) — 双方达成"总体平衡和积极的成果"
4. [邓小平南巡](https://en.wikipedia.org/wiki/Deng_Xiaoping%27s_southern_tour) — 1992年1-2月视察武汉、深圳、珠海、上海,GDP增速从3.9%飙至14.3%
5. [抗美援朝:中国参战](https://en.wikipedia.org/wiki/China_in_the_Korean_War) — 1950-1953年,中国投入超过100万志愿军,在装备极度劣势的条件下作战
6. [两弹一星](https://en.wikipedia.org/wiki/Two_Bombs,_One_Satellite) — 1964年原子弹、1967年氢弹、1970年卫星;23位功勋科学家
7. [中国从原子弹到氢弹的32个月(原子科学家公报)](https://thebulletin.org/2024/04/the-short-march-to-chinas-hydrogen-bomb/) — 所有拥核国家中从裂变到聚变最短的时间
8. [中等收入陷阱与中国(CEPR)](https://cepr.org/voxeu/columns/trapped-china-and-middle-income-trap) — 世界银行高收入门槛 $14,005;1960年以来101个中等收入经济体中仅13个成功跨越
9. [中国人均GNI接近高收入门槛(SCMP)](https://www.scmp.com/opinion/china-opinion/article/3319278/china-could-become-high-income-country-year-can-it-stay-one) — 2024年约$13,500,差距约4%
10. [斯坦福2026 AI指数报告](https://hai.stanford.edu/ai-index/2026-ai-index-report) — 中美AI性能差距缩小至2.7%;中国AI专利占全球近70%
11. [DeepMind CEO:中美AI差距仅"几个月"](https://vertu.com/lifestyle/the-global-ai-race-why-china-is-just-months-behind-the-us-according-to-deepminds-ceo/) — Hassabis 对中美AI差距的评估
12. [中美AI投资差距(摩根士丹利)](https://www.morganstanley.com/insights/articles/global-ai-race-us-vs-china-investment-opportunities) — 美国私人AI投资$2859亿 vs 中国$124亿
13. [马关条约](https://en.wikipedia.org/wiki/Treaty_of_Shimonoseki) — 1895年甲午战争后李鸿章与日本签订,割让台湾、澎湖列岛、辽东半岛
14. [辛丑条约](https://en.wikipedia.org/wiki/Boxer_Protocol) — 1901年八国联军后签订;李鸿章为中方签字代表,签字后不久病逝
---
### Demo 一小时,产线三小时
- URL: https://guanjiawei.ai/zh/blog/from-demo-to-production
- English: https://guanjiawei.ai/en/blog/from-demo-to-production
- Published: 2026-05-14
- Tags: AI, 内容生产, TTS, AI Agent, 本地化, 思考
网上经常有人讲一句话:AI 时代最重要的是可靠。
第一次看到这句的时候我觉得是车轱辘话。每个时代都被人挑一个词出来盖章,"聪明"和"执行力"之前都被讲过一轮,"可靠"听起来跟 AI 时代特别贴吗?也不见得。
最近自己手头几个项目,倒是把这句话讲明白了。
## 一天三个字,一百天上千条素材
之前给儿子做了个汪汪队认字游戏。每天三个字,一百天三百字。这个数字看着小。
问题是这一百天里每一天都是一个独立的小关卡。每天大概要六七张图,几十条音频。语音是克隆汪汪队里某个角色的声音生成的,每条对应一句台词。一百天合起来,几张图一算,几千条素材跑不掉。
第一天的 demo 跑通了。我跟儿子坐在那玩了二十分钟,挺开心。问题就出在这。
我以为剩下的事情就是把 demo 再跑九十九次。后来发现这件事跟 demo 是两个东西。
我从全量第一批跑出来的二十条音频里随机抽了两条听。两条都不行。一条吞了两个字,一条情绪完全跟台词对不上。剩下的十八条还敢用吗?再抽,还是有问题。那一百天合起来一千多条素材,到底有多少能用?心里没底。
这种没底的感觉是关键。它不是小问题,是会让你停手。
## 多出来的那一道叫质检
demo 之所以好做,是人在里面盯着。生成一条听一遍,不行重来,挑一个最好的留下。整个过程是手工的,人在中间做了一道隐形的质检。
想全自动,就得把"人在中间盯着"换成"模型在中间盯着"。这就是质检。
听起来简单。做起来打开了一个新世界。
## 一段音频,三四个模型同时打分
我开始翻一些行业里的非主流模型。常规听说的是 ASR 和 TTS——理解声音用 ASR,生成声音用 TTS。但是给 TTS 打质检分这件事,原来有专门一拨模型在做。
DNSMOS 是微软出的,最早给降噪算法打分用。它不需要原始干净声音作为参考,单凭一段音频就能判断里面有多少杂音、整体可不可听。后来发现它对 TTS 生成的人工痕迹也敏感。
NISQA 是柏林工大 Gabriel Mittag 那边做的,里面有一个 NISQA-TTS 的权重,直接评 TTS 自然度。它给的不是单一分数,是噪声、染色、不连续、响度几个维度的分。
UTMOS 是东京大学 SaruLab 团队的,VoiceMOS Challenge 2022 的冠军,现在是 TTS 圈打分的一个事实基线。我把它放在最外面做兜底。
最后还有一道反向 ASR:把生成的音频用 Whisper 再识别一遍文字,跟原始 script 对一遍,差太多就打回。这一道最朴素,但也最稳。
四个分加起来,超过阈值算合格,不合格触发重新生成。这套搭起来跑了一天,效果确实比单跑 TTS 强一截。
## 一倍时间变三倍,不是夸张
但成本也起飞了。
加质检之前我以为最多多一半时间。挑出错的重生成嘛,就算重生成的全错也就再跑一遍,最多 1.5 倍。
实际上 1 小时变成了 3 小时。
原因是模型在某一句话上就是过不去。同一段台词换不同种子生成,七遍、八遍、九遍都过不了质检的阈值。有时候得回退到换 prompt、换语速、换情绪标签才能挤过去。每一次重生成都是一次完整的模型调用,每次都要烧 token。
如果这套跑在云上,按时长计费,几分钟烧上百块不夸张。我后来粗算了一下,一个本来打算云端跑完的语音生成任务,按重试率折算,账单大概是 demo 那次的 7 到 10 倍。
这是我之前没算明白的一道账:从 demo 到产线,烧的钱按数量级走,不是按百分比。
## 同样的事,在另一个项目上又碰到一次
最近还在玩另一个项目,叫 MiroFish。
这是个挺有意思的开源项目,作者是中国的本科生郭航江,2026 年 3 月登过 GitHub Trending 全球第一,背后投资是盛大集团的陈天桥。它做的事情是生成一大堆带个性、带记忆、带社交关系的 agent,然后在两个模拟平台上让它们互相讨论、辩论、结盟、改观点,最后用一个 ReportAgent 把整个演化过程的结论总结出来,用来预测某个事件的走向。
我跑的配置不算大。一个事件大概 54 个 agent,时间线 20 轮。每一轮所有 agent 都要跑一遍,54 × 20 大约 1000 次完整调用。
我用的是 Kimi K2.6 Thinking。问题在于 thinking 这个模式关不掉,每次都要先思考再输出。一次思考几千个 token 是常态。1000 次乘起来,token 烧得让人心疼。
跑了几遍我开始想:这种场景,真的需要顶级模型吗?
每个 agent 在它那一轮里要做的事,无非是看一下上下文、根据自己的人设说一句话或者投个票,最后被汇总。每一次的智力门槛其实不高。把它换成一个去年级别的模型,比如 GPT-4o 那个档位的,效果可能差不多,速度还更快。
## 中等智力模型那个一直没人讲清楚的位置
过去一年一直有个问题没什么人讲清楚:什么场景该用次顶级的模型?大家都奔着最好、最贵的去,"中等"这个档位一直比较尴尬。
我现在看到两个非常具体的位置。
第一个是质检。判断一段音频自然不自然、判断一张图风格对不对、判断一段对话有没有跑题,对模型的要求其实是中等档位。让顶级模型来做这种事,等于用 Claude Opus 来检查 GPT-4o 写的代码。能做,但不划算。一个轻量级的视觉模型加一个 NISQA 这种专项模型,加起来比一次顶级调用便宜得多。
第二个是大量 agent 的模拟。MiroFish 这种把 1000 次推理串起来求一个集体演化结果的场景,对单次质量没那么敏感,对总成本极其敏感。这种场景的"最佳模型"不是最聪明的那个,是单次 token 单价乘以推理速度的综合最优。
这两个场景之前没被讲清楚,是因为没有真的需要工业化的人去做内容批量。等到你认真要做几千条音频、几万次 agent 推理,这两个位置就自己跳出来了。
## 本地化的第二个理由
也是这个时候我才看明白本地化算力为什么这么重要。
本地部署平时常被讲的两个理由:快、隐私。两个理由都对,但都不是最致命的。
最致命的是单位调用成本。
工业化产线注定要大量重试。云上的 TTS 按时长计费、token 模型按调用计费,重试一次就是一次账单。本地跑就不一样。一台 DGX Spark 跑 F5-TTS 或者 VoxCPM 这种开源模型,电费之外没有边际成本。挂在那跑一天,跑出来的素材足够用一周。失败了?再跑一遍,无所谓。
这是云模型和本地模型在工业化场景里的根本差别。前者按使用量收费,后者只收一次硬件钱。在重试率高的 pipeline 里,这个差别会被放大成两个数量级。
之前讲本地化讲不清楚的原因是大家拿 demo 的成本去对比。你 demo 跑一次 TTS 几毛钱,对比本地一台机器几万块,账永远算不平。但如果你换成工业化的成本去对比,把重试率、质检、agent 模拟都算上,账马上就翻过来。
## 三套模型,三个位置
写到这突然意识到,AI 内容工业化其实需要三套不同档位的模型同时跑。
顶级模型在最前面,负责最难的那部分内容生成。它单次贵但你不会让它跑很多次。
中等模型在质检和 agent 模拟,负责量大、智力门槛中等的活。它们要被反复调用,每次都不能太贵。
本地模型在最底下扛量。素材生成、向量化、转录、对齐这些苦活,能本地跑就不要走云。
这三套不会写在任何一个官方教程里,因为还在演化。但你只要真的下场去做内容工业化,迟早会自己拼出来这套结构。
回头看开头那句听起来像废话的话,我反而觉得讲得太轻了。AI 时代最重要的不是"可靠"本身,是"可靠"这件事的成本曲线。从 demo 到产线,那条 3 倍起步的曲线。
掌握了这个曲线,你才知道怎么花钱。否则你以为花了 1 倍的预算,账单回来你看到的会是 7 倍。
---
## 参考资料
- [DNSMOS:用于评估降噪器的非侵入式感知客观语音质量度量(Microsoft Research)](https://www.microsoft.com/en-us/research/publication/dnsmos-a-non-intrusive-perceptual-objective-speech-quality-metric-to-evaluate-noise-suppressors/)
- [DNSMOS P.835 ICASSP 2022 论文(arXiv)](https://arxiv.org/abs/2110.01763)
- [NISQA:非侵入式语音质量与 TTS 自然度评估(GitHub)](https://github.com/gabrielmittag/NISQA)
- [NISQA Speech Quality Corpus(TU Berlin DepositOnce)](https://depositonce.tu-berlin.de/items/3b08adda-9fe5-485a-ae0b-813c89975235)
- [UTMOS:UTokyo-SaruLab System for VoiceMOS Challenge 2022(GitHub)](https://github.com/sarulab-speech/UTMOS22)
- [F5-TTS:A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching(GitHub)](https://github.com/SWivid/F5-TTS)
- [VoxCPM2:Tokenizer-Free TTS for Multilingual Speech Generation(OpenBMB)](https://github.com/OpenBMB/VoxCPM)
- [Whisper:Robust Speech Recognition via Large-Scale Weak Supervision(OpenAI)](https://github.com/openai/whisper)
- [Kimi K2 Thinking API 定价(OpenRouter)](https://openrouter.ai/moonshotai/kimi-k2-thinking)
- [MiroFish:A Simple and Universal Swarm Intelligence Engine(GitHub)](https://github.com/666ghj/MiroFish)
- [MiroFish:Swarm-Intelligence with 1M Agents That Can Predict Everything(Medium)](https://agentnativedev.medium.com/mirofish-swarm-intelligence-with-1m-agents-that-can-predict-everything-114296323663)
---
### AI失业潮之后的三道题
- URL: https://guanjiawei.ai/zh/blog/three-questions-after-jobs
- English: https://guanjiawei.ai/en/blog/three-questions-after-jobs
- Published: 2026-05-13
- Tags: AI, 就业, 分配, UBI, 思考
现在招人的动力很弱。
以前一个方向想做大,本能反应是「这块需要再加几个人」。现在的反应反过来了,变成「这几个人怎么把效率再榨一道」。招实习生的动力都不如以前。
这是个很小的体感,但它指向一件不可逆的事。
两天前,韩国总统府的政策室长金容范发了一条 Facebook:AI 时代的「超额收益」不该只归个别公司,应该有一部分以「全民红利」的方式回到国民手里。第二天 KOSPI 一度跌 5.1%。他后来澄清没说没收谁的利润,只是讨论 AI 红利产生的「超额税收」怎么用,市场情绪才稳住。
一条 Facebook 让股市震荡 5%,本身就说明问题已经摆到桌面上了。
背景也很直观。SK 海力士今年一季度营业利润率 72%,员工奖金散下来人均接近 50 万美元。三星电子同期半导体部门营业利润 53.7 万亿韩元,但工会代表的 7.4 万名员工拿到的比例和 SK 差一截。三星工会威胁,从 5 月 21 日起罢工 18 天。工人要的不是几千块奖金,是 AI 红利分配链上一个体面的比例。
我把这件事看作三道题里的中间一道。AI 真正抛给社会的事,分配只是一道。前面还有一道失业题,后面还有一道身份题,三道连着。
## 第一道:净减岗位是定式
第一道题是失业本身。
先把口径说清楚。主流报告其实并没有一致预测「全球净减」。WEF 的《Future of Jobs Report 2025》还预测到 2030 年净增 7800 万。ILO 的 GenAI 暴露指数用的是「转型」而不是「替代」:全球四分之一岗位被 GenAI 触及,高收入国家三分之一。IMF 的口径最大,全球 40%,发达经济体 60%。
但宏观模型整齐归整齐,落到具体劳动池上就不一样。一个文员被「转型」成「AI 协作的高效角色」,宏观报告里可以算转型,对当事人就是失业。新增的 AI 产品经理、数据治理、模型评估、机器人运维岗位,未必在同一个城市,未必给同一个年龄段,也未必接得住原来的客服、文案、初级程序员、行政。中间总要有人下车。
当下数据已经能看到这个过渡有多疼。Challenger 2026 年 3 月的美国裁员报告里,AI 是当月排名第一的裁员理由,15341 人,占当月所有裁员 25%。一季度美国科技行业裁员 52050 人,比去年同期高 40%。Goldman 算下来过去一年 AI 替代每月切掉 2.5 万岗位、新增不到 9000,净减 1.6 万。最受冲击的是 Gen Z 和入门白领。斯坦福 Digital Economy Lab 的研究也看到,AI 暴露最高的岗位里,22 到 25 岁的就业明显下降。
这就是我说的「净减」。不是预言 2030 年全球总就业,是看具体职业、具体年龄、具体公司当下的真实需求。一家企业发现 10 个人加 AI 能干过去 15 个人的活,它不会先去问宏观模型五年后会不会创造新岗位,它会先停招、少招、把边缘岗位裁掉。
传统上能吸纳大量就业的方向也在反向走。自动驾驶在替代司机,无人机在替代外卖员,工业机器人在替代产线工人。IFR 的 World Robotics 数据:全球制造业机器人密度七年翻倍,中国 2023 年每万名制造业员工对应 470 台机器人。新基建也不再像修桥修路那样天然带来大量低门槛岗位。算力中心、特高压、电池工厂、黑灯工厂,投资大,用工少。
也有人寄希望于「一人公司」。OPC 这两年被反复拿出来讲,我自己也觉得它会变成一种真实的新组织形态。到 2025 年 6 月中国一人有限责任公司超过 1600 万家,2025 上半年新注册 286 万家,同比增长 47%。杭州上城已经在做 OPC 社区政策。
但要看它能不能撑就业,不能只看存量和故事。1600 万这个存量大多是传统个体经营和小微法人,AI 之前就在了。真正要看两件事:增速,和增速里能撑住中产收入的比例。
增速够亮,47% 同比。但分布很难看。行业报告里 OPC 收入是极度长尾的:一半以上还停在月入几千的产品验证期,能稳定做到年入百万级的不到一成。乐观估个 10%,一年新增 600 万 OPC 里能稳到中产水平的就 60 万人。
国家统计局 2025 年公报里中国年末就业人员 7.25 亿。按 IMF 的暴露口径,发达经济体 60% 岗位有 AI 暴露;中国按更保守的 30% 估,也是 2 亿多。60 万 vs 2 亿,差两个数量级。OPC 会撑超级个体,但它撑不起就业的盘子。
这场冲击为什么这么尖锐?我归到一个字:集中。
SK 海力士一季度营业利润 37.6 万亿韩元,全公司大约 3.5 万员工。一个员工背后一季度对应 10 亿韩元营业利润,年化超过 40 亿,折人民币两千多万。当然不是每个员工真的创造了这么多,但 AI 红利被压在多少人手上,这个数字够直观。
小米没这么极致,方向是一样的。集团 2025 年营收 4573 亿,其中智能电动汽车和 AI 创新业务营收 1061 亿,毛利率 24.3%,全年交付 41 万辆车。以前造车厂之间比产能,现在还要比算法、供应链软件、自动化产线和数据闭环。产能在放大,用工没按同样比例放大。
工业革命到现在,每一波大产业的兴起都拉动新岗位链条,劳动力规模和产业规模大体同向走。AI 这一波反过来:产值越大,背后能容纳的人头越少。芯片、云、模型、数据中心,加上少数能把 AI 用到极致的团队,吃掉大部分红利。
可以这么算。一千个人里的一个,靠超级生产力把剩下九百九十九个人的一部分工作抹平。不是所有工作都被抹掉,但需求曲线会变平。哪个新方向能在同等时间窗口里反向再造同样规模的人头需求,我目前看不到答案。
接受这件事是讨论后面两道题的前提。净减不是一句恐慌口号,是局部劳动市场正在发生的量级错配。
## 第二道:分配要重做
到了第二道题,分配。
韩国这事其实是一个分配样板。AI 红利集中到少数公司之后,到底该留给股东、高管、核心工程师,分给全体员工,还是通过税收公共支出回到社会?这个问题迟早从韩国扩散到日本、欧洲、中国。
集中的红利如果还按老规则分,结果几乎是必然的。大头进股东和高管,核心员工拿到高额奖金,普通员工拿固定工资,产业链外的大多数人只感受到物价、房租、岗位收缩、竞争加剧。这种结构本来就在拉大不平等,AI 只是把曲线变陡。
最被夹住的不是最低收入人群,是中产,尤其是靠工资、专业技能和稳定岗位生活的那批。
原因很简单。工资计税最完善,跑都跑不掉。中国个税里综合所得是 3% 到 45% 的超额累进,工资薪金单位代扣代缴,社保个税在到手之前就扣完了。高收入工薪当然应该纳税,问题在于更高财富阶层的收入形式更多元。资本利得、股权激励、分红、公司结构、信托、家族办公室、跨境安排,不是说这些都违法,是说他们有更多税基选择和递延空间。
这套结构在互联网时代已经很明显,到 AI 时代只会更严重,因为产业的核心收益向更少的人集中。EU Tax Observatory 的全球税收逃避报告里也提过,全球亿万富豪相对于自己财富的有效税率极低。财富越容易跨境,单个国家越难单独完成再分配。
中产的另一头是替代率。AI 当前最容易冲击的就是中产工种:程序员、设计师、客服、初级法务、初级分析师、文案、翻译、运营、行政、财务助理。这批人税最重,被替最快,是当下结构里最难受的一群。
回到韩国。三星和 SK 的工会争的不是一次性奖金,是一条长期规则。公司只肯给「特别奖金」,工会要的是把利润分配比例写进每年都生效的正式协议。表面是奖金金额,实际问的是这套分配规则下一年还成不成立。
把「超额利润」或者「超额税收」拿出来做再分配,从框架上不算新东西。北欧国家已经跑了几十年。丹麦 2026 年最高边际个税被推到 60.5%,瑞典、芬兰、挪威也长期维持较高的劳动税负和公共服务。OECD 的 Taxing Wages 也能看到,欧洲国家的平均劳动税楔明显高于美国、韩国。
但 AI 时代会遇到一个新问题:生产力的载体可以走。
三星和 SK 海力士这种重资产、重 fab 的玩家跑不了,韩国政府至少能从企业所得税和产业链里吃到一部分。但更典型的 AI 生意不长这样。算力租在新加坡,公司注册在爱尔兰,团队分散在五个时区,结算走全球支付网络。三五个人撑起几亿美元营收的团队会越来越多,国家想征税,抓手比传统制造业少得多。
所以「AI 税」不能只理解成对几家公司加税。它更像一组问题。税基放在哪里?算力、利润、资本利得、数据,还是机器人替代下来的人力成本?征回来之后给谁?是继续投新基建,还是补社保、教育、医疗、养老金、失业保险,甚至直接给居民发钱?
这里最需要警惕的是路径依赖。过去很多国家习惯用投资和基建托经济,但 AI 时代的新基建未必托就业。建更多算力中心、数据中心、特高压、电池工厂,最后很可能继续抬高头部企业的生产率,让资本和少数高技能岗位受益,对被替代的中产和低收入者未必有直接帮助。
这就是 OpenAI 那批人这些年公开聊 UBI 的原因。Sam Altman 资助的 OpenResearch 在德州和伊利诺伊做过一个三年实验:1000 个低收入参与者每月拿 1000 美元,另外 2000 人做对照组。2024 年公布的结果没那么神话。拿钱的人平均每周少工作 1.3 小时,就业概率低 2 个百分点,不含补贴的家庭收入下降。但他们更愿意主动找工作,更看重有意义的工作,也更有余地搬家、看病、做长期规划,创业想法的比例更高。
这个实验值得看,不是因为它证明 UBI 一定对,是因为它把争论从口号拉回了数据。现金不会自动让人躺平,也不会自动给人尊严。它给的是缓冲和选择权。对一个生产力过剩、岗位重组又快的社会来说,选择权本身可能就是基础设施。
我不觉得 UBI 是 AI 时代的标准答案。但它是当前少数被认真试过、有数据的候选答案。比起在老规则上修修补补,它至少给了一个不一样的起点。
## 第三道:不工作的人,价值从哪来
第三道是最难的一道。前两道还能靠政策、税制、再分配去推进,这一道不行。
中国语境下,「不工作」是一个非常重的判断。家里聚会有人问「你做什么的」,预设答案是某种职业。如果你回「我目前没工作」,气氛会立刻不一样。这不只是面子问题。国家统计局 2025 年公报里年末城市低保 595 万人、农村低保 3340 万人,中国不是没有福利体系。但低保和救助在很多地方仍然带耻感。符合条件却不去领的家庭一直存在,原因不是钱不够,是怕被人在背后说「靠救济过日子」。
这套羞耻感来源很深。我们这代人是在「奋斗就有回报、努力就值得尊重」的叙事里长大的。教育、媒体、身边人的眼光,都在告诉你同一件事:你的价值等于你创造的产出。劳动是身份的锚点,工资是身份的刻度。我之前写过[一篇关于 AI 焦虑的文章](/blog/beyond-ai-anxiety),提到过这件事的另一面。当 AI 算命冲上热搜,年轻人涌向玄学找确定性,本质上就是这个锚点在松动。
AI 把这套话语的有效期提前用完了。它真正动摇的不只是收入,是身份感。你拿了基本收入,吃住没问题,朋友也尊重你,但早上醒来对一天没有期待。这种空洞,政策给不了答案。
一个被 AI 释放了时间的社会,缺的不是福利发放点,是一套能给人提供新身份的叙事。这件事工程师写不出来,模型也算不出来。它需要重新讲一个故事,告诉大家什么样的人是值得尊重的、什么样的活法是体面的。
一千年前这套故事是「读书做官」,一百年前是「工业报国」,三十年前是「下海做生意」。过去十几年是「进大厂」「买房」「创业」「财务自由」。AI 时代该是什么,没人能给一个干净的答案。
## 写在最后
三道题是连着的。第一道让第二道紧迫,第二道做得再好也躲不掉第三道。
韩国 5 月 11 日那条提议引发的市场震荡只是开场。我估计下半年这种讨论会扩散到日本、欧洲、中国。每个国家会基于自己的政治和文化给出不同答案。征 AI 税、上 UBI、改税基、做新基建、推一人公司,每种都会有人试。试错本身就是答案的一部分。
作为个体能做的事其实不复杂。多攒点能力,多留点本金,少被某一波叙事卷走情绪。作为社会要做的事更难:别再用「新岗位总会出现」糊弄过去,也别把失业的人重新推回羞耻里。三道题没有谁能一次答完,只能一道一道往前走。
---
## 参考资料
- [Senior Blue House official calls for returning Samsung, SK's "excess" chip profits to the public(Korea JoongAng Daily)](https://koreajoongangdaily.joins.com/news/2026-05-12/national/politics/Senior-Blue-House-official-calls-for-returning-Samsung-SKs-excess-chip-profits-to-the-public/2590097)
- [South Korea roils market by floating "citizen dividend" from AI(Bloomberg / Moneycontrol)](https://www.moneycontrol.com/news/business/pay-citizens-a-dividend-from-ai-windfall-south-korea-roils-market-by-floating-plan-to-redistribute-gains-13917168.html)
- [Samsung workers protest for higher pay, threaten to strike(AP)](https://apnews.com/article/korea-samsung-union-strike-ai-38e7a5030d3688850d3e8d8baf240f58)
- [Samsung Electronics Announces First Quarter 2026 Results(Samsung Global Newsroom)](https://news.samsung.com/global/samsung-electronics-announces-first-quarter-2026-results)
- [SK hynix 2026 年第一季度经营业绩发布(SK hynix Newsroom)](https://news.skhynix.co.kr/q1-2026-business-results/)
- [Xiaomi Corporation 2025 Fourth Quarter and Annual Results(Xiaomi IR)](https://ir.mi.com/system/files-encrypted/nasdaq_kms/assets/2026/03/24/6-20-53/Xiaomi%20Corp_25Q4_ER_ENG%20vF.pdf)
- [Generative AI and jobs: A 2025 update(International Labour Organization)](https://www.ilo.org/publications/generative-ai-and-jobs-2025-update)
- [One in four jobs at risk of being transformed by GenAI — ILO–NASK Global Index(International Labour Organization)](https://www.ilo.org/resource/news/one-four-jobs-risk-being-transformed-genai-new-ilo%E2%80%93nask-global-index-shows)
- [AI will transform the global economy(International Monetary Fund)](https://www.imf.org/en/Blogs/Articles/2024/01/14/ai-will-transform-the-global-economy-lets-make-sure-it-benefits-humanity)
- [The Future of Jobs Report 2025(World Economic Forum)](https://www.weforum.org/publications/the-future-of-jobs-report-2025/in-full/2-jobs-outlook/)
- [Challenger Report: March 2026 cuts rise 25%, AI leads reasons(Challenger, Gray & Christmas)](https://www.challengergray.com/blog/challenger-report-march-cuts-rise-25-from-february-ai-leads-reasons/)
- [AI is cutting 16,000 U.S. jobs a month(Fortune / Goldman Sachs)](https://fortune.com/2026/04/06/ai-tech-displacement-effect-gen-z-16000-jobs-per-month/)
- [Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of AI(Stanford Digital Economy Lab)](https://digitaleconomy.stanford.edu/publication/canaries-in-the-coal-mine-six-facts-about-the-recent-employment-effects-of-artificial-intelligence/)
- [Global Robot Density in Factories Doubled in Seven Years(International Federation of Robotics)](https://ifr.org/ifr-press-releases/news/global-robot-density-in-factories-doubled-in-seven-years)
- [One-person companies rise in popularity, gain policy support(China Daily)](https://global.chinadaily.com.cn/a/202605/06/WS69fa9a65a310d6866eb47064.html)
- [2026 一人公司洞察报告发布:1 元 AI 成本撬动 72 倍人力杠杆(证券时报 / 东方财富)](https://finance.eastmoney.com/a/202604093699351321.html)
- [中华人民共和国 2025 年国民经济和社会发展统计公报(国家统计局)](https://www.stats.gov.cn/sj/zxfbhjd/202602/t20260228_1962662.html)
- [Individual Income Tax Law of the People's Republic of China(国家税务总局英文站)](https://www.chinatax.gov.cn/eng/c102441/c5211934/content.html)
- [Top Personal Income Tax Rates in Europe 2026(Tax Foundation)](https://taxfoundation.org/data/all/eu/top-personal-income-tax-rates-europe/)
- [Taxing Wages 2026 overview(OECD)](https://www.oecd.org/en/publications/taxing-wages-2026_3a5169ef-en/full-report/overview_d93131c3.html)
- [Global Tax Evasion Report 2024(EU Tax Observatory)](https://taxobservatory.world/publication/global-tax-evasion-report-2024/)
- [Unconditional Cash Study(OpenResearch)](https://www.openresearchlab.org/projects/unconditional-cash-study)
---
### AI Coding 这门生意,被自己吃掉了
- URL: https://guanjiawei.ai/zh/blog/ai-coding-eats-itself
- English: https://guanjiawei.ai/en/blog/ai-coding-eats-itself
- Published: 2026-05-12
- Tags: AI, AI coding, 商业模式, 思考
今天跟人聊到 AI Coding,我说这是个挺奇怪的赛道。所有人都看好的方向,最早笃定的人现在挣不到钱。
我自己一直在 AI 行业里,AI Coding 是很早就盯着的方向。当年做边端一体机,第一个瞄准的就是这个场景。但站在 2026 年回头看,做 AI Coding 软件这件事越走越像一桩没法成立的生意。
不是方向错了。是方向太对了。
## 补全时代
把时间拨回 2021 年。GitHub Copilot 上线,OpenAI 训了一个叫 Codex 的模型给微软,封装进编辑器里做代码补全。这个东西启动了整个赛道。
到 2023 年,Copilot 已经有超过 100 万付费用户、年化收入 1 亿美元。当年看是很惊人的数据,新生品类付费用户百万级。但那年微软自己每个 Copilot 用户每月还在亏 20 多美元。订阅价撑不住推理成本,大家也不太在意,反正先把生态占住。
然后第一批创业公司涌进来了。逻辑很简单。既然编程是个独立场景,干嘛不专门训一个编程模型?通用模型贵又慢,编程小模型应该能走出一条性价比的路。
微软自己出过 Phi-1,1.3B 参数在 HumanEval 上拿到 50.6%,跟当时大十倍的模型打平。国内清华+智谱的 CodeGeeX 从 2022 年 9 月开始迭代,每半年一代。北大那边有家叫硅心智能的团队,2023 年底开源了 7B 的 CodeShell,HumanEval 上压过当时的 CodeLlama-7B 和 StarCoderBase-7B,IDE 插件也一并放出来。共同的判断是:编程语料集中,专精模型应该比通用模型便宜得多、好得多。
中间还有一圈做工具链的。评测、RAG、向量库、补全集成。当时 RAG 概念正火,套到编程场景里能讲一堆故事。
但 2023 年其实还谈不上商业模式。模型本身的编程能力不稳定,开发者用得也偏轻度。整个赛道处在一个看起来一定有戏、但还没出来的状态。
## 工作流时代
真正的拐点是 2024 年。
Anthropic 在 2024 年 6 月发了 Claude 3.5 Sonnet,编程能力一下子被拉到一个新高度。Anysphere 做的 Cursor 第一时间把这个模型接进自己的 IDE。不是简单调一下 API,是把整个工作流围着它重新设计了一遍。读上下文、跨文件改、多轮迭代、命中率反馈,原来散在补全里的能力被串成了一条像样的链路。
商业模式也变了。Cursor 用包月订阅做底层 token 补贴。你一个月给我 20 美金,我把 Claude API 的量包给你用。直接去 Anthropic 买原价 token 同样用量轻松上千美金。这种低价转售模型能力的打法把用户量推得极快。Anysphere 在 2025 年 6 月 ARR 突破 5 亿美元、估值 99 亿,到 2025 年 11 月估值已经做到 293 亿。
但这里就开始出现问题。Cursor 的工作流范式本身没什么壁垒。
为什么没人马上抄?因为当时只有 Claude 3.5 Sonnet 这一档模型能撑住这套范式跑起来,其他模型接进去要么慢要么蠢。所以做 AI Coding 的第二波公司大多卡在两条路上。要么去接 Claude 然后跟 Cursor 卷价格,要么用自家或开源模型,但用户一对比就走了。
## DeepSeek 和 Claude Code 的两记重锤
2024 年底 DeepSeek V3 开源,这件事改变了局面。
V3 在编程上还没完全追平 Claude 3.5 Sonnet,HumanEval 82.6% 对 Claude 的 93.7%,差了 10 多分。但它便宜得离谱,token 价格大概是 Claude 的四十二分之一。这个性价比让原本接不起 Claude 的玩家、特别是国内厂商,突然都能跑起 Cursor 那套工作流。
那段时间几乎所有做 AI Coding 软件的公司都接了 V3。做出来的产品长得越来越像,差异化的窗口很短。
紧接着 Anthropic 在 2025 年 2 月推出 Claude Code。这玩意儿没有 IDE,就是一个 CLI。在终端里跟你聊,自己读你项目、改代码、跑测试。第一次发的时候我是当 demo 看的,后来用了一周突然意识到一件事:当模型够强,IDE 这一层可能真的不再必需。
更刺激的是商业数据。Claude Code 上线不到一年年化收入做到 10 亿美元,到 2026 年初估算年化已经接近 20 亿。这个增速直接把做软件的和做模型的之间的话语权差距拉得很远。
CLI 形态本身也没什么软件壁垒。开源世界很快做出了 OpenCode、Aider、Cline 等一堆东西,Cursor 后来也开始往 CLI 形态靠。结果是连 IDE 这层最后的差异化空间都被熨平了。
## 三层都被吃掉
回头数一下被吃掉的层。
第一批做编程小模型的公司今天基本听不到声了。原本的逻辑是"通用模型不专精所以我做小的",结果通用模型每发一版都把编程当核心打榜项,专精小模型的优势窗口几乎没出现过。CodeShell、CodeGeeX、Phi 这些名字现在更多是技术报告里的脚注,不是产品。
中间做工具链和工作流软件的更难。模型一变强,原本那些靠绕过模型短板建起来的工程价值就被原地抽走了。半年前还卖得动的 RAG 集成、prompt 编排、补全增强,现在新模型一来基本不用了。
连独立 IDE 都开始有压力。Cursor 增长还在,但底层范式被 Claude Code 这种 CLI 形态分流。当模型自己就能在终端里完成大半工作,IDE 的价值边界就被往回压。
不是说这些公司做错了什么。他们方向都对,时机也都踩在节点上。问题是这个赛道太重要、太赚钱,导致每个基础模型公司都把它当第一阵地。第一阵地的意思就是它会把上面所有人的活都干掉。
## 束胸到胸罩
最近想这件事,想起来一段服装史。
20 世纪初欧美女性还在穿束胸(corset),结构里要塞硬钢条。这是个上百年的成熟产业,无数小作坊靠这个吃饭。1914 年纽约一个叫 Mary Phelps Jacob 的女性用两块手帕和粉丝带做了一个简单的胸托并申请了专利,那时候没什么人当回事。
真正的拐点是一战。美国战争部要求妇女停穿束胸,原因不是出于关心,是因为束胸里那些钢条要被熔了拿去造武器。整个市场被一道令直接掐掉。
原本做束胸的厂商死掉一大片。但有一家 Warner Brothers Corset,看清楚之后转产胸罩,到 1920 年代年营收做到 1260 万美元。
这个故事有意思的地方是底层需求一点没变。女性还想让自己更优雅,变的只是承载它的那个东西。原本是束胸,后来是胸罩。原本卖束胸的厂商死了,因为他们守的是产品形态,不是需求。
AI Coding 现在就在这个阶段。所有人五年前赌的方向是对的。开发者用 AI 写代码、提效十倍、改变生产关系,这些都在发生,没有一个判断错。但承载这个需求的东西已经不是 IDE 插件、不是工作流软件、不是专精小模型了。它正在快速收敛到"基础模型 + CLI/agent 形态"。
夹在中间的那些形态都在被加速淘汰。
## 还能卖什么
赛道被吃掉,但需求还在。换个角度想,剩下能卖的东西大概收敛到三块:质量、成本、其他。
第一是质量。编程是高密度场景,每一行错误都可能在生产环境里炸开。开发者愿意为更准、更稳的输出持续多付钱。这个需求只会变大,但承载它的主要是基础模型公司,你能把模型本身的水平做到行业前列,这个生意就成立。所谓"高水平 token",本质上就是质量这一档。
第二是成本。同样能力下谁更便宜谁就赢。开源模型、推理优化、缓存策略、调度策略,每一层都有降本空间。这部分对应用层公司其实有机会,因为模型公司不是每家都精通工程优化,更不是每家都有动力把价格压到极限。
第三是其他。这个其他比前两块都大。今天大多数团队 AI Coding 用得都很乱,每个人一套,组织层面的效率根本没起来。怎么把工作流、代码审查、知识沉淀、责任边界跟 agent 的工作模式拼起来,是个实打实的需求。再往下走,安全、隐私、可恢复性、合规这些维度今天还没真正展开,很快会变成大厂买单的核心理由。这部分不太像传统的 SaaS,更像咨询、工程、培训混在一起的活,定价方式也得重做。
不管哪一块,原来"卖一套软件多少钱"那种模式基本上是不通了。要么转成 token,要么转成服务。
## 写到最后
我们在 AI 这一波里反复看到一个模式。方向赌得越对、越笃定,原本的商业形态死得越快。因为方向对意味着这件事重要,重要意味着基础模型公司一定会把它做成第一阵地,第一阵地意味着上面的层一层一层都会被吃掉。
AI Coding 是这个模式最经典的例子,但应该不是最后一个。未来几个月里我估计会看到 AI 客服、AI 设计、AI 销售这些领域陆续走完同样的循环。
小公司其实船小好掉头。最危险的是中等规模、已经按"卖软件"模式建好了销售、交付、客户成功体系的那些。他们最难放下原本的工程资产去重新选个角度。
如果你也在 AI Coding 这个赛道里折腾,或者在别的赛道见过类似的"被吃掉"的过程,欢迎在评论区一起聊聊。
---
## 参考资料
- [Microsoft has over a million paying GitHub Copilot users(2023)](https://www.linkedin.com/posts/ashtom_microsoft-has-over-a-million-paying-github-activity-7123051140115562497-7Hbq)
- [GitHub Copilot subscriber count and revenue growth(CIO Dive)](https://www.ciodive.com/news/github-copilot-subscriber-count-revenue-growth/706201/)
- [Phi-2: The surprising power of small language models(Microsoft Research)](https://www.microsoft.com/en-us/research/blog/phi-2-the-surprising-power-of-small-language-models/)
- [CodeGeeX: 多语言代码生成模型(清华 KEG)](https://keg.cs.tsinghua.edu.cn/codegeex/index_zh.html)
- [硅心智能 CodeShell-7B 开源(IT之家)](https://www.ithome.com/0/726/089.htm)
- [WisdomShell/codeshell(GitHub)](https://github.com/WisdomShell/codeshell)
- [Introducing Claude 3.5 Sonnet(Anthropic)](https://www.anthropic.com/news/claude-3-5-sonnet)
- [Cursor AI coding startup valuation $9.9B(CNBC)](https://www.cnbc.com/2025/06/05/cursor-ai-coding-startup-valuation.html)
- [Cursor maker raises at $29.3B valuation(Bloomberg)](https://www.bloomberg.com/news/articles/2025-11-04/cursor-ai-coding-startup-anysphere-raises-funds-at-29-billion-valuation)
- [DeepSeek V3 release notes(DeepSeek API Docs)](https://api-docs.deepseek.com/news/news1226)
- [DeepSeek-V3 vs Claude 3.5 Sonnet detailed comparison(DocsBot AI)](https://docsbot.ai/models/compare/deepseek-v3/claude-3-5-sonnet-20241022)
- [Claude Code product page(Anthropic)](https://www.anthropic.com/claude-code)
- [Anthropic Claude Code revenue(The Information)](https://www.theinformation.com/articles/anthropic-revenue-claude-code)
- [From Bombs to Bras: WWI Conservation Measures(Connecticut History)](https://connecticuthistory.org/from-bombs-to-bras-world-war-i-conservation-measures-transform-the-lives-of-women/)
- [How World War I Helped Women Ditch the Corset(HISTORY)](https://www.history.com/articles/world-war-i-women-corset)
---
### AI 尖兵:还剩 10 周
- URL: https://guanjiawei.ai/zh/blog/ai-vanguard-ten-weeks
- English: https://guanjiawei.ai/en/blog/ai-vanguard-ten-weeks
- Published: 2026-05-11
- Tags: AI, GPT-5.5, Claude Code, Codex, Vibe Coding, 思考
最近几个数字串起来看挺有意思。
Sam Altman 在 GPT-5.5 发布之后明显很兴奋。Codex 单周下载量冲到 9000 万。付费用户从 3 月份的 300 万一路推到 4 月底的 400 多万。我自己的体感跟这个对得上。5.5 出来之前,我手里一个 200 美金的 Codex 账号;现在是四个,每月 800 美金。很多人在说 5.5 不该叫 5.5,该叫 GPT-6。我之前发过一句"它不是一个小版本",被这件事印证。
Anthropic 那边更夸张。Dario Amodei 上周接受 CNBC 采访,算过一笔账。他们成立的时候就预判 AI 会 exponential 增长,按"每年 10 倍"做的基础设施准备。今年 Q1 的增长年化下来是 80 倍。年化营收从年初的 90 亿美金跑到四月份的 300 亿。基础设施被打爆,于是他们和 SpaceX 签了一个协议,把 Memphis 那座 Colossus 1 数据中心的 22 万张 GPU 全租下来,给 Claude Pro / Max 用户解锁 5 小时限额。
这是当下的背景。
在这个背景里,我昨天和一个朋友聊了几个小时。他用 AI 很深,会用 Terminal,会基于 OpenClaw 这类开源框架搭东西,在公司里是资深用户。这次有家公司请他过去做 AI 变革的专家,问我该怎么看。
聊完之后我发现,对话里有几个判断值得单独拎出来。
## 一、看 offer,看的是"能不能无限制用最强的模型"
我跟他说,当前这个时间点,offer 本身不是最重要的事情。你已经走在挺好的位置上了。
真正决定性的,是平台能不能给你接近无限制地使用最顶尖模型的资源,以及足够的自由度去折腾任何你想折腾的方向。
什么意思?像我这种工作年限稍长的,自己有方法绕过资源限制——我可以一个月烧 1000 美金给自己买顶配,自己定方向。但更年轻的、刚有用 AI 热情的,公司还是挺关键的。因为你是在工作时间为别人创造价值。模型不是最好的,你就始终差一线。你能感觉到这个差距,但你抓不到。
底牌没有,去做 AI 变革专家其实很难。
## 二、别再"用 GPT-5.5 跑 medium effort"了
第二件事我猜得很准。我跟他说,你用 GPT-5.5 的时候,effort 不会开到最高对吧?是不是为了省钱、为了控成本,做"路由",把 effort 压下来?或者直接换成 Kimi、DeepSeek、Minimax?
答案是对的。我认识的人大多数都是这么用的。
这里我觉得有问题。
我自己有个反复试出来的结论。当年 Opus 4.6,把 effort 从 high 降到 medium,同一个模型,准确率从 80% 掉到 30% 左右。模型没换,只是 effort 改了一档,整条工作链的表现就完全不同。那次之后我没再用过 medium effort,Claude 一直走 x high。
GPT 这边从第一天起我都是 x high。原因很简单。如果一个任务 Claude Code 跑得不错,我基本不会再去试 GPT。让我觉得"这玩意确实不一样"的瞬间,都是开到最高 effort 才看到的。5.4 时代就这样,5.5 出来之后这个差异更明显。
所以一句话:当前阶段不要过早优化成本。
算笔账。一个最好的模型,一个账号一个月 200 美金。两个账号给非常充足的用量,单一垂直任务上几乎可以 7*24 连续跑。400 美金一个月,3000 人民币。这个钱比招一个实习生还便宜,但它的产出能接近一个博士级别的研究人员。便宜的那点钱省下来,意义在哪?
我现在一个月给自己花 1000 美金,五个账号轮着用。如果换成 API 调用,按同样的强度大概要 1 万美金。
为什么不去优化?因为你现在不知道最强模型的边界在哪儿。研发的人也不知道,他们没在你的领域试过。这就是未知地带。你要做的是用最强、最贵、最高 effort 的东西去撞这个边界,把它推到极限再说。等它真做不到,你也是确切地知道。
至于"为什么不能像传统软件那样先把成本控住"——等大家对边界都摸清了,到了大规模铺开的阶段,再考虑性价比。当前不在那个阶段。
## 三、还剩 10 周
朋友问:那时间呢?多花点时间慢慢试不行吗?
我说我帮你算笔时间。
世界现在还没被广泛震撼,是因为顶级模型出得太快、太密、间隔太短。我自己用下来发现一件挺反常识的事。即使是 GPT-5.5、Claude Opus 这种最顶尖的模型,开到最大 effort,把一个有价值的方向跑出来也需要时间。它很快,但没快到"想到就立刻做出来"的程度。它会一步一个脚印地走。原本一个团队几个月做的事,它能压缩到几周。但还是要走步骤。
带入到时间轴:
- GPT-5.5 在 4 月 23 号发布,两周前。
- 那个时间点已经有一批人意识到这次不一样,开始在它上面跑自己最有野心的方向。
- 保守估计 3 个月之内,会有一批东西从想象不到的人、想象不到的方向、想象不到的领域 ship 出来。
3 个月 = 12 周。已经过了 2 周。还有 10 周。
10 周之后,会有一批了不起的成果走进这个世界,让大家意识到"世界不一样了"。这种成果不会等你。10 周后你的市场位置、你的标签、你的论资排辈,都可能要重新算一次。
10 周长吗?不长。它短到不允许你浪费一周去搭一个低效的工作流,或者犹豫用什么工具。
## 四、不要用 IDE,也不要折腾第三方框架
第三个话题:那我用什么?
我的回答可能会得罪一批人,但我想说清楚。
**不要用 IDE。** coding agent 这个场景下,IDE 在我看来就是被淘汰的形态。它对原本不是资深程序员的人尤其不友好。你得花时间学一个对你来说没什么意义的复杂界面,结果 agent 写出来的代码你也看不懂。中间挤一个小小的 Terminal 窗口,这个形态从根上就不顺。
**Terminal 这个名字耽误了 Claude Code 和 Codex。** 很多人一听 CLI、Terminal,脑子里跳出来的就是"程序员的东西"。但我帮一些零编程基础的朋友装上 Claude Code 和 Codex 之后,没有一个人说"用不明白"。它就是把重要的东西展示给你,不重要的过程压成日志,跟着关键节点判断就行。新手反而比 IDE 上手更快。
**有条件的话,不要用 OpenClaw、Hermes 这类第三方框架。** 这个有点反常识。我之前确实帮人装过这些。但现在再看,Terminal 加官方 CLI 已经成熟到可以做所有这些框架能做的事,效果还更好。
为什么?因为官方 CLI 是围绕官方模型的 behaviour 定制的。Claude Code 接 Claude 模型,Codex 接 GPT 模型。缓存机制、错误恢复、风险闸门、上下文压缩,这些都是为那一个模型调过的。换成"用 OpenClaw 接 GPT"或者"用 Claude Code 接 Kimi",理论上能跑,实际效果就是差一截。
最近有一个挺火的开源项目可以印证这件事。有人专门为 DeepSeek V4 做了一个 Deep Code CLI,类似 Claude Code 的形态,但只为 DeepSeek 一个模型定制。很多人觉得反常识——中转站不都是"我什么模型都要接"吗?这条路反而是对的。模型有自己的 behaviour,载体围绕它定制,效果和成本都会更好。
## 五、永远不要用"完全黑盒"的代理
OpenClaw 还有一个我觉得很危险的"优点"。它可以远程下发任务、出结果,过程不用看。听起来很爽。
对一部分人来说这是好事。但对正在探索边界的人,这个功能要禁用。
你跟 agent 协作的基础是理解。它什么活干得好、什么活干得不好、思维有什么惯性,你必须看着它干才能学到。一旦黑盒化,你失去的是判断力,不是只是看不到细节。
带 AI 干活,像带新员工干活。最快的学习方式是看着他做每一步。把他当成许愿机会给你结果,但许愿机不会让你成为更厉害的领导者。
## 六、想随时随地操作?SSH + tailscale + tmux 够了
朋友说他喜欢 OpenClaw 的另一个原因是手机能控、随时随地下任务。这一段被大家忽略得太多,专门讲一下。
只用一台笔记本的话,跳过这段没事。
如果你想用手机操作家里的台式机,需要的基础设施其实非常成熟。SSH 是非常老的协议,让你从一台机器登录另一台机器,权限够高。tailscale 是免费的虚拟 VPN,把台式机、笔记本、手机都加进同一个 VPN,互相用稳定的内网 IP 直连。tmux 是后台 session 工具,在台式机上开一个 session,进项目目录打开 Claude Code 或 Codex,这个 session 永远在后台跑,断网、关手机都不影响。你随时可以 attach 进去看进度。
手机这一端配一个 Termius 之类的 Terminal app,连进去就行。整套搭起来一个小时不到。
搭好之后的工作流大概是这样:早上出门前给台式机的 tmux session 下个任务,通勤路上手机 attach 进去看一眼,进度有问题就调一下方向。公司开会期间 agent 自己跑。中午休息再 attach 进去看,继续给反馈。晚上回家电脑前接着干。
整条链路无缝。我现在每周大概有 50 小时是 agent 在我看不见的地方自己干活,但我对它干的事情有清楚的掌握感。手机就是控制器。
这种基础设施在程序员里很普通,但在"用 AI 推工作变革"的语境里被严重低估。它能让你从一台笔记本扩到一栋楼的算力,不需要任何中间件。
## 把上面这些放一起看
回到朋友最早那个问题:要不要接 AI 变革专家的 offer?
我没给他直接答案,给他了我的判断框架。一是看那家公司能不能给你接近无限制用最强模型的资源。不能的话,offer 价值有限。二是你自己平时一定要用顶配模型加最高 effort。尖兵阶段不省钱。三是时间只剩 10 周左右,这 10 周不要浪费在低效工具链上,也不要纠结"用第三方框架是不是更香"。
归根到底就一句话。当前没有人知道最强模型的真实边界。你要做的不是优化成本、不是适配现有流程,是用最猛的东西去撞那道边界,看它能不能往外推一点。
10 周之后,世界会被一批意想不到的成果震撼。到那个时候,你最不希望出现的状态是:过去这几个月我都在折腾 IDE 的配置和模型路由的成本。
时间是最贵的资源。注意力其次。钱排在最后。这个顺序,10 周之内别搞反。
---
## 参考资料
- [OpenAI Codex 单周下载 9000 万 — Crypto Briefing](https://cryptobriefing.com/openai-codex-90m-installs-gpt-5-5/)
- [Codex 周活开发者 4M+ 增长曲线 — Codex Blog](https://codex.danielvaughan.com/2026/04/09/codex-3-million-users-growth-usage-limits/)
- [OpenAI Codex 用户激增至 1.6M / 企业 AI Agent 定位 — Fortune](https://fortune.com/2026/03/04/openai-codex-growth-enterprise-ai-agents/)
- [Anthropic Q1 增长 80x,Dario Amodei 解释算力告急 — CNBC](https://www.cnbc.com/2026/05/06/anthropic-ceo-dario-amodei-says-company-crew-80-fold-in-first-quarter.html)
- [Anthropic 300 亿美金年化营收 run rate — VentureBeat](https://venturebeat.com/technology/anthropic-says-it-hit-a-30-billion-revenue-run-rate-after-crazy-80x-growth)
- [Anthropic × SpaceX:Colossus 1 数据中心、22 万张 GPU、Pro/Max 解锁 5 小时上限 — Anthropic 官方](https://www.anthropic.com/news/higher-limits-spacex)
- [Anthropic-SpaceX 协议:300 兆瓦、超过 22 万张 NVIDIA GPU — Bloomberg](https://www.bloomberg.com/news/articles/2026-05-06/anthropic-inks-computing-deal-with-spacex-to-meet-ai-demand)
- [Deep Code:DeepSeek-V4 专属 CLI Agent — DeepSeek 官方文档](https://api-docs.deepseek.com/quick_start/agent_integrations/deepcode)
- [DeepSeek-TUI:终端里的 DeepSeek coding agent — DEV.to](https://dev.to/arshtechpro/deepseek-tui-run-a-deepseek-coding-agent-directly-in-your-terminal-59ij)
---
### Deepseek 估值 3000 亿,梁文锋领投 200 亿
- URL: https://guanjiawei.ai/zh/blog/deepseek-respect
- English: https://guanjiawei.ai/en/blog/deepseek-respect
- Published: 2026-05-09
- Tags: AI, DeepSeek, 梁文锋, 极客精神, 思考
昨天 DeepSeek 融资的新闻出来,我朋友圈刷到的时候愣了一下。
外界讨论的是 3000 亿人民币的估值,是中国大基金牵头、腾讯阿里跟投的阵容,是这家公司成立以来第一次开口融资。这些都很重要。但我反复看了几遍新闻,真正震到我的是另一组数字:DeepSeek 这一轮内部出资 200 亿,按这个估值跟外部投资者一起进了同一轮。而梁文锋持股近 90%。
我在 AI 行业从业这些年,没见过这种操作。
## 一、自己买自己的蛋糕
打个比方就清楚这事有多反常。
你有一块蛋糕,自己做了几年,员工跟着一起做了几年。某一天市场说要给这块蛋糕估个价,估出来 3000 亿。所有人都很高兴,因为每个人手里那点份额突然值钱了。
正常情况下,这时候创始人会松一口气:之前砸的钱不算了,外部资金按高估值进来了,公司有现金,员工期权有了锚点。
但梁文锋多做了一件事。他在自己定的 3000 亿估值上,又掏了 200 亿,跟外部投资者一起买。
他自己认 3000 亿这个价,且愿意再加一仓。换成股东大会上的客气话就是"我很看好公司",但客气话用不上真金白银的 200 亿。
来源也耐人寻味。梁文锋之前没融过资,公司前几年所有的钱都是他自己砸的。这种创始人通常对外部资本有戒心,第一次开口往往是因为现金不够用了。但 DeepSeek 不缺钱,幻方光是 2025 年的管理规模就超过 700 亿,光这一家私募给他个人的分红就够烧很多年研究费用。
这一轮真正的目的,是给员工的期权一个被市场认可的价格锚点。模型行业现在挖人挖得凶,没有清晰估值就没法用股权留人。融资是为这个,但创始人自己跟投 200 亿,已经远超过这个目的。这是用钱说出来的一句话:我自己认这个价,且我愿意继续在这个价上加仓。
## 二、第一次听到这家公司
时间倒回 2023 年底。
那会儿大模型最热的标签是"四小虎""六小虎",智谱、月之暗面、百川、MiniMax、零一万物、阶跃星辰,江湖排名变着花样讲。投资人和媒体都在这个名单里转。我那时候在智谱,整个圈子谁也没听过 DeepSeek。
直到有一天一个朋友在朋友圈问我:你听过 DeepSeek 没?听说成本优势挺夸张的。
我去翻了下这家公司的资料。它脱胎于一家叫幻方量化的私募基金,2023 年 5 月才正式成立做大模型。最早出来的版本效果上没特别出彩。他们本来想做的是效果,结果效果没达到预期,但 MoE 架构意外地把成本降了一个数量级。然后做了一件挺意外的事:既然成本低,那就直接降 API 价格。
这是圈子里第一次听到 DeepSeek 名字的时间点。不是因为模型多惊艳,是因为价格便宜,而且训练成本数据写在论文里,技术圈一看就知道这真是有东西。
## 三、当时全国能拿出万卡集群的没几家
还有一件事让人意外。
2023 年是中美芯片战最紧的时候。A100 早就被列入限制清单,市面上的存量越来越少。我那会儿在智谱,能直观感受到 A100 是稀缺资源。当时国内能拿出真正万卡级 A100 集群的玩家不多。商汤算一个,到 2022 年财报披露时是 27000 张 GPU,A100 储备过万。
然后 DeepSeek 那边的数字浮出水面:幻方 2021 年就投了 10 亿元搞"萤火二号",已经搭起 10000 张 A100 的集群。等于在大模型还没成为主流议题的时候,他们就已经备好了今天打大模型的硬件底座。
圈子里开始重视这家公司,是从这个时间点开始的。一家做量化私募的,跑去囤 A100 万卡,搞自研深度学习平台。这不是普通的二级市场玩家会做的事。
## 四、价格屠夫
2024 年 5 月,V2 发布。
价格表出来那一刻,所有人都意识到事情不一样了。输入 1 元每百万 tokens、输出 2 元每百万 tokens,大概只有当时 GPT-4 Turbo 的 1%。这不是降价,是把价格拉到了另一条赛道。
后面的连锁反应很快。智谱把 GLM-4-Plus 降了 90%,从 50 元一路砍到 5 元;字节豆包直接报到 0.0008 元每千 tokens,号称行业最低;阿里通义、百度文心也跟着下调。整整一个月,行业的定价基线被重写。
这场价格战和大家以前见过的不一样。以前模型公司降价是跟随 OpenAI,OpenAI 怎么降大家就怎么降。这一次是中国一家此前没什么名气的公司,定下了一个比 OpenAI 低两个数量级的锚,把整个国内市场拽到了完全不同的成本曲线上。
## 五、低调到反常
DeepSeek 在很多地方都不像一家典型的中国 AI 公司。
它在杭州,不在北京。它没有任何政府背景,也没去拿地方扶持。CEO 不出来路演、不接受采访、不发朋友圈。融资之前也没积累 VC 关系,员工招聘靠技术圈口碑,不靠猎头。
最有意思的是它招的岗位。当时圈里流传一个名字叫"数据百晓生",岗位要求是:对各种领域有强烈兴趣、自驱力强、对 AGI 实现有热情。学历背景没特别要求,Python 会读文件调 API 就够了,明确写着"不要求算法推导和手写代码"。这个岗位本质上是教 AI 怎么更像人,所以反而更看重通识、好奇心。当时我有一个做产品经理的朋友,看了岗位描述跟我说他想去试试,最后没录上。
我自己那时候也一度想去。这家公司身上有种神秘感,来自一种少见的纯粹:闷头做技术,不搞别的。后来一直也没太合适的契机,但保持着关注。
## 六、V3 到 R1,把行业拉回了主线
2024 年 12 月,V3 发布。
效果直接到了开源模型的顶尖水平。然后没等多久,2025 年 1 月 20 号,R1 上线,并且直接放出了 APP。这是 DeepSeek 第一次有 to C 产品,恰好赶在春节前。
接下来一周大家都看到了。R1 在春节期间登顶各大应用商店,海外媒体集体报道,OpenAI 那边的人在 X 上反复点评。整个 2025 年上半年的 AI 议程被这一件事改写。
但 R1 真正的影响不是它火本身。是它把一批在被资本和市场逼着"强行商业化"的中国大模型公司,拉回了"先把模型做好"这条主线。
DeepSeek 之前,中国的大模型公司大部分都在闭源。逻辑是:开源会被白嫖,影响商业化。R1 直接证明了这个逻辑站不住。一个完全开源的模型可以同时拥有最好的技术影响力和最广的用户基础,商业化是迟早会跟上来的事。
到 2025 年中段,Kimi 开源了 K2、智谱开源了 GLM-4.5、MiniMax 开源了 M2.1、千问继续 day-0 开源,一群之前坚持闭源的公司全部转向。市场上不再有人讨论"开源还是闭源"这个问题,转成了"你的模型够不够好"。
DeepSeek 没有发布会,没有大喊大叫,但它出手一次,行业的出牌方式就变了。
## 七、xAI 是另一个剧本
可能有人会说:理想主义的 AI 公司不止 DeepSeek 一家,xAI 不也是吗?
xAI 起步的时候,使命也是用 AI 寻找真理,叙事跟 DeepSeek 有几分像。它也是创始人自己出钱、自己组队、自己叫板大厂。但今天再看这家公司,故事完全不一样了。
2026 年 2 月,SpaceX 宣布收购 xAI,按 SpaceX 1 万亿、xAI 2500 亿美元的估值合并,整体估值 1.25 万亿美元。3 月,xAI 当年的 11 位联合创始人全部离职。5 月,xAI 作为独立公司不再存在,并入 SpaceX 之后改名 SpaceXAI。马斯克把 22 万张 GPU 中的大部分转手租给了 Anthropic。
这是另一种合理的剧本:足够大的算力,足够强的资本叙事,最后被并入更大的母体。如果你看 xAI 现在的产品节奏和研究强度,已经不像当初那个"为研究而研究"的样子了。
不是说 xAI 走错了,是说理想主义并不会自动走到 DeepSeek 这条路上。一家公司能不能在融资上百亿之后还保持研究优先、产品克制,是个独立选择,而且越往后越难做。
DeepSeek 的反差就在这。它走到了估值 3000 亿这个量级,融资规模约合 70 亿美元,市场关注度跟全球前几名的 AI 公司没差。但梁文锋还是不出来。最近 V4 Preview 的发布说明里,他用了荀子《非十二子》的一句:"不诱于誉,不恐于诽,率道而行,端然正己"。这话他不是说出来做公关的,是他这几年的行为本身就是这样。
## 八、极客精神
中国 AI 行业不缺技术人,缺的是带着以技术改变世界为执念躬身做事的人。
王坚是上一个这样的代表。他不是计算机科班出身,1990 年拿的是杭州大学心理学博士,1993 到 1998 年还在做浙大心理系主任。但 2009 年他作为阿里软件 CTO,从零开始主持研发飞天云操作系统。当时没什么人相信中国能从底层做出云操作系统,他埋头做了下去。最后阿里云从一行行代码写到几百亿生意,2019 年他以民营企业出身的第一个中国工程院院士身份当选。
我对极客精神的理解,不是技术多硬,是相信技术能让世界变好,并且愿意躬身去做。
DeepSeek 让我敬佩的,是它在 70 亿美元融资量级上还能保留这件事。所有人都已经被催着商业化、被催着去成为热点、被催着退出的当下,还有人愿意把研究本身当作目的。
中国应该有更多这样的团队。不一定都做大模型,做什么都行,关键是在自己干的事上有这种纯度。
那 200 亿不是钱的问题。它是一个声明:这家公司还要继续走研究这条路,且我自己愿意继续陪它走下去。
无论这家公司最终是成是败,无论 V4 V5 接下来表现如何,只要这种声明还在做,这种状态还在保持,就值得每个人去关注它。
Respect。
---
## 参考资料
- [DeepSeek 50 亿起投,最新估值高达 3000 亿(投资界)](https://news.pedaily.cn/202604/563086.shtml)
- [DeepSeek to soon close first external fundraising at US$50b valuation(SCMP)](https://www.scmp.com/tech/tech-trends/article/3352945/deepseek-soon-close-first-external-fundraising-us50b-valuation-sources)
- [DeepSeek could hit $45B valuation from its first investment round(TechCrunch)](https://techcrunch.com/2026/05/06/deepseek-could-hit-45b-valuation-from-its-first-investment-round/)
- [China's Chip Fund in Talks to Lead DeepSeek Funding(Bloomberg/FT)](https://www.bloomberg.com/news/articles/2026-05-06/china-chip-fund-in-talks-to-lead-mega-deepseek-funding-ft-says)
- [Tencent to back DeepSeek in $4B round at $50B valuation(TFN)](https://techfundingnews.com/tencent-to-back-deepseek-in-4b-round-at-50b-valuation-marking-first-external-funding-report/)
- [DeepSeek 融资,梁文锋的"现实主义"转身(钛媒体)](https://www.tmtpost.com/7959921.html)
- [手握万块 A100 芯片,量化巨头幻方发布通用大模型(华尔街见闻)](https://wallstreetcn.com/articles/3701177)
- [幻方 AI DeepSeek 模型背后的万卡集群建设](https://blog.csdn.net/m0_59163425/article/details/143349082)
- [解码 DeepSeek 模式:幻方量化十年孵化出 OpenAI"杀手"(腾讯新闻)](https://news.qq.com/rain/a/20250127A06KRY00)
- [创大模型价格新低!DeepSeek API 价格战(证券时报)](https://www.stcn.com/article/detail/3821826.html)
- [大模型"价格战"仍在继续 智谱旗下大模型降价最高逾 90%(财联社)](https://www.cls.cn/detail/2015502)
- [DeepSeek - Wikipedia 模型时间线](https://en.wikipedia.org/wiki/DeepSeek)
- [Change Log | DeepSeek API Docs](https://api-docs.deepseek.com/updates)
- [DeepSeek V4 问世,引用《荀子》自勉(腾讯新闻)](https://news.qq.com/rain/a/20260424A05PBL00)
- [DeepSeek "不诱于誉不恐于诽"解读(腾讯新闻)](https://news.qq.com/rain/a/20260424A05QDQ00)
- [SpaceX 收购 xAI,合并估值 1.25 万亿美元(澎湃)](https://m.thepaper.cn/newsDetail_forward_32523096)
- [马斯克解散 xAI,并入 SpaceX 并出租 22 万张 GPU(新浪财经)](https://finance.sina.com.cn/stock/usstock/c/2026-05-07/doc-inhxaxnx2652455.shtml)
- [DeepSeek "数据百晓生"岗位招聘详情](https://deepseek.club/t/topic/239)
- [年薪 154 万,DeepSeek 豪掷千金全网求简历(澎湃)](https://m.thepaper.cn/newsDetail_forward_30081951)
- [浙大心理与行为科学系杰出系友王坚博士当选中国工程院院士](https://psymap.zju.edu.cn/2020/0924/c63155a2427876/page.htm)
- [王坚(信息技术专家)- 维基百科](https://zh.wikipedia.org/zh-hans/%E7%8E%8B%E5%9D%9A_(%E4%BF%A1%E6%81%AF%E6%8A%80%E6%9C%AF%E4%B8%93%E5%AE%B6))
- [SenseCore 商汤大装置 — A100 储备与万卡集群(智东西)](https://www.zhidx.com/p/281424.html)
---
### Vibe Coding 起步只有两条路
- URL: https://guanjiawei.ai/zh/blog/where-to-start-vibe-coding
- English: https://guanjiawei.ai/en/blog/where-to-start-vibe-coding
- Published: 2026-05-09
- Tags: AI, Vibe Coding, 数字身份, 思考
最近朋友和同事问得最多的一个问题:Vibe Coding 听起来挺酷,但具体从哪开始用?
这是个好问题。AI Coding 是生产力工具,不是娱乐工具。你拿它去日常生活里折腾,多半摸不着头脑。绝大多数日常需求过去十几年早被各种廉价甚至免费的 APP 喂饱了。想喝奶茶有美团,想剪视频有剪映,自己再 vibe 一个出来干嘛?
我给的答案只有两条路:要么从工作切入,要么从做自己的数字身份切入。没有第三条。
## 一、从工作场景起步
我先说为什么是工作。
人的注意力放在哪里,工具就该长在哪里。一天 8 小时也好、10 小时也罢,是你被强制要求产出价值的那段时间。压力大,反馈直接。要改造工作范式,没有比这更合适的实验场。
打球、做饭、追剧这些场景看起来更"自由",但你一周真正投入的时间薄得可怜,注意力的挂念也不够。这些地方 vibe coding 不容易上手,因为你心神根本不在。
工作场景反过来。你绝大多数时间都泡在那。现成的工具大多要花钱、又都不算好用。输出有人验证,反馈不会跑。改进空间是实在的,不是想出来的。
我自己用的衡量是看 AI 在工作时间里的渗透率。早期我大概只有 10% 的时间在跟 AI 打交道,剩下九成是原本的工作方式,这种状态基本等于没渗透。后来慢慢推到 80% 以上。渗透率高的时候,我一天里只剩下开会、签字、跟客户谈这种纯人的事还在用旧范式。
这个数字其实比想的更接近。Stack Overflow 2025 年开发者调研里,84% 的开发者已经在用或计划用 AI 工具,每天用的占 51%。Anthropic 自己的 Economic Index 数据更直接:Claude.ai 上 46% 的对话是工作相关的,API 端是 74%。重度用户更是把它当工作伙伴,不是玩具。
但渗透率从 10% 推到 80%,不是把 AI 加到流程里就行。它要求你把手上的活拆开重新分配:哪些环节让 AI 写、哪些让 AI 查、哪些让它自己跑、哪些必须人盯。这种重排是 vibe coding 起步最自然的训练场。
## 二、从做数字身份起步
如果你工作上一时找不到切入的口子,比如流程过死、或者团队还没准备,那第二条路一样成立。做你自己的个人数字身份。
为什么把它放在工作之外的第二位?因为它的 ROI 高得过分。
投入小到几乎不用算。一个个人网站现在用 vibe coding 一两天就能搭起来。
潜在收益是复利。你写的内容是你的,不是平台的。同一篇东西发到知乎、微信公众号、极客邦、X、小红书,是五个完全不同的曝光形态。每个平台算法不一样,命中爆款的概率叠加在一起,比押注单一平台稳得多。
我自己冷启动了一个多月,全平台日均浏览大约 2000。这个数字其实没什么意义。重要的是分布。我有一篇讲软件招投标的文章,在知乎被推到 2 万多阅读、上百条评论。其他文章很多在每个平台都是几十到几百的水位。但只要存量够多,总会有一两篇命中。这就是分发的复利。
有个反直觉的事实。profy.dev 调研过 60 多位技术招聘经理:93% 的人会去看候选人的作品集网站,但 51% 直接说"没有作品集网站不会拉低候选人机会"。意思是什么?静态展示型的"花瓶网站"用处不大,真正起作用的是能让内容慢慢沉淀的载体。GitHub profile、博客、项目笔记,这些有"输出痕迹"的东西,才是数字身份。
落到 vibe coding 上,这条路现在好走多了。AI 已经把内容 pipeline 里最繁琐的部分压到接近零成本:写、改格式、适配不同平台、生成不同媒介。原来一个人把一篇文章铺到五个平台要折腾大半天,现在十几分钟。每天哪怕只投 30 分钟,长期下来很可观。
至于"为什么应该做数字身份",我之前写过[一篇](/zh/blog/digital-identity-biggest-leverage)更完整地讲过,这里不重复。
## 三、前提:必须是真实的你
朋友追问了第二个问题,我觉得比"从哪起步"更值得展开。
他说:要在网上把自己的东西公开发出去,我心里有点犹豫。该发什么?怎么发?
我的回答只有一条:发,但发出去的必须是真实的你。
别扮演,也别为了追流量去模仿一种你自己都不认可的风格。这是长期 ROI 最容易翻车的地方。
很多人有个误解,以为做个人身份就是要"演一个更好的自己"。这条路只在那种全职靠流量吃饭的网红身上跑得通。那是他们的生存方式。对绝大多数人来说,数字身份是工作之外的复利项,不是主业。一旦开始扮演,你就有了一个看不见的负债:你发出去的每一篇东西,都是未来某天可能被翻出来对照的"原始档案"。
互联网有记忆这件事,我觉得被低估得离谱。
最经典的例子是 Justine Sacco。2013 年她飞南非前随手发了一条推文,当时只有 200 粉丝。11 小时飞行落地,她在全球被骂上了热搜,回到公司就被开除。粉丝量并不是护身符。James Gunn 2018 年被迪士尼炒掉,翻出来的是 2008-2009 年的旧推,十年前。Kevin Hart 同年退出奥斯卡主持,翻出来的也是十年前的笑话。
一旦你的影响力越过某个临界点,过往内容会被以放大镜级别审视。
所以我每发一篇东西之前,会问自己一句:在那个时间点,这是真实的我吗?是我愿意将来回头来认领的观点吗?
如果是,发。哪怕之后想法变了、觉得当时幼稚都没事,人本来就会变,回头看年轻时的天真是正常的,那也是你的历史的一部分。但如果在那个时间点你都没办法认可自己写的东西,将来回头看那就是污点。这种污点累计起来会变成你以后的掣肘。
发真实的自己还有一个隐藏的好处。它逼着你把"什么是真实的自己"想清楚。这个过程本身的价值,可能比内容能带来的曝光还高。
## 不发就是 0
回到朋友最早那个问题。
两条路:从工作切入是最自然的,注意力本来就在那;从数字身份切入是最划算的,投入小,回报复利。哪条能马上动手就走哪条,比纠结半年要有效得多。
数字身份这件事,[我上次](/zh/blog/digital-identity-biggest-leverage)也说过:不做,机会就一直挂在那里等。任何一个事件命中你的概率是 0。买彩票不买,概率就是 0;买了,至少有概率。
但比起"数字身份是杠杆"这种宏大叙事,我更想强调的是:今天就动手,不要等。门槛已经低到不像话。少有几件事能这样跨行业通用、对每个人都管用。前提只有一个:是真实的你。
每个人都该做。马斯克、雷军都在做,连特朗普都在做。跟他们用的是同一套基础设施、同一种媒介。没有理由你不做。
---
## 参考资料
- [Stack Overflow Developer Survey 2025: AI 工具使用率](https://survey.stackoverflow.co/2025/ai/)
- [Anthropic Economic Index — January 2026 Report](https://www.anthropic.com/research/anthropic-economic-index-january-2026-report)
- [profy.dev: Portfolio Websites Survey — 60+ 招聘经理调研](https://profy.dev/article/portfolio-websites-survey)
- [Justine Sacco 推文事件 (2013) — CNN](https://www.cnn.com/2013/12/21/us/sacco-offensive-tweet/index.html)
- [James Gunn 旧推被翻出 (2018) — Variety](https://variety.com/2018/film/news/james-gunn-fired-from-guardians-of-the-galaxy-vol-3-1202879817/)
- [Kevin Hart 退出奥斯卡 (2018) — NPR](https://www.npr.org/2018/12/07/674447464/kevin-hart-bows-out-as-oscars-host-amid-backlash-over-past-tweets)
- [GitHub Copilot 在 Fortune 100 的采用率 — GitHub 官方文档](https://docs.github.com/en/copilot/concepts/copilot-usage-metrics/copilot-metrics)
- [Cursor 增长数据 — Sacra 分析](https://sacra.com/c/cursor/)
---
### 陪 agent 干活到此为止
- URL: https://guanjiawei.ai/zh/blog/let-the-agent-run
- English: https://guanjiawei.ai/en/blog/let-the-agent-run
- Published: 2026-05-08
- Tags: AI, AI Agent, Codex, Coding Agent, GPT-5.5, 思考
我用 Codex 的 APP 做了两天自动化,烧了一个 Pro 账号,进展微乎其微。换到 Codex CLI 的 Goal 功能,立刻就顺了。
一开始觉得反常。同样的模型,同样的任务,怎么换个壳子表现差这么多。两天之后想明白了:这不是 APP 的问题,是 agent 形态还在过渡,APP 提前去做「大众化」的尝试,跑在了模型能力之前。
放下账号让我意外的反而是另一件事。心态。
## 一、一个困惑
最近有个事一直没想明白,挂出来跟大家聊聊。
同一个 coding agent,在终端里和在官方 APP 里,行为差异大到不像是同一个东西。终端里跑得很爽,挪到 APP 里就明显变蠢。
按理说不该有这个差。APP 不就是个壳子吗,套个框架、改个视觉,行为应该一致才对。但一线重度用户的选择已经投了票,绝大多数还是泡在终端里,APP 推了这么久也没真正起来。
这事我自己实测之后发现,可能比想象中复杂。
## 二、Codex APP 的「自动化」:两天踩了一遍坑
事情起源于 GPT-5.5 出来之后那种「这模型已经够强」的感觉。
5.5 让 Codex 的端到端执行能力上了一档,长程任务里它会自发地选择「先验证再推进」。我体感它一个 loop 大概能撑住 30 分钟,干到一个阶段会自然停下来。盯了它好多天,发现自己在终端里其实就是反复说「继续」。下一步它判断得已经很可靠了。
那既然这样,为什么不让它高度自动化?反正就是「继续」。
我印象里 Codex APP 之前有 Routine 功能,正好用上。下下来之后才发现 Routine 不见了,改名叫「自动化」。读了一下文档,能力大体相似,就开始上手。
第一个坑是触发模式。它支持按固定时间跑、或者按间隔触发。我把自定义间隔调到半小时一次,让它围绕一个目标持续跑了两天。
我最开始想模拟终端里的体验:同一个会话不断「继续」,过几次迭代瞄一眼成果,发现跑偏了拉回来。在 APP 里这对应 thread automation,即在当前会话里挂上心跳式的定时唤醒。
听上去合理,实测发现一个隐藏限制:在一个会话里,自动化只能成功触发一次。第一次跑完,系统就把后续心跳吃掉了,理由是怕你形成无限循环。这就没法实现连续迭代了。
退一步,改用 standalone automation,每次起一个新会话,按时间表反复触发。这下能跑了,但代价两个。
第一是价格。每一个新会话都不带历史上下文,要把之前的状态以文档形式重新交接。新 session 没有任何缓存命中,会把所有相关文档从头爬一遍读一遍。OpenAI 的 prompt caching 机制下,缓存命中的 token 价格大约只有非命中的十分之一,这一下就把成本拉了 10 倍。我体感对得上:一个 Pro 账号同时跑三个独立自动化任务,差不多两天就把额度耗干了。
第二是表现。我把自动化方向收窄了,夜里只让它围绕单个具体小问题做尝试和突破。早上看进展,跑了八小时,进展微乎其微。
这跟我对终端里这个模型的预期差太多。在终端里我反复说四小时「继续」,得到的成果质量稳稳高于这八小时无人值守的产出。一开始让我以为是模型本身没那么强,后来推翻了。是 APP 这条路径有问题。
## 三、Codex CLI 的 Goal:终端里第一次见着像样的长跑
正好搜资料的时候看到,Codex CLI 在 0.128.0 版本里加了一个实验功能叫 `/goal`。
它的设计逻辑很直接:你给一个目标(不是单个 prompt),它就持续走 plan → act → test → review → iterate 的循环,跑到目标达成或预算耗完为止。状态在会话之间持久化,可以暂停、恢复、清除。这跟我在 APP 自动化里苦苦想模拟的东西,本质就是一个东西。
我刚好在新机器上 set up,就开了这个功能体验。结论是它的体感跟我期待的差不多:长程执行能力撑得住,大多数时候围绕一个目标自己往前推,不太离谱地跑偏。这是终端里第一次见着真正像样的「长跑」形态。
到这里就有点尴尬。APP 的精美界面、可视化的 diff、对话气泡,最后效果不如一个朴素的终端循环。
为什么?
老实说我没琢磨明白。APP 不是开源的,背后到底怎么实现的看不到。但有个观察可能有点说法:真正在做长程任务的几个产品(Codex 终端 Goal、Boris 自己挂出来的 Claude Code 装备、OpenCode 这类社区项目)形态都收敛到一处。后台一个 loop,模型加工具调用加上下文追加,反复跑。状态用文件、用 git、用 worktree 持久化,UI 只是个观察口。
而 APP 这种围绕对话框设计的体验,在长跑场景里反而成了拖累。它把每一次交互当成一次独立的「问答」,结果该共享的上下文断了,该缓存的前缀变了,该让模型自己判断的「下一步」被人为拆成了多个事件。
## 四、放手 24 小时:心态变了一次
回到那两天的实验上,撇开成本和效果不谈,我注意到一个完全意外的东西。心态。
之前用 agent,不管它多自动化,你的心神始终是在它身上的。会不断等下一个回合、看它在干嘛、判断要不要纠偏。这个负担不在工时里,在意识里。你没有真的把这件事「交出去」,你只是把执行委托给了它,决策还在你这。
那 24 小时它自己在三个分支上跑的时候,第一次出现了「不需要盯」的感觉。我心里清楚它在工作,知道它具备这个能力,那就让它跑。这一天我去做了别的事。和家人吃饭、读了点哲学的东西、看了个电影。
成果不如预期,账面上是亏的。但那个心态变化我觉得是真的拐点。
我之前一直没意识到「随时盯着 agent」对意识的占用有多重。你以为没花时间,确实,你也就十几分钟看一次。但你的注意力一直系在那。一旦放手成立,整段时间是真的属于你的。
这件事让我想清楚了 agent 的演进阶段。
第一阶段,以人为中心。聊天机器人、代码补全。AI 是提效工具,每个细节人都要关注。
第二阶段,人指导 agent。这是当下的主流形态。让 agent 自己乱搞会出问题,得在过程里给指导,盯着它干活。这里有个反直觉的东西:这个阶段其实比纯人工更累。你的产出大很多,但身体和精神的负担反而更重。我家人对我的状态变化看得最清楚。她说我现在是真的 7x24 挂在那里。
第三阶段,agent 自主。人只负责定目标和偶尔监督,剩下的它自己搞定。我觉得 5.5 是第一个让这个阶段「看起来真的可能」的模型。
第二阶段是过渡态。它的特征就是「期望大于能力」。你希望 agent 能像员工一样独立干活,但模型还差一口气,所以你不得不补位。补到第三阶段就不用了。
## 五、模型 + 目标 + 循环
Boris Cherny(Claude Code 的创始人)最近反复在表达一个判断:未来一年,Claude Code 可能只剩 100 行代码。
他的逻辑是这样:现在 harness 里那一堆东西,权限闸门、上下文管理、工具路由、防 prompt injection、人工审核 hook,大部分是为「模型不够聪明」准备的。模型一旦能自己做对的判断,这些就成了累赘。剩下来真正必要的核心其实就一个 loop:
```
while (model returns tool calls):
execute tool → capture result → append to context → call model again
```
这就是 Claude Code、Codex、Cursor agent、Manus 全部框架的共同底色。一个循环,外加目标和工具调用。
这个判断跟我自己的体感是吻合的。`/goal` 这种功能能成立,靠的是模型本身在「下一步该干嘛」上已经足够稳。你不再需要外部去约束它先做这个再做那个,它自己会规划,自己会判断要不要回退验证。
形态一旦定型,下一步的演化方向就很清楚了:一个人对应多个 agent,每个 agent 围绕一个目标在循环里跑,互相之间或许还会协作。是 agent team 而不再是 agent copilot。
## 六、Token 的逻辑会反过来
到这里有个有意思的副作用:token 消耗会跟人数解耦。
现在大部分付费用户的心态是「token 焦虑」。价格按周或按月结,那就要把额度榨满,不然有负罪感。底层逻辑跟雇人差不多:买的是时间,那就七乘二十四压榨。
但这个机制跟实际价值产生其实挺扭曲的。不是所有任务都需要 24 小时跑下去,绝大部分任务都不需要。
只是,第一阶段的瓶颈在「能力」,模型不够强,无法独立完成很多事。第二阶段的瓶颈在「人」,你只有这么多注意力,能开三个 agent 就顶天了。等到第三阶段,瓶颈转移到「目标」上:一个人有多少有价值的方向值得用 agent 去推?
这件事一旦成立,token 消耗就跟用户数没关系了。有的人到现在都没用过 agent,有的人一个月在 agent 上的开销已经过千美元(我自己也快这个量级)。这种分化只会更剧烈。一个人有 100 个 agent 在 24 小时为他跑,是完全可能的事。
短期内的现象是:token 需求会进一步爆发,但形态可能跟用户增长完全不挂钩。重度方向的少数人,会消耗掉绝大多数算力。
## 七、被解放出来去做什么
这就回到我开头说的那个心态变化。
人在工业化里被放在了一个矛盾的位置:管理者期望员工 7x24 工作、有自主性、又能实时被监督。这本身是矛盾的。因为「工资按月结」,所以管理者会想办法把这个矛盾推到最满。
agent 没有工资矛盾,它就是按 token 结算的。理论上你可以让它真的 24 小时跑。前提是它有能力在没人盯的情况下产出。这个前提,5.5 之后我觉得开始成立了。
成立之后,对人意味着什么?
这事我家人比我想得更通:人不应该被定义成生产单位。我那两天「无人值守」的状态,让她直接说了一句:你这种紧绷的状态,从健康看就是不可持续的。她说得对。第二阶段「比纯人工更累」这件事不是抱怨,是真的在发生。你在不断寻找跟 agent 协作的方式,那种摸索成本在精神上是真实的。
第三阶段如果真成立,人被腾出来的时间可以拿去做什么?去表达,去连接,去做感兴趣的事。简单的回答,但越想越觉得这才是值得的方向。学哲学也好,看影视也好,回归家庭也好,都是在「人」这个维度上加分的事。是 agent 替不了的事。
## 八、观察人的方式正在变
最后说一个偏宏观的判断。
整套价值体系都在被重塑。原来观察一个人产出的方式,是看他的工时、代码量、PR 数。这些指标在 agent 时代会越来越虚。Boris 一个人一天 150 个 PR,你怎么用 PR 数来评估他?
未来真正有区分度的东西,是领导力和目标感。你能不能定义有质感的目标?你能不能识别真正有价值的方向?你能不能让一队 agent 朝同一个北极星跑?
这些东西,原来在「人和人协作」里也重要,但还可以靠组织流程、KPI、激励去托底。换成「人和 agent 协作」,托底的东西没了。目标定不准就是直接的浪费,一晚上 100 美元在某个跑偏的方向上就烧光了。
放手是个很难的事。但有些事就是要放手才能走到下一步。
---
## 参考资料
- [Codex CLI Features:`/goal` 功能 0.128.0 版本说明](https://developers.openai.com/codex/cli/features)
- [Codex APP Automations 文档(thread / standalone / project 三类自动化)](https://developers.openai.com/codex/app/automations)
- [Codex `/goal` 深度解析:OpenAI 内置的 Ralph Loop](https://ralphable.com/blog/codex-goal-command-ralph-loop-openai-built-in-autonomous-coding-agent-2026)
- [Boris Cherny 谈 Claude Code 未来:harness 越来越薄](https://newsletter.pragmaticengineer.com/p/building-claude-code-with-boris-cherny)
- [Boris Cherny 公开的 Claude Code 工作流](https://howborisusesclaudecode.com/)
- [GPT-5.5 Terminal-Bench 2.0 拿下 82.7%(OpenAI 官方介绍)](https://openai.com/index/introducing-gpt-5-5/)
- [GPT-5.5 长程任务表现:Codex 内部 session 跑了 7 小时](https://www.coderabbit.ai/blog/gpt-5-5-benchmark-results)
- [OpenAI Prompt Caching 机制与价格说明](https://developers.openai.com/cookbook/examples/prompt_caching_201)
- [OpenCode:开源终端 coding agent](https://opencode.ai/)
- [Claude Code APP vs CLI 体感差异讨论](https://www.mindstudio.ai/blog/claude-desktop-app-vs-terminal-agentic-work)
---
### Agent 时代最贵的浪费:GPU 在等 CPU
- URL: https://guanjiawei.ai/zh/blog/agent-cpu-bottleneck
- English: https://guanjiawei.ai/en/blog/agent-cpu-bottleneck
- Published: 2026-05-07
- Tags: AI, AI Agent, Infra, CPU, 思考
最近一段时间我在用 Agent 做 AI Infra 的实验。统计了一下,七百多轮真机实验,光「等环境起来」这一件事就吃掉了三十五个小时。
这事让我开始怀疑一个常识:在 Agent 大规模铺开的今天,瓶颈到底在哪儿。
## 一开始我以为是模型慢
GPT-5.4 刚出来那会儿,我老觉得它墨迹。当时 fast 模式是消耗两倍额度换 1.5 倍吞吐,我开了一阵,体感快了一点,但远远没有 1.5 倍那么明显。账面上有点亏。但 OpenAI 那段时间推广,额度给得很慷慨,也就没太计较。
5.5 出来之后 fast 变得更贵了,[2.5 倍额度换 1.5 倍速度](https://developers.openai.com/codex/speed)。我又试了几天,结论是几乎完全没用:额度跑得飞快,体感速度提升几乎为零。
我想了一下原因。5.5 本来就比 5.4 操作精准得多,废动作砍掉一大半,单位时间已经在做更多事。再多花两倍多的钱去抠那点吐字速度,根本没法有显著体感。
更让我意外的是另一件事:我盯着自己的工作流看了几天,发现模型大多数时候不是在生成,是在等。
等什么?
## 七百轮实验,三十五小时被环境吃掉
我做的方向是 AI 推理 Infra,所以一轮典型实验长这样:搭环境、跑数据、收结果、写日志。
跑数据这段主要看 GPU 性能,是个波动因子,没什么可优化的。我盯了几天日志才意识到,每轮里被卡死的硬时间都在「环境启动」上:装依赖、配 cuda、起服务、做编译。这一段每轮平均三分钟。
七百轮乘以三分钟,是两千多分钟。差不多三十五个小时。
而我端到端跑完一轮,设计实验、写代码、跑数据、做分析、写记录加在一起,平均也就五到六分钟。也就是说,整段时间里有相当一部分是模型蹲在那里干等 CPU 把环境配出来。
我读一遍这个数据有点出戏。所谓的智能体在做实验,听上去很高大上,结果其中一半时间它真的就在那里发呆。
## 不是实验场景独有
放到日常工作场景,问题更扎眼。
随便举个例子,你让 Agent 用 PPT 做点东西。模型生成调用指令的速度可能就是几秒,刷地一下就给出来了。然后呢?等 PPT 启动。如果电脑老一点、PPT 是冷启动,光打开就一分钟。打开之后下指令、画图、调位置,又是 30 秒。
而且这中间几乎没法并行。每一步都要等上一步的结果。上一步效果不好就要改,改完才能进下一步,每一次交互都是串行依赖。看上去 Agent 在「自动化」工作,其实是在不停地阻塞等待。
我把时间算了一下。模型这边读你给的反馈,按 prefill 2000 token/s 算,1 万字大概五六秒就读完。输出指令按当下普遍的 30 token/s 算,1K token 差不多 35 秒。读加写一轮 40 秒左右。
但工具那一段也要 30 到 40 秒。两段是对等的。模型生成完之后就坐在那里等。等结果回来,再分析下一步。
这是当前 Agent 工作流的真实节奏。
## 模型再快,CPU 慢就是浪费
那我们假设把模型推理速度从 30 token/s 拉到 100 token/s。
听起来很爽,三倍。但成本可不是三倍。你要堆更多 GPU、用更高频的卡、跑更激进的并行策略,整体成本上去远不止三倍。
收益是什么?模型那 35 秒缩到 10 秒。一轮 40 秒变成 15 秒。
但工具那段还是 30 秒。整体一轮变成「执行 15 秒 + 等待 30 秒 = 45 秒」。
注意这个比例:六成多的时间 GPU 是闲着的。你花了大代价把 GPU 提了三倍速,结果三分之二的时间它都在等 CPU。
这个浪费在 Agent 场景里被放大得很厉害。因为一个工作流不会只调一个工具。Agent 可能要打开 PPT,再开 Word 拿点东西,再开浏览器搜张图,回来编辑。每一步都是冷启动加执行加等待。串起来全是 CPU 密集和 IO 密集的活。
## 这一年硬件圈在干同一件事
一开始我以为这只是我个人的体感。后来发现整个硬件圈这一年都在围着这件事转。
Intel 公开说,[服务器里 CPU:GPU 配比已经从 1:8 收紧到 1:4,未来会到 1:1](https://www.tomshardware.com/pc-components/cpus/shifting-need-for-cpus-in-ai-workloads-drives-intensifying-shortages-price-hikes)。Nvidia 在今年 3 月的 GTC 上直接点名 CPU 已经成为 agentic 工作负载的瓶颈,紧接着在 CES 2026 上发了 [Vera CPU](https://nvidianews.nvidia.com/news/nvidia-launches-vera-cpu-purpose-built-for-agentic-ai),88 核 Olympus、1.2 TB/s 带宽,专门给 agentic 编排和工具调度用。Arm 第一次自己下场做服务器 CPU。OpenAI 跟 Nvidia 那个超大单子里写得很明白:「数十万张 GPU,加上数千万颗 CPU。」
服务器 CPU 自今年 3 月已经涨了 20%,分析师预计下半年还要再涨 8 到 10 个点。Intel 把产能从消费级 CPU 切到 Xeon。
为什么所有人同步动起来?Nvidia 在自己技术博客里把那个工作流写得很清楚:拿任务、拉 context、调模型、解析输出、决定下一步、调工具、等 IO、处理结果、拼下一轮 prompt、再调模型。除了「调模型」那两下是 GPU 的活,其余几乎全都跑在 CPU 上。
## 反过来想,AI 把传统计算的需求拉爆了
以前我们觉得 AI 起来了,对底层基础设施的需求会被 AI 重塑。GPU、HBM、互联这些会更值钱,CPU 这种传统部件就那样吧。
现在看完全是反过来。AI 不是替代了传统计算,是把传统计算的需求拉爆了。Agent 越复杂,工具调用越多,串行依赖越深,对 CPU、内存带宽和 IO 的要求就越高。
底下其实是个朴素的成本逻辑。以前一个 PPT 启动慢一分钟,是人在等,那就等呗,损失不过是「人不爽」。现在如果是 Agent 在等,背后那张 GPU 每秒都在烧钱,等一分钟的成本是人的几十倍。
谁能让 GPU 等待时间最短,谁就赢了端到端的性价比。这件事最后会传导到机房的拓扑、调度的策略、推理服务的设计哲学,乃至每一家公司怎么挑硬件、签合同。这个传导链才刚刚开始。
## 给在做 Infra 和 Agent 工程的人
几件事可以提前想。
别把「模型快」等同于「端到端快」。一个工作流的真瓶颈很可能根本不在模型,而在那个被你忽略的工具冷启动。下次有人跟你聊「我们模型 TPS 多少」的时候,先反问一句你的工具链平均冷启动多久。
CPU、内存、IO 的预算别砍。你跑过一段时间真实工作流就知道,闲下来的不是 CPU,是 GPU。买 GPU 之前先看一眼 CPU 是不是已经快被压扁了。
回头看一眼自己工具链的冷启动时间。能预热的预热,能复用的复用。Agent 工作流大部分是串行的,但启动这一步几乎总有办法挤出空间。
我自己接下来一段时间会重点盯这块。先把那三十五个小时榨出来再说。
---
## 参考资料
- [Speed — OpenAI Codex Developers](https://developers.openai.com/codex/speed)(fast 模式 1.5x 速度 / 2.5x 成本的官方说明)
- [GPT-5.5 Pricing: Full Breakdown of API, Codex, and ChatGPT Costs](https://apidog.com/blog/gpt-5-5-pricing/)
- [Intel says AI Inference Pushes CPU Ratio From 1:8 Toward 1:1(TrendForce)](https://www.trendforce.com/news/2026/04/24/news-intel-says-ai-inference-pushes-cpu-ratio-from-18-toward-11-18a-yield-target-reportedly-advanced-by-6-months-to-mid-year/)
- [CPU requirements for AI workloads are multiplying(Tom's Hardware)](https://www.tomshardware.com/pc-components/cpus/shifting-need-for-cpus-in-ai-workloads-drives-intensifying-shortages-price-hikes)
- [The Great Rebalance: How Agentic AI Is Reshaping the CPU:GPU Ratio(TrendForce Insights)](https://insights.trendforce.com/p/agentic-ai-cpu-gpu)
- [NVIDIA Launches Vera CPU, Purpose-Built for Agentic AI](https://nvidianews.nvidia.com/news/nvidia-launches-vera-cpu-purpose-built-for-agentic-ai)
- [Building for the Rising Complexity of Agentic Systems with Extreme Co-Design(NVIDIA Technical Blog)](https://developer.nvidia.com/blog/building-for-the-rising-complexity-of-agentic-systems-with-extreme-co-design/)
- [The Forgotten Chip: CPUs the New Bottleneck of the Agentic AI Era](https://www.uncoveralpha.com/p/the-forgotten-chip-cpus-the-new-bottleneck)
- [The CPU Bottleneck in Agentic AI(Vik's Newsletter)](https://www.viksnewsletter.com/p/the-cpu-bottleneck-in-agentic-ai)
---
### 人人都要当领导:用了一周 GPT-5.5 和 Opus 4.7 之后
- URL: https://guanjiawei.ai/zh/blog/everyone-needs-leadership
- English: https://guanjiawei.ai/en/blog/everyone-needs-leadership
- Published: 2026-05-06
- Tags: AI, GPT-5.5, Claude, Codex, AI Agent, 思考
四月这一波模型迭代密度有点夸张。Opus 4.7 在 4 月 16 日发布,同一天 Codex CLI 推出了 Goal Mode;4 月 23 日 GPT-5.5(代号 "Spud")上线,紧跟着 5 月 5 日 GPT-5.5 Instant 直接顶替了 ChatGPT 的默认模型。一个月不到,我手里常用的几个模型全刷了一遍。
按理说手感应该很好。结果用了一周下来,我有两个发现跟自己一开始想的不一样。
## 一、模型跑得快,但人的预期跑得更快
模型这一年发的速度真不慢。按 Epoch AI 的数据,Anthropic 的中位发布间隔从 2024 年的 168 天压到了 2026 年的 71.5 天,OpenAI 直接是月更,整个前沿圈子的下限已经被压到 4 到 6 周。即使如此,使用过程里那种"怎么这么笨"的感觉还是会冒出来。
我自己反思下来,这事和模型本身关系不大,跟人的预期曲线有关。
举个例子。我小时候学过一段跳舞。最开心的是刚开始那阵,根本不会跳,对着镜子摆几个动作就觉得自己挺帅。最难受的反而是中段。自己刚学了一些基础,同时也开始看高水平的视频,审美的提升远远跑在动作能力前面,再看镜子里的自己怎么看怎么别扭。学拳击也是同一回事,没接触前觉得自己出拳像泰森,真上场练几节课下来,连躲闪都跟不上。
用 AI 是这条曲线的极端版本。
ChatGPT 刚出的时候那种跨越大家都记得,但人们不会停在那个跨越上。免费的时候,要它给世界级的咨询;付一点钱,就指望它在 80 分钟里解掉一道世界难题。一个原本想都不敢想的能力,一旦摆在面前,预期会以远远高于能力进步的速度往上跳。模型每 6 周强一档,预期可能每 6 天强一档。
我觉得这是很多人没办法持续用 coding agent 的根本原因。不是这工具不好,是用的人还没学会怎么调整自己对它的预期。
## 二、和它协作,比我想的难
我用 agent 经过了几个心态阶段。
第一阶段不太信任,每一步都盯着,看它哪里行哪里不行。第二阶段反过来,开始觉得诶它好像很多事比我自己强,那干脆撒手让它自己干。第三阶段,我用 Codex 桌面端开了一个无人值守任务跑了两天,烧掉了一个账号一整周的 token,结果是一堆走偏的弯路,成果不如我自己花两个小时干的。
这把我打回来一些。我开始重新和它做更密的协作,同时晚上让它自动跑一段时间,对照看差异在哪。Prompt 没写得很复杂,和我白天用的指令风格一致,轻量的方向,给充分的上下文。
有三个问题在自动化的场景下变得很显眼。
### 问题一:过早放弃
最先冒出来的是这个。
Claude 的表现最戏剧化,它的用词非常拟人。每次跑到稍微复杂一点的环节,它就会冒出一句类似"今晚的 session 已经差不多了,建议这里收尾,睡一觉,明早再开下一个 session"这样的话,给的理由经常是"接下来这块可能要烧很多 token,你要慎重"。
我后来直接在 prompt 里加了一句"今晚不睡觉,不要再提睡觉这件事"。
这背后并不是模型在偷懒,更像是训练目标显式收紧了。Anthropic 自己的 4.7 发布文档里有一句话写得很直白:模型现在更严格地遵守 effort 等级,会"把工作的范围限定在被问到的事情上,而不是主动越界"。这套行为对大多数日常请求是合理的。但放进自动化任务里就反过来了,因为很多有价值的探索,恰恰需要它越界一点。
GPT-5.5 不像 Claude 那么戏剧化,它的过早放弃更隐蔽。我观察下来它的策略大致是:先做一轮浅层探测,确认方向有没有立刻可见的机会,再决定是否深入。这个策略本身没毛病,问题出在后半段。一旦探测得到一个稍微负面的信号,它就会很快关掉整个方向,跳到下一个,几乎不会回过头质疑自己探测的方法本身有没有问题。
### 问题二:高潜力方向被一刀切
第二个问题是第一个的延伸,但更可惜。
人在做研究判断的时候,最值钱的能力之一是认为某些方向"这里有东西,但要挖一阵才能见底"。这种方向开头不确定性高,要持续投入,撞对了回报也极大。
而当前的 agent 在 token 效率训练之下,恰好对这类方向最不友好。它会用很简单的探测做出"不行"的判断,然后把这个方向永久关闭。下一次它在没有这个方向的搜索空间里继续尝试,结果就是绕开了那块最值得啃的硬骨头,最后落到一些好做但也没太大价值的局部解上面。
这件事让我重新看到一个东西的价值,就是人对方向的直觉判断。
这不是"我比 AI 懂得多"那种价值,恰恰相反,很多领域我根本没它懂。但在它有充分领域知识的前提下,我能根据各种零散信号告诉它"这个方向值得你再多挖一阵,就算暂时探不到"。这种判断会让总 token 上升,但带来的是真金白银的产出差异。
### 问题三:跨 session 的大局不一致
第三个问题最头疼。
在我自己手动用的时候,上下文是连贯的,一个 session 持续几小时,我可以不断微调方向。但在自动化里,agent 会反复起新的 session,每次都从外部文档读上下文。理论上只要文档完整,新 session 应该和老 session 保持一致才对。
实际不是这样。
同样的上下文,不同 session 起来,它对方向的判断可能会大幅度漂移。前一个 session 兴致勃勃地认定 A 方向值得深挖,下一个 session 看到同样的笔记,可能就把 A 放一边,跑去探 B;再下一个 session 又跳到 C。从外面看,整个工作呈现一种"东一榔锤西一棒子"的样子,几乎不可能聚出真正的成果。
这正是行业里被叫做 context rot 的现象。意思是上下文在跨会话使用下会"腐烂",模型越来越难基于早先的决策保持一致,每个新会话都倾向于做局部最优。这两年专门做"持久上下文层"的工具公司一波接一波(Augment、Hindsight、OneContext 之类),就是为了解决这个事。但工具能解决的只是把上下文搬运得更完整,搬运不解决"模型每次读完之后判断会不一样"这个核心问题。
## 三、所以人人都要当领导
把上面三个问题摆在一起看,能看到一件事:人在协作里需要扮演的角色,正在变。
它不太像传统意义上的工程师,更像一个领导。
领导力的核心,不是比下面的人懂得更多。很多时候领导对具体技术方向并不专精。它的核心是在不确定里做出方向判断,并且能在零碎信号和反复反弹之间坚持或调整这个判断。这套能力以前主要在带团队的人身上才需要,现在每个用 agent 的人都得自己扛。
跟传统领导不同的是,agent 这个"团队"成本极低。带一个真人团队,月成本几十万到上百万;带几个 agent,月成本几千块就差不多了。低几个数量级的成本意味着每个普通人也能拥有自己的"团队"。但反过来,决策这件事再也甩不出去了。以前你还可以指望团队里的资深成员替你判断方向,现在 agent 不会替你判断,它会非常配合地按你的指引做下去,方向错了它也照做。
有几件事是它做不了、必须由你来补的。它过早放弃的时候,你得知道这个方向值不值得再多试一会儿;它把一个高潜力方向关掉的时候,你得能识别出来再把它领回去;它跨 session 漂移的时候,你得主动维护那个全局方向,不让每个新会话从零判断。
这些能力听上去都不像编程能力,更像 PM 或者 TL 的能力。但在 2026 年,它们正在变成每个普通使用者的基本功。
人人都要当领导的时代真的到了。
---
## 参考资料
- [Introducing Claude Opus 4.7 — Anthropic](https://www.anthropic.com/news/claude-opus-4-7)
- [What's new in Claude Opus 4.7(关于 effort 行为收紧)— Anthropic Docs](https://platform.claude.com/docs/en/about-claude/models/whats-new-claude-4-7)
- [Introducing GPT-5.5 — OpenAI](https://openai.com/index/introducing-gpt-5-5/)
- [GPT-5.5 Instant 成为 ChatGPT 默认模型 — TechCrunch](https://techcrunch.com/2026/05/05/openai-releases-gpt-5-5-instant-a-new-default-model-for-chatgpt/)
- [Codex Goal Mode:持续性目标与 token 预算 — Codex Blog](https://codex.danielvaughan.com/2026/04/16/codex-cli-goal-mode-persistent-objectives-token-budgets/)
- [Frontier Model Release Velocity Index 2026 Q2 — Digital Applied](https://www.digitalapplied.com/blog/frontier-model-release-velocity-index-q2-2026)
- [Context Rot in AI Coding Agents — MindStudio](https://www.mindstudio.ai/blog/context-rot-ai-coding-agents-how-to-prevent)
- [Why AI Agents Lose Context — Hindsight](https://hindsight.vectorize.io/guides/2026/04/21/guide-why-ai-agents-lose-context-and-how-hindsight-fixes-it)
- [AI Model Release Tracker | Epoch AI](https://epoch.ai/data/ai-models)
---
### Codex 5.5:版本号是骗人的
- URL: https://guanjiawei.ai/zh/blog/codex-5-5-paradigm-shift
- English: https://guanjiawei.ai/en/blog/codex-5-5-paradigm-shift
- Published: 2026-05-01
- Tags: AI, AI Agent, GPT-5.5, Codex, Claude Code, 思考
OpenAI 4 月 23 号悄悄上线了 GPT-5.5,代号 SPUD(土豆)。版本号给得很克制,5.4 到 5.5,0.1 个版本。我用了两周下来,体感这个跨度根本不止这个数。它是 GPT-4.5 之后第一次完整重训的基座,不是 5.4 上做的微调。
我自己变化最直接。原本是 Claude Code 的重度用户,现在基本不打开了。那个标签页留着,只在很少几个场景里会用到。其他时间都在 Codex 5.5 里。
换过去的原因不是它比旧的好 5%、好 10%。Claude Code 之前那几个让人头疼的短板,5.5 这一波一次性都补完了。
## 一、那些让人想点拒绝的瞬间,没了
用过 Claude Code 的人都体感过这个东西:刚开始用,它什么都问你权限。文件能不能读?命令能不能跑?要不要让我连网?每一步都要点确认。
然后大家发现:基本上每次都是点"允许"。索性把开关拨到 `dangerously bypass permissions`,全默认通过。
这从侧面反映了它已经足够成熟。你已经很久没真的想点过拒绝了。它不会乱来,至少不容易把事情搞砸。但它也经常很难一次性把事情做对。Claude 的特点是快,几分钟就能给你东西看,可你拿过来验收,明显的问题就摆在那,它就是没找出来。
这种"快但不准"的体验,是 Claude Code 这一代最大的短板。
5.5 这次让我惊讶的,是它把几个老短板一次性都补了。
**过程开始说人话了。** 之前 Codex 中间过程是糊一团的中间件,盯着也搞不清在干什么。5.5 之后它会告诉你每一步在做什么、为什么要这么做。这事听起来不复杂,但对长任务的体验差别非常大。
**不墨迹了。** 之前感觉是一个任务左试一下右试一下,绕一大圈才找到那个点。现在它的判断变得清晰,知道什么时候该加速。发现某个任务正在等待,它会先去并行做点别的,把下一步要用的东西提前准备好。这种行为我之前真没见过,第一次看到挺意外的。端到端执行效率因此上了一个台阶。
**下一步建议突然有价值了。** Codex 一直有个习惯:每次任务结束都给一个 next step。GPT-5.4 时代这个建议经常是凑数的。5.5 之后我发现它的提议变得相当靠谱,连续在一个项目里干了 8 个小时,我基本上每次都点"继续"。这意味着它在把握"高价值方向"这件事上的能力起来了。
**compact 这个老毛病终于解了。** 我之前 5.4 用得不深,对 compact 没那么敏感。但深度切过来之后,长会话不可避免要压缩上下文。Codex 这边的压缩比 Claude Code 稳很多。大多数信息压完都还在,Claude Code 那边一压基本上半张脸都没了。
这件事被研究比较过。Codex 是把整段对话交给模型重写成结构化的"交接摘要",里面带着元数据和工具状态;Claude Code 用的是分层人类可读摘要,肉眼能看懂但天然有损。两种思路各有道理,实际长会话里我体感是 Codex 这边信息掉得更少。
5.4 时代 compact 经常因为网络问题中断的体验也彻底好了。session 可以一整天连续跑,几乎不用管。
## 二、形态已经变了
5.4 那会儿研究能力其实就已经相当强。5.5 短板补完之后,它整个的形态都变了。
我现在能让它以非常高的自动化程度完成复杂任务。前提是任务能端到端验证。比如做算子层的性能调优。这种场景颗粒度小、迭代快、有 AB 可比,5.5 跑起来非常专业。它会主动设计查询、跑完改良、再去验证下一步是不是真的好了。整条链路自己往前推。人不在的情况下,它能连续跑几十轮。
这种密集循环里它现在很难被绊倒。OpenAI 公布的几个数字也支持这个体感:Terminal-Bench 2.0 上 82.7%,FrontierMath 第 1-3 档 51.7%,ARC-1 推理任务 95%。研究者那边的反馈更直接:开始有人让它晚上自己跑实验变体,早上来看完成的扫频仪表盘。
它当然不完美。我注意到两个明显的天花板。
第一个是大系统的格局问题。让它从一个总的架构层面看全局,视野是受限的,给的方案经常停留在局部。
第二个是创新和创造力。如果你完全甩手,它给你的方案大概率是中规中矩的。你得自己先把思路甩过去,让它在你的思路上展开和评估。
但即便有这些短板,整件事已经让我觉得不太一样了。原本你以为不盯着它就会跑偏,现在你会发现它连续跑几小时回头看,绝大部分都是在做合理的事。在写代码这条主线上,它会自发地优先去验证、谨慎一步步推进,而不是急冲冲往前撞。
这一面让我突然想清楚了一件事。agent 的设计哲学,其实已经定型了。
## 三、"假设下一步会失败",是一种哲学
从 Claude Code 到 Codex,这一类编程 agent 的设计都建立在同一个假设之上:下一步可能失败。
整个工程都围着这个假设构建。我怎么样在下一步可能失败的情况下把这一步做好?真失败了,我有没有路径回滚或者绕过?工具调用没成功?换一个思路。写出来的东西不符预期?回去重新验证。
听上去简单,但这是 Claude Code 整个工程里 98% 的代码量在做的事。权限闸门、上下文管理、工具路由、错误恢复逻辑,大都是确定性的工程基础设施。模型本身只是这个 harness 上的一个组件。
5.5 让我看到的是这种哲学开始结出果实。在它的执行过程中,"先验证再推进"已经是自发选择。它要保证每一步都立得住,而不是一次跑多快。
这就是所谓的"慢就是快"。
我们之前对 agent 的期待一直是"诶你给我一冲到底,半小时给我个结果"。结果你回头看,错落百出,找补的时间是原来的 3 倍 5 倍。短期看着爽,长期跑下来反而最慢。
每一小步都走得稳之后,要做的事就是想办法让它走得快。fast mode、并行子任务、24 小时不间断运转,这些放大器能成立的前提是底下每一步都不出错。
## 四、为什么我说这是爆炸前夜
把上面的事实串起来:
- 它已经能超过相当一部分领域专家。
- 它能不知疲倦地连续工作几个小时。
- 它能做相当复杂的科研类工作,只要任务能端到端验证。
- 它的成本没有显著上涨。同样的 Codex 任务,5.5 比 5.4 还更省 token。
这意味着什么?意味着技术爆炸最先会发生在那种"颗粒小、能验证、能迭代"的领域。算子优化、性能调优、特定子领域的科研、自动化工作流。这些地方多一个不知疲倦、推理水平接近顶尖专家、能自己设计实验的同事,进展速度会很可怕。
那条线之外的事,大系统的格局判断、原创思路、跨领域综合,人的角色还很重要。但每次小版本迭代,模型都在朝这个方向多挪一点。
三个月前我跟一个朋友吃饭,他抛过一个问题:既然现在 coding agent 这么强,那有没有真的看到没有工程背景的人靠它 ship 出东西?
那时候我说"慢慢会有"。现在已经在发生。一个零编程经验的瑜伽馆店主用 Lovable 两小时搭出了自己的预约系统,登录、日程、支付都齐全,那一周就上线。这种例子开始变多。NVIDIA 内部一万多名员工在通过 Codex 处理日常,覆盖工程、法务、财务、运营。Codex 已经不只是工程师的工具。
我相信下一步还会更进一步。这些非工程背景的人,会开始 ship 出像样的研究成果。它们一开始会出现在那些颗粒小、能验证、能迭代的细分领域。
5.4 让我看到的是能力的提升。5.5 让我看到了路径。agent 在这个设计哲学下持续演进,会真的改变知识生产的形态。
如果当前的发展速度不被打断,知识层面的大爆炸会比很多人预想的更快到来。
之前工信部的一位领导跟我聊,问哪些方向值得多关注。我当时说要多看一眼 GPT-5 这条线,它的能力轨迹跟 Claude Code、跟之前小龙虾那一类不太一样,能解决的问题类型也不一样。5.5 出来之后我又确认了一遍这个判断。两条不同的演化路径,得分开看。
下一步一定会有一大批有趣的产品和成果 ship 到市面上,三个月后见分晓。
---
## 参考资料
- [Introducing GPT-5.5 — OpenAI](https://openai.com/index/introducing-gpt-5-5/)
- [GPT-5.5 — Wikipedia](https://en.wikipedia.org/wiki/GPT-5.5)
- [OpenAI releases "Spud" GPT-5.5 model — Axios](https://www.axios.com/2026/04/23/openai-releases-spud-gpt-model)
- [GPT-5.5: Capabilities and Reactions — Zvi Mowshowitz](https://thezvi.substack.com/p/gpt-55-capabilities-and-reactions)
- [Context Compaction Deep Dive: Codex CLI vs Claude Code vs OpenCode](https://codex.danielvaughan.com/2026/04/14/context-compaction-deep-dive-codex-cli-claude-code-opencode/)
- [Dive into Claude Code: The Design Space of Today's and Future AI Agent Systems (arXiv)](https://arxiv.org/html/2604.14228v1)
- [OpenAI's GPT-5.5 Powers Codex on NVIDIA Infrastructure — NVIDIA Blog](https://blogs.nvidia.com/blog/openai-codex-gpt-5-5-ai-agents/)
- [The Complete Vibe Coding Guide: How Non-Engineers Can Build Apps with AI (2026)](https://www.shareuhack.com/en/posts/vibe-coding-guide-2026)
---
### AI 这个词,已经换了三次魂
- URL: https://guanjiawei.ai/zh/blog/what-we-mean-by-ai
- English: https://guanjiawei.ai/en/blog/what-we-mean-by-ai
- Published: 2026-04-30
- Tags: AI, AI Agent, 认知, 思考
最近跟朋友聊 AI,越聊越觉得不对劲。每个人都说自己懂,每个人都聊得起来,但聊到一半我经常发现,我们说的根本不是一个东西。
这让我想起一个经济学家的吐槽。他说经济学跟物理学不一样。你在饭桌上说自己是物理学家,对方一般会回"我不懂物理,最近有啥新进展?"然后认真听你讲。但你说自己研究经济学,对方会说"我不太懂经济学",然后开始讲他对经济学的看法,一讲半个钟头。一桌人都在聊经济学,唯独经济学家自己没怎么开口。
AI 现在就是新的经济学。
## 一个词,换了三次魂
"Artificial Intelligence" 这个词是 1956 年达特茅斯会议上 John McCarthy 提出的。到现在快七十年,词没换过,但它背后到底指什么,已经悄悄换了好几次。
### 第一代:远方的智能传说
我读书那会儿,业内说 AI 主要指机器学习。天文学里找规律,金融里挖数据,给广告做点击预测。这些事离普通人很远,没人会在饭桌上聊。
大众对 AI 的最初印象来自两个事件。
1997 年 5 月 11 日,IBM 深蓝在第六局赢了卡斯帕罗夫,国际象棋世界冠军第一次输给电脑。那时候大家还是当一台超级算力机器看,跟所谓"通用智能"挂不上边。
真正的拐点是 2016 年 3 月,AlphaGo 在首尔 4-1 赢了李世石。围棋在中文世界的地位很特殊,它代表的是策略、全局、兵法。一个能下赢人类顶尖棋手的程序,一下让人产生联想:它围棋这么强,是不是别的领域也很强?是不是已经有了"通用智能"?
差不多同一时期,计算机视觉也突破了。2014 年 3 月,香港中文大学汤晓鸥团队的 DeepID 在 LFW 人脸识别基准上拿到 98.52% 的准确率,第一次超过人眼平均水平 97.53%。2015 年微软的 ResNet 在 ImageNet 上把分类错误率降到 4.94%,又一次超过人类。
人脸这件事很不一样。一只猫稍微动一下,你分不清是 A 猫还是 B 猫;但一个人五官稍微变一下,你立刻看得出来"这不是同一个人"。人对人脸的敏感度是天赋级的。计算机能在这件事上超过人,意义就大了。
围棋的策略加上视觉的感知,两件事撞在一起,民众情绪一下被点燃。
戏剧性的是,在 AlphaGo 之前,国内做视觉的公司其实日子并不好过。商汤 2014 年拿到 IDG 天使轮之后有过一段资金紧张的时间,外面的钱不太愿意进——一个看起来跟围棋没什么直接关系的事件,是 AlphaGo 把整个 AI 赛道一起带火之后,下一轮才顺利接上。从 2016 到 2018 年,AI 四小龙商汤、旷视、云从、依图融资拿到手软。
但热潮持续几年就降温了。
为什么?因为期待中的"泛化"没出现。AlphaGo 只能下围棋,让它干别的就废了。视觉公司想识别人脸就训一个人脸模型,想识别车就再训一个车模型,每多一个场景成本几乎线性增加。"重大投入产生通用智能"那个故事,在那一代技术里就不成立。
到 2020 年前后,情绪回到了商业化的锅碗瓢盆里。
### 第二代:ChatGPT 让 AI 长出了嘴
第二次大转变是 2022 年 11 月 30 日,OpenAI 发布 ChatGPT 3.5。
这次最大的不同在"语言"。AI 第一次能跟人聊得像那么回事。坐在屏幕另一头的,你有时候真分不清是人还是机器。
老一辈搞 AI 的人会马上想起图灵测试:人和 AI 双盲对话,让第三方猜哪个是机器。这是 1950 年图灵提出的判定通用智能的标准。原本以为要被通过得很久。
结果 2024 年加州大学圣迭戈分校 Cameron Jones 的研究里,GPT-4 在五分钟对话测试中被判为"是真人"的概率达到 54%,已经接近真人水平的 67%。2025 年的后续研究里,GPT-4.5 直接被认为通过了"原始图灵测试"。曾经被供奉的标准,现在已经没人提了,因为早就被默默跨过去。
ChatGPT 真正的不一样,是它把 AI 变成了"每个人都能亲手用"的东西。机器学习、AlphaGo 那一代,普通人是当新闻看的,评头论足是别人的事。ChatGPT 之后不一样了,到 2026 年 2 月已经有 9 亿人每周打开它聊一次。这个普及度跟以前完全是两件事。
所以过去两三年里,绝大多数人讲 AI 时——不管说的是 ChatGPT、DeepSeek、豆包还是 Kimi——指的都是这个东西:聊天机器人。
### 第三代:从嘴到手脚
但从去年年底到今年初,AI 的内涵又变了一次。
我最近聊天经常碰到一个情景。对方说"我懂啊我经常用,豆包 Kimi DeepSeek 我都用过"。这话过去几年都成立。现在不成立了。因为我说的 AI 已经不是那个东西。
新范式叫"智能体"(Agent)。
如果上一代 AI 是有嘴有脑、坐你对面陪聊的顾问,那这一代是有手有脚、能拿工具替你干活的同事。至少在数字世界里是这样。
引爆这次转变的标志事件是 2024 年 10 月 Anthropic 发布的 Claude Computer Use。AI 第一次能自己看屏幕、移动鼠标、点按钮、敲键盘。从那以后一年多时间里,编程智能体成了主战场。Claude Code 2024 年宣布、2025 年成熟,OpenAI 2025 年 4 月发布 Codex CLI、5 月接着发 Codex Cloud,国内 Kimi Code 等也都跟了上来。
最有意思的是泛化。原本编程智能体冲着"写代码"去的,结果做着做着发现,它能干的活远不止代码:查资料、批量处理文件、操作浏览器、调试软件、自动跑实验。电脑上 80% 到 90% 的任务它都能干,而且干得不算差。这一代终于兑现了上一代承诺过却没做到的"泛化"。
为什么很多人没注意到这次的 AI 跟上次的 AI 是两个东西?因为词没换,还是 AI 这两个字。但脑子里那个"AI"是聊天框,还是会自己干活的智能体,是天差地别的两件事。
## 我们到底在聊什么
回到最开始那个问题:今天讲 AI 的时候到底在讲什么?
我试着分了一下。
第一种,脑子里"AI = 豆包 / Kimi / DeepSeek 这种聊天框"。那是 2022 到 2024 那一代的认知。我们说的不是同一件事。
第二种,用过 OpenClaw、Hermes、KimiClaw 这种通过 IM 操控的智能体应用。我们说的至少在同一平面上,能聊到一起。
第三种,日常在用 Claude Code、Codex、Kimi Code 任意一个编程智能体。我们说的就是同一件事,可以非常精确地讨论它带来的变化。
反复强调这个,是因为这件事跟图灵测试很像。已经悄悄跨过去了,但很多人还停留在上一代的认知里,在讨论一个其实不存在的东西。
## 真正的壁垒不是技术
每次 AI 内涵切换,普通人体验它的方式也跟着变。
机器学习那一代,普通人完全没机会上手。门槛太高,要准备数据、配环境、调参数,对非专业的人完全不友好。对 AI 的印象只能从新闻里来。
ChatGPT 那一代,普及度天花板被打穿了。打开网页就能用,免费的,能"用"AI 了。那时候大家开始评头论足说"哪家更好哪家不行",能评论是因为能用。
智能体这一代其实也一样。门槛很低,几十块钱一个月就能起步。我之前帮过几个在校大学生用 Claude Code,他们没什么基础,照样跑通了自己的项目。
那真正的壁垒在哪?我觉得就一个字:懒。
不是技术上的懒,是认知上的懒。已经听过别人说,已经刷过两条短视频,已经在朋友圈读过几篇刷屏文,就觉得自己懂了。但你没真的动手,没让它替你干一件具体的活,没体会过那种"哦,原来是这样"的瞬间。
每次技术变革其实都是这样。蒸汽机出来时是这样,互联网普及时是这样,移动互联网普及时也是这样。慢的从来不是技术,慢的是听过两耳朵就觉得自己懂了的人。
而每一次切换之后,旧认知就变成一种隐形成本。你以为自己在用 AI,其实是在用 AI 的上一代。
如果你聊到这里还没真正用过一次智能体,建议很简单:今天就找一个最便宜的方案上手用。不用看视频、不用读教程,让它替你做一件你本来要自己做的事,看会发生什么。
---
## 参考资料
- [Dartmouth workshop — Wikipedia](https://en.wikipedia.org/wiki/Dartmouth_workshop)
- [Deep Blue versus Garry Kasparov — Wikipedia](https://en.wikipedia.org/wiki/Deep_Blue_versus_Garry_Kasparov)
- [AlphaGo versus Lee Sedol — Wikipedia](https://en.wikipedia.org/wiki/AlphaGo_versus_Lee_Sedol)
- [DeepID 与香港中文大学汤晓鸥团队人脸识别突破](https://zhuanlan.zhihu.com/p/69530060)
- [Microsoft researchers win ImageNet computer vision challenge](https://blogs.microsoft.com/ai/microsoft-researchers-win-imagenet-computer-vision-challenge/)
- [ChatGPT — Wikipedia](https://en.wikipedia.org/wiki/ChatGPT)
- [Sam Altman says ChatGPT has hit 800M weekly active users (TechCrunch)](https://techcrunch.com/2025/10/06/sam-altman-says-chatgpt-has-hit-800m-weekly-active-users/)
- [People cannot distinguish GPT-4 from a human in a Turing test (Cameron Jones, 2024)](https://arxiv.org/abs/2405.08007)
- [Large Language Models Pass the Turing Test (Jones & Bergen, 2025)](https://arxiv.org/abs/2503.23674)
- [Introducing computer use, a new Claude 3.5 Sonnet (Anthropic, 2024)](https://www.anthropic.com/news/3-5-models-and-computer-use)
- [Introducing Codex (OpenAI, 2025)](https://openai.com/index/introducing-codex/)
---
### AI 时代的赛博地主:你的工作流不是你的
- URL: https://guanjiawei.ai/zh/blog/ai-cyber-landlord
- English: https://guanjiawei.ai/en/blog/ai-cyber-landlord
- Published: 2026-04-29
- Tags: AI, 权力, 组织, 思考
4 月初,一家叫 Belo 的公司一夜之间被 Anthropic 封了号。60 多个员工的账号同时失效,整个团队搭在 Claude 上的工作流瞬间瘫痪。
申诉?没有客服,没有邮件,只有一张 Google 表格。CEO 填完之后三天没人回。直到他把这事发到 X 上、舆论起来,Anthropic 大约 15 小时后悄悄给解封——一句"误判"算交代。
几天后,第二起。一家 110 人的农业科技公司,周一一早所有员工同时收到封号邮件。同样的"违反政策",同样的 Google 表格,同样到现在没人回复。最魔幻的是:账号封了,API 还在扣钱,续费通知照样发。人不让用了,钱继续收。
Belo 那位 CEO 后来只说了一句话:"Never put your eggs in one basket."
俗话,但扎心。
## 这不是孤例
Anthropic 自己的透明度报告里写得很清楚:2025 下半年封了 145 万个账号,同期收到 5.2 万次申诉,恢复了 1700 个。3.3% 的成功率。
这家公司的体量你也得算一下。2026 年 3 月 ARR 突破 300 亿美元,半年前还只有 90 亿。最新一轮估值 3800 亿,全公司大约 5000 人。它的客户包括财富 10 强里的 8 家,80% 营收来自企业。
一边是几百万家把核心工作流绑死在它平台上的客户,一边是 5000 人的运营团队加一套自动检测系统。决定你账号生死的那张 Google 表格,背后大概率没几个人真的在看。
这就是赛博地主。
封建时代地主和佃农的关系本质是什么?地主拥有不可移动的生产资料(土地),佃农只有自己的劳动力。佃农交不交得起租,地主决定。
AI 时代的模型公司复刻了这个结构。它们拥有难以替代的核心能力——一线推理模型就那几家,要构建复杂工作流绕不过去。客户拥有的是搭在上面的整套流程、积累的对话上下文、定制的 skills、跑通的 integration。模型公司一句"违反政策",这些东西全部清零。
不对等的不只是产出,还有利益的轻重。一家 110 人的公司一年能给 Anthropic 贡献多少?算 10 万美元。对 Anthropic 那是 ARR 的小数点后几位,"不要也罢"。对那 110 个人,是大半年搭起来的资产、是养家糊口的工作。这边动一根手指,那边整个组织停摆。
## 国家层面是同一个问题
往大了看,国家面临的是同一个问题。
如果一国所有的关键模型、算力、AI 基础服务都依赖外来供应,那本质上就是把生产基础押在了别人的开关上。哪一天那个开关被切,怎么办?2022 年俄乌之后大家对"断供"这个词应该还有印象。AI 算力会成为下一个被断供的关键品类。
最近"自主算力"和"开源模型"被反复讨论,很多人把它说成意识形态偏好。其实不是,是基本的风险常识。
## OpenAI 那边并没好到哪去
很多人下意识把锅扣在 Anthropic 头上,说它"不够 user-friendly",然后拿 OpenAI 当反例。
OpenAI 当前阶段是温和一些,但主要原因是被 Claude Code 抢市场份额逼的。回头看 GPT-5 发布那段时间,事情真的不好看。
2025 年 8 月 7 日 GPT-5 上线,OpenAI 一刀切,把 GPT-4o、GPT-4.1、o3、o4-mini 全部下架。问题是大量用户已经把 GPT-4o 当工作搭档、心理咨询师、创作伙伴在用——它的"sycophancy"(讨好程度)从 14.5% 砍到 6% 不到,本来"会聊天、有温度"的那个对象一夜消失。Reddit 上一个题为 "GPT-5 is horrible" 的帖子,几天里涌进 2000 多条评论。
Sam Altman 没扛住,几天后把旧模型给 Plus 和 Pro 用户放回来。但很多人对他的称呼从此变了——"暴君"、"独裁者"。这不只是网络情绪。2026 年 4 月,一个叫 Daniel Moreno-Gama 的 20 岁得州小伙凌晨 3 点 37 分向 Altman 在旧金山的家扔了一个燃烧瓶,点着了车道大门。他随后跑去 OpenAI 总部门口,准备拿椅子砸玻璃。被警察控制后,身上搜出一份名单,写满 AI 公司高管和投资人的姓名地址。罪名包括谋杀未遂、纵火、非法持枪。
把账号封禁、把模型下架、把工作流"砍"掉——平时看像产品决策,本质都是权力的运用。被对面的人感受到的是一种"无可奈何"——你跟一个市值数千亿、5000 人团队的公司讲道理,没有渠道、没有代价能让对方注意你。Moreno-Gama 走到了极端,但这种愤怒并不是孤立的。
## 工人不爱 AI,比管理层愿意承认的多
ManpowerGroup 2026 年初的一组数据挺反直觉:员工 AI 使用率年增 13%,但对 AI 的信任反而下降 18%。越用越不信。
Writer 的调研更狠。29% 的员工承认自己在以各种方式"破坏"公司的 AI 战略——把机密塞公开 LLM、用未授权的工具、直接拒绝使用——其中 Z 世代的比例 44%。
为什么?两条线。
一是替代焦虑。43% 的人担心自己两年内会被自动化替代。在这种焦虑下,所谓"接纳 AI",字面意思就是"配合公司把自己替换掉"。换你你也磨洋工。
二是管理层的强推变形。问题在于很多管理层对 AI 的理解层次和员工差不多,但又被董事会逼着"All-in AI",于是动作变形。Meta 内部那个搞笑的"烧 token 排行榜",就是这种动作变形最荒诞的一个版本。
## Meta 的两个现场
第一个:Claudeonomics 排行榜。
Meta 内部搞了个 dashboard,给 8.5 万名员工排"token 消耗量",前 250 名是 super user。过去 30 天烧掉超过 60 万亿 token,估算花了 90 亿美金,最高个人用量 2810 亿。系统给消耗多的员工挂上 "Token Legend"、"Session Immortal"、"Cache Wizard" 这种游戏化称号,还有从青铜到玉的奖章。Andrew Bosworth 公开夸过一位"用相当于自己年薪的 token 量、做出 10x 生产力"的员工。
后面发生的事完全可以预测。员工开始写无意义的循环 agent,挂在那里 24 小时空烧 token。提示词的格式甚至变成了"请尽可能多消耗 token,请反复啰嗦地解释,请生成长篇毫无意义的内容"。SEV(生产事故)数量据说也开始变多——AI 随手生成的代码炸进生产环境。两天后,因为内部 dashboard 数据被泄露到公司外面,这个排行榜被悄悄撤了。
这件事的喜剧外壳底下是一个很严肃的问题:**把一种成本(token 消耗)当作产出(生产力)来奖励。**能源、算力、人时三个维度同步浪费,是一种 ROI 极大负数的"努力"。
第二个:MCI(Model Capability Initiative)。
Meta 开始在员工电脑上装跟踪软件,记录键盘输入、鼠标轨迹、点击行为甚至屏幕截图,覆盖范围从内部工具一直到 Google、LinkedIn、Wikipedia、GitHub、Slack。官方说法是用这些数据训练 AI,让模型学会"基础的电脑使用行为"。
多名员工在内部聊天里把这个项目形容成"dystopian"。除了对隐私的担心(这套系统会顺手抓到密码、医疗信息、移民身份),更深一层的问题是:
**一个人 10 年沉淀下来的判断力,到底属于谁?**
## know-how 的所有权
这个问题平时没人正面回答,AI 推开门后无处可藏。
按一般雇佣关系的逻辑,公司付的工资买的是劳动成果——代码、文档、决策。买不下来的是积累出来的判断力本身。一个老电气工程师 15 年下来对设备故障的直觉、一个产品经理对用户的 sense、一个律师写到第 1000 份合同时的措辞习惯——这些东西放在那个人脑子里,法律和合同都没办法清晰转移。
AI 把这一刀切下来:管理层会觉得,既然我可以低成本地用模型复现这个 know-how,为什么不直接"提取"出来变成公司资产?
提取本身没错,错的是路径。如果公司要拿走这一块,对应的对价是什么?正常市场交易里,没有人会用一份基本工资把过去 10 年沉淀的判断力买断。但管理层默认这是"附赠"的、"理所应当"的。
员工抗拒的不是 AI 本身,是这种隐性的资产征用。
## 两种未来组织形态
我能想到这个矛盾的两种解法。
第一种是资本路线:公司用足够高的价格预先买断 know-how。Palantir 的 FDE(Forward Deployed Engineer)某种程度做的就是这件事——派一个能蒸馏流程的工程师去客户一线,跟在专家旁边把他做事的方法逐步固化进 AI agent。这条路在国防、军工、对国家有归属感的领域走得通——客户愿意把"自己的东西"贡献出去给国家用。搬到普通商业领域就别扭了。我隔壁站了一个人在记录我怎么干活,被蒸馏出去的那套东西后面会替代我——这件事正确吗?至少不舒服。
第二种我更看好:人 + agent 成为新的生产单元。
设想一下未来的工作方式。每个专业人士(律师、工程师、咨询、设计、医生……)有自己的工具箱:自己的账号、自己的设备、自己的 AI agent、自己的私域积累。我带着这套东西走进公司,签一份协议——你给我 input、给我接系统接口、我答应不滥用,我把 output 交还给你。中间过程是黑盒,公司不窥探,只看结果。
这个模型像今天的律师、咨询师、外科医生:你雇的是这个人,他用的工具、积累的模板、过往的判断力,都是他个人的资产,不属于事务所或医院。
几个明显的好处:
- 激励顺了。我提升生产力的成果归我,使用 AI 的成本由我承担,我有动机投资自己。
- 定价由竞争决定。每个人是一个独立的"黑盒生产单元",谁的投入产出比高,谁拿溢价。Meta 那种烧 token 比赛在这种模型里成立不了——成本是个人的,没人会自己烧自己钱。
- 知识产权清楚。公司没动机征用 know-how,员工也没顾虑配合 AI。
这听起来比现在普通员工的处境要"贵"一些。但这对应的本来就是劳动者把自己升级成微型企业的过程。AI 让这个升级第一次有了可行性,问题是组织和制度还没跟上。
## 回到最开始
Belo 一夜清零、Altman 家被烧、Meta 烧 token 排行榜、MCI 监控、29% 员工悄悄抵制 AI——表面上是不同领域不同公司的事,背后是同一根线。
**AI 时代的权力分配还没有就位。**
公司之间,模型公司在变成新的赛博地主;
公司和国家之间,算力依赖正在变成新的命脉问题;
公司和个人之间,know-how 的所有权正在被重新争夺。
这件事不会自己解决。需要每一方都把"什么属于我,什么属于你"重新讲清楚。模型公司要更稳定的服务承诺、更人性化的申诉机制;国家要本土的关键算力底座;个人要把自己升级成一个独立的、可携带 AI 资产的生产单元。
否则我们只是换了个看起来更现代的封建结构,继续打工。
---
## 参考资料
- [Anthropic 一夜封禁 60 人公司 Belo 全员账号 — Tom's Hardware](https://www.tomshardware.com/tech-industry/artificial-intelligence/anthropic-nuked-a-companys-access-to-claude-stopping-60-employees-dead-in-their-tracks-support-via-google-form-is-the-only-recourse-for-vague-usage-policy-violation)
- [Min Choi 关于 Belo 事件的 X 帖子](https://x.com/minchoi/status/2045542832241262602)
- [Om Patel 关于 110 人农业科技公司被封事件的 X 帖子](https://x.com/om_patel5/status/2048594208345227497)
- [Hacker News:Anthropic bans orgs without warning](https://news.ycombinator.com/item?id=47853021)
- [Anthropic ARR 突破 300 亿美元 — ARR Club](https://www.arr.club/anthropic/anthropic-arr-run-rate-revenue-surpasses-30b-up-from-9b-at-end-of-2025)
- [Anthropic 大约 5000 名员工 — SaaStr](https://www.saastr.com/anthropic-only-has-5000-employees-almost-no-one-has-ever-been-this-efficient-thats-by-choice/)
- [GPT-5 发布的反弹和 GPT-4o 的回归 — Platformer](https://www.platformer.news/gpt-5-backlash-openai-lessons/)
- [Sam Altman 旧金山住所遭燃烧瓶袭击 — CNBC](https://www.cnbc.com/2026/04/13/sam-altman-openai-ai-arson.html)
- [Daniel Moreno-Gama 被控谋杀未遂和纵火 — CNN](https://www.cnn.com/2026/04/13/tech/sam-altman-openai-arrest-charges)
- [Meta Claudeonomics 内部 token 排行榜 — The Decoder](https://the-decoder.com/meta-employees-compete-for-token-consumption-on-an-internal-ai-leaderboard/)
- [Meta 取消内部 AI token 排行榜 — Fortune](https://fortune.com/2026/04/09/meta-killed-employee-ai-token-dashboard/)
- [Meta MCI:监控员工键盘鼠标行为用于 AI 训练 — Fortune](https://fortune.com/2026/04/21/meta-will-start-tracking-employees-screens-and-keystrokes-to-train-ai/)
- [Meta MCI 项目细节 — CNBC](https://www.cnbc.com/2026/04/22/meta-tracks-employee-usage-on-google-linkedin-ai-training-project.html)
- [29% 员工自承破坏公司 AI 战略 — Writer Survey](https://writer.com/blog/enterprise-ai-adoption-survey-results-press-release/)
- [AI 使用率上升 13%、员工信任下降 18% — Fortune / ManpowerGroup](https://fortune.com/2026/01/21/ai-workers-toxic-relationship-trust-confidence-collapses-training-manpower-group/)
- [AI 在工作中的应用前景:美国员工担忧多于希望 — Pew Research Center](https://www.pewresearch.org/social-trends/2025/02/25/u-s-workers-are-more-worried-than-hopeful-about-future-ai-use-in-the-workplace/)
---
### 拼图的最后一块:vibe一个推理引擎
- URL: https://guanjiawei.ai/zh/blog/inference-engine-last-puzzle-piece
- English: https://guanjiawei.ai/en/blog/inference-engine-last-puzzle-piece
- Published: 2026-04-28
- Tags: AI, 推理引擎, 边缘计算, AIMA
昨天看到一条新闻,盯了挺久。
23 岁的 Liam Price,没什么高深数学背景。一个普通星期一的下午,他把一道编号 Erdős #1196 的题随手丢进了 ChatGPT,几轮挑挑拣拣之后,居然把一道困扰数学界 60 年的难题给捅破了。Terence Tao 看完之后说了句很有意思的话:以前看过这道题的那些人,"从第一步就走偏了"。
那条新闻让我那晚没怎么睡好。倒不是羡慕,是我开始重新审视手里这几个项目。
## 一张拼图,差最后一块
做边端 AI 这条线,我心里一直有一张拼图。
要解的核心矛盾很经典。一头是 SOTA:希望小型化设备上跑 AI 模型也能拿到当前业内最强的性能,而且要跨各种操作系统、各种硬件。另一头是 TCO:这台设备的总拥有成本要尽量压到接近硬件加电费。
单看任何一头都不算难,凑一起就拧巴。要 SOTA 就得请专家针对这台机器的硬件、推理引擎、模型去专门调;调参的人月薪两万不算贵,但放到一台两万块的边端设备上,这账就算不平了。这件事的来龙去脉我之前在[《边缘AI推理:算力金矿,还是管理黑洞?》](/blog/edge-ai-inference-tco-trap)里写过。
为了堵这个矛盾,我做了两块拼图。
第一块叫 [AIMA](/blog/why-we-built-aima)。一个知识驱动的管理平台,把调优的知识塞进去,让 Agent 在每台设备上自己跑 benchmark、自己调参,慢慢逼近这台机器的最佳性能。说白了就是把"那个两万月薪的人"的活让 AI 接走。
第二块叫 [AIMA Service](/blog/why-i-built-aima-service)。设备出问题之后的售后维护,过去得让工程师远程连进去人肉操作。AIMA Service 让 Agent 直接接管这块,诊断、调优、修故障一条龙,把超出现场管理者认知边界的事情吃掉。
两块拼图齐了之后,我以为差不多到位了。直到最近真上手用,才发现一件尴尬的事:我做完一整套管理层,**不知道去管什么推理引擎**。
## 现在能选的引擎,每个都让我皱眉
### Ollama:体验最好,性能最遗憾
Ollama 的体验是真的好。装上、点一下、模型自动下载、一键启动,跨 macOS / Windows / Linux 都很丝滑。第一次接触私有化部署的人几乎都从这里入坑。
但它有两个硬伤。
第一个是性能拿不到。Ollama 背后跑的其实是 llama.cpp,llama.cpp 的可调参数极其多极其复杂,这是它的优点(足够灵活),也是它的缺点(绝大多数人调不出最佳那一组)。Ollama 干脆替所有人选了一套保守的默认值,让普通人开箱就能跑,代价是几乎永远拿不到这台机器的极限性能。
第二个是默认只有一并发。`OLLAMA_NUM_PARALLEL` 出厂就是 1,每个请求老老实实排队。可以配上去,但配上去意味着上下文要按并发数线性放大、内存得重新算账,并不是开关那么简单。批处理任务、Agent 多步调用,遇到 Ollama 都会很疼。
### llama.cpp:参数能调,精度被自己的格式吃了
直接用 llama.cpp 而不是用 Ollama,性能能高 5–10%,并发更可控,跑得动各种各样的硬件。当前最跨平台的引擎之一。
但有一件事我之前没注意到,最近做出来才意识到:它必须把模型从 safetensors 先转成自家的 GGUF 格式才能跑。
这一步在过去的聊天场景里没什么问题。一到 Agent 这种走多步调用的场景,麻烦就来了。
哪怕完全不做量化,光是这一步格式转换,模型在智能体任务上就会出现一次比较明显的精度下滑。再往下走如果做了量化,事情更糟。我看过一些公开数据:Q4_K_M 在某些小模型上准确率会从 0.87 一路掉到接近一半,Q3_K_M 直接崩盘;Llama 3.2 3B 转成 q4_k_m 之后 MMLU 从 64.2 掉到 61.8。
这些数字单步看还能忍。但 Agent 一次任务要走几十步,每步丢一点点精度,复合衰减跑下来就是另一回事。有研究统计过,对话长度涨 50%、效率降 3–5%;超过 12 轮之后,Agent 开始大量做无意义的重复操作,把上下文塞满垃圾。
所有人都在往 Agent 编程、智能体场景走。这条路上的精度问题,只会更难处理,不会变轻。
### vLLM / SGLang:性能拉满,但是另一种重
vLLM 和 SGLang 是另一极。性能拉满,原生支持多模态。vLLM 现在已经稳稳支持视觉模型,加上 ASR / TTS、embedding、rerank 这一套接口;SGLang 那边支持 30+ 多模态模型、扩散模型,甚至 TTS。云端推理引擎的标准答案。
但放到边端,问题也很直接:包大小动辄十几 GB,部署很重,跨平台不友好。让一个普通用户在自己的 16GB 盒子上跑 vLLM,几乎不现实。
## 我想要的引擎是什么样的
把这三家的优点和痛摊到一张桌子上,要的引擎其实就是把它们的优点拼起来。
像 Ollama 一样开箱即用,跨操作系统,几百兆量级的包大小,点一下就跑。底层像 llama.cpp 一样灵活,CPU、GPU、NPU 不挑。性能像 vLLM 那样拉满,原生支持视觉、ASR、TTS、embedding、rerank,而不是后面打补丁补上去的。最后还有一条:不要 GGUF 中转,直接吃 safetensors,避开格式转换带来的精度悬崖。
这几件事单独都有人在做。把它们叠在一起做的,我目前没看到。
如果做出来了,整张拼图就闭环了。用户体验跟 Ollama 一样傻瓜,几百兆装上点一下就跑。性能上 AIMA 在背后让 Agent 自动调参,逼近 vLLM 那种 SOTA。本地直接跑视觉、语音、embedding、rerank,不用再去关联一堆云端账号。出问题 AIMA Service 自己接管。
这件事其实就是我之前在[《AI盒子该像路由器一样无聊》](/blog/edge-ai-device-blueprint)里讲那个"什么辅助模型都跑得动的盒子"的最后一块拼图。
## 三个月前我不敢想的事
讲到这里得说点别的。
3 个月前我对"做推理引擎"这件事的态度是:不敢想。太底层、太硬核,市面上做这事的开源项目要么死气沉沉、要么是大厂内部的活。
但今天我已经动手了,甚至不只是一个引擎,是几个不同版本的引擎。这个心态怎么变过来的?
3 个月前我第一次认真上 AI coding。给团队布了个一周的小任务:写个性能测试脚本,因为这事我惦记好久了一直没人帮我做。一周后大家陆陆续续都把工具做出来了。
做完之后开始有新想法:能不能做个 demo?展会上能展示的那种。做着做着又想,能不能做一个自动获客的小工具?做出来之后再想,能不能给自己做个个人官网?
每一件事做出来都让我惊讶。预期都很低,结果都跑通了。
到这里就开始往大处想:之前一直想做的模型管理平台(AIMA),是不是我自己也能做出来?花了一段时间,居然真做出来了,开始接真实业务跑。
下一步我又问:那能不能做个云服务?这跟做单机软件完全是另一个领域,我以前没碰过。结果还是能搭起来,真的能给人用。
再到最近开始去优化硬件层的性能,拿到了非常不错的结果。这一刻我突然意识到,AI 真能在原本属于研究项的、非常底层的事情里产生突破,尤其是那种端到端可以验证的场景。
回头看:之前积攒的软件能力、云能力,加上现在这块研究项的能力,组装一下就是一个推理引擎。从不敢想到已经在做,差的不是技能,是一次次"诶,原来这也能做"。
每一步都是"试一下没想到能行"。每一步又把"下一步还能做什么"的答案再撑大一圈。
## 写在最后
回头看那条 23 岁小伙的新闻。
最值得记的不是"AI 做出了数学家的发现"。原报道里写得很坦白,AI 直接产出"质量很差",是人挑出了里面有价值的那一点。值得记的是它的触发结构:一个不在数学圈、没受过专业训练的 23 岁年轻人,因为有了 ChatGPT,敢去碰一道困扰数学界 60 年的题。
不是 AI 替你做了,是 AI 让你敢做了。
我自己这 3 个月也一样。从一个性能测试脚本起步,一步一步把原本以为不可能的事变成现在动手在做的事。模型每个月都在变强,今天卡你的事情,往往两个月之后下一代模型一出来就只是个工程量问题。
倒不是说躺着等模型就好。是说今天觉得做不了的事,最好别太快下结论。能做的范围,每个月都在变大。
---
## 参考资料
- [Amateur armed with ChatGPT 'vibe-maths' a 60-year-old problem — Scientific American](https://www.scientificamerican.com/article/amateur-armed-with-chatgpt-vibe-maths-a-60-year-old-problem/)
- [23-Year-Old Amateur Solves 60-Year-Old Math Problem with ChatGPT — 36Kr](https://eu.36kr.com/en/p/3784815604817154)
- [Ollama FAQ(OLLAMA_NUM_PARALLEL 默认 1)](https://docs.ollama.com/faq)
- [Configure Ollama Concurrent Requests — Markaicode](https://markaicode.com/ollama-concurrent-requests-parallel-inference/)
- [How Ollama Handles Parallel Requests — glukhov.org](https://www.glukhov.org/llm-performance/ollama/how-ollama-handles-parallel-requests/)
- [vLLM Supported Models(多模态、embedding、rerank)](https://docs.vllm.ai/en/latest/models/supported_models/)
- [SGLang 项目主页](https://github.com/sgl-project/sglang)
- [SLMQuant: Benchmarking Small Language Model Quantization](https://arxiv.org/html/2511.13023)
- [LLM Quantization Guide: GGUF vs AWQ vs GPTQ vs bitsandbytes — premai.io](https://blog.premai.io/llm-quantization-guide-gguf-vs-awq-vs-gptq-vs-bitsandbytes-compared-2026/)
- [We ran over half a million evaluations on quantized LLMs — Red Hat Developer](https://developers.redhat.com/articles/2024/10/17/we-ran-over-half-million-evaluations-quantized-llms)
- [Evaluation and Benchmarking of LLM Agents: A Survey](https://arxiv.org/html/2507.21504v1)
---
### AI 做科研:三堵墙、八亿人、一场哥白尼革命
- URL: https://guanjiawei.ai/zh/blog/ai-for-science-three-walls
- English: https://guanjiawei.ai/en/blog/ai-for-science-three-walls
- Published: 2026-04-27
- Tags: AI, AI for Science, 科研, 智能, 思考
前几天参加一个大会,话题轮到 AI 在科研领域的变化。原本是个收尾环节,结果聊得停不下来。几个有意思的点没来得及展开,回来这两天想了想,记一下。
## 一、AI 写论文已经是常态,问题是论文这个载体本身
AI 写论文这件事已经普及到不需要再讨论。Nature 2025 年那份 5000 人的研究员调查里,过去两年 57% 的科学家承认用过 AI 帮自己写作,未来两年想用的更高,72%。这还是研究员愿意承认的数字。
大会上有人说,这对刚入行的研究者其实不是好事。写论文本来是一种思维训练,模型代写之后这一关就跳过去了。
我听完没立刻反应过来,琢磨了一会儿才想清楚。这个担忧成立,但格局有点小。真正的问题再上一层。论文这种载体本身,到底还合不合适?
现在的论文绝大多数还是 PDF。PDF 是给人读的格式:版面、字号、双栏排版,照着几十年前的出版社范式走。可如果未来知识的第一手消费者是 agent 而不是人呢?PDF 就成了一道转译,每次得把它拆回结构化文本,再交给模型。
为什么不直接是 Markdown?
Markdown 对 agent 友好得多。结构清晰,可机读,可改写,能嵌进更大的工作流。人想看,再渲染一遍版面就行,不耽误事。default 形态应该反过来:先服务 agent,再服务人。
这件事现在还没人在推,但两年内必然会变。
## 二、AI 做科研真正的瓶颈,是三堵墙
写论文这种成果输出的部分容易做,但科研的核心从来不在写论文那一步。
科研的核心是把广泛的知识连接起来,在交汇的地方长出新东西。单点的智能有用,但远不够。大会上一个朋友讲得特别清楚:现在卡住 AI 做科研的不是模型能力,是三堵墙。
### 第一堵:付费墙
整个科学知识体系绝大多数藏在付费墙后面。
计算机有 arXiv 算是一个例外,物理、数学也基本都在 arXiv 上。但出了这几个圈子情况就变了。药学、无机化学、化工这些学科 90% 以上的论文都在付费墙后,agent 根本读不到。开放的部分其实是少数学科的少数人在维持。
朋友用了一个挺贴的比喻:战争迷雾。打过 RTS 游戏的都知道,地图大部分黑着,你只能看到自己探索过的那一小块。AI 现在面对的就是这样一个知识地图。你以为它在做全局推理,其实能看到的版图小得可怜。
更糟糕的是,那些被遮住的部分恰恰是知识连接最密集的地方。一个新发现常常需要跨好几个学科做关联。其中一两个学科是黑的,连接就断了。模型再聪明也补不出不存在的输入。
### 第二堵:从数字世界到物理世界的墙
两三年前 AI for science 最热的时候,材料学是焦点。那段时间我也认真看过这个领域,发现一个挺经典的卡点。
理论阶段是大量分子、晶体结构的排列组合,要从里面挑出有潜力的。这一步 AI 可以加速几个数量级。Google DeepMind 的 GNoME 系统 2023 年用 17 天就识别出 220 万个新的稳定无机晶体结构,相当于过去人类积累近 800 年的成果,其中 38 万个被预测稳定到可以工程化。
听起来美得不行。但材料从理论结构走到能用的产品,中间要过湿实验、过工艺、过生产工程化。前端加速 100 倍,后端通道没动,整条链路就只能按最慢的速度走。
这一两年好的趋势是 self-driving lab。把湿实验整套自动化、数字化,让 AI 直接调度实验设备,闭环跑。北卡罗来纳州立大学 2025 年发的那个方案,靠动态流体实验,每半秒能采一次数据,比批次实验快了 10 倍以上。
但这条路才刚开始。绝大多数学科的湿实验还是手工的,跑一次几天到几周。物理反馈循环不打通,AI 那一端再快也只能干等。
### 第三堵:感知墙
这一堵最容易被忽视,可能也是最深的。
AI 现在做得最好的是文字。视觉在追赶,但视觉里包含的真实信息密度,光照、纹理、空间关系,能被多大程度数字化,目前没有清晰答案。
更难的是文字和视觉之外的部分。触觉、气味、味道,对很多学科是关键数据。研究食品的,气味就是核心信号。做生物研究的,化学物质细微的气味变化常常是判断反应方向的依据。这些信号到今天还没有好的数字化通道。
还有一类更模糊的东西,叫直觉。人看到一个实验现象、听到一组数据、闻到一种气味,第一反应不是线性推理出来的,是大脑某个角落直接给出来的。这种直觉是几十年训练沉淀下的模式识别,模式本身却说不出来。
只要这一层在,AI 就没法独立完成科研,必然要跟人协作。
## 三、陶哲轩说:智能要来一场哥白尼革命
讲到协作,正好想起陶哲轩最近一直在说的一个东西。他在 Dwarkesh 的播客上有句话我记下来了:
> "我们正在经历一场认知层面的哥白尼革命。我们以前以为人类智能是宇宙的中心,现在才看清,外面有非常不同种类的智能,各有各的强项和短板。"
哥白尼当年做的事,是把人类从宇宙中心拉下来。陶哲轩说智能这件事也是一样的,要把人类从智能的中心位置拉下来。
我们以前思考智能是单维的、线性的。人在中间,超过人就是超人,低于人就是没用。所以一谈 AGI 就紧张:万一它哪天超过我了,我是不是就没价值了?
陶说这个思路本身就错了。
智能是多维的。不同维度可以共存、可以协作,而不是相互替代。AI 在广度上极强,快速扫描海量信息、跨学科联想,这是人怎么练都练不出来的能力。人在深度上有不可替代的东西,直觉、问题选择、意义判断这些。两者放一起做事,比任何单一一方都强。
这件事跟前面的三堵墙刚好对得上。AI 翻不过去的那几堵墙,正好是人最有着力感的地方。物理世界的体感、跨感官的直觉、对一个问题"值不值得做"的判断,AI 短期内替不掉,反而是这场协作里人最值钱的部分。
哥白尼当年把人从宇宙中心拉下来,并没有说人没价值了。他说的是宇宙真实的运行方式跟人想的不一样。陶哲轩这句话也是一个意思。从认知中心退下来不是降级,是看清楚自己在更大的系统里到底站在什么位置。
## 四、科研的"参与人口",可能要跳两个数量级
整场讨论里最让我兴奋的是另一个角度的变化。
大家担心 AI 冲击科研人员,但有意思的事情正好反过来。AI 把科研这件事,从极少数人手里下放给亿万人。
按 UNESCO 的统计,2018 年全球全职科研人员大约 880 万。看起来不少,但放到全人类 80 亿的盘子里,比例不到千分之一。也就是说人类知识的最前沿过去一直只有千分之一的人在推进,剩下 99.9% 都在更基础、更日常的位置上做事。
这件事不是大家过去不愿意,是参与不进去。
翻一下科学史就明白。早期科学家有不少都是业余的。牛顿做光学是兼着干,达尔文是搭便船去考察。那时候人类知识的前沿还没那么深,一个聪明、好奇又有时间的人,认真投入几年,是真的能做出贡献的。
后来不行了。学科越分越细,前沿越走越远。一篇严肃论文要先读几百篇前序文献,一个实验要先掌握一整套实验技术。门槛越垒越高,大多数人就被挡在外面,社会分工把他们安排到了别的位置上去做基础工作、做组织运转、做重复劳动。没办法的事。
AI 的到来把这道门槛压下来一大截。
不是说每个人都能去破解千禧年大奖问题。是说当你对某个领域真有好奇心、愿意持续钻进去的时候,以前你需要十年才能建起来的那套"先备能力",现在可能几个月就够用了。剩下真正稀缺的是问题判断力、好奇心、坚持力,这些本来就跟"是不是科班出身"关系不大。
前两天写过 [AI 让无知变成了优势](/blog/amateur-advantage),讲 23 岁的 Liam Price 用 GPT-5.4 Pro 破了 Erdős 困了 60 年的数学猜想。那是一个很极端的样本,但它指向的方向是真的。能站到人类知识前沿的人数,未来 5 到 10 年很可能会从百万级跳到几千万、甚至几亿。
十倍、百倍的体量提升。
我自己的体感是,以前根本不敢想去碰前沿研究。我做的是商业,琢磨的是公司怎么把创新带到社会里去。在这个层级思考,每一次"要不要去研究 X"都得极其谨慎。资源有限,每条路都得投入大量的人和钱,等很长时间。过去做战略要天天琢磨的就是这个:怎么把有限的资源砸到最关键的地方。
但 AI 把研究的门槛拍到地面之后,那些原本太深、太复杂、太久远的方向,比如某个推理引擎的优化、某种设备的能效改进、某个被忽视的细分问题,普通人只要真有思考、愿意钻进去,是有机会做出非平凡贡献的。
下一个十年大概率会有一次知识的大爆炸。不是那种微小增量的进步,是参与人数翻几个数量级之后必然出现的供给侧爆发。
## 五、好的一面之外,那道阴影
当然不能只看积极的一面。
技术进步从来不直接等于幸福。生产力的提升能创造多少新可能性,跟它带来多少实际福祉,中间还隔着一层叫分配。分配是另一个话题,今天不展开,但不能装作不存在。
直接的影响里最确定的一件事:重复性劳动会持续被砍掉。这件事没什么悬念。一种供给变得极其便宜、极其充裕的时候,它就不再有稀缺性。没有稀缺性就没有价值,没有价值就不能再以此为生。经济学最基础的一段。
电梯里有人聊起被裁员,写周报、做 PPT、跑流程的岗位先消失。这部分新闻已经天天在发生。
但放到更长的时间尺度上看,我还是更愿意看积极的一面。参与科研的人口从千分之一变到几个百分点,体量太大了,大到任何一种短期的负面冲击都会被它的长期影响盖过去。
这种级别的杠杆,历史上你很少看到人类拿到过。
## 写在最后
回到大会上那场讨论。
有人担心 AI 写论文会让初级研究者失去思维训练。我现在觉得这个担忧抓的尺度有点小。AI 写论文只是这场变革最表层的一层。深一层的变化是,过去只有 880 万人在推进人类知识的前沿,未来可能是 8 亿人。过去这件事是少数学科精英的特权,未来对每一个有真正好奇心的人都开放。
门里面还有那三堵墙:付费墙、湿实验墙、感知墙。今天已经能看到,明天还得一堵堵翻过去。
陶哲轩说要从智能的中心位置退下来。话听起来谦逊,最关键的潜台词其实是:人要重新看清楚,在新的智能系统里自己最值钱的那部分到底是什么,然后把时间和注意力都砸到那部分上。
上一次发这种门票,已经是几百年前的事了。
---
## 参考资料
- [Terence Tao on AI: Mathematical methods and human thought in the age of AI(arXiv 2603.26524)](https://arxiv.org/abs/2603.26524)
- [Terence Tao – How the world's top mathematician uses AI(Dwarkesh Podcast)](https://www.dwarkesh.com/p/terence-tao)
- [Copernican View of Intelligence: Tao's AI Framework(blockchain.news 解析)](https://blockchain.news/ainews/copernican-view-of-intelligence-terence-tao-s-ai-framework-explains-breadth-vs-depth-practical-analysis-for-2026)
- [UNESCO: Number of scientists worldwide reaches 8.8 million(Science|Business)](https://sciencebusiness.net/news/number-scientists-worldwide-reaches-88m-global-research-spending-grows-faster-economy)
- [UNESCO Institute for Statistics: Researchers per million inhabitants 2015–2022](https://x.com/UNESCOstat/status/1924433795903615295)
- [Nature 2025 survey: Is it OK for AI to write science papers?](https://www.nature.com/articles/d41586-025-01463-8)
- [Open access prevalence and discipline distribution(PMC)](https://pmc.ncbi.nlm.nih.gov/articles/PMC5815332/)
- [Self-driving labs collect 10× more data — NC State 2025](https://news.ncsu.edu/2025/07/fast-forward-for-self-driving-labs/)
- [Autonomous self-driving laboratories: a Royal Society 2025 review](https://royalsocietypublishing.org/rsos/article/12/7/250646/235354/Autonomous-self-driving-laboratories-a-review-of)
- [Google DeepMind GNoME: 2.2 million crystals discovered(DeepMind Blog)](https://deepmind.google/blog/millions-of-new-materials-discovered-with-deep-learning/)
- [Scaling deep learning for materials discovery — Nature 2023](https://www.nature.com/articles/s41586-023-06735-9)
---
### AI 让无知变成了优势
- URL: https://guanjiawei.ai/zh/blog/amateur-advantage
- English: https://guanjiawei.ai/en/blog/amateur-advantage
- Published: 2026-04-26
- Tags: AI, 创新, 就业, 思考
今天我撞见了两件事,一件让我觉得这个时代有点不真实,一件让我觉得这个时代非常真实。
## 一、23 岁的门外汉破了一个 60 年的猜想
Liam Price,23 岁,没受过高级数学训练。一个礼拜前的周一下午,他随手把一道 Erdős 没解出来的问题扔给了 GPT-5.4 Pro。题目编号 #1196,关于"原始集合"的一个猜想,困了人类 60 年。一次会话,大约 80 分钟,模型给出了一份证明。
Cambridge 的本科生 Kevin Barreto 帮着整理。后来 Jared Lichtman 和陶哲轩参与简化,把 LLM 原始那份很糙的输出蒸出关键 insight。陶哲轩点评的那句话挺刺人的:
> "这个题人类是看过的。看过它的人在第一步就集体走偏了。"
不是没人想过,是想过的人都用同一种方式想错了。LLM 走的那条路,在相邻的数学领域是常识,没人把它搬过来。
最近开始流行一个词,叫 vibe-math,氛围数学。意思就是你不太懂这个领域,把题扔进 ChatGPT,看它怎么瞎蒙。
同一周 GPT-5.4 Pro 还在 Mensa 挪威 IQ 测试上拿了 150 分,超过 99.96% 的人类。OpenAI 上一个最高分是 o3,136。一年跳了 14 分。
当 AI 稳定地超过 95% 的人类专家之后,"我什么都不懂、随便试试"反倒成了一种结构性优势。
## 二、为什么"懂行"反而是束缚
讲个我最近做项目的真实体感。
你让 AI 做项目评估,它列计划:第一步一到两周,第二步两到三周,加起来三个月。看上去合理,因为这是过去做这件事的人会写的时间轴。
但你真让它去执行那个计划,它几天就做完了。
它评估的时候模仿了人类的"先验",执行的时候根本就不是同一种生物。
回到 Liam Price 这个事。在他之前看过 Erdős #1196 的数学家都在做同一组开局动作,因为那组动作在过去 60 年一直被当成这类问题的"标准解法"。这就是先验。先验过去是好东西,是省时间的捷径。但工具底层一换,先验反而把你绑住了。
在一个领域深耕的人,对"成本"和"难度"是有直觉的——这事得多少人、多少钱、多少时间,他心里有谱。这种直觉决定了他愿不愿意去想一个问题。
想象一个明朝人,要构思一个登月计划。
得调动几个国家最顶尖的天文学、火箭学(这词他都没听过)人才远程协作,反复试错。光想到把信送到那些人手上、等他们回信,这事就构思不下去了。明朝人不是没本事,他是从 day 0 就放弃了思考。
你今天的"先验"也是一样的。某件事 ROI 太低,某件事得跨多少层组织,某件事算下来时间太长——所以你压根就不去想。
## 三、门外汉没这个负担
门外汉不知道难。
对他来讲,让 AI 解一个 60 年的数学猜想,跟让 AI 写自动化周报、画一张 PPT,主观难度差不多。反正都不会,反正都难。所以他都愿意试。试一试不花什么钱,token 烧一烧的事,万一中了呢?
中了一次,他就比深耕了一辈子的人多走了一截。
我之前写过 [AI 放大的不是技能,是热情](/blog/ai-amplifies-passion)。那篇讲的是热情决定你愿不愿意持续投入。这次想补一刀:在你愿意之前,"你以为这件事难不难"先把大多数人筛掉了。门外汉绕过了这一关。
最近罗福莉跟张小珺聊了 3.5 小时,话题主要是 Pre-train 到 Post-train 的范式切换、组织怎么变。听下来有一种共通的体感:现在跑得快的,反而是包袱少、对"我知道这有多难"先验少的人。AI 把过去只有顶尖机构才调动得起来的资源,以几乎免费的方式塞给了个体。这种自由感放在历史里不多见。
## 四、电梯里的两个陌生人
得记一下今天另一件事。
晚上下楼吃饭,电梯里两个陌生人在聊。一个说"我心情不好,今天被裁了"。另一个回了一句"哦我也被裁了"。从 9 楼到 1 楼,几十秒的功夫。出电梯我还在算这个概率。
这是这个时代的另一面。有人用 AI 跨过了原本进不去的门槛,有人原本做得挺好的工作今天突然就没了。
两条路在企业层面已经看得很清楚。
沃尔玛 CEO 公开说,未来三年公司总人数基本不变。代价是要让 160 万员工全部接受 AI 培训,联合 Google 和 OpenAI 投了 10 亿美金做技能升级。意思是不裁,但每个人都得变。
字节是另一种打法。他们家自研的 AI IDE TRAE 内部月活早就过了百万,超过 80% 的工程师每天在用,抖音生活服务那条线 AI 写的代码已经占到 43%。还没到 100%,但方向清楚:能让 AI 写的就让它写,人腾出手做评审和判断。
两条路其实是一件事的两面:要么把每个人变成一个能用 AI 的"百倍员工",要么把不需要的环节直接砍掉。你在哪条路上,决定了你今天看到那条新闻是机会还是威胁。
## 五、两极分化的真相
回头看到的图景大概是这样。
小众领域在被打开。数学研究、生物医学、材料学、底层编程,这些原本要几十年 know-how 才敢碰的领域,门槛突然变低了。一个 23 岁的人破了一个 60 年的猜想。下一个可能是某个高中生在医学、在某种设备效率提升上做出非平凡的事。这种事过去只在科幻里。
大众领域则不再需要那么多人。周报、PPT、初阶代码、客服、基础文案,AI 都能做,做得还行,做得越来越快。需要的人会持续往下走。
最难受的是那种在大众领域已经做得很熟、又没动力进新领域的人。技能没问题,方向出了问题——AI 拿在手里,还是只在更顺地交差。
## 六、给世界多加点东西,还是把交差做得更漂亮
你能做的反应其实不复杂。挑一件你过去因为"听上去太难"而放弃过的事,把 AI 拉进来重做一次。
但选哪件事,是有差别的。
把周报写得更顺、把 PPT 画得更花、把已有流程跑得更省一点——AI 都帮得上忙。可这些事本质上还是交差。世上多一份漂亮周报跟少一份漂亮周报,对人类没什么区别。AI 在这种事上的边际产出,落到外面的世界里基本是零。
让世界真正多一点东西的事是另一类:解一个被卡了几十年的数学问题,做一个能解决某个真实问题的小工具,捅一捅一个你只是好奇但不在专业里的方向。23 岁的 Liam Price 能破 60 年的猜想;下一个让某种设备的性能跳 10%、让某个被忽视的人群拿到能用的工具的,未必不是某个普通人。
不必非要做出震动学界的事,中间地带很大。但你得选**值得做的事**——值得你身上最稀缺的那点时间和注意力。
我现在判断一件事值不值得做,标准跟以前不一样了。以前先问的是"能不能做成""能不能交差""有没有故事讲"。现在问得更直接:这件事如果做成了,世界是不是多了一点真东西?
AI 把过去最贵的资源以几乎免费的方式给到了每一个有好奇心的人。这件事最讽刺的地方是,绝大多数人拿到这份杠杆之后,第一反应是用它来更高效地交差,而不是去做点对人类真正有用的事。
把这份杠杆用在让世界多一点东西的方向上,比用在把交差做得更漂亮的方向上,重得多。
接住这种自由,比在乎被裁的概率更重要。
---
## 参考资料
- [Erdős Problem #1196 — primitive sets discussion thread](https://www.erdosproblems.com/forum/thread/1196)
- [Amateur armed with ChatGPT 'vibe-maths' a 60-year-old problem — Scientific American](https://www.scientificamerican.com/article/amateur-armed-with-chatgpt-vibe-maths-a-60-year-old-problem/)
- [GPT-5.4 Pro solves Erdős Problem #1196 — Hacker News 讨论串](https://news.ycombinator.com/item?id=47774494)
- [GPT-5.4 Pro 在 Mensa 挪威拿到 IQ 150(CryptoSlate)](https://cryptoslate.com/gpt-5-4-iq-150-ai-capability-economic-impact/)
- [AI IQ 测试榜单 2026(BinaryVerse AI)](https://binaryverseai.com/ai-iq-test-2025/)
- [沃尔玛三年人数不变、给 160 万员工做 AI 培训(Fortune)](https://fortune.com/2026/02/19/walmart-trillion-dollar-retail-gaint-artificial-intelligence-training-google-partnership-invest-in-workers-not-replace-tech-changing-jobs/)
- [字节 TRAE 一年 200 次更新、内部月活破百万(腾讯新闻)](https://news.qq.com/rain/a/20251229A065ZX00)
- [罗福莉 × 张小珺 3.5 小时访谈 — 商业访谈录第 138 期](https://www.xiaoyuzhoufm.com/episode/69eae15a1e94ae692107cc50)
---
### DeepSeek V4 这一天:比的是 Infra,不是模型
- URL: https://guanjiawei.ai/zh/blog/deepseek-v4-infra-matters
- English: https://guanjiawei.ai/en/blog/deepseek-v4-infra-matters
- Published: 2026-04-24
- Tags: AI, DeepSeek, Infra, 大模型, 思考
今天 AI 行业跟过年一样。
上午 OpenAI 刚推 GPT-5.5,下午 DeepSeek V4 就上线了。加上前两天 DeepMind 的 Vision Banana,还有蔡浩宇家 Anuttacon 那篇数字人论文。这一周挤进来的新东西,比过去一整个季度都多。挑着聊。
## DeepSeek V4
V4 发布前我参与了一些内测。之前要保密不能讲,现在放开了。
先交代下尺寸。V4 发了两个版本:V4-Pro 总参 1.6T、激活 49B;V4-Flash 284B / 13B。都在 32T+ tokens 上预训练,1M 上下文做标配,MIT 协议开源,支持 non-think / think high / think max 三档推理档位。API 价格上,V4-Pro 每百万 tokens 输入 1.74 美元、输出 3.48 美元;V4-Flash 再便宜一个数量级,0.14 / 0.28 美元。
能力这边,官方自己承认,V4 大概在 Opus 4.6 这一档,甚至略弱。不到最顶尖。
这跟上一次 R1 对 O3 的格局是一样的。接近,不在最前沿。
那 DeepSeek 的意义在哪?我一直觉得,它不是靠模型碾压同行的公司,它是靠 Infra 领先同行的公司。而且 Infra 不是跟着模型走,是走在模型前面。
V4 这一版 Infra,对市面上所有做推理的公司都是灾难。这个词不夸张。
原生 FP4。V4 是 FP8 + FP4 混精的模型,MoE 专家用 FP4,其余参数 FP8。目前大多数芯片、大多数推理栈对 FP4 的支持要么没有要么很弱。
算子切得很碎。我跑 V4 推理的时候就发现,它在算子层做了极多个性化优化,市面主流开源引擎基本跑不出官方性能。你想追上它的性价比,等于要从底层编译一条条打磨。
单机都吃力。上一代单机至少能跑,这一代单机都跑不动,集群就更别提。不用官方那一套去跑,想做到它那个价格基本没戏。
这让我想起 V3/R1 那阵 DeepSeek 披露过 545% 的理论毛利率。意思是严格按它的架构跑下来,毛利可以极高;同一时间所有复刻的推理服务都在赔钱。V4 是这个故事的更激进版本。
另外聊个插曲。官方负责 Infra 的同事跟我们聊过,很认真地说:慎重点,技术变化太快,上一版的某些架构可能就是个过渡形态,下一代直接不用了。你前面投入重金做 Infra,下一代一出来就打水漂。
这背后有个本质分歧。大多数模型公司先把模型做好,Infra 放后面;DeepSeek 是 Infra 先行,靠底层创新反推模型的经济学。两种都能活。但真要大规模 serve C 端,没把 Infra 想清楚就一定翻车。DeepSeek 第一次爆红那会自己也栽过,网页挂了、API 掉线。那还是它 Infra 已经相对到位的情况下。
### 模型本身
体感上看:
- 中文文本能力仍然是它的强项。做中文写作、做报告这类内容整理的任务,值。
- 工具调用体感不错,有点 Claude 的感觉。
- 没到最顶尖那一档。GPT-5.5、Opus 4.7 那个水平它追不上。
- 目前没有 coding plan。应该暂时也不会出。挺遗憾。
### 100 万上下文做成默认
这可能是 V4 最值得记一笔的事。100 万 token 上下文,所有线上服务直接默认,不分段涨价。
100 万 token 什么概念?差不多 200 万字,一本连载一两年的网络小说能整本装进去。
以前大家都想做,但真做出来的要么单独定价要么开一阵就关。Anthropic 百万档去年开了一阵又收回去,最近才重新放出来;OpenAI 到现在 API 百万档都没正式开。不是能力问题,是 Infra 顶不住。
V4 能做成标配不加价,是因为在注意力上动了大手术。它引入了 CSA(Compressed Sparse Attention)和 HCA(Heavily Compressed Attention)两种结构交替使用:CSA 先把 KV 沿序列方向压缩 4 倍,再做稀疏注意力挑最相关的 token(V4-Pro 取 top-1024、V4-Flash 取 top-512),配一个 128 token 的滑动窗保证局部不丢;HCA 压得更狠(压缩率 128),但在压缩后的表示上做密集注意力,相当于给部分层留一个低分辨率的"全局摘要"。两种层在网络里交替穿插,一些做精确 look-up,一些做模糊全局。另外还叠了一层 Manifold-Constrained Hyper-Connections(mHC)来稳住跨层信号传播。
官方给的效率数据是:1M 上下文下,V4-Pro 单 token 推理 FLOPs 只需要 V3.2 的 27%,KV 缓存 10%。百万标配不加价,底层靠的就是这。
23 年 Kimi 最早就在提这个方向:百万上下文能覆盖大多数场景。三年过去,这件事终于变成基础设施级别的默认能力。
### Day-0 适配国产芯片
V4 这次做到了对华为昇腾等国产芯片的 day-0 深度适配。这事我觉得有格局。
一直依赖海外芯片做训练推理,不是技术问题,是风险问题。V4 能在 day 0 就把国产适配想清楚,比模型本身更有意义。
## 这一周其他几个
### Vision Banana:生成式模型其实"懂"图像
DeepMind 这两天发了个叫 Vision Banana 的东西。做法是拿 Nano Banana Pro 这个文生图模型做一轮指令微调,让它去做分割、深度估计、法向量估计这些传统视觉任务。
结果打平甚至打过 Segment Anything、Depth Anything 这些专用模型,生图能力不掉。
这事挺有意思。文生图模型内在其实已经具备了对图像的理解,只是以前没人知道怎么把这份理解"问出来"。现在图像理解和生成被统一在同一个接口下:所有任务都用图生图的方式解。
按这个思路走,生成式模型天然通向"世界模型"。2D、3D、视频、物理这些维度,可能都会收进同一个模型里。
### 蔡浩宇家的 LPM 1.0:数字人终于会"听"了
4 月 10 日,米哈游前创始人蔡浩宇的新公司 Anuttacon 在 arXiv 放了一篇论文,LPM 1.0,170 亿参数扩散 Transformer,做的是视频角色的"表演生成"。
数字人这件事说烂了。但这篇论文定义了两个以前没人认真做的问题:持续身份一致性、倾听时的互动。
身份一致性不只是外观稳定。是说人物在不同场景下的反应要符合同一个"人格",你不会突然觉得"这不是刚才那个人"。
以前的数字人都是输出导向的:让它说话、让它动,现在做得也不错。真正难的是倾听。你跟它说话的时候,它要给你表情反馈、微动作、呼吸节奏,让你感觉对面是个活人。现实里跟人说话,对方不是面无表情等你说完再回应,他全程都在反馈。这份反馈量巨大,以前几乎没人做。
论文发了,模型不开源。因为越真就越像人,诈骗风险太高。这个判断我觉得对。
### Opus 4.7 的锅:Infra 翻车
Anthropic 这一两周被骂得挺惨。4 月 23 日官方出了复盘,三件事叠起来:
1. 3 月 4 日把默认 reasoning effort 从 high 降到 medium,为了改善 UI 延迟,代价是 Sonnet 4.6 和 Opus 4.6 智能度明显下降。
2. 3 月 26 日上线一个清空 idle session thinking 的功能,bug 导致每轮都清空,模型开始健忘和重复。
3. 4 月 16 日加了个系统提示词限制回复字数,结果 Opus 4.7 编码质量掉了 3%。
三件都是 Infra 层的失误。一个模型服务好不好用,Infra 占的比重在变得越来越大。
## 一家没发顶尖模型,却还能占热搜
DeepSeek 这么久没发新模型了。中间几代基本没什么声浪。今天一发,占掉几个热搜。
我觉得这是格局实力。它做了几件当下很有代表性的事:百万上下文做成标配、FP4 推到生产、国产芯片 day-0 适配跑通。都是 Infra 层的硬活。
也要承认现在这个格局下想一枝独秀很难。Kimi K2.6、GLM 5.1、MiniMax 新模型一堆,开源阵营水位整体抬起来了,跟 V3/R1 那会独占开源高地的时代不一样了。
## 再说一次那个结论
今天上午有朋友来找我。他们公司想转型,想"买个 AI 产品"来助力团队变革。金融行业,人不多。
我跟他说的原话是:别着急谈转型,先让公司每一个人成为 coding agent 的重度用户,再谈组织变革。
然后把自己的电脑桌面投给他看,看我每天怎么用 Claude Code,看 Agent 在桌面上同时开多少条线。他看完第一反应就是立刻去下一个 coding plan。
这个反应是对的。这个时代最超值的一笔投资,就是买一个 coding plan 然后天天用。不是"用过几次 ChatGPT"的那种用,是真的让 Agent 进到你每天的工作流里。没这个基础,组织层面的变革都是空中楼阁。
2026 年一定会被记一笔。不是因为哪一个模型,是因为密度;一天能挤进来三个模型一个论文。你能感觉到这个节奏,就已经在场了。
---
## 参考资料
- [DeepSeek V4 发布公告(ofox.ai)](https://ofox.ai/blog/deepseek-v4-release-guide-2026/)
- [DeepSeek-V4-Pro on Hugging Face](https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro)
- [DeepSeek-V4-Flash on Hugging Face](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash)
- [DeepSeek API Pricing(官方)](https://api-docs.deepseek.com/quick_start/pricing)
- [Simon Willison: DeepSeek V4—almost on the frontier](https://simonwillison.net/2026/Apr/24/deepseek-v4/)
- [DeepSeek V4 携手华为昇腾(凤凰网)](https://tech.ifeng.com/c/8saBEvg22eB)
- [DeepSeek 理论毛利率 545% 披露](https://zhuanlan.zhihu.com/p/27570317822)
- [Introducing GPT-5.5 — OpenAI](https://openai.com/index/introducing-gpt-5-5/)
- [Vision Banana — Google DeepMind](https://vision-banana.github.io/)
- [Anuttacon LPM 1.0 论文报道(新浪财经)](https://finance.sina.com.cn/roll/2026-04-11/doc-inhucmsx9427887.shtml)
- [Anthropic: An update on recent Claude Code quality reports](https://www.anthropic.com/engineering/april-23-postmortem)
- [Moonshot 发布 Kimi K2.6](https://kimi-k2.org/blog/24-kimi-k2-6-release)
- [智谱发布 GLM-5.1(Build Fast With AI 评测)](https://www.buildfastwithai.com/blogs/glm-5-1-open-source-review-2026)
---
### 风水轮流转:模型一个半月一代
- URL: https://guanjiawei.ai/zh/blog/monthly-model-cadence
- English: https://guanjiawei.ai/en/blog/monthly-model-cadence
- Published: 2026-04-24
- Tags: AI, 大模型, OpenAI, Anthropic, 思考
万众期待的 OpenAI "土豆",今天发了。
结果不是 GPT-6,是 GPT-5.5。
我出来之后马上试了一下,发现它解决了 5.4 最让我头疼的一件事:**它开始说人话了**。
5.4 那会 Codex 输出的过程读起来很折磨。一堆词堆在一起没什么逻辑,中间的汇报、执行说明来回跳,大部分时候你看不懂它到底在干嘛。5.5 把这块修了,整个工作过程可读性一下上来。
然后就很搞笑。前段时间我还在团队里讲:GPT 5.4 虽然在某些复杂任务上比 Claude 强,但它不说人话,用得累;Claude 是说人话的,能带你走,**所以还是推 Claude Code**。有同事听完就把 Codex 退了,买了 Claude。今天我又得在群里发一条,要不你们两个账号都开吧,一起用。
大家能理解这事多离谱吗。
## 一个半月一代
5.4 是 3 月初发的。我当时就判断这不是小版本,它比上一代 Codex 5.3 强得不是一点半点。现在是 4 月 24 日,一个半月就又一代。
Anthropic 这边节奏更夸张。2 月发 Opus 4.6,上周发 Opus 4.7,中间两个月。更离谱的是 4 月 8 日他们官方还发了一个叫 **Mythos Preview** 的模型。官方说这是他们至今最强的模型,SWE-bench 93.9%,USAMO 数学奥赛比 Opus 4.6 高整整 31 个百分点。
但这个模型**没对公众开放**。只通过一个叫 Project Glasswing 的项目,给 Microsoft、Google、AWS、JPMorgan、Nvidia、Cisco 等 50 多家机构受限使用。配了 1 亿美金的 usage credits。
原因不是藏着掖着。官方说 Mythos Preview 的挖漏洞能力强到离谱——在主流操作系统和浏览器里能找出普通 bug hunter 根本挖不动的"几万级"零日漏洞,全面公开风险太大。上周的 Opus 4.7,相当于是同一代模型里"能公开发布"的那个阉割版本。
节奏现在就是这样:一个半月到两个月一定会有新一代,而且顶尖版本已经开始用"太强所以不公开"的理由来限制分发了。
## 去年是三个月打底
这个节奏放到一年前是不可想象的。
2025 年初 DeepSeek R1 出来之后,大家讨论了它整整半年。2 月份讲 R1,到 5、6 月份还在讲 R1。中间 V3.1 是小版本升级,其他公司也发了些模型,但基本没声量。到大概 6、7 月的时候 Kimi K2 才开始冒头,当时也打不过 R1。一个模型能把话题面主导半年。
海外那边,Google 的 Gemini 从去年秋天开始风头正盛。Nano Banana 的文生图冲击挺大,我印象里去年 9、10 月份参加一些顶尖学术会议,大家聊的全是 Gemini。多模态强、编程也好,哪一项都不差。
然后今年突然就变了。3 月之后再谈模型,Google 好像已经不存在了一样。大家对标的全是 Claude Opus,后面 OpenAI 迎头追上来。前几天我让团队做了一个盲测:OpenAI 的 Image Generation 2 和 Nano Banana 2 各出一张图,我故意不说谁是谁。团队全选了 OpenAI 那张。一看,正是 OpenAI。据说 Google 那边创始人又拉了红色警报,号召全员冲锋追赶。
一个季度前 Google 还在"最强、最全面"的位置上,一个季度后就已经在"我们要追赶了"。离谱到什么程度。你上次给团队的建议,过三个月可能就得推翻重来。
## 风水也在转
更逗的是,连模型风格都在风水轮流转。
几个月前我的判断:GPT 5.4 复杂任务强但不说人话,Claude 4.6 说人话但在某些硬骨头上差一点。所以推 Claude Code。
最近两周用 Opus 4.7,我发现它开始不说人话了。结构不清,话里堆一堆有的没的,跟 4.6 那种清爽感比差很多。社区里也有人发现了这个问题,说 Opus 4.7 开始"GPT 化"。
反过来 GPT-5.5 又开始说人话了。简洁,可读,不啰嗦。
两边像换了个身份一样。
这不光是某个模型在变好或变坏。是整个行业节奏太快,你的判断**半衰期变短了**。三个月前我很确信应该推 Claude Code,现在我不敢那么确信。不是谁做错选择,是"确信"这种东西在这个行业里已经很难持久。
## 最划算的投资
所以我越来越确信一件事:**最划算的投资,没有之一,就是立刻去买一个 coding plan 的账号,然后开始用**。
一个月几百美金,或者国产模型几百块人民币。你能第一时间用到世界上最顶尖的生产力。而且它每一个半月就升级一次。**你今天搞不定的问题,两个月后下一代模型很可能自然就不是问题了**。
为什么我强调 coding plan,不是直接用 API?
最近做一些 API 实验发现,Claude Code、Codex 这类产品里面,prompt caching 的命中率非常高,整个产品链条是一条贯通的优化链。缓存、调度、工具调用都打通了。这也是为什么厂商能在高亏损下支撑这么大用量。你如果用一些中转 API 搞来搞去,这条优化链就断了,价格不划算,稳定性也容易出问题。
有条件就直接官方 coding plan。多开几个账号都可以,每家一个月也就那点钱,用各自的长板。
## 进化是跳跃的
整件事我慢慢琢磨明白了,它不是线性的。
不是今天 10 分、明天 11 分、后天 12 分这样往上走。更像是:十一、十二、十三,然后卡在 13 很久,然后某一天直接跳到 100。
2024 年底 o1 推出之后,那个冬天我跟几位前沿研究者坐在一起讨论,大家觉得 reasoning 加强化学习这个范式很有机会把模型推向下一个 scaling law。几周之后 DeepSeek R1 就开源了。那种震撼我现在还记得。顶尖成果直接开源,R1 一出就冲到世界第一梯队,reasoning 变成了新默认范式。
再往前看。GPT-4 是 2023 年初发的,o1 是 2024 年底发的,中间将近两年是相对平缓的。说实话 2024 年我是有"放缓"体感的。2023 年大家被 3.5 到 4 的那次跃迁喂得预期太高,后面跟不上了。
回头看那不是放缓,那是在蓄力。下一跳出来就是 reasoning。
研究 AGI 的人喜欢画一个阶梯:对话,工具使用,智能体,研究,创新。你以为它是线性爬阶的,其实前面一直不太行,直到某一代模型突然跨过一个坎。**而且一跨过去所有人都能跨过去**。
## Agent 不是被设计出来的,是被模型推出来的
再举一个范式跃迁的例子。
2025 年初,整个圈子讨论的全是同一个问题:AI 应用到底在哪里?我们做什么应用?当时没人能答。主流还是 IDE 嵌入补全(Cursor 那一路)、vector database 加流程编排(LangChain 那一路),还有各种拖拉拽 workflow 工具。
那时候 reasoning/thinking 能力被很多团队看成累赘。任务流都写好了,逻辑都固定了,模型多想反而容易跑偏。很多人推荐"关掉 thinking 开一个小模型效率更高"。
到 Opus 4.5 那一代(2025 年 9、10 月),上下文变长、工具调用变强,长程自主性也上来了。然后 Manus 一个演示视频扔出来,大家看完愣住:**模型已经强到可以自己在长任务里推进了**。有人立刻说"这没什么技术难度啊"。说得也没错,它真的不难。难的是意识到**模型已经到了可以这么用的程度**。
再往后 Claude Code 出来更极端。它不是 IDE 嵌入,是一个 CLI。终端里一个对话窗,你跟它说话,它自己去做事。很多人一开始接受不了"这也能干活?"。用了两天才发现,**模型强到一定程度,IDE 本身反而成了累赘**,在里面看来看去反而限制它发挥。
现在回头看 2025 年初那个"AI 应用在哪里"的问题,**已经不存在了**。不是被解决,是问题变得没意义。模型能干的事太多,这个问题的边界消失了。
## 普通人能第一时间参与
最后讲一点我觉得特别奇妙的。这件事竟然是**普通人能第一时间参与**的。
以前这种量级的技术,核能、航天、半导体,普通人不可能在新东西落地的几天内就摸到最前沿。AI 不一样。新模型发布之前会有一些圈内人提前几周体验,但时间差最多一个月。拖久了竞品就跟上来了,领先优势就被稀释。
所以每次新模型一发,你我几乎当天就能用到。用一台普通笔记本,几百块一个月,判断它好不好用,哪里强,哪里翻车。有时候你比研发它的人更早发现问题。
这种参与感以前没有过。时代本身在加速,节奏里的每一个人也被拉进来了。
几百块一个月就能站在前沿,这么划算的事,我这辈子还没遇到过。
---
## 参考资料
- [Introducing GPT-5.4 — OpenAI](https://openai.com/index/introducing-gpt-5-4/)
- [Claude Opus 4.6 — What's New — Anthropic](https://platform.claude.com/docs/en/about-claude/models/whats-new-claude-4-6)
- [Claude Opus 4.7 — What's New — Anthropic](https://platform.claude.com/docs/en/about-claude/models/whats-new-claude-4-7)
- [Claude Mythos Preview — red.anthropic.com](https://red.anthropic.com/2026/mythos-preview/)
- [Anthropic Project Glasswing](https://www.anthropic.com/glasswing)
- [Anthropic 'Mythos' AI model representing 'step change' — Fortune](https://fortune.com/2026/03/26/anthropic-says-testing-mythos-powerful-new-ai-model-after-data-leak-reveals-its-existence-step-change-in-capabilities/)
- [Anthropic rolls out Claude Opus 4.7, less risky than Mythos — CNBC](https://www.cnbc.com/2026/04/16/anthropic-claude-opus-4-7-model-mythos.html)
- [DeepSeek R1 & 官方主页](https://www.deepseek.com/)
- [Google DeepMind Gemini](https://deepmind.google/models/gemini/)
- [Cursor](https://www.cursor.com/)
- [Manus](https://manus.im/)
- [Anthropic Claude Code](https://www.anthropic.com/product/claude-code)
- [Moonshot Kimi](https://www.moonshot.cn/)
- [Introducing OpenAI o1](https://openai.com/o1/)
---
### 用 AI 花了一天半给儿子做个识字游戏
- URL: https://guanjiawei.ai/zh/blog/paw-patrol-literacy-game
- English: https://guanjiawei.ai/en/blog/paw-patrol-literacy-game
- Published: 2026-04-23
- Tags: AI, 家庭, 教育, 思考
最近去一个大会做分享,会前会后接触了不少人,发现参会者里大体分成两拨。
一拨每天泡在开源社区,自己做产品、自己长方向。跟他们聊几句就能感到一种在前线的密度,观点是现场长出来的,带着热度,也有感染力。另一拨人身上是另一种气味:老板派活,交差逻辑。讲的东西是"我做了一个什么,它能干什么干什么",很标准的过去式软件叙事。AI 现在最不缺的恰恰就是"能干什么",最缺的是"能不能做好"。后一拨人讲到这里往往就没下文了。
这两拨人之间已经有了一道不小的缝隙。更大的鸿沟还在后面,回头再讲。先说最近这两天在我家里发生的事。
## 那句"你怎么总盯着电脑"
最近几个月工作强度比以前都大。不是坐班那种忙,是自驱的忙。agent 的边界每天都在动,探索起来很上瘾,我停不下来。出门很早,回家常常十一点多,家里的事一直在往后排。
前几天儿子突然跑来问我:你为什么总盯着电脑?
我没敷衍他,让他坐下,挑他能听懂的话讲了一下什么叫人工智能。他盯着我屏幕上那个自己在动的光标,说:电脑怎么自己在打字?我说:我跟它讲了我要什么,它就在帮我干活。
他还是有点糊涂。我说那给你现场做个东西。
那会儿他正迷上汪汪队。我打开一个 coding agent,念给它听:我要一个汪汪队威力狗的对战游戏,横屏,可以选狗对打。然后让他先回去玩别的,五分钟后再叫他。
五分钟后游戏真的跑起来了。六只狗可以选,轻拳重拳、上下蹲跳都能用。他一脸不可置信的样子玩了一会儿跟我说:哎,好像威力狗的大招没出来。我说那再改一下。又过了五分钟,大招也有了。特效很粗糙,但对他足够了。
他意犹未尽。我说:等你大一点,爸爸给你做更好的。
## 一个拿不到小红花的小孩
大概是这场临场做游戏让他觉得,爸爸今天终于参与了一下他的世界。他问我能不能教他认钟表——就是那种有指针的钟表(那东西对小孩其实非常不友好,这是另一个故事)。教到中间他失去了兴趣,转而问我能不能教他认字。
我有点意外。他小声说,学校里认字可以得小红花,他经常拿不到。
那种挫败感我一下就懂了。我问他为什么不跟妈妈说。他说不上来,只是闷闷地坐在那里。
那一刻我做了一个决定:把刚才那种临场做游戏的思路,放到"教他认字"这件事上。做一个他专属的认字游戏,用他喜欢的 IP,让大人能陪着玩。
## 先别写代码,先让 agent 去把功课做完
那天晚上回家我打开 coding agent,第一件事不是让它写代码,是让它去做背景研究。
我扔给它三个问题:
1. 学龄前儿童的汉字学习,最近这几年的教育学和心理学结论是什么
2. 记忆相关的学习理论,适合学龄前小孩的做法有哪些
3. 汪汪队立大功这个 IP 到底怎么回事,它的叙事结构是怎样的
它花了差不多一个小时做调研。等它把总结甩回来,我才发现我原本的几个默认想错了。
**学龄前的重点不是拼音。** 2016 年秋天开始,部编本一年级语文的第一单元就已经从"a o e"换成了"天、地、人"——先识字,再学拼音,把拼音放回"辅助识字的工具"的位置。这背后不是一拍脑袋的决定。广东省妇幼保健院 2002 年在幼儿园大班做过对比实验,汉字班的成绩和答卷速度都优于拼音班;北师大心理学院 2011 年跟了 176 个一年级学生一整年,发现长期读带拼音材料的孩子,阅读效能感反而低于读无拼音材料的孩子。学龄前真正该抓的是象形字,让孩子从"图"进到汉字,而不是从符号进。
**不要贪多。** 教育部 2012 年的《3-6 岁儿童学习与发展指南》明确反对早期机械识字和强化训练。幼儿园阶段认一个字所需的时间,大概是小学同样一个字的三到四倍。方法上,三桶记忆法(简化版的 Leitner 系统,1970 年代德国科学记者 Sebastian Leitner 提出的间隔重复方法)很适合这个年龄。第一桶每天看一遍,第二桶隔三天,第三桶隔七天;新字进第一桶,答对往后走,答错退回第一桶。每天的新字控制在两三个,比一口气塞十个要稳得多。
**汪汪队本身就是一套固定公式。** 每一集的节奏几乎一模一样:某个居民出事 → 打电话给莱德 → 召集狗狗 → 选合适的救援犬 → 出发 → 救援过程 → 庆祝收尾。这种高度重复的结构其实非常适合做成关卡。每一关就是一次完整的"警报、出警、庆祝",节奏熟,挫败感低,小孩不会被陌生的新逻辑拦住。
这三件事搞清楚之后,我才开始跟它一起设计游戏。这一段我让它走 superpower 那个 skill 来做设计,它会频繁停下来跟我确认:"这个机制你觉得 ok 吗?"、"这一步要不要砍掉?"。来回几轮,一个能跑的框架出来了。
## 做素材比写代码累多了
框架是一回事,素材是另一回事。字幕、图、音效、角色配音、关卡背景,全都要。我本来想自己录音,录了几次放弃了。
我让另一个 agent 专门做素材。整条 pipeline 它自己搭起来的:
1. 去 YouTube 找原版集,把音频抽出来
2. 本地跑 ASR,把音频切成 2 秒一段,抽出每段台词
3. 每段再用视觉模型抽帧,判断画面里是哪只狗、哪个场景
4. 本地跑 TTS 生成游戏内的角色提示音
5. 视觉素材用 Gemini 的 Nano Banana 生成(那时候 GPT 新的 image 模型还没出)
一开始它想让我手工告诉它每一帧是哪只狗,我认不全汪汪队里所有角色,搞不清楚。它自己改了思路:先 ASR 出文字,再靠视觉模型把画面内容跟台词对齐,自动筛。这条 pipeline 我看了一下可行,就让它跑。
第一版出来我试了下,一堆 bug,交互复杂得连我都不想碰。我让它砍掉一批功能,简化到孩子一个人能上手。第二天又跑了一版,还是很多问题。
这时候我做了一件后来看挺关键的事:让 agent 自己先做一轮端到端测试,不要等我来测。它跑完自己列了一大堆问题,顺手还要求"要不要加一个美术指导的角色来统一画面风格?"。加进去之后画面一下子整齐,素材的一致性也好很多。
整个过程一天半。到第二天晚上,像个能玩的东西了。
## 第一次让他们俩玩
那天晚上回家已经十一点多,我跟妻子说要不要先试一下。太晚了,没用。拖了几天。
昨天下午她突然想起来,问能不能玩。我人不在家,用 Tailscale 从她手机接进我电脑,远程把游戏启起来。
她先自己跑了一遍,回我一句:比我想的要好。这版有个我比较喜欢的设计——孩子看一个屏,家长作为"指挥官"拿手机看另一个屏,家长会收到节奏提示,知道什么时候该鼓励、什么时候该帮忙。这个分屏她很买账。
然后她带儿子玩。儿子玩完不肯走,说明天还要玩。这样正好,按理论一天认三个字就够了,再多就是贪。
## 那一刻她的表情
这件事最让我意外的不是儿子的反应,是我妻子的。
我之前跟她讲过很多次 AI。讲 agent、讲 coding、讲接下来会发生什么。她听我讲,但没有感觉,跟我儿子第一次听我讲人工智能其实是一种没感觉。概念落不到她在乎的那件事情上,再怎么讲都是别人的事。
这一次不一样。孩子的教育是她心里最沉的那块东西。看到一个一天半就能做出来的东西真的让儿子愿意坐下来玩,她的反应不是"很厉害",是"我能用"。
当晚她跟我讲了一句话:那我们能不能给朋友家的小孩也做一个?
我说能。
## 三类人,两道鸿沟
回到开头说的那个大会。会里是两拨人,会外的整个世界其实是三类人。
第一类,完全没感知。知道 AI 很火,文章刷过不少,觉得离自己远,不上手,也不觉得该上手。
第二类,上过手,做的是别人派下来的活。老板说公司要搞一个类似的东西,跟着搞一个,交差完就结束。
第三类,把它用在自己真正在乎的事情上。用的过程里能感到边界被顶开了一下,然后停不下来。
两道鸿沟里,第二道比第一道大。第一道只是"听说"和"上手"之间的距离。第二道是"交差"和"被点燃"的距离。交差的人完成一轮就下班了;被点燃的人回家还在想下一步怎么走。
过去说"用 AI"大家容易理解成一种技能:多会几个 prompt,多熟几个工具。这两年我越来越觉得这不是关键。关键是:把它放到你每天睡前都在想的那件事情上。
我妻子心里最沉的是孩子的教育,这个东西就进到了汪汪队认字游戏里。我自己做 AI Infra,心里最沉的是硬件效率和 TCO,这个东西就进到每天那些跑不完的实验里。不用多远,是你自己真的在乎的事就好。这时候它会很快告诉你它能做到什么。告诉你的方式不是几篇文章,是你自己亲手做出来了一样以前想都不敢想的东西。
以前百词斩那种产品得一个团队、一家公司做出来给所有人用。现在是一个爸爸一天半给自己儿子做一个他专属的认字游戏。这不是同一类东西,是两种不同的世界。
先找到你真正在乎的那件事。剩下的路会自己长出来。
---
## 参考资料
- [2016 秋新教材:一年级先学汉字再学拼音(新浪)](https://news.sina.cn/2016-08-25/detail-ifxvixsh6587992.d.html)
- [先识字后学拼音,小学语文教改回归教育规律(央广网)](http://edu.cnr.cn/list/20160826/t20160826_523087371.shtml)
- [新版小学一年级语文教材识字量减少,拼音学习向后排(中国新闻网)](https://www.chinanews.com.cn/m/gn/2016/09-01/7990445.shtml)
- [汉语儿童识字的心理机制及其给教育的启示(华东师大学报)](https://xbjk.ecnu.edu.cn/EN/article/downloadArticleFile.do?attachType=PDF&id=10548)
- [3-6 岁儿童学习与发展指南(UNICEF 归档版 PDF)](https://www.unicef.cn/media/8456/file/%E3%80%8A3---6%E5%B2%81%E5%84%BF%E7%AB%A5%E5%AD%A6%E4%B9%A0%E4%B8%8E%E5%8F%91%E5%B1%95%E6%8C%87%E5%8D%97%E3%80%8B.pdf)
- [识字越早越多孩子越聪明?脑科学专家和牛校老师谈识字(腾讯新闻)](https://news.qq.com/rain/a/20210208A044U700)
- [Leitner system — Wikipedia](https://en.wikipedia.org/wiki/Leitner_system)
- [A short & sweet guide to the Leitner system(Goodnotes 博客)](https://www.goodnotes.com/blog/leitner-system)
- [Patterns in Natural Language Data — A Paw Patrol Analysis(Udig)](https://www.udig.com/insights/blog/patterns-natural-language-data-paw-patrol)
- [汪汪队立大功(维基百科 中文)](https://zh.wikipedia.org/zh-hans/%E6%B1%AA%E6%B1%AA%E9%9A%8A%E7%AB%8B%E5%A4%A7%E5%8A%9F)
---
### 聊聊大模型定价:芯片锁死了供给,剩下的都是商业哲学
- URL: https://guanjiawei.ai/zh/blog/llm-pricing-no-silver-bullet
- English: https://guanjiawei.ai/en/blog/llm-pricing-no-silver-bullet
- Published: 2026-04-22
- Tags: AI, 大模型, 定价, 商业模式, 思考
最近跟几个模型公司的朋友聊天,发现谁都在为定价的事头疼。
## 先回到经济学课本
价格在经济学里本职就是个供需调节器。东西贵了,需求降、供给升,最后成交量变小;东西便宜,反过来。来回拉扯几轮,市场摸到一个均衡点:没人想再涨,也没人想再降。
大模型这件事的奇怪之处在于,两边都不按这个套路出牌。
## 供给被芯片管制锁死了
国内市场对模型的需求两极分化:好模型的需求大得离谱,体量小一点的模型几乎没人用。背后的拽力主要是 coding——编程一活,智能体跟着活,工具调用和长链思考这些能力对最顶尖模型的依赖非常重,跟过去那种"chat API 大家都能用"的格局完全不一样。
但供给跟不上。
最顶尖的推理需要英伟达 Hopper(H100/H200)或更新的 Blackwell(B200/B300)。这批芯片现在的状况是:B200 和 B300 直接被美国禁运;H200 在 [2026 年 1 月通过新规](https://www.cfr.org/articles/new-ai-chip-export-policy-china-strategically-incoherent-and-unenforceable)部分放开,但要交 25% 出口税,且总量被锁在历史出货量的一半。国内备案审批这关也卡得很严,[今年早些时候深圳海关一度直接拒绝 H200 报关](https://www.tomshardware.com/tech-industry/chinese-customs-told-to-block-h200-imports-report-claims-directive-would-effectively-ban-the-nvidia-ai-chip-from-china)。
国产替代这条路也快不起来。华为最强的 Ascend 910C [今年的目标产能是 60 万片](https://www.bloomberg.com/news/articles/2025-09-29/huawei-to-double-output-of-top-ai-chip-as-nvidia-wavers-in-china),看起来不少。但 [HBM 才是真正的瓶颈](https://newsletter.semianalysis.com/p/huawei-ascend-production-ramp)——长鑫的 HBM 产能只够最终封装大约 25 到 30 万片 910C。新一代国产芯片基本要等 2027 年才会规模化交付。半导体的产能爬坡是慢功夫,靠技术突破和合资签字都加不了速。
这就出问题了。你哪怕把价格涨一倍、十倍,市场上也变不出更多的 B300。**供给在这个市场上几乎没什么弹性。**
短期能动的只有两层:模型层让推理更便宜更快,infra 层让卡的互联和调度更高效。这两件事都在做,效果也立竿见影——[过去三年大模型推理的单 token 成本从 20 美元/百万 token 跌到 0.4 美元/百万 token,差不多 1000 倍](https://a16z.com/llmflation-llm-inference-cost/)。但要注意,这是供给曲线整体往下平移,不是供给弹性变好。技术突破是它发生就发生,跟你愿意付多少钱没关系。
## 需求被切成了三层完全不一样的形状
需求这一边更有意思。
**最顶尖的那批人几乎没有价格弹性。** 如果你的模型确实能解决他们解决不了的问题,贵 10% 完全无所谓。这跟当年 GPT-4 时代很像——那一小撮真正在用 AI 重构工作流的人,关心的是边界,不是单价。Seedance 2.0 是个挺典型的例子,[每秒大约 1 块钱](https://technode.com/2026/03/05/bytedances-seedance-2-0-video-model-costs-about-0-14-per-second/),听起来不便宜。但对一个原本一条精良视频要花上万元的商业用户,这个价格根本无所谓——一秒涨到一块五还是降到八毛,他无感。
**最不重度的那批人极其敏感。** 中国互联网过去培养出的习惯是先免费看看再说。这一层人原本可能是 [DeepSeek 那个白菜价 API](https://api-docs.deepseek.com/quick_start/pricing/)(输入 0.27 美元/百万 token、输出 1.10 美元/百万 token)的客户,几十块钱够他们玩好几个月。在他们眼里 9 块 9 的会员、第一批送 token 的活动都值得花一晚上去研究怎么最划算。这一层是真敏感。
**真正难定价的是中间那一层。** 重度的编程工程师、研究员、智能体折腾者。他们在乎价格,但更在乎单位时间产出的价值。在这一层定价就变得 tricky 起来,也正是这一层把 Coding Plan 这个争议拉了出来。
## Coding Plan 是不是个伪命题
最近反复在朋友圈里听到一种观点:Coding Plan 就不应该存在。
这个观点不是没有道理。理由是:模型的成本就是 token 的成本,跟你包不包月没关系,本质上跟用电是一回事。然后实际操作里也确实出过不少幺蛾子——有些公司提供 Coding Plan,承诺给你的额度根本服务不过来,5 小时一周期里一半时间连不上、剩下时间限速,所谓"用完了额度"只是一种欺诈式体验。
听到这个讨论的时候我有点恍惚,因为这个争论太眼熟了。它就是当年平台经济里"会员制 vs 抽佣制"那场吵了好几年的老题,换了个壳。
我的结论跟当年差不多:两种都有它的存在价值。
Coding Plan 的好处不是给模型公司省事,是给购买方省心。注意,**用户不一定是顾客**——尤其在 to B 场景里,员工是用户,企业是顾客。一个企业要给 100 个工程师配 AI 编程助手,如果按 token 计费,光是预算管理就能折腾死财务和 IT。给每人配个固定额度的 Coding Plan,相当于把 token 计费这层不确定性彻底封装掉了,对企业是一个 hard budget 的硬约束。这才是 Coding Plan 真正解决的问题:不是定价,是不确定性管理。
想想看,这正是 Costco 模式的本质。[Costco 的会员费贡献了它差不多三分之二的净营业利润](https://strategycapstone.org/costco-business-model/),门店本身基本平进平出。但会员制带来的是另一种东西:它筛出了那批高频复购、高客单的核心用户,把"决定来不来"这件事提前在年初一次性做完了,省掉了后续每次购买的决策成本。Coding Plan 在 to B 场景里干的就是这件事。
## Anthropic 和 OpenAI 是两套商业哲学
回头看 Coding Plan 这个产品的演化,挺有意思。
ChatGPT 第一天就同时上了 API 和会员两条线。但当年的 ChatGPT Plus,重点不是限额包月,而是"你充会员就能用更好的模型"——它是一种 c 端权益型会员,限额只是顺手做的限速。真正把 Coding Plan 这个名字立起来的是 Anthropic,跟着 Claude Code 这个产品走的,[到 2026 年 2 月 Claude Code 单独的年化收入已经做到了 25 亿美元](https://stormy.ai/blog/claude-code-gtm-strategy-anthropic-revenue-2026)。
这背后是 Anthropic 跟 OpenAI 截然不同的两套商业逻辑。
Anthropic 走的是 target——瞄准最重度、付费意愿最强、粘性最高的那批用户,把模型质量推到顶。商业模式很像 Costco:靠会员费而不是单笔交易赚钱,把人筛进来之后用极强的产品体验把人锁住。这群人就是编程开发者。所以你会看到 [Anthropic 在 2026 年 4 月的 ARR 已经做到 300 亿美元,首次超过 OpenAI 的 250 亿](https://www.the-ai-corner.com/p/anthropic-30b-arr-passed-openai-revenue-2026),80% 收入来自企业。
OpenAI 走的是 coverage——广覆盖。[ChatGPT 周活已经超过 9 亿](https://techcrunch.com/2026/02/27/chatgpt-reaches-900m-weekly-active-users/),多模态什么都做。c 端起家的逻辑决定了它的会员对应的是更广义的"功能使用权",而不是 token 包额度。这两套思路在过去一年长成了完全不同的形态。
而当 Coding Plan 这种瞄准重度用户的模式真的跑通之后,问题就来了:用户太重度了,重度到 Anthropic 自己也供不起。今年 4 月 4 日 Anthropic 正式 [封禁了 Claude Pro 和 Max 订阅在 OpenClaw 这类第三方 agent 框架里的使用](https://thenextweb.com/news/anthropic-openclaw-claude-subscription-ban-cost),理由很直白:subscriptions weren't built for the usage patterns of these third-party tools。当时数据估计有 13.5 万个 OpenClaw 实例在跑,订阅价和等量 API 费用之间差了 5 倍以上。这相当于一群人在用 Anthropic 的钱办 Anthropic 不愿意办的事,被切是迟早的。
国内某些原本对标 OpenAI 的公司也开始往 Anthropic 这个方向转。智谱在过去半年里 [把 GLM Coding Plan 的价格在 2 月和 4 月连涨了两次](https://www.trendforce.com/news/2026/02/16/news-rising-costs-and-demand-drive-chinas-llm-price-jump-zhipu-glm%E2%80%915-hikes-30-in-first-2026-increase/),订阅整体涨了 30% 到 60%,企业 API 涨幅 67% 到 100%。这不是它单纯想多收钱,是供给真的吃紧到了不得不调价的程度。
## 所以呢
把上面这些事拼起来,能得出几个不太"性感"但比较扎实的判断:
**供给端短期内不可能有弹性。** 涨价是趋势。模型公司能做的事是把模型变小、把推理变快、把 infra 变厚,这些都是把供给曲线整体往下推。但这跟"涨价能换更多供给"是两件事。
**需求端的三层分化让"统一定价"变得不可能。** 最顶尖的人不在乎贵,最浅尝的人不接受任何收费。中间那一层是真正在博弈的,他们又被分成了两类付费场景:自己花钱的散客和企业付钱的员工。前者更适合按量付费,后者更适合 Coding Plan。
**两种模式不是你死我活,是各司其职。** 喊"Coding Plan 应该消失"的人,其实是把企业场景里的不确定性管理低估了。喊"按量付费才叫真本事"的人,则是把散客场景里"看了价格表就退订"那种本能反应低估了。
要做到普惠 AGI,Coding Plan 这种模式跑不通——一个人吃掉一百个人的算力,再普惠也补贴不起。要做到极致体验,按量付费就拢不住企业——不是钱的问题,是预算管理的问题。这两条路任何一家想同时走通几乎不可能,所以才有了 Anthropic 和 OpenAI 这种程度的分化。
我现在看大模型公司的定价,跟看零售业看 Costco 和沃尔玛差不多——没什么对错,只是哲学不同。哪种路走到底,取决于公司想抓哪一类人,以及在那一类人身上能不能持续把价值做厚。
---
## 参考资料
- [Anthropic 在 2026 年 4 月 ARR 突破 300 亿美元,首次超过 OpenAI](https://www.the-ai-corner.com/p/anthropic-30b-arr-passed-openai-revenue-2026)
- [Claude Code 单独 ARR 在 2026 年 2 月达到 25 亿美元(Stormy AI)](https://stormy.ai/blog/claude-code-gtm-strategy-anthropic-revenue-2026)
- [Claude Code Pro / Max 5x / Max 20x 定价说明](https://www.howdoiuseai.com/blog/2026-04-16-claude-code-pricing-2026-plans-costs-and-free-tier)
- [Anthropic 在 2026 年 4 月切断 OpenClaw 等第三方框架对订阅的使用(TNW)](https://thenextweb.com/news/anthropic-openclaw-claude-subscription-ban-cost)
- [美国 2026 年 1 月新规:H200 出口中国加征 25% 税,B200/B300 仍禁运(CFR)](https://www.cfr.org/articles/new-ai-chip-export-policy-china-strategically-incoherent-and-unenforceable)
- [中国海关一度要求物流公司停止 H200 报关(Tom's Hardware)](https://www.tomshardware.com/tech-industry/chinese-customs-told-to-block-h200-imports-report-claims-directive-would-effectively-ban-the-nvidia-ai-chip-from-china)
- [华为 Ascend 910C 2026 年目标产能 60 万片(Bloomberg)](https://www.bloomberg.com/news/articles/2025-09-29/huawei-to-double-output-of-top-ai-chip-as-nvidia-wavers-in-china)
- [HBM 才是华为 Ascend 真正的瓶颈(SemiAnalysis)](https://newsletter.semianalysis.com/p/huawei-ascend-production-ramp)
- [LLMflation:3 年内大模型推理成本下降约 1000 倍(a16z)](https://a16z.com/llmflation-llm-inference-cost/)
- [DeepSeek 官方 API 定价](https://api-docs.deepseek.com/quick_start/pricing/)
- [Seedance 2.0 大约 1 元人民币/秒(TechNode)](https://technode.com/2026/03/05/bytedances-seedance-2-0-video-model-costs-about-0-14-per-second/)
- [ChatGPT 周活在 2026 年 2 月突破 9 亿(TechCrunch)](https://techcrunch.com/2026/02/27/chatgpt-reaches-900m-weekly-active-users/)
- [智谱 GLM-5 在 2026 年 2 月与 4 月两次调价(TrendForce)](https://www.trendforce.com/news/2026/02/16/news-rising-costs-and-demand-drive-chinas-llm-price-jump-zhipu-glm%E2%80%915-hikes-30-in-first-2026-increase/)
- [Costco 商业模式:会员费贡献了大部分营业利润(Strategy Capstone)](https://strategycapstone.org/costco-business-model/)
---
### 一个人并行跑六个 agent:AI coding 改了什么,没改什么
- URL: https://guanjiawei.ai/zh/blog/ai-coding-four-dimensions
- English: https://guanjiawei.ai/en/blog/ai-coding-four-dimensions
- Published: 2026-04-21
- Tags: AI, Claude Code, Vibe Coding, 工作方法, 思考
关于 vibe coding 的争议一直没停。一边把它当许愿池,什么活都扔进去;另一边直接贴"垃圾代码工厂"的标签。两种我都不能接受,工具不是信仰问题。
与其站队,不如讲讲它到底改变了哪些维度,又没改变哪些维度。
## 两个方向相反的信号
先看最近两件事。
一个是 Karpathy 本人。2025 年 2 月他在 X 上抛出 vibe coding 这个说法——"完全交给 vibes、拥抱指数、甚至忘掉代码本身的存在"——当年就被 Collins 英语词典选成了年度词。然后 2026 年 2 月,他自己跳出来说这个词已经过时了,现在他用的说法是 agentic engineering:99% 的时间你不是在敲代码,是在编排 agent 并做 oversight;engineering 是为了强调这事有门槛、有手艺。
另一个是 Amazon。2026 年 3 月 5 日他们主站宕机 6 小时,追因发现又是 AI 辅助代码引发的连锁故障。上一次是 2025 年 12 月,自研的 AI 编程工具 Kiro 把一个 AWS Cost Explorer 环境删了重建,在中国区触发了 13 小时故障。内部会之后 Amazon 下了一条新规:初级和中级工程师写的 AI 辅助代码,必须由一位 senior 工程师签字才能进生产。
看上去方向相反,其实是同一件事。Karpathy 把词从"体验"(vibe)换到了"你得负责"(oversight + engineering),Amazon 直接把"你得负责"写进了章程。一个是观念层面的转身,一个是制度层面的落地。
真正值得想的不是谁对谁错,是它改变了什么、没改变什么。四件事讲清楚,大多数争议都会自动安静下来。
## 宽度:一个人的工作面被拉开了
以前一个人一天能做的事很有限。你的领域、技能、手头能同时推的项目数,都被"你是一个人"这件事实压着。
现在 coding agent 能接长程任务,工作面就被拉开了。
举个我最近几周的日常。主线是一个叫 Aima 的 AI 硬件产品,agent 写新功能、占机器跑 UAT,我 review 测试结果再给下一轮意见。这是条标准的串行链,但每个节点之间我都有大量等待。空档里就可以启动第二条线:Aima 背后的云服务最近有不少稳定性问题,另一个 agent 去查根因、补架构洞、再进 UAT 循环。第三条是研究分支,边端硬件里还没被榨出来的推理性能,算子要做 AB 测试、编译、跑准确率,成果不保证,但 token 够用就让它一直跑。第四条是 agent 框架本身的效率研究,打包成独立运行时扔机器上跑,另起一个 agent 做数据分析。加上个人主页的小改动,以及周末花一天多给儿子做的认字小游戏——他最近在学校因为不认字拿不到小红花——一共六条线同时在跑。
听起来像吹牛。但实际体感不是因为我有多能扛,是因为每条线里"等 agent"的时间本来就很长。这套模式在 2026 年已经有了通用名字:parallel agent coding,git worktree 做隔离是主流基础设施,大多数人的物理上限在 5 到 7 条同时跑,再多会被 review 和合并成本吃掉。
这事有一个不太被讨论的副作用:它在悄悄改变一个人的"职能身份"。我过去一直觉得自己是产品经理兼半个开发,现在这个身份在往外长,同时包含产品、运维、研究甚至家庭教育。不是我变成了超人,是工具把单人能覆盖的宽度抬起来了。
## 速度:天花板被挪开了,但"快"本身不再是优势
过去做一个东西有物理上限。你打字再快一天也就那么多行,脑子再快也只有两只手。
AI 把这个上限挪开了。最能感到的场景是拿 demo:以前黑客马拉松 48 小时能拿出一个能看的东西就算好成绩,现在同类事情以"天"为单位拿出草稿级 demo 是常态。不是说它打磨好了,是它能被看到、能被玩、能被用来讨论下一步。
但有个挺别扭的副作用:当所有人都能"快"的时候,快本身就不再是优势了。
过去动作快是加分项,慢的会被讨论。现在动作快是入场券,慢的直接出局,而快也不会再被单独表扬。这在组织里是个结构性变化,很多以"速度"为核心激励的团队会卡住:奖励发不下去,绩效评估全是满分,焦虑感反而在上升。
更麻烦的问题藏在下一层:快了之后,质量怎么办。
## 质量:从工作问题变成预算问题
质量和速度的矛盾从来不是 AI 特有的问题,项目管理课本第一章就是它。但 AI 确实把这件事的形态换了。以前质量是"你招多少人、流程多严、review 多细"的工作问题,现在它更像一个预算问题:你愿意给它多少 token,它就能做到什么级别。
极速:写完合入上线,3 小时搞定。
稍微严肃:让 agent 做一轮代码 review,再做一轮设计层面的 review,有问题改完再来。
做得像样:合入前过单元、集成、UAT。UAT 这一关我用得越多越觉得绕不过去,很多问题是链条级的,不真正模拟使用流程就看不见。好处是 agent 现在能自动化跑 UAT,能操作、复现、给 trace,你只要核验结果。
再严一点:接 CI/CD,加 smoke test,推 staging,在 staging 上再做一次 UAT,全绿了再上生产。
每加一层,时间多一倍,token 多几倍。功能本身 3 小时能完成的,走完全链路 12 小时打底,token 30 倍起。
30 倍看起来像浪费,其实不是。CodeRabbit 2025 年底对 470 个 GitHub 开源 PR 做过对比分析,AI 共同生成的代码里 bug 数量比人类代码多约 1.7 倍,在最容易引发下游事故的那类逻辑和正确性问题上高出 75%。
换句话说,agent 第一轮输出的统计平均,就是比人差。你不往质量上多烧 token,差距就原样带进生产。但反过来,只要你真的肯跑几轮 review、做一次像样的 UAT,我的体感是它能追平、有时候还更稳——不是因为 agent 变聪明了,是它有近乎无限的耐心做重复核对,而这恰好是人类最容易走神的环节。
所以在我这里,质量不是"要不要用 AI"的问题,是"给它留多少预算"的问题。
## 责任:最有争议,也最没得商量
前面三条都在讲怎么用好工具。第四条是用完之后账算在谁头上。
最常见的误用是把责任甩给 AI。功能挂了说"AI 写的",决定做坏了说"模型建议的"。这个框架一开始就是歪的。
AI 不是责任主体。你赢了它拿不走工资奖金,输了它也赔不了,承担不了法律后果,也没有"补救"这个概念。签字盖章的永远是人。
2026 年那两件事其实都在说同一件事:Amazon 的新规不是"禁用 AI",是"AI 参与可以,但有一位人类 senior 必须背书";与此同时很多开源社区也在更新贡献指南,明确 AI 不被视为 co-author,提交者对每一行代码负全责。两边逻辑一模一样——AI 能参与,签字的是人。
这个共识一旦讲清楚,很多关于 AI 的焦虑就会自动降温。
组织层面为什么对 vibe coding 反应这么激烈?因为它冲的是三个传统管理假设:职能分工按"单点深挖"切,速度默认越快越好,质量靠人力 review 把关。agent 一上这三条都动摇了——一个人横跨好几个领域,速度远超原有审核节奏,review 通道瞬间被淹。组织的慌很合理,但解法不是禁用,是把"责任主体是人"讲透,然后围绕这一条重新设计分工、速度门槛和质量关。
Karpathy 把 vibe coding 换成 agentic engineering 这个动作我是认的。它把重心从"体验好不好"挪回了"你是那个负责的工程师"。你不是在享受 vibes,你在 orchestrate,在 oversight。
## 写到这里
AI coding 不是一件需要站队的事。
说它万能,或者说它有毒,都跳过了太多细节。这个工具真正做的事,是把四件本来紧紧耦合的东西拆开了:宽度变成杠杆,速度变成入场券,质量变成预算,责任没动。
前三条决定你用得好不好。第四条决定别人敢不敢跟你合作。
---
## 参考资料
- [Andrej Karpathy 最早定义 vibe coding 的 X 推文(2025 年 2 月)](https://x.com/karpathy/status/1886192184808149383)
- [Vibe coding — Wikipedia(Collins 年度词、定义沿革)](https://en.wikipedia.org/wiki/Vibe_coding)
- [Vibe Coding Is Passé:Karpathy 转向 agentic engineering(The New Stack)](https://thenewstack.io/vibe-coding-is-passe/)
- [Not All AI-assisted Programming Is Vibe Coding(Simon Willison)](https://simonwillison.net/2025/Mar/19/vibe-coding/)
- [Amazon 要求 AI 辅助代码必须由 senior 工程师签字(Awesome Agents)](https://awesomeagents.ai/news/amazon-ai-code-review-outages-senior-approval/)
- [Amazon's AI Coding Tools Broke Production(aiadopters.club)](https://aiadopters.club/p/amazons-ai-coding-tools-broke-production)
- [State of AI vs. Human Code Generation Report(CodeRabbit)](https://www.coderabbit.ai/blog/state-of-ai-vs-human-code-generation-report)
- [2025 Was the Year of AI Speed, 2026 Will Be the Year of AI Quality(CodeRabbit)](https://www.coderabbit.ai/blog/2025-was-the-year-of-ai-speed-2026-will-be-the-year-of-ai-quality)
- [Multi-Agent AI Coding Workflow: Git Worktrees That Scale](https://blog.appxlab.io/2026/03/31/multi-agent-ai-coding-workflow-git-worktrees/)
- [AI Governance in 2026: Who Bears the Risk?(Telecom Review)](https://telecomreview.com/articles/reports-and-coverage/27180-ai-governance-in-2026-who-bears-the-risk/)
---
### GitHub 小红书化之后:做产品这件事反而更孤独了
- URL: https://guanjiawei.ai/zh/blog/product-middle-is-lonely
- English: https://guanjiawei.ai/en/blog/product-middle-is-lonely
- Published: 2026-04-21
- Tags: AI, 产品, Vibe Coding, 思考
最近做产品有个不太一样的感受,记一下。
## 点赞是秒级的,产品不是
自从 vibe coding 这套东西出来,GitHub 上短时间内窜起来的项目特别多。两天拿几万 star 已经常见,Collins 词典 2025 年把 vibe coding 选成年度词之后这个节奏也没慢下来,Y Combinator 2025 冬季一批里四分之一的项目代码库据说有 95% 都是 AI 生成的,整个开源生态的"发笔记"味越来越重。
这种状态越来越像小红书。一个好玩的 idea、一点有意思的切面,就能吸引人路过、点个 spark、下下来尝个鲜。做法也被动地变成了"发笔记"——有想法就发,火了皆大欢喜,没火就换一个。
但我这段时间越来越明白一件事:给 idea 点赞是秒级的事,把一个想法做成能让人用起来的产品,依然不是。中间那段说起来不性感、讲给人听也不好懂的路,vibe coding 没怎么缩短。
## 基础设施型产品的硬门槛
我们做的 Aima 主业是端侧 AI 硬件,手里还有些围绕模型推理性能、边缘设备、agent 运行时这类偏底层的东西。这种产品对"稳定"的要求比我以前做过的任何东西都高。
原因挺简单。你做一个营销小游戏,跑崩一次用户最多骂一句;你做一个 IM、一个网关、一个推理引擎,跑崩一次可能意味着整条上游业务被拖死。这类东西又最容易被高并发、高频调用拍到墙上——Facebook Chat 当年上线后积累到 1.75 亿活跃用户,channel server 反复在 CPU 和带宽之间被逼到临界点,那种"基础能力的折磨"是每一个做 infra 的人都要经历的。
然后还得经得起挑剔。新意得够新,让用户觉得跟已有的东西不一样。稳定和新意是两类完全不同的能力:稳定要求你对细节偏执,新意要求你对通用方案不满意。一个产品两条都要过关,本身就是概率很低的事。
vibe coding 能帮你把 demo 推到"能跑"的状态,这件事以前要几周,现在几小时。但从"能跑"到"经得起被人日常用、被人反复挑刺"之间那段落差,这一波工具升级没替你补上。
## 中段那条看不见的路
产品真正折磨人的地方,往往是 PoC 验证之后那一大段。
初期点子被验证,有几个人说"这个有意思",这段是高光。你有热情、有反馈、有分享欲。然后进入中段:把它做扎实,覆盖边缘情况,灌真实数据,接真实系统,盯稳定性。这一段没什么可分享的,每天干的事都是"又堵了一个窟窿",既没朋友圈素材,也没点赞。
你还要反复跟人解释自己在做什么。我这几周试过好几次跟朋友描述手上在做的东西,讲完对方说"哦,那不就是 XXX 吗"。XXX 跟我做的完全不是一回事,但对方的坐标系里没有那个东西的位置,就只好找一个最近的把你塞进去。这种无奈没法避免。
更难的是,中段你经常要自己跟自己打架。做宽一点还是做深一点,上还是不上这个功能,收一刀还是再试一下,很多决定没有明确的外部信号帮你做,全靠自己扛。一个东西只要是"新"的就会有大量问题;你修掉一个问题,就又改出新的问题。这个循环自己是停不下来的。
再加上风险:别人做一个类似的出来怎么办?资源被抽走怎么办?团队动摇怎么办?很少有人能持续坚定不动摇。坚定的那批人事后往往都被描述成"偏执"。
## 翻一翻那些熬出来的人
所以你去翻历史上熬出好产品的人,会发现一件一致的事:他们都在某件事情上特别拧。
乔布斯最容易想起来。1985 年他被自己请来的 CEO John Sculley 和董事会联手从 Macintosh 部门拿下,那年 5 月他还试过趁 Sculley 出差去中国期间发动一次董事会政变,被 Jean-Louis Gassée 反水告密之后彻底出局,9 月正式辞职。之后十二年他在 NeXT 和 Pixar 两边熬着,回到苹果已经 1997 年。这期间他被外界反复挑战"你又不是工程师、你又不会写代码、凭什么你说了算",2015 年那部《乔布斯》电影里 Wozniak 那句"你既不写代码,也不是设计师"的戏剧台词,其实是把那十几年的质疑声压成了一句。拧的人能扛下这些,不拧的早走了。
张小龙是另一个。他做邮件客户端 Foxmail 起家,1998 年前后已经有 200 万用户,靠一己之力撑了很多年,中间经历过博大收购、团队动荡、被质疑"一个不会商业化的人"。2005 年进腾讯接手 QQ 邮箱,头两年基本是失败状态:笨重、迟缓、没人用,他在内部扛了两年才把"超大附件"这个小点凿出来,把邮箱从死线上拉回来。微信也一样,灵感来自一个叫 Kik 的手机应用,他给 Pony 写了一封邮件提了这个想法,然后在腾讯内部跟 QQ 团队、跟无线团队反复博弈,才把它做出来。他自己和身边人都承认他性格上某种程度的"独裁"与孤僻。也正是这种拧,才能顶住各种"为什么不做得跟 XXX 一样"的声音。
两个人放一起看,有一种共同气质:对某件事不听劝、不讲道理、持续看下去。外人常觉得"这有什么希望啊",他们就能继续看。
## Vibe coding 没改变的那部分
vibe coding 的真实影响其实挺清楚。
它把生命周期每个阶段都压短了。以前做一个 demo 要两周,现在一个下午;以前一轮功能迭代要一个 sprint,现在几小时;以前一个人覆盖不了的栈,现在一个人能横着跑。
但"完整的产品生命周期"这个东西没被替换掉。PoC、打磨、稳定性、用户反馈、迭代、质量、坚持——这套流程还在,只是每个环节缩短。我自己的体感是快的地方快得很,慢的地方没怎么变。
中段那段最折磨的,恰恰是"变化最不明显"的那部分。打磨一个边界条件不是 vibe 能解决的,它要你反复构造场景;稳定性不是几小时能出的,它要跑在真实流量下面;质量更不是一句 prompt 能顶住的。CodeRabbit 去年对 470 个 GitHub 开源 PR 的对照研究显示,AI 共同生成的代码在逻辑和正确性上的 bug 数比人类代码高出约 75%,这笔账账面上 vibe 帮不了你,只能慢慢磨。
所以这段时间我越来越清楚:工具变快了,难的那部分没少,只是被衬得更显眼。以前整体都慢,中段慢没人觉得特别慢;现在前两段嗖嗖过去,中段那种反复磨、反复跟自己较劲、反复没有反馈的质感就被放大了。
## 我自己的体会
说点个人的。过去的职业经历里,我真正独立负责产品的机会不多。最早做战略,后来转一些偏技术的产品岗,再后来做生态、做 BD、做销售。这些岗位做多了会发现,反馈速度差别很大。
销售反馈最快。你见客户,聊两小时,走出门你基本就知道有没有机会、对方在乎什么、下一个动作该是什么。坏消息也来得快,不成就是不成,不会拖你。这种节奏很上头,但副作用是:你会习惯短反馈,一段时间没反馈就开始焦虑。
真到自己做产品,才发现这跟销售是两种生活方式。初期几天可能还有兴奋反馈,之后进入长期的"没声音"阶段。这段时间里大量的工作看起来没产出——其实是在打地基、是在对用户痛点做更细的拆解、是在等一轮一轮的实验跑出来。外部没有人给你每小时的反馈;家里人问你在忙什么,也没法一句话说清。
我之前低估了这种"反馈稀薄"状态对一个人的消耗。以前我以为产品人的孤独感是少数"大师"的专属,现在我更相信那是这个工种的底色,只是大多数人没扛过这段,所以好产品本来就不多。顺带也解释了为什么"好产品经理"这个词这么稀缺:不是大家没想法,是大多数人没熬过中段。
## 所以
我觉得 vibe coding 真正带来的好处,不是让做产品变得容易,是让"开工"变得容易。以前想做一个东西,光搭环境就劝退一半人,现在这一半劝退没了。
但从"开工"到"做成"这段路,它没替你走。决定谁能做成的,仍然是那几样老东西:有没有一个自己真的在乎的方向、能不能忍住别人看不见自己在干嘛的那段、愿不愿意反复去修同一个地方。这些听起来俗,俗得对。
今天写这些不是劝人去当偏执狂。是提醒自己也提醒同类一句:你手上的那个产品如果迟迟没有外部反馈,不是你做错了,是这段本来就长。能继续走,就继续走。
---
## 参考资料
- [Vibe coding — Wikipedia(Collins 年度词、定义沿革)](https://en.wikipedia.org/wiki/Vibe_coding)
- [OpenClaw 爆火与 YC Winter 2025 数据综述(Vibecoding.app)](https://vibecoding.app/blog/openclaw-ultimate-guide)
- [Chat Stability and Scalability — Facebook Engineering](https://engineering.fb.com/2009/02/17/web/chat-stability-and-scalability/)
- [Steve Jobs — Wikipedia(1985 年离开苹果的时间线)](https://en.wikipedia.org/wiki/Steve_Jobs)
- [Why did Apple's board fire Steve Jobs in 1985? — Corporate Governance Institute](https://www.thecorporategovernanceinstitute.com/insights/case-studies/why-did-apples-board-fire-steve-jobs-in-1985/)
- [一文读懂微信之父张小龙:失败天才、颠覆者、独裁者、人性操控师(知乎)](https://zhuanlan.zhihu.com/p/91238014)
- [这 55 条思考,解释了为什么做出微信的是张小龙(腾讯新闻)](https://news.qq.com/rain/a/20220801A0262400)
- [State of AI vs. Human Code Generation Report — CodeRabbit](https://www.coderabbit.ai/blog/state-of-ai-vs-human-code-generation-report)
---
### 被郑丽文圈粉,新一代的领导应该什么样?
- URL: https://guanjiawei.ai/zh/blog/zheng-liwen-hundred-schools
- English: https://guanjiawei.ai/en/blog/zheng-liwen-hundred-schools
- Published: 2026-04-20
- Tags: 思考, 国际形势, 数字身份
最近被郑丽文圈粉了。
郑丽文就是新的国民党主席,2025 年 10 月 18 日以 50.15% 的票数当选,是国民党第二位女性主席,也是第一位民进党出身的党主席。她当选之后立场很鲜明:回到九二共识,反对台独,用和平的方式推动两岸交流。
上周 4 月 7 到 12 号,她率团访问大陆,这是国民党主席十年来第一次率团来访。上一次还是 2015 年朱立伦见习近平。她这次跟习近平在人民大会堂会见,规格很高。
这次访问本身就是一件大事。但真正让我有触动的,是她回台湾之后做的事情。
## 她不搞传统访谈
一般的政治人物回来,就是开记者会、跟官媒聊一聊。她不一样。
她开始直播。4 月 16 号晚上跟台湾的网红馆长陈之汉直播连线,聊了两个多小时。从小米汽车聊到台湾青年人才外流,从大陆智能制造水平聊到两岸差距。非常直接,没有套话。
你想想这个画面:一个两岸关注度拉满的政治人物,刚被对岸最高领导人接见过,回来不找主流媒体,跑去跟网红两个人在镜头前唠嗑。
反常识。但又非常自然。
我看了一段,觉得她讲的东西特别有感染力。不是准备好了念一套话,是真的在思辨,真的在说她相信的东西。这种人在政治领域其实不多见。
其实她跟馆长也不是临时搭的伙。2025 年 6 月两人就一起搞过一个"党外在野大联盟",集结不同光谱的人对话。这次直播算是顺其自然。
## 她在承担的风险
另外一个让我敬佩的点是风险。
现在推动两岸和平这件事本身是有危险的。美国那边这么多年一直在搞各种各样的事情,间谍、渗透、暗杀,从来没停过。做这种事情上不了台面,但一直在做。她作为这个问题上最鲜明的推动者,本身就是一个被盯上的人。
她愿意站出来,积极促成这次访问,回来继续扩大成果,这个不容易。人身安全是真实的风险,不是嘴上说说。
## 见雷军那段特别说明问题
直播里她讲见雷军那段我印象很深。
她说这次行程最后一天去北京小米汽车超级工厂,雷军亲自接待,试了 YU7,还收了一台小米手机。她说自己是雷军的粉丝,老公更是。家里全是小米的东西,杯子、手机、手环、背包、平板,全是。雷军讲解小米杯子一套 29.9 的时候,她笑着说"我们家里都是小米的东西"。
[这段特别说明一件事](/blog/digital-identity-biggest-leverage)。
一个对岸最高领导人刚接见过的政治人物,回来主动讲见到雷军很开心,因为她是粉丝。雷军是什么人?一个企业家,一个每天在抖音、微博上表达自己的人,一个靠产品和内容持续延伸身份的人。
他在数字世界里构建的这个身份,有这么大的能量:能让一个区域政治上最有影响力的人之一,主动去做粉丝。
反过来也一样。郑丽文为什么能迅速产生这么大的讨论度?不是靠官方通稿。是靠她自己上直播、跟网红对话、用这种方式把想法直接送到人面前。
这件事让我更确信之前的判断:[数字身份是现在最大的个人杠杆](/blog/digital-identity-biggest-leverage)。不分行业,不分方向。政治人物、企业家、创作者、研究员,谁做得早谁占优。
## 这个时代特别需要政治思想者
到这里我想讲一个更大的事情。
大家天天讲 AI,好像这个技术本身就能解决一切。我越来越觉得不是这样。
这次的 AI 在改变经济学,经济学底层逻辑和生产公式在发生巨变。历史上每一次这种巨变,都会带来一次社会的重新洗牌。权力分配会变,财富分配会变,甚至国与国之间会打仗。
问题是,技术本身是中性的。全世界的人用的都是差不多的 AI,门槛没有那么高。但你去看:硅谷的工程师在稳定的环境里琢磨怎么用 Claude 提升研究效率;非洲有的地方连水都喝不上;乌克兰天天担心导弹飞过来。
为什么?
不是因为他们拿不到技术。是因为组织方式、分配方式、政治结构完全不同。
所以真正对一个社会、一个世界产生最大影响的,从来都不只是科学家。科学家很重要,但不是唯一一条叙事。金(Martin Luther King)讲 I have a dream 推动的是种族平权,甘地搞非暴力不合作,邓公带中国从一穷二白走向另一种状态。这些人做的事情都是在改变人的组织方式、分配方式、关系方式。
这个事情的重要性,在现在这个时代尤其高。
## 礼崩乐坏的时代
说白了,现在这个世界正在进入一个新的阶段。
我跟朋友讲,这个格局非常像春秋末期往战国过渡的那个时间点。礼崩乐坏。
以前的世界秩序是美国在维护:IMF、联合国、世界银行、文化输出这套东西。不见得公平,但至少大家表面上还讲规则。有点像春秋时期:诸侯要打仗,也得找个由头,得从周王那边讨个名义,得搬出礼乐道德来证明自己师出有名。
特朗普现在做的事情,已经完全不是这样了。
委内瑞拉是一个例子。2026 年 1 月 3 号美军对委内瑞拉境内发动打击,抓了总统马杜罗,关在美国说要按贩毒案审判。转头特朗普就宣布跟委内瑞拉签了"历史性能源协议",他原话是美国以后会"run Venezuela",委内瑞拉的石油利益归美国。委内瑞拉已探明石油储量约 3030 亿桶,是世界最大。
伊朗那边更狠。2026 年 2 月 28 号,美国和以色列联合行动,把伊朗最高领袖哈梅内伊直接击杀了。双方之前没有正式宣战,美国国会也没有授权。想象一下:两个国家关系本来就紧张,但没有进入敌对状态,结果突然一方把另一方的最高领导人给杀了,然后宣称这是一次成功的军事行动。任何一个国家的领导人看到这一幕都会后背发凉。
格陵兰是另一条线。他公开讲不排除动用军事力量从丹麦手里拿格陵兰,还威胁对丹麦加税 25% 逼它交地。2026 年 1 月达沃斯之后他暂时收回,但那个姿态已经摆出来了:我想要,你最好给。
这三件事放在一起,信号很清楚:大国之间不装了,拳头大说了算。道德、规则、程序,统统可以扔掉。
这就是春秋末期的感觉。
## 百家争鸣
但春秋末期还有另一面,叫百家争鸣。
大家稳定安定的时候,思想和新的治理理念其实没有市场,没人需要。但当原有的组织方式开始崩塌,新的经济基础又在以极快的速度诞生,这恰恰是思想必须出现的时候。
现在正是这样。
一面是旧秩序在崩。一面是 AI 带来的新经济基础。两头都在动。
在我看来这个时代需要的不只是科学家,我们需要更多的思想者、政治上的实践者、组织方式的实验者,去探讨什么样的社会组织方式适合这个技术、这个格局、这个现状。
这是郑丽文给我最大的触动。她的做法恰恰是这个时代匹配的方式:直接对话、用直播和网红合作、在镜头前思辨表达。她承担风险推动一件事情,也恰恰是这个时代需要的姿态。
## 形式不必花哨
在传递思想这件事上,现在很容易走一条歪路:总想把形式搞得很花哨,很 fancy,很有创新感。做个短视频、搞个动画、弄个互动装置。这些都很厉害,但不是唯一的方法。
人的话语和文字本身就非常有力量。不管短视频怎么泛滥,这件事不会消失。
郑丽文用的方法就是:坐下来,直播,讲自己看到什么、想到什么、感受如何。没有剪辑、没有滤镜、没有脚本。但几个小时的对话里,她传递的信息量和感染力,超过一百条精心制作的宣传视频。
## 中国现在处在窗口期
回到我们自己。
中国现在在整个世界剧烈震荡的背景下,反而是相对稳定的一块地方。外面打得厉害,里面相对平静,外紧内松。这本身是一个了不起的成就,也是一个很珍贵的窗口期。
在这个窗口期里,其实已经有一批很年轻的从政者在一线做事。县里、村里、区里,出现了一些非常年轻的领导人,在用新的方式做实践、做表达。
但这还远远不够。
春秋的百家争鸣当时不是各走各的、各说各的。是几十个小国家、几百个思想者,在各自的地方做实验,然后汇聚到一起辩论、交流、比较结果。儒家、道家、法家、墨家都是在这种环境里长出来的。现在如果我们只有零散的实践,没有交流和碰撞,百家争鸣起不来。
所以我希望更多的人,不管你是研究员、创业者、政治工作者、地方官员、内容创作者,把自己的想法拿出来,做实验,用数字身份去传播,去找到共鸣和反对意见。
一个人能改变的事情,现在是被放大的。不是说什么都做不了,而是有太多了不起的事情可以试一试。
郑丽文做的不是一个大国战略,是一次访问、几次直播、几场对话。但它真实地改变了很多人的感受和想法。
我们也可以。
---
## 参考资料
1. [郑丽文当选国民党主席](https://cpc.people.com.cn/n1/2025/1020/c64094-40585170.html) — 2025 年 10 月 18 日,以 50.15%(65,122 票)胜选,国民党第二位女性党主席,首位民进党出身党主席
2. [郑丽文率团抵达大陆](https://cpc.people.com.cn/n1/2026/0408/c64387-40697040.html) — 2026 年 4 月 7-12 日"2026 和平之旅",访问江苏、上海、北京
3. [习近平会见郑丽文](http://politics.people.com.cn/n1/2026/0410/c1024-40698997.html) — 2026 年 4 月 10 日北京人民大会堂会见,国共两党领袖时隔近 10 年再次会面(上次为 2015 年朱立伦-习近平)
4. [Taiwan's opposition leader arrives in China for a 'Journey of Peace'](https://www.npr.org/2026/04/07/nx-s1-5776401/taiwan-opposition-arrives-china) — NPR 报道访问行程
5. [The Domestic Politics of Cheng Li-wun's China Trip](https://thediplomat.com/2026/04/the-domestic-politics-of-cheng-li-wuns-china-trip/) — The Diplomat 分析访问的政治意义
6. [郑丽文参观小米工厂雷军亲自接待](https://finance.sina.com.cn/wm/2026-04-12/doc-inhufqsh5641124.shtml) — 2026 年 4 月 12 日访问北京小米汽车超级工厂,试驾 YU7
7. [郑丽文直言雷军粉丝](https://www.sina.cn/news/detail/5288030199089172.html) — 公开表示自己和丈夫都是雷军粉丝,家里全是小米产品
8. [郑丽文与馆长陈之汉直播对谈](https://www.163.com/dy/article/KQNJTT7K05566FM9.html) — 2026 年 4 月 16 日晚两个多小时直播连线,聊小米汽车、台湾青年人才外流、两岸差距
9. [党外在野大联盟成立](https://news.qq.com/rain/a/20250618A011S000) — 2025 年 6 月,郑丽文与馆长陈之汉等人共同组建,集结不同光谱力量对话
10. [美军打击委内瑞拉抓捕马杜罗](https://en.wikipedia.org/wiki/2026_United_States_intervention_in_Venezuela) — 2026 年 1 月 3 日美军对委内瑞拉境内发动打击,抓捕总统马杜罗
11. [Trump Claims 'Historic' Venezuela Oil Deal After Maduro Arrest](https://www.military.com/daily-news/headlines/2026/01/20/trump-claims-historic-venezuela-oil-deal-after-maduro-arrest.html) — Military.com,特朗普宣布接管委内瑞拉石油
12. [Assassination of Ali Khamenei - Wikipedia](https://en.wikipedia.org/wiki/Assassination_of_Ali_Khamenei) — 2026 年 2 月 28 日美以联合行动击杀伊朗最高领袖
13. [U.S. and Israel launch a major attack on Iran](https://www.pbs.org/newshour/world/u-s-and-israel-launch-a-major-attack-on-iran-trump-says-supreme-leader-khamenei-killed) — PBS 报道事件过程
14. [Greenland crisis - Wikipedia](https://en.wikipedia.org/wiki/Greenland_crisis) — 特朗普威胁对丹麦加征 25% 关税,不排除军事手段获取格陵兰
15. [Proposed United States acquisition of Greenland](https://en.wikipedia.org/wiki/Proposed_United_States_acquisition_of_Greenland) — 美国政府对格陵兰主权企图的整体背景
---
### Opus 4.7 上线前后这两天
- URL: https://guanjiawei.ai/zh/blog/parallel-with-agents
- English: https://guanjiawei.ai/en/blog/parallel-with-agents
- Published: 2026-04-17
- Tags: AI, Claude, 大模型, OpenClaw, 性能优化, 思考
昨天半夜 [Anthropic 放出了 Opus 4.7](https://www.anthropic.com/news/claude-opus-4-7)。本来已经躺下准备睡了,消息一出来就没睡成,起来装上试了试。
## 4.7 的体感
没有那种"我原本搞不定的事一次过"的奇迹时刻。手头正好缺一个能被攻下的硬骨头,所以也没法验证。但放到日常工作流里用了一天,几个点我印象挺深。
指令遵循比 4.6 好一截。文档里的要求、提示词里的指令,4.7 更愿意照字面办。Anthropic 官方公告里原话是 "takes the instructions literally"。你切过去用一阵就能感觉到。
之前那种"哈哈搞定了"、结果代码跑不通的情况也少了很多。4.6 动作快,但经常是虚快——太乐观地宣布完成,一跑还是不行。4.7 在交付之前会自己先验一遍。这点它 release note 里写了,"devise ways to verify its own outputs before reporting back"。
还有一个小变化我没预期到。我手边有一个之前用 4.6 加 Codex 来回收敛很多轮的中型项目,切到 4.7 让它过一遍说"看看当初有没有啥坑",它挑出来几个挺严重但大家之前都没意识到的问题,然后就开始改。这种"回头看"的能力提升,从短时间体感看还挺明显的。
顺带说一下,4.7 并不是内部传说中的那个 [Mythos](https://red.anthropic.com/2026/mythos-preview/)。Mythos 被 Anthropic 因为安全顾虑锁在 Project Glasswing 联盟里,只给 Amazon、Apple、Google、Microsoft 这几家内部用。4.7 按官方说法是 "less broadly capable" 的版本,大概率是同代能力树上剪下来的一个更小、更安全的分支。具体怎么训的没公开,只能猜。
但从节奏看,让我有点感慨。[Opus 4.6 是 2 月 5 号发布的](https://www.anthropic.com/news/claude-opus-4-6),4.7 是 4 月 16 号,两个多月一代新模型。这比之前快。上一次有这种"卧槽怎么又来一代"的感觉,还是 2022 年底 ChatGPT 3.5 出来没多久,[23 年 3 月就跟上了 GPT-4](https://en.wikipedia.org/wiki/GPT-4) 的那阵子。
所以一个判断习惯得调一调:不要按"当前模型能做什么"去划问题的边界。你今天绕半天搞不定、以为这事儿没法做的问题,搁三个月,下一代出来同样的方法可能就跑通了。这不是说可以躺平等模型。只是说,卡住了可以先放一放,可以多让它试几次,没必要因为今天搞不定就给这事判死刑。
## OpenClaude:第一次给一个外面的开源项目合入代码
前段时间 Claude Code 的源码泄漏过一次。朋友圈里很快有人开始琢磨,这个 CLI 的提示词界面、工作流都挺顺手,能不能魔改一下让它接多模型。
我一开始是想自己搞的。让 Codex 去 Claude Code 源码里扫了一遍,问它"把这层接口抽象成多 provider,工作量多大?"。它评估完告诉我要动的东西挺多,你确定要做吗。我想了想,算了,不折腾。
结果两天后朋友圈里就有人开源了这个项目,叫 OpenClaude,拿那套泄漏的源码做底,把多模型这件事支持上去了。我直接下载装上用了一下。
一用就是一堆问题。
第一个是模型的 effort 被写死了,锁在 `high`,没有 `xhigh`。我日常用 Codex 就是要 xhigh 的,一上来就卡。第二个是 agent 调用会失败,我这边有代理环境,它一调就挂。第三个是它要开 worktree 的时候动不动就死,fast mode 也没法开,而 Codex 的 xhigh effort 思考得又慢,一等就是十几分钟,团队里试的人直接劝退了。
就让 Codex 一个一个修。模型选择改成三级的 `provider → model → effort` 并持久化;agent 代理那段补了补;fast mode 给 xhigh 加了个开关。本地测通了,我说你给我提个 PR 吧。它整理了一下,一股脑把所有改动塞进一个 PR 就交上去了。
PR 被打回来了。先是 CI 红了几个,过一天又收到邮件——是作者那边接的 AI PR review。格式是很典型的那种 AI 风格,挺啰嗦的,但说的点是对的:"东西可以,但你一个 PR 动了几十个文件,这样没法 review,拆开再提。"
我一想确实如此。晚上在手机上打开 codex,说按这些 comments 把之前那个 PR 拆成几个小的重新提。它咔咔拆成了四个,提上去。
又过了一天再收邮件,看了一下,三个合入主干了,一个还因为 CI conflict 在收尾。
这是我第一次有代码进到一个外面跑的开源项目里。我自己的项目里也有人提 PR,但那是自家地盘。这次是一个不属于我、也不归我团队的东西把我的东西收了,感觉挺奇妙的。
坦白说,这整个链路里面我技术上的判断做得并不多。方向是我定的,问题是我报的,但每一段代码都是 agent 写的,PR 描述、拆分策略也都是它按 review 意见重新整理的。我干的事就是对、不对、继续。
## Strix Halo:一个非专业人士把 prefill 推到了接近 DGX Spark
另一条平行线跑的是 [AMD Ryzen AI Max+ 395](https://www.amd.com/en/blogs/2025/amd-ryzen-ai-max-395-processor-breakthrough-ai-.html)(代号 Strix Halo)这台盒子的性能优化。
背景稍微解释一下。我们团队在做 [KTransformers](https://github.com/kvcache-ai/ktransformers),这是清华 MADSys 实验室和 Approaching.AI 合作的 [SOSP'25 论文工作](https://madsys.cs.tsinghua.edu.cn/publication/ktransformers-unleashing-the-full-potential-of-cpu/gpu-hybrid-inference-for-moe-models/),专门给 MoE 模型做 CPU/GPU 异构推理。我一开始的想法很简单:把 KTransformers 适配到 395 这台机器上。
一查发现卡在上游。[KTransformers 的 KT 分支是基于 SGLang 跑的](https://lmsys.org/blog/2025-10-22-KTransformers/),而 [SGLang 在 Strix Halo 上几乎没怎么适配过](https://llm-tracker.info/_TOORG/Strix-Halo)。哪怕我把 CPU 算子那一半搞定了,接上一个在这台机器上本身就很差的 SGLang,最后异构加起来还是很差。这条路走不通。
那就换思路。让 Codex 把 [vLLM](https://community.frame.work/t/llama-cpp-vllm-toolboxes-for-llm-inference-on-strix-halo/74916)、[llama.cpp](https://strixhalo.wiki/AI/llamacpp-performance)、SGLang 三个都装上,跑个 benchmark,先看看基线在哪。
模型选的是 [Qwen3-30B-A3B](https://huggingface.co/Qwen/Qwen3-30B-A3B) 的 BF16 原精度版。30.5B 总参数,3.3B 激活参数的 MoE 模型,在 Strix Halo 128GB 统一内存上跑起来刚好合适。llama.cpp 不支持 safetensors 格式,只能用 GGUF,让它先转了一遍格式。
初始 baseline 跑出来,vLLM 最好,prefill 不到 1000 tps,decode 十几 tps。llama.cpp 次之,prefill 三四百 tps,比 vLLM 差一截但稳定。SGLang 连跑都跑不通,打了几个补丁勉强跑起来,还比 llama.cpp 差。
按常理这时候就该收摊了,毕竟没啥期望。但我那段时间手里有点空闲、也有 token,就跟 Codex 说继续优化 SGLang 吧,你自己跑实验,跑完给我报告,下一轮两个方向二选一我拍板。
就这么开始了。两三天,200 多轮实验,中间我干预很少,基本就是"继续"。我也不看它每一轮具体选哪个分支,很多技术细节我本来也看不太懂。
最后跑到的数字让我自己都有点意外。prefill 到了约 1,300 tps,比最初 vLLM 那个 baseline 还高出一大截。decode 稳在 20 tps 左右,这个 BF16 的 30B MoE 在这台机器上,内存带宽基本就决定了这个上限,不期待能突破。更关键的是,跟 [NVIDIA DGX Spark](https://www.nvidia.com/en-us/products/workstations/dgx-spark/)(GB10 加 128GB 统一内存,那台要 4000 美金的小机箱)的性能贴得很近了。原本 Strix Halo 和 Spark 在这种模型上差距大概是 4 到 8 倍。现在 prefill 基本打平。
同事看到结果第一反应是"这么夸张?正确性对不对?"。又跑了一轮正确性验证,数字对得上。
让我有点震动的其实是过程。那 1,300 tps 只是表层。我没什么 AI infra 的技术背景,Strix Halo 本来也不是我计划要优化的机器,是因为原本要优化的另一台最近下线了,手里空出时间才顺手捡起来的。两三天下来,居然能做到接近顶尖研究员手工调优的水平。花的时间和成本都没有很夸张。
走到这一步我已经在认真考虑一个以前完全不敢想的问题:要不要整理一下给 SGLang 提个 PR。作为一个非专业人士,给一个主流推理引擎贡献代码。目前东西还没拆得足够清晰,整理到成熟状态还得花点工夫。但这个想法居然已经能被认真考虑,这本身就挺新鲜。
## 并行变得可能了
Human-in-the-loop 我还是觉得必要。这点我认同我同事的一个观点:人经过自然选择的筛选,有真实的生存压力,所以人定目标、做取舍是相对靠谱的。Agent 没有生存压力。它一条路走得很偏、目标定义很烂,它也不会有"我这是在浪费生命"的那种焦虑,它就继续往下做。很多时候 A 和 B 之间没有绝对的对错,就是一个取舍,这个取舍得人来做。
所以让 agent 纯自治、不带人、长期运作一个复杂项目,目前还搞不定。
但 agent 强到这个程度之后,"in the loop" 需要的时间量在显著下降。你不用全程盯着了,只要在关键节点出现、做判断、给方向就够。
而且这几件事里都有大段人参与不进去的时间。SGLang 的 benchmark,一次实验跑十几分钟到半小时,我根本搭不上手。OpenClaude 那个 PR,等 CI 跑完、等作者那边 AI review 回复,一等就是几个小时到一天。4.7 让它去翻老项目挑问题,它自己读代码、做判断,我坐旁边也没法帮忙。
这些等待窗口原本是天然浪费的。现在的变化是,如果几件事的等待窗口能错开,我就可以用空出来的时间去推进另一件事。SGLang 在跑实验的时候,我去看 OpenClaude 的 PR review;OpenClaude 在等 CI 的时候,4.7 正好读完代码等我拍板。几件事就这么交错着往前走,每件事好像都没怎么被耽误。
并行太多也不好,会串频。但 2 到 3 件事,每件事的推进速度其实没什么损耗。一个项目全天专注 8 小时,不如在 3 个项目之间切着做 8 小时——真正需要深度投入的窗口加起来也就 2、3 个小时,剩下的时间原本是在等的。
这个逻辑以前在人和人之间就存在。团队里一个人在等别人 review,顺手就做点别的。现在把"别人"换成了 agent,等的周期变短了,但窗口交错的逻辑是一样的。
所以我最近在调整一个老默认。以前总说"要专注做一件事,把它做好"。这个原则我现在也不反对,但它的前提是你的时间会被这件事大量占满。如果 agent 把你在一件事上真正重度投入的时间缩到三分之一,那你那些原本被压住的好奇心和想试的念头,其实是可以放出来的。
Strix Halo 这件事本身就是个例子。这事我们团队讨论过很多次,但一直没人认真做,因为评估下来投产比一般,不值当。是我前段时间有块空闲时间,出于好奇捡起来跑了一下,才跑出了不一样的结果。
过去一年我会觉得"专注于一件事"是某种默认美德。现在我还是觉得专注重要,但"只做一件事"已经不是它最好的表达方式了。几个你真感兴趣的方向如果能同时开着,总的产出反而可能更高。
前提是每件事你都是真的感兴趣。并行做三件你不在乎的事,效率还是不行——那就是干耗。
---
## 参考资料
1. [Introducing Claude Opus 4.7 — Anthropic](https://www.anthropic.com/news/claude-opus-4-7) — 2026 年 4 月 16 日发布,强调指令字面化遵循、长任务一致性、输出自校验
2. [Introducing Claude Opus 4.6 — Anthropic](https://www.anthropic.com/news/claude-opus-4-6) — 2026 年 2 月 5 日发布,两代之间只隔两个半月
3. [Claude Mythos Preview — red.anthropic.com](https://red.anthropic.com/2026/mythos-preview/) — 仅向 Project Glasswing 联盟(Amazon、Apple、Google、Microsoft、Nvidia 等)开放,官方承认 4.7 "less broadly capable"
4. [GPT-4 — Wikipedia](https://en.wikipedia.org/wiki/GPT-4) — 2023 年 3 月 14 日发布,距 ChatGPT 3.5 只有四个月
5. OpenClaude — 社区基于 Claude Code 泄漏源码重做的多模型 agent 框架,文内修复的几个 PR 已进主干
6. [kvcache-ai/ktransformers — GitHub](https://github.com/kvcache-ai/ktransformers) — 清华 MADSys 与 Approaching.AI 合作的 CPU/GPU 异构 MoE 推理框架
7. [KTransformers @ SOSP'25](https://madsys.cs.tsinghua.edu.cn/publication/ktransformers-unleashing-the-full-potential-of-cpu/gpu-hybrid-inference-for-moe-models/) — 论文原文,prefill 4.62–19.74x、decode 1.25–4.09x 加速
8. [Accelerating Hybrid Inference in SGLang with KTransformers CPU Kernels — LMSYS](https://lmsys.org/blog/2025-10-22-KTransformers/) — SGLang 与 KTransformers 的集成说明
9. [Qwen3-30B-A3B — Hugging Face](https://huggingface.co/Qwen/Qwen3-30B-A3B) — 30.5B 总参数、3.3B 激活,128 experts 选 8,适合大内存小显存的异构推理
10. [AMD Ryzen AI Max+ 395 — AMD](https://www.amd.com/en/blogs/2025/amd-ryzen-ai-max-395-processor-breakthrough-ai-.html) — 16 核 Zen 5、128GB LPDDR5X-8000、Radeon 8060S iGPU
11. [Strix Halo LLM 性能跟踪 — llm-tracker.info](https://llm-tracker.info/_TOORG/Strix-Halo) — 社区 benchmark 汇总,vLLM/llama.cpp/SGLang 在 395 上的基线状态
12. [NVIDIA DGX Spark — NVIDIA](https://www.nvidia.com/en-us/products/workstations/dgx-spark/) — GB10 Grace Blackwell + 128GB 统一内存,2025 年 10 月 15 日上市
---
### AI 行业的战时状态
- URL: https://guanjiawei.ai/zh/blog/ai-wartime
- English: https://guanjiawei.ai/en/blog/ai-wartime
- Published: 2026-04-16T10:00:00
- Tags: AI, 思考, 国际形势
Anthropic 最近出了个新政策,在特定场景下使用 Claude 需要上传身份证件加实时自拍做实名认证。中国这边炸锅了,很多人大惊小怪的。
说实话,这事太正常了。从我看来,这已经算轻的。
## 这从来就不是和平年代
今年年初我跟团队说的原话就是:现在还能用海外模型,不要纠结钱和账号的问题,先用起来,先掌握跟 AI 协作的体感和方法。快的话三个月你就会出问题,可能就用不上了。一定要以这种紧迫的心态去使用。
从 2023 年开始,AI 这个行业就处在战时状态。
你看 2023 年 ChatGPT 出来的时候,3.5 免费使用,但从 Day 1 就封掉了中国的 IP。你需要海外电话号才能注册一个免费账号,中国这边也直接把它屏蔽了。后面这事从来没有放松过,只有越来越紧。
到了 2025 年 9 月,Anthropic 官方宣布禁止所有"中国控制的公司"使用 Claude 服务,不管你在哪运营,只要股权结构中超过 50% 由中国实体控制,就不给用。同年 11 月开始大规模封号。到 2026 年 2 月就更直接了,Anthropic 公开指控 DeepSeek、Moonshot AI、MiniMax 三家中国 AI 公司通过大约 24,000 个虚假账号蒸馏 Claude 模型,总共产生了超过 1,600 万次对话。
就在几天前,OpenClaw 的创始人 Peter Steinberger 也被封了号。不是针对他,大概率是异常检测误伤,后来恢复了。但这种事搞得人心惶惶。
所以我说,别大惊小怪。这些模型公司的意图从 Day 0 就没变过,各种方式在封堵你。但大规模封了又误伤,误伤了又要处理申诉,他们那边基础设施压力也很大,才多少人管这事?搞出实名认证反而是一种退而求其次的方案。
## 芯片和模型,一体两面
芯片这边也是打来打去。
2025 年 1 月,美国商务部工业和安全局发布新规,英伟达 H100、H200 等旗舰 GPU 对中国的出口全面卡死。4 月连合规芯片也禁了。7 月又悄悄放开 H20,条件是英伟达要把 15% 的收入交给美国政府。12 月干脆连之前禁掉的 H200 也放开了,这回收 25%。华为的芯片反过来也被美国禁。来回折腾。
模型那边也一样。2025 年 2 月,美国国会提出 "No DeepSeek on Government Devices Act",禁止联邦雇员在政府设备上使用 DeepSeek。随后商务部、海军等多个联邦机构,纽约、田纳西、弗吉尼亚等多个州跟进执行。
芯片和模型就是一体两面的事,这个绕不开。
## AI 已经上了战场
很多人可能没注意到,AI 已经在真正的战场上大规模使用了。
以色列在加沙战争中部署了一套叫 "Lavender" 的 AI 系统,综合信号情报、图像情报、人力情报和空间情报,生成了一份 37,000 人的打击目标列表。其中很多是低级别成员,甚至没有确认的军事角色。到 2024 年 3 月,以色列军方使用微软和 OpenAI 技术工具的频率比 10 月 7 日之前那一周增长了近 200 倍。微软 Azure 的使用量在战争头六个月激增了 60%。
2026 年 3 月,美军在对伊朗的军事行动中公开确认使用了"先进 AI 工具"。海军上将 Brad Cooper 的原话是 AI 在"压缩从发现到决策到行动之间的时间",把卫星、无人机、电子情报、战场传感器的数据融合成实时作战画面。
再看 AI 公司这边。2026 年 2 月,OpenAI 拿下了 2 亿美元的五角大楼合同。Palantir 更夸张,2025 年 8 月拿到美国陆军 100 亿美元的 10 年期软件合同,到 2026 年 3 月它的 Maven 智能系统被正式列为全军五个军种的核心系统。
Anthropic 呢?因为拒绝让自己的模型被用于大规模监控和自主武器系统,直接被特朗普政府列为"供应链风险",军事合同全被剥夺,所有国防承包商被要求停止使用 Anthropic 的 AI 模型。
你看,它就是一个军事级别的先进生产资源。改变社会生产力的同时,也直接被拿去打仗。
## 跟工业革命时期的清朝太像了
生产力发生巨大变革的时候,生产关系一定跟着变。生产关系一变,权力就要重新洗牌。历史上每次都是这样。
现在这个局面,跟当年工业革命时期的清朝太像了。其他国家坚船利炮、金融体系、工业制造全在发生巨变,我们这边还在讨论:这是不是泡沫?这对生活有什么帮助?
讨论这些没有错。但后面发生的事情大家都知道,别人的大炮打开了你的国门,烧杀抢掠。这对我们国家来说只有一两百年的历史,课本上写得清清楚楚。
数据也说明问题。康熙、乾隆时期,中国 GDP 占全球约 35%,到 1820 年仍然有 32.9%,是当时全世界最大的经济体,不是之一。然后鸦片战争来了,到 1870 年就缩水到不到西欧的一半。
全世界最有钱的国家,没有先进的技术和武力,结果被人打上门。
但多亏了这一两百年来无数人的努力,今天的中国跟当年的清朝完全不是一个状态。
现在的局面更像 17 世纪英国和荷兰掰手腕那会儿。当时荷兰是全欧洲最大的商船队,船比所有其他国家加起来还多,控制着东印度群岛的香料贸易,商业霸主。然后英国追上来了,1651 年搞了《航海条例》,直接开打,前后四次英荷战争。两个体量接近的强国从贸易打到军事,谁也吃不掉谁,打了将近一个世纪。
今天中美之间的 AI 竞争就是这个感觉。斯坦福大学 2026 年 AI Index 报告说得很清楚:美国顶尖模型和中国顶尖模型的差距只剩 2.7 个百分点了,2023 年这个差距还有 17 到 31 个百分点。DeepSeek R1 在 2025 年 2 月一度追平了美国最强模型。AI 专利这块中国占了全球约 70%,论文产出占 23.2%。再看 AI 之外的领域,全球 60% 以上的新能源汽车是中国造的,比亚迪 2025 年 3 月超了特斯拉成为全球第一,工业机器人装机量占全球一半以上。
这跟清朝被人碾压完全是两回事。这是两个接近的强国在正面较量。但也正因为接近,竞争才更狠。英荷当年打了四次战争,打了一个世纪。现在的芯片禁令、模型封锁、军事合同争夺,就是这个时代的《航海条例》。
所以回到 AI 模型这件事。Claude Mythos 这个新模型,Anthropic 直接不对公众开放,只通过 Project Glasswing 项目分享给微软、苹果、亚马逊、谷歌这几家公司。为什么?因为这个模型在内部测试中自主发现并利用了所有主要操作系统和浏览器的零日漏洞,包括一个存在 27 年的 OpenBSD 漏洞和一个 16 年的 FFmpeg 漏洞。
这个信号已经很明显了。AI 在某些领域的定位越来越接近核武器。
核武器从二战到今天,全世界还在围绕谁应该有、谁不应该有这件事打来打去。AI 不会吗?一定会。
## 这次浪潮,普通人可以参与
不过有一个跟以前很不一样的地方。这次参与的门槛降低了。
当年工业革命的时候,普通人能做什么?捐钱。洋务运动、北洋海军,大部分人只能在旁边看着。
现在不一样。每个普通人都可以拿顶尖的 AI 模型去参与创造。你甚至可以针对一个很复杂的系统,贡献你的想法,然后直接做出来。
想象一下三年后。A 国 1000 万人口里面 200 万是重度 AI 用户,全民普遍使用 AI 参与建设。B 国同样 1000 万人,只有 1000 人在用。这个生产效率的差距会很恐怖。
工业革命后西方大量普及数学和科学教育,人口变成了新的工业生产力。有的国家 100 万人经过了这种教育,能参与工业建设和制造;有的国家只有 100 个人。真到国家实力碰撞的时候,差距就出来了。而且培养人是有周期的,你想用人的时候招不到,那就真出大问题。
## 该参与就参与
所以回到最开始的话题。Anthropic 搞实名认证,太正常了。
能用就偷偷摸摸用一用,看看国外的东西。国内现在模型其实也不差,我每个月也花不少钱买国产大模型的会员。不用翻墙,不用折腾账号,就是理所应当的商业服务,很舒服。折腾海外的不就是因为水平高一些嘛?说到底,不就是因为人家的东西现在更先进?
在这种环境里面,不想着参与贡献,不想着怎么自力图强,天天琢磨别人又封了又要搞我,没有必要。
封是永远封不住的。市场有需求就会有口子。就像之前比特币那些需要实名认证的场景,一批人跑到非洲拿着一麻袋钱,后面站两个背 AK47 的兄弟,找当地人搞身份。画面很生动。
但真正该思考的是:在这样的形势下,我们是不是应该意识到,至少在 AI 这个领域,已经是战时状态了?国际形势从来不太平,不要再以和平年代的思维去想自己的参与。
就像打即时战略游戏。前期是和平发展,爆农民、攀科技。但到了中期大家开始打了,你不能光想着发展,生存是第一位。你没兵,别人打过来你就挂了。清朝 GDP 占全世界 1/3,最有钱的国家,但没技术没武力,照样被人打上门。
落后就要挨打。这是非常近的历史,没多远。
我一直觉得,不要把结果当成目标。结果是你做对了方向之后自然跟着来的东西。好好学习自然有好成绩,为了成绩才去学习,那你一定痛苦。
在这个时代,去做有意义的事,去参与,想想自己能贡献什么。别老盯着结果看,那个不是你能控制的。
---
## 参考资料
1. [Anthropic 身份认证政策](https://support.claude.com/en/articles/14328960-identity-verification-on-claude) — 2026 年 4 月 15 日上线,需提交护照/驾照/身份证 + 实时自拍,由 Persona Identities 处理验证
2. [Anthropic 禁止中国控制企业使用 Claude](https://www.anthropic.com/news/updating-restrictions-of-sales-to-unsupported-regions) — 2025 年 9 月,禁止股权超过 50% 由中国实体控制的企业使用服务
3. [Anthropic 指控中国 AI 公司利用虚假账号蒸馏 Claude](https://venturebeat.com/technology/anthropic-says-deepseek-moonshot-and-minimax-used-24-000-fake-accounts-to) — 指控 DeepSeek、Moonshot AI、MiniMax 通过约 24,000 个虚假账号产生超过 1,600 万次对话
4. [Anthropic 临时封禁 OpenClaw 创始人](https://techcrunch.com/2026/04/10/anthropic-temporarily-banned-openclaws-creator-from-accessing-claude/) — Peter Steinberger 因"可疑活动"被临时封号后恢复
5. [美国 AI 芯片出口管制历程](https://www.congress.gov/crs-product/R48642) — 从 H100 全面禁售到 H20 有条件放开再到 H200 解禁(2025 年 1 月-12 月)
6. ["No DeepSeek on Government Devices Act"](https://www.congress.gov/bill/119th-congress/house-bill/1121) — 2025 年 2 月提出,禁止联邦雇员在政府设备上使用 DeepSeek
7. [美军确认在对伊朗行动中使用 AI](https://www.aljazeera.com/news/2026/3/11/us-military-confirms-use-of-advanced-ai-tools-in-war-against-iran) — 2026 年 3 月
8. [以色列 AI 军事系统"Lavender"](https://moderndiplomacy.eu/2024/12/07/ai-a-strategic-edge-to-isreal-in-modern-warfare/) — 综合多源情报生成 37,000 人打击目标列表
9. [微软/OpenAI 工具被以色列军方大规模使用](https://al-shabaka.org/briefs/ai-for-war-big-tech-empowering-israels-crimes-and-occupation/) — 使用频率在 2024 年 3 月前增长近 200 倍
10. [OpenAI 拿下 2 亿美元五角大楼合同](https://finance.yahoo.com/news/openai-secures-200-million-pentagon-190059280.html) — 2026 年 2 月
11. [Anthropic 被特朗普政府列为"供应链风险"](https://fortune.com/2026/02/28/openai-pentagon-deal-anthropic-designated-supply-chain-risk-unprecedented-action-damage-its-growth/) — 因拒绝允许模型用于大规模监控和自主武器
12. [Palantir 100 亿美元陆军合同与 Maven 系统](https://www.tomshardware.com/tech-industry/artificial-intelligence/pentagon-formalizes-palantirs-maven-ai-as-a-core-military-system-with-multi-year-funding-platforms-investment-grows-to-usd13-billion-from-usd480-million-in-2024) — 2025 年 8 月签约,2026 年 3 月成为全军核心系统
13. [清朝 GDP 占全球比重](https://en.wikipedia.org/wiki/Economy_of_the_Qing_dynasty) — 康熙乾隆时期约 35%,1820 年 32.9%,鸦片战争后急剧下降
14. [Claude Mythos 模型受限发布](https://www.infoq.com/news/2026/04/anthropic-claude-mythos/) — 2026 年 4 月,因自主发现零日漏洞等安全隐患仅向 Project Glasswing 联盟公司开放
15. [80% 美国 AI 初创企业使用中国开源模型](https://www.kucoin.com/news/flash/80-of-u-s-ai-startups-use-chinese-open-source-models-despite-export-controls) — 美中经济安全审查委员会 2026 年 3 月报告
16. [斯坦福 2026 AI Index:中美差距缩小至 2.7%](https://siliconangle.com/2026/04/13/stanford-hais-2026-ai-index-reveals-china-u-s-now-neck-neck-race-global-dominance/) — DeepSeek R1 一度追平美国顶尖模型,中国 AI 专利占全球 70%,论文产出占 23.2%
17. [中国成为全球最大 AI 专利持有国](https://en.people.cn/n3/2026/0309/c98649-20433440.html) — 世界知识产权组织数据,中国 AI 专利占全球约 60-70%
18. [17 世纪英荷战争与商业竞争](https://www.britannica.com/event/Anglo-Dutch-Wars) — 四次英荷战争,两个近似实力的强国围绕贸易和海上霸权展开近一个世纪的竞争
19. [比亚迪超越特斯拉成为全球最大电动车制造商](https://research.contrary.com/report/chinas-journey-to-ev-dominance) — 2025 年 3 月,中国生产全球 60% 以上的电动汽车
---
### AI 不是许愿池:两个我最近搞不定的事
- URL: https://guanjiawei.ai/zh/blog/ai-coding-failures
- English: https://guanjiawei.ai/en/blog/ai-coding-failures
- Published: 2026-04-15
- Tags: AI, Claude Code, 编程, 失败, 思考
之前聊 AI coding,聊的多半是它能干什么、干得有多漂亮。今天换一面,记录两个最近我没搞定的事:一个勉强收了尾,另一个直接搁置。
## 一、Claude Code 修不好自己家的插件
Claude Code 有个挂在 Chrome 上的 [官方插件](https://code.claude.com/docs/en/chrome),让 agent 能直接操作浏览器。我挺依赖这个功能,做实验、查资料、看视觉交互,经常用到。
前段时间它突然连不上了。每次启动都失败。
当时的第一反应是——这不就是它自己家的产品吗?让它自己修呗。Opus 4.6,effort 拉到 high,让它去想办法。
然后就开始了一场三四个小时的原地打转。
它每隔一阵就跟我说"我发现了重要线索",改一通代码,然后告诉我"到这里了你得重启一下 session"。我重启,打开,还是不行。又一轮假设、又一轮改、又一轮"这次重启就好了"。中间它还让我把浏览器插件的 console 日志返给它——一给它,方向就开始围着日志里几行无关紧要的 warning 转,越走越歪。
我开始觉得有点好笑。它修的是自己家的 CLI 和自己家的插件,纯软件问题,没有外部变量。理论上这应该是它最擅长的场景。但它就是在原地画圈,每一圈都长得差不多。
最后我拦下来一次,说你别自己瞎想了,去 GitHub 上搜一下有没有人遇到过一样的问题。它翻了一圈,很快找到答案:[Claude Desktop 和 Claude Code 的 CLI 都注册了同一个 extension ID 的 native messaging host,Desktop 赢了,CLI 就再也拿不到连接](https://github.com/anthropics/claude-code/issues/46869)。按社区给的思路走,二十分钟收尾结束。
这事让我有点意外的不是"它搞不定"——搞不定很正常。是它从头到尾没想过"这个问题可能不是我这个会话闭门能解的"。它默认自己能从头把答案推出来,推不出来就让你重启。如果不是我主动让它去搜社区,它可能还要再耗我半天。
我后来想过一下原因。Agent 在一个会话里是孤立的,它不容易主动承认自己卡住了。人会,人碰到同样的坑反复踩,第一反应是去 Google、去 issue、去同事那问一嘴。AI 得你点它。
## 二、小红书的软限流
另一个事更干脆,就是彻底搞不定,也不打算继续搞了。
过去几周我一直想把博客里已有的文章分发到小红书上。自己手工发了几篇,流量是零。我就想,要不让 Claude Code 陪我设计一轮实验——选题、标题、封面、发布节奏都认真过一遍,比我自己瞎发一定更系统。结果还是零。
反复查下来,[原因基本只有一个:新号被软限流了](https://zhuanlan.zhihu.com/p/459943204)。平台不告诉你账号有问题,它就是把你的曝光死死压在一两百以下,搜索也搜不到。你以为自己在发内容,其实是在跟一堵看不见的墙说话。
这事有它的道理。小红书注册门槛低、发帖门槛也低,机器人和营销号是个常年的大麻烦。[2026 年的《社区公约 2.0》又新增了一条针对纯 AI 生成未标注内容的限流规则](https://www.sohu.com/a/1006210421_120176836)。从平台角度看,新号冷启动阶段保守推流是合理的自我保护。但对我这种只想把存量思考做二次分发的人,就是一堵绕不过的墙——除非养号、除非按它那套节奏慢慢来。
我没继续折腾。投产比太差,同时它让我重新确认了一件其实我心里早就有的事:
**当初从个人网站开始,是对的。**
网站是通用互联网环境,没人在那给我限流。文章写得有点意思,朋友会读、会转,偶尔还有陌生人看完发邮件给我。这半年下来积累的文章其实是一份可以往不同方向分发的思想库——前段时间一篇搬到知乎的文章反响不错,一大堆人收藏讨论,那是搬运的附带收获,不是一开始就冲着那个地方去写的。
小红书、抖音那种平台是另一种游戏。你不是在一个开放的互联网里写东西,你是在一个封闭的、有推荐算法做裁决权的场里参赛。规则是人家定的,规则对新玩家也极度不友好。有选择的话,先把自己的地盘立起来再去别人场上打怪,这个顺序比反过来健康得多。
## 失败才是工作的主旋律
讲这两个例子,不是说 AI 不行。恰恰相反。
我们很容易把 AI 想得特别神:给它任务,它就"啪"地给你一个成品。那种期待更像许愿,不像用工具。真实的工作从来不是这样的。真实的工作里,大部分时间都在失败。试一个方向不行,换一个思路还是不行,绕两圈偶尔撞上一个能跑通的。成功是少数,失败是日常。
AI 没改变这个底色。它改的是两件事:
- **尝试的面变宽了。** 同样的时间,我能同时开三四条线去试,哪怕每条都可能失败。
- **反馈变快了。** 如果没有 Claude Code,前面那个 Chrome 插件的问题我一晚上可能都卡在最初的错误假设里。现在是它帮我在几小时里把几种可能都走了一遍,逼着我往"这问题不该我闭门想"的方向去。
换句话说,AI 不是成功制造机,它是失败加速器。听上去没那么性感,但这是它最值钱的地方。失败的周期从几天缩到几小时,一年下来你做的实验数量是原来的十倍以上,采样多了,自然更容易撞到成功。
## 过去三个月的模型变化也值得记一下
这波体感跟过去三个月模型迭代的节奏分不开。我的时间线是这样的:
- **2025 年 12 月末**:开始认真用 Claude Code,Sonnet 4.5,用了没几天因为一些账号原因中断了。
- **2026 年 1 月末**:Moonshot [发布 Kimi K2.5](https://www.kimi.com/ai-models/kimi-k2-5),我临时切过去。意外地好用,比那时候的 Codex 5.2 体感要强。拿它做了几个小项目,预期不高但基本都跑通了。
- **2 月初**:Anthropic [发布 Opus 4.6](https://platform.claude.com/docs/en/about-claude/models/whats-new-claude-4-6)。有一个我之前用 K2.5 折腾两三天、每次都卡在最后一步的小 demo,切到 Opus 4.6 一次过。这种时刻你才体感到所谓"模型变强"不是榜单多几个点的事,是你原本搞不定的突然就能搞定了。
- **2 月中下**:[GLM-5](https://www.zhipuai.cn/) 和 [MiniMax M2.5](https://www.minimax.io/news/minimax-m25) 陆续出来,我在外面出差期间用过一段,性价比不错。
- **3 月初**:OpenAI [发布 GPT-5.4 并同步更新了 Codex](https://openai.com/index/introducing-gpt-5-4/)。有一个 Opus 4.6 绕了半天的小插件问题,我丢给新版 Codex 跑了三个小时,搞定了。
- **现在**(4 月中):新一代模型又在路上。
整个节奏给我的感觉是,当前你卡住的那些问题,往往等个一两个月,下一代模型一出来就不再是问题了。这不是叫你躺平等模型,是说不要因为今天搞不定就灰心放弃。你可以多让它跑,也可以先搁一阵再回来。
## 最后
我想讲的其实是一种更诚实的期待。
如果你指望 AI 把你的工作从"以失败为主"变成"以成功为主",你会失望。任何工具都做不到这件事。工作的底色就是失败。
但如果你把它当成一个能让你更快失败、同时开多条线试水的搭档,你对它就会平和很多。它有限,你也有限,但你们凑一起能做的事比各自单独多很多。
AI 真正值钱的地方在于加速失败。这话听上去反直觉,用一阵就懂了。
---
## 参考资料
- [Claude in Chrome — Claude Code Docs](https://code.claude.com/docs/en/chrome)
- [Claude-in-Chrome CLI 连接问题讨论(GitHub Issue #46869)](https://github.com/anthropics/claude-code/issues/46869)
- [Claude Opus 4.6 — What's New](https://platform.claude.com/docs/en/about-claude/models/whats-new-claude-4-6)
- [Kimi K2.5 发布说明](https://www.kimi.com/blog/kimi-k2-5)
- [MiniMax M2.5 发布说明](https://www.minimax.io/news/minimax-m25)
- [Introducing GPT-5.4 — OpenAI](https://openai.com/index/introducing-gpt-5-4/)
- [2026 小红书《社区公约 2.0》解读](https://www.sohu.com/a/1006210421_120176836)
- [小红书限流自查指南(知乎)](https://zhuanlan.zhihu.com/p/459943204)
---
### GPT-6 今天又'发布'了一次?
- URL: https://guanjiawei.ai/zh/blog/gpt-6-released-again
- English: https://guanjiawei.ai/en/blog/gpt-6-released-again
- Published: 2026-04-15
- Tags: AI, 信息, 思考, Claude Code, Codex
前两天在朋友圈看到一个朋友发"GPT-6 发布了",后面跟着"哈哈哈"。
这人不是乱传消息的风格,行业里的。我第一反应是:"这么大的事我居然错过了?"
顺手 Google 了一下。没找到。又让 Claude Code 帮我查,刷刷刷跑出来一堆"发布会几点开的""参数是多少""对比 GPT-5 提升多少"——细节还高度一致。但 OpenAI 官网什么都没动。
后来反应过来。4 月 14 日是英文圈流传过的发布日之一。OpenAI 3 月 24 日刚在 Stargate 数据中心完成代号 Spud 的预训练,Altman 放话"再过几周发布",然后所有人开始猜哪天是"几周"的终点。4 月 14 日被选中了。几天之内,一圈人写帖子、配图、编参数、互相引用,就能拼出一个看起来自洽的"事实"。中文圈的版本更离谱——"GPT-6 下周发布""下个月发布""明天发布",去年秋天以后就没停过,每一轮都能收一波转发。
真正让我在意的不是假消息本身,是我越想越绕。
## 假信息其实是有观众的
早些年知乎刚火那阵,再到微信疫情那段时间,出过一堆假信息。当时的思路是辟谣。果壳的谣言粉碎机 2010 年就在做这个,三年 503 篇,"地震生命三角""核污染扩散图"这种靠他们按下去不少。路数是:有谣言 → 专业人士拆 → 大家恍然大悟。
但这条路好像越走越窄。
因为假信息不是"需要被纠正的错误",它是一种情绪消费品。
打个比方。我们聊天的时候,除了正经说事,也会扯淡。明明在聊一个正经话题,我突然想到一个很偏的点,说几句夸张到离谱的话。对方不会跳出来说"这不符合事实",对方会笑。这件事就这样被消费掉了,没谁受损。
网上很多"假信息"扮演的就是这个角色。它根本不以"被相信"为目标,它的目标是让你点一下、转一下、在评论里扯两句。你越较真地去搜去辨别,平台越觉得这条有流量,越把它推给下一个人。
想通这点,一些困惑的事就说得通了。
GPT-6 为什么能"发布"这么多次——每次"发布"都能收割一轮流量。你越想证伪,越给它喂养。
小红书那些没来源的医学帖子为什么这么火——几张图几行字,写一个激进观点,什么什么大学发现、什么什么激素其实怎么怎么,下面的讨论都是默认"这是事实"之后展开的:"诶难怪呢""原来是这样"。我最近看了几十篇,没一篇有靠谱来源,评论区反倒热闹得很。
还有前阵子[那匹小马](/zh/blog/happy-horse-video-privatization)。Artificial Analysis 榜单上一个叫 HappyHorse 的匿名模型把字节的 SEEDANCE 2.0 挤下来,一夜之间 happyhorse.io、happyhorse.com 被抢注,HuggingFace 上冒出一堆空仓库写着"开源""第一名"。我让 Claude Code 去调研它的身世,第一次它真的中招了,把这些蹭热度的内容当权威来源引用。换了另一个 agent 重新跑,才给出靠谱的结论:"来源仍然模糊,建议等官方"。
这事对我有点震动。不是因为 AI 犯错——犯错能接受——是因为我的信息链路根本不安全。
## 真信息其实是个细分市场
绕一圈回来我才看明白:真信息是贵的。
生产贵这个好理解。分析、调研、实验、反复验证,每一步都在烧时间。
消费也贵。你要花精力理解那些绕口的表达,那些平平无奇、没什么情绪价值的结论。真信息不给你"诶原来是这样"的即时爽感,它常常给你的是"这个好像也没什么意思"或者"这个我还得想想"。
两头都贵,真信息就天然是个细分市场。它不是被压制,是供需曲线就长这样。
这个认识以前我没有。我一直以为问题是"怎么辟谣"。现在我觉得问题是:"在一个假话比真话便宜又好消费的环境里,我怎么保住自己的判断力?"
## AI 让这事变严重了,不是变轻了
一开始我也觉得 AI 是解法。让 AI 帮你核实、甄别、分析。
越用越不这么觉得。
AI 像一个特别强的员工。他能干活,干得还挺好。但如果你每次都不看过程只看结论,你就会陷入一种危险状态:你和真相之间多了一层幕布。
之前聊过一个观点:创造本身就是逼近真相的一种方法。实验失败了,你根据失败的样子判断下一步往哪调;方案不行了,你从不行的理由里学到新东西。这些都不是看结论能学到的。
而人天然会偷懒。8 小时工作里如果 7 小时是 AI 干、你只看结论,你会觉得今天很高产——但判断力在悄悄退化。这才是最让我担心的地方。AI 看起来在放大你的产出,同时也在削弱你的判断力。碎片化、短视频已经在做这件事,AI 现在又加了一把火。
这事具体到每天的工作里,就是工具选择的事。
## 所以我又推回了 Claude Code
过去一两个月我一直在对比 [Codex](https://openai.com/codex) 和 [Claude Code](https://www.anthropic.com/product/claude-code)。
一开始我推荐团队上 Codex。理由很直接,它更强。Claude Code 啃不下来的硬骨头 Codex 能啃下来,GPT-5.4 在复杂架构和长链推理上明显上了一个台阶。benchmark 上它在 SWE-Bench Pro 上比 Opus 4.6 高了十几个点。遇到那种 Opus 磨了半天搞不定的事,Codex 经常一把过,我当时很惊艳。
但最近我改主意了。不是因为 Codex 不好,它能干的活还在干。是因为我发现,对大多数人来说,只用 Codex 会把你困在"AI 干、我不成长"的状态里。
Claude Code 的过程是透明的。它会主动做计划、会问你澄清问题、每一步在干什么都写得清楚,用的是人话。我不是每个领域最懂的人,但能参与讨论、能看懂思路、能补充质疑——有时候它抛出的角度还能让我想到原本没想到的点。一个月下来,我在好几个原本完全不懂的子领域里开始有判断力了。
Codex 不一样。它思考的过程是偏机器语言的,一堆奇奇怪怪的标签拼出来,看不懂它在干嘛。干完丢一大坨总结给你,内容很浓缩。你问它解释,它再糊一坨,还是费劲。我用 Codex 烧的 token 其实比 Claude Code 多——它敢接硬活,自然要多烧——但我的成长更少。只知道"它搞定了"或"没搞定",不知道怎么搞的。
一个月不算长,但放到一年里看,这个差距会很明显。
## 朋友问我推哪个
推 Claude Code。
不是因为它 benchmark 最强(它不是)。不是因为它最便宜(它也不是)。是因为它把"让你变强"做进了产品里。Codex 像一个闷头加班搞定的同事,Claude Code 像一个愿意带你过一遍代码的同事。前者速度快,后者一年下来你是两个人。
---
回到开头那条朋友圈。
AI 时代,信息越来越便宜,但人反而变贵了。不是 AI 变强就自动解决问题,是我们这些使用 AI 的人,得自己想办法在这个环境里保住判断力。
所以我的选择标准也变了。不光看 AI 能帮我完成多少事,还看一天协作下来自己有没有多懂一点。这是两件事,但以前我没分开看。
---
## 参考资料
- [GPT-6 Release Date: April 14 Rumor Unconfirmed — FindSkill.ai](https://findskill.ai/blog/gpt-6-release-date/)
- [GPT-6 (2026) — Dr Alan D. Thompson, LifeArchitect](https://lifearchitect.ai/gpt-6/)
- [ChatGPT 6 Release: Rumors & What's Confirmed — Fello AI](https://felloai.com/all-we-know-about-chatgpt-6/)
- [果壳网三周年:谣言粉碎机"最粉碎"的三年](https://m.guokr.com/article/437589)
- [果壳网 — 维基百科](https://zh.wikipedia.org/zh-hans/%E6%9E%9C%E5%A3%B3%E7%BD%91)
- [GPT-5.4 vs Claude Opus 4.6 for Coding — NxCode](https://www.nxcode.io/resources/news/gpt-5-4-vs-claude-opus-4-6-coding-comparison-2026)
- [Codex with GPT-5.4 vs Claude Code with Opus 4.6: Why I Now Use Both — Chandler Nguyen](https://chandlernguyen.com/blog/2026/03/13/codex-gpt-5-4-vs-claude-code-opus-4-6-dual-wielding-ai-coding-tools/)
- [Claude Opus 4.6 vs. GPT-5.3 Codex: How I shipped 93,000 lines of code in 5 days — Lenny's Newsletter](https://www.lennysnewsletter.com/p/claude-opus-46-vs-gpt-53-codex)
- [GPT-5.3 Codex vs. Opus 4.6: The Great Convergence — Every](https://every.to/vibe-check/codex-vs-opus)
- [Best AI for Coding (2026): Every Model Ranked by Real Benchmarks — Morph](https://www.morphllm.com/best-ai-model-for-coding)
---
### 数字身份是最大的杠杆
- URL: https://guanjiawei.ai/zh/blog/digital-identity-biggest-leverage
- English: https://guanjiawei.ai/en/blog/digital-identity-biggest-leverage
- Published: 2026-04-14
- Tags: AI, 思考
最近有一种越来越强的感受:数字世界的身份,可能是接下来杠杆最大的事情。不是"应该做",是"不得不做"。
## 生产本身不值钱
你写了多少代码、提了多少 commit、合了多少 PR,有什么意义?一个软件 1,000 万行代码,就值钱了?
不是的。
你在小红书上发了 1,000 篇文章、做了 1,000 个视频,就创造了价值?也不是。生产的效率太高了。AI 生成视频的成本已经从传统制作的每分钟 4,500 美元降到 400 美元左右。营销视频的制作周期从 13 天压缩到 27 分钟。当所有人都可以又快又便宜地把东西做出来,"做出来"本身就没什么稀缺性了。
## 所有创造都是实验
那什么是有价值的?
我觉得我们做的所有创造,本质上都在做实验。做软件是在验证一个想法,发视频是在测试一个假设。做完了扔到真实世界里去跟人交互,看看行不行。
比如做了一个工具,功能描述上都达到了,但用起来又不准又不方便。那这个软件本身没创造什么价值,它唯一有用的地方是告诉你:这样的方式不灵。发了 1,000 条视频没人看也一样,有价值的不是那 1,000 条视频,是"这种方式行不通"这个信息。
很多人说的 growth mindset,发展型思维,其实干的就是这个事情。Eric Ries 在《精益创业》里讲的 Build-Measure-Learn 循环,说白了也是这个意思——用最小代价最快速度去验证,验证失败了也是结果。AI 编程把这个循环压缩了——[更快地失败](/blog/failing-faster-with-ai),也就更快地接近真相。
所以真正有价值的,不是你生产了多少,是你能多快地得到真相。
## 1,000 个人
Kevin Kelly 2008 年写过一篇文章叫"1,000 True Fans",说一个创作者只需要 1,000 个真正的粉丝就足以建立事业。这个说法在 AI 时代有了不一样的含义。
不是说 1,000 个粉丝够你吃饭。是说当你有 1,000 个活跃的关注者,你做的每一个实验都能更快地得到反馈。
你随手做了一个产品、发了一个视频、表达了一个观点,就会有人帮你检验:这个想法 work 不 work?用了你的产品说好用不好用,看了你的内容点赞或者骂你垃圾。你不需要等很久就能知道方向对不对,然后推进下一轮。
没有这 1,000 人呢?你要去找,去想办法,去依赖别人。我自己最近在小红书上发内容就深有体会——想找到第一批跟你产生紧密连接的人太难了。平台的算法管控很激进,动不动就软限流,你根本不知道是内容不行还是被限了。这个门槛还会越来越高,因为注意力是有限的,内容在膨胀。
你不做,它就一直等在那里。越拖越难。
## 谁在做这件事
Karpathy,之前特斯拉自动驾驶的研究负责人,现在活得跟网红一样。X 上接近 200 万粉丝,YouTube 超过 100 万订阅。今年 3 月他发了个 AutoResearch,630 行 Python 脚本,跑了两天跑完 700 个 ML 实验,发现 20 个优化点,Fortune 报道了。4 月又发了个 LLM Wiki 的想法,一个 GitHub Gist 几天拿了 5,000 多 star。每一个项目发出去,大量的人帮他验证能不能用,他很快得到印证,推进下一个。反馈时间可能是别人的十分之一。
雷军也一样。大家说他企业家、投资人,但他也是个网红。抖音 4,450 万粉丝,2024 年新榜数据显示他是抖音企业家 IP 影响力第一名。SU7 从 2024 年 4 月上市到年底交付 10 万台,2025 年全年 41 万台。他搞新产品,投票问大家行不行、价格高不高、外观好不好,几天就有结论。他做实验比别人快太多了。而且他去年还因为一起 SU7 事故一天掉了 29 万粉丝,这个事本身也上了热搜,3,400 万阅读——个人品牌和产品绑得有多紧,从正反两面都能看出来。
马斯克就更夸张了,X 上 2.36 亿粉丝,全平台第一,每天发 8 到 12 条。特朗普 1.09 亿,全平台第三,炒股的人都盯着他的 X。往大了说这些人搞的都是一回事:通过数字身份做实验,验证想法,收集反馈。
往小了看也一样。有些视频博主一开始各种方式起号,积累了流量,后来想转型去给家乡带货卖农产品,结果带动的量比村长县长都大。她有那个数字身份在,它就是个杠杆,可以撬别的事情。
AI 行业的 KOL 更明显。我之前做商务了解到,现在 AI 圈 KOL 的广告报价跟粉丝数大概 1:1——1 万粉丝一篇文章 1 万块,10 万粉丝一篇 10 万块,中腰部账号大致这个水平。排期经常排不上,拿着钱人家不一定有空发。有些做 AI agent 方向的 KOL 已经开始被地方政府邀请去办会了。
这个东西积累起来之后可以用到所有地方,不局限在一个领域。
## 到年底就晚了
我的观点比较激进:到今年年底,没有数字身份就会变成一个很大的问题。
以前建个网站费劲,做内容费劲,搞视频费劲。但 coding agent 普及之后,门槛在快速消失。文生图、文生视频出来之后,制作内容的成本越来越低。别人都在做,你不做,差距只会拉开。
举一个我自己工作里的场景。我之前跟团队的商务同事讨论过:假如到年底,我们俩一起去拓新客户。我在网上一直维护着一个活跃的身份,有博客、有项目、有社交媒体,1,000 个比较好的粉丝经常帮我转发。你从现在开始什么都没做,数字世界里搜都搜不到。
见面之后对方第一反应是什么?搜一搜。现在大部分人已经习惯用 DeepSeek 或者 ChatGPT 先查一下。以后会有 agent 替你做——帮我调研一下这个人,什么背景,什么信用状态,发过什么观点。
一搜,有的人信息丰富,个人网站、项目、观点都在。另一个人一搜,啥也没有。你不慌吗?你觉得搜不到的那个人可信赖吗?关键是其他人可能都逐渐很活跃了。
如果你是研究员或者 AI 从业者,没有个人网站,没有项目列在上面,现在可能就已经在找工作时吃亏了——因为别人有。
## 全红婵
当然数字身份也有让人头疼的地方。
最近全红婵的事情让人挺难过的。她不是自己想建立数字身份,是因为太厉害了被推到聚光灯下。东京和巴黎拿了三块金牌,后来因为自然生长发育长高了 10 厘米、增重 8 公斤,在网上被反复说"胖了"。她自己说焦虑、失眠、反复做噩梦,一度认真考虑过退役。4 月初体育总局介入调查网络暴力,4 月 12 日广东警方拘留了一名持续辱骂她的男子。
这个事挺说明问题的。数字身份如果你不主动建立和维护,它的影响范围可能远超你的预料。现实中你接触的人可能就那么几个,数字世界里可能是几千万人在看着你。突然间你没在意,那个东西就崩了。
隐私问题也是真的。你活跃了就有社交属性,不能想说什么说什么。但这跟现实世界的社交其实没区别——你出来工作就要遵守基础的规范。但凡你的身份是活跃的,你就得管理它。
不过话说回来,你不主动建立,别人也会搜你、议论你。被动不如主动。
## 最大的杠杆
回到开头。
我觉得当前能找到的最大个人杠杆就是这件事:去构建自己在数字世界的身份。跟行业无关,跟方向无关。它加速的是你做实验、得到真相的整个过程。从 1,000 人到 1 万到 10 万,滚动会越来越快。
AI 让做这件事的门槛比以前低太多了。我自己[用 Claude Code 两天就把这个官网聊出来了](/blog/from-idea-to-seen),一周后就有人找上门。剩下的就是你自己动手。
---
### 更快地失败
- URL: https://guanjiawei.ai/zh/blog/failing-faster-with-ai
- English: https://guanjiawei.ai/en/blog/failing-faster-with-ai
- Published: 2026-04-13
- Tags: AI, 编程, 思考
之前聊了不少 AI 在 web coding 里带来的变化,大多是它强的地方。今天换个角度,记几个失败的例子。
## 自己修不好自己
Claude Code 有一个 Chrome 浏览器扩展,通过 MCP 协议操控浏览器,可以让它直接在浏览器里搜东西、点按钮、截图。
这个插件一开始用着还行,某天突然打不开了。
当时对它的能力还比较信任。毕竟是自家的插件连自家的工具,纯软件问题,应该很快搞定。我就说:你自己看看怎么回事,修一下。
结果折腾了三四个小时。
中间的过程挺有意思。Opus 4.6,effort 开到 high,让它自己去找原因。每次都是一通分析,说"发现了关键线索",改了一些配置,最后说"你重启一下 session 应该就好了"。重启,不行。再分析,再改,再说重启就好。又不行。
后来甚至让我去 Chrome 扩展的控制台看日志,把错误信息复制给它。一旦开始向你要信息,方向就跑偏了。它不断索取更多的调试数据,但每一轮的结论都是"重启一下"。
这个循环重复了很多轮。到后面有点搞笑了。
最后是我提醒它:你去网上搜一下,看看别人有没有遇到类似的问题。它搜了一圈,找到了 GitHub 上其他人提的 issue,顺着解决思路,15 分钟搞定了。
后来了解到,这个扩展的架构是一条多跳连接链:CLI → WebSocket → bridge.claudeusercontent.com → native messaging host → Chrome 扩展。任何一跳断掉都会连接失败,而且断了之后没有明确的错误提示。如果同时装了 Claude Desktop,两个程序还会抢同一个 native messaging host,互相打架。在 GitHub 的 claude-code 仓库里是个已知问题。这种经历跟我之前[10天写30万行代码然后全删了](/blog/code-is-liability)的感悟一致——代码是负债,做之前想清楚比做完再删便宜太多。
自己公司的插件,连自己的工具,本以为是最熟悉的领域。三四个小时自己诊断,最后是"去搜一下"15 分钟搞定的。
## 小红书实验
第二个是小红书。
已经积累了不少博客内容,想着能不能转化成小红书上的流量,让不认识的人也能看到。
先试了最直接的方式:把博客文章发过去。效果约等于零。
然后让 Claude Code 帮我设计实验方案。方案本身做得不错,内容改编、标签策略都考虑到了,比我自己做系统得多。但结果都很差。
排查下来,全是被软限流了。
小红书对新账号的管控很激进。它不会直接告诉你"你的内容违规了",就是悄悄不给流量。搜也搜不到,推荐也没有。你发了帖子,看起来一切正常,但就是没人看见。你也不知道是内容不行还是被限了,这个才烦。
后来查了一下,2025 年 4 月单月小红书就处理了 100 万个违规账号。平台要求原创度超过 60%,低于 600 字的笔记可见性会被压制。对于用 AI 批量生成然后分发的内容,NLP 层面的语义理解让换词、谐音基本没用。注册门槛低,所以起号阶段被拦截的概率非常高。
做了几轮实验之后我就放下了。这事目前搞不定。
不过折腾这一圈也让我更确信一开始的选择是对的——[先沉淀到自己的官网,再分发到各平台](/blog/from-idea-to-seen)。如果一开始在小红书上做内容,面对不透明的算法和随时可能变的规则,新号没有正向反馈,做着做着可能就放弃了。个人网站没有这些,想写什么写什么。不同时间有朋友来说"这个蛮有意思",在知乎发一篇文章偶尔反响还不错,很多人讨论收藏。这些反馈是自然的。博客的资产是思想,先有内容再找分发,比先依赖平台再想内容健康得多。
## 失败才是主旋律
这两个例子都不算大事。第一个不及预期,但最终搞定了。第二个既不及预期也搞不定。
但我不觉得要因此对 AI 编程失望,也不觉得该因此瞧不起它就不用了。
日常工作里,人去做事的主旋律本来就是失败。想一下整个工作过程,获得成果的时刻其实非常少,大多数时候都在碰壁和调整方向。通过大量失败积累经验,在过程里探索,这就是常态。
跟打游戏一样。谁一上来就是顶尖玩家?最开始都是被虐,菜鸟,然后在失败里逐渐学习和提高。
跟模型协作也绕不开这个过程。CodeRabbit 今年的报告说 AI 生成的代码产生问题比人工代码多 1.7 倍。Copilot 的建议只有约 30% 被开发者接受。还有个调查挺有意思,说开发者自认为用 AI 快了 20%,实际算下来因为审查和修 bug 反而慢了 19%。
这些数字看起来不太好看。但换个角度想,AI 编程的价值可能就不在"成功率"上面。
软件开发里有个 fail-fast 原则,Jim Shore 说过一句话:立即且明显地失败,听起来让软件更脆弱,实际让它更健壮。Eric Ries 的《精益创业》也是这个思路,Build-Measure-Learn 循环说白了就是用最小代价最快验证假设,验证失败了也是结果。
AI 编程做的就是把这个循环压缩了。以前修一个 Chrome 扩展的问题,可能要花好几天搜索学习求助,最后可能还是放弃。现在三四个小时,中间人什么都没做,就看它一遍一遍跑、给它重启,最后搞定了。小红书那个实验本来可能要折腾更久才能知道走不通,现在几轮实验就有结论了。
尝试的面变宽了,反馈的速度变快了。以前折腾一件事要很久才知道结果,现在可能缩短到原来的十分之一。
## 模型在变强
这段时间还有个感受,模型进步速度比想的快。
去年 12 月底开始折腾 AI 编程。先用了一天 Sonnet 4.5,没能继续用。正好 Kimi K2.5 在 1 月底发布,买了会员试了试,体感不如 Sonnet 4.5 但也能用。同期试了 Codex 5.2,有点笨,还不如 K2.5 好使。没有什么高预期,就说这个事情既然已经开始在尝试了,不然做个小项目看看。
当时要求其他人也一起来做这个小项目。过程也不顺利,各种问题,来来回回折腾半天。但确实可以做到。这就令人诧异了。
然后就开始有新的想法。当时想做一个展会的 demo,大概有个想法,觉得应该不难。让 K2.5 去试,折腾了两三天怎么都搞不定,每次都说"行了可以了",结果就是跑不通。
2 月初 Opus 4.6 出来,一次搞定。
这种时刻才会真切感受到模型的进步。不是跑分高了几个点的事,是在实际使用中解决了你之前怎么都过不去的问题。
再后来旅行期间用 GLM-5、MiniMax 2.5,国内模型便宜些。后来用 Opus 4.6 做一个小插件,又是来来回回跑不通,每次都说好了没问题,一试就不行。把同一个任务扔给 3 月初发布的 GPT-5.4,三个小时后说搞定了。一试,真搞定了。
这些事全发生在三个月内。[Vibe coding](/blog/vibe-coding)的核心就在这里——工具在飞速迭代,今天的短板明天可能就补上了。
这意味着什么呢?现在卡住的问题,可能下个月就不是问题了。要么多花点时间让模型多跑多试,配合它一起来做。要么等一等,新模型一出来可能就是另一个故事。
当然,遇到小红书这种平台规则的问题,模型再强也帮不了你。
## 不是许愿
如果觉得有了 AI 就能从"以失败为主旋律"变成"以成功为主旋律",那想多了。那是许愿,不是工具。
实际发生的事情是:还是以失败为主旋律,但失败得更快了,失败得更多了。
我们处在一个高度不确定、竞争激烈的时代。不可能每做一件事马上就出成果。但如果失败的速度快了、范围宽了,穿越这些弯路到达有价值的地方,也会快一些。
我觉得这可能才是现在这个阶段,它比较有意思的地方。
---
### 急诊室与消失的护城河
- URL: https://guanjiawei.ai/zh/blog/emergency-room-vanishing-moat
- English: https://guanjiawei.ai/en/blog/emergency-room-vanishing-moat
- Published: 2026-04-11
- Tags: AI, 产品, 重构, 思考
最近把 Aima Service 重构了一遍。花了一周多,过程里冒出不少想法,记一下。
## 急诊室
Aima Service 不是那种天天打开的工具。更像是设备的急诊室,平时想不起它,出了问题才来。
这就导致一个很别扭的局面:成功的时候用户没感觉。问题解决了,"嗯,还行",走了。因为没经历过痛苦嘛,自然不觉得解决了多大的事。
反倒是失败的时候有意思。
失败分几种。智能体认真干了但搞不定,告诉你任务失败,这算一种。声称搞定了你一试发现没有,假成功,这也算一种。但最要命的是通道本身坏了。崩溃、卡死、跑着跑着断了。
前面两种还好。就像去急诊,医生看了半天没治好,你换一家就是了。最后那种不行。你打了 120,车来了,到了急诊室门口发现关门了。或者进了门,挂号系统崩了,医生看了一半人不见了,有人出来跟你说"不好意思,今天打烊了"。
这个才是真的让人崩溃。
## 装修没用,医生得在
想明白这件事,优先级就清楚了。
急诊室,装修再豪华没用,沙发再舒服没用。就看两样:门开不开,医生能不能看病。
之前的版本功能上够用,但稳定性不行。跑任务经常 bug 一堆,动不动崩溃,各种莫名其妙的卡死。急诊室的门开着,医生不在。
所以做了一次彻底重构。不加新功能,就是把地基重打。
## 两个模型轮着上
重构用了 Claude Code 和 Codex 两个模型,轮流做。
先把文档体系设计好,让两个模型各自读一遍文档和代码,列出要做的事。然后 Claude Code 先跑一轮重构,做完交给 Codex 再来一轮。来回交替。
为什么不只用一个?试过,容易跑偏。Claude Code 架构感强,能看到结构层面的问题,但有时候太保守。Codex 推进速度快,更敢动手,还会回头扫一些细节,但偶尔太粗放。只让一个做,缺陷会被放大。交替着来反而节奏最好,一个发现的问题另一个经常能补上。
后来查了一下,NeurIPS 2025 有一篇 ["Lessons Learned"](https://arxiv.org/pdf/2505.23946),专门分析不同 LLM 怎么互相补位,结论是大概 3 个 agent 效果最好,再多就递减了。跟实际感受对得上。
每轮让模型自己拉 agent team 并行跑,一个任务三四个小时很正常。反正异步的,人该干嘛干嘛,偶尔看一眼提几个问题就行。
## CI/CD 吃掉的时间比想象中多
功能重构大概一周就七七八八了。真正耗时间的是后面。
代码改了一大片,上线之前靠什么兜底?自动化测试、构建检查、集成验证,一个都跑不掉。流水线跑一次几十分钟过去了,有问题改完再跑,又几十分钟。后面反反复复调测试用例、优化流水线,光测试代码就写了好几万行。
大家聊 AI 写代码,关注的都是"多快"。但真要上生产,CI/CD 和测试占掉的工程量可能超过一半。这部分 AI 也能做,但轮次多、调试多,急不来。
## 130 万行
重构完生成了一份报告,看了一下数字。
功能上没加新东西,看起来平平无奇。但架构从之前"跑个任务 bug 一堆"的状态变成了能扛 10 万级用户的设计,模块拆分干净了很多,分布式 worker、海外联邦都做进去了。
代码量让我有点意外:抛开文档约 130 万行,加上文档 170 万行。八九天,一个非专业的人,两个 AI 模型。
然后我想起来一件事。
## 护城河干了
前几年有个说法挺流行的:代码量就是软件公司的壁垒。几百万行代码堆在那里,别人想抄也抄不了。
我记得以前读过相关的东西,当时觉得有道理。[思科 IOS XE 有 1.9 亿行代码](https://blogs.cisco.com/networking/how-ios-xe-developers-at-cisco-work-remotely-and-cohesively-on-a-190-million-line-code-base),3000 多人在维护,每年出 700 多个新功能。SAP 的 ABAP 代码超过 2.5 亿行,能看懂的人越来越少。这些公司确实是靠"这坨东西太复杂了,没人能替代"撑着的。
不过仔细想想,代码量从来不是壁垒的全部。思科的护城河是 1.9 亿行代码加上生态系统和切换成本,还有品牌。SAP 的壁垒不是 ABAP 难写,是 42.5 万客户里只有 5% 在七年内迁到了 S/4HANA。[Lidl 试过,烧了 5 亿欧元放弃了](https://www.computerweekly.com/news/252446965/Lidl-dumps-500m-SAP-project)。[Revlon 亏了 6400 万美元销售额](https://www.henricodolfing.com/2019/08/case-study-revlon-sued-because-sap-implementation.html)。复杂度制造的锁定效应,比代码本身顽固得多。
但现在有意思了。今年初 Marek Kowalkiewicz 写过一篇 ["Drying the Moat"](https://marekkowal.substack.com/p/drying-the-moat),里面提到 Anthropic 演示 AI 能读懂和现代化 COBOL 系统之后,[IBM 一天市值蒸发了 400 亿美元](https://www.cnbc.com/2026/02/23/ibm-is-the-latest-ai-casualty-shares-are-tanking-on-anthropic-cobol-threat.html)。代码复杂度制造的其实是一种"理解不对称":你看不懂我的代码,所以你离不开我。AI 把这层不对称给抹掉了。
回头看我自己这次:八九天,一个人带两个模型交替跑,130 万行代码的系统已经在线上跑着了。有分布式架构,有 CI/CD 流水线。
130 万行当然不等于思科那 1.9 亿行,差两个数量级。生态和客户锁定也不是代码能替代的。但"代码复杂度"这条腿,已经在被抽掉了。剩下几条腿能撑多久,不好说。
## 想到就做
回头看整个过程,有几点感受。
AI 做产品级的软件,能做。这次出来的东西已经在线上跑了,有用户在用,不是 demo。难的地方在 CI/CD 和测试,这些费时间,但 AI 也能做,就是得多跑几轮。
重构这件事也没那么可怕了。以前接手一坨屎山代码,光搞清楚它在干嘛就得好几周。现在模型读进去几分钟就能画出架构图来。一周从屎山到新架构,技术债清得比人工还干净。
最大的变化可能是心态上的。以前重构是个大决策,要算投多少人、花多长时间、风险大不大。现在觉得代码库撑不住了就重来一个。有新技术出来也一样,直接用新的重新构建。代码这个东西,越来越像耗材了。
当然代码还是产品的骨架,这个没变。但生产骨架的成本,跟以前已经不在一个量级。
---
### 当饺子馆开始发 Skill
- URL: https://guanjiawei.ai/zh/blog/github-xiaohongshu-era
- English: https://guanjiawei.ai/en/blog/github-xiaohongshu-era
- Published: 2026-04-11
- Tags: AI, 编程, 思考
前几天看到一个帖子说 GitHub 正在小红书化,想了想,还真有点道理。
## 随手参与
三月底 [Claude Code 的源码泄露了](https://thehackernews.com/2026/04/claude-code-tleaked-via-npm-packaging.html)。不是主动开源,是 npm 包里带了一份 59.8 MB 的 source map,顺着能找到 Anthropic 存储桶上的完整源码,将近 1900 个 TypeScript 文件,51 万行代码。Bun 默认生成 source map,没人加进 .npmignore,就这么漏出去了。
泄露之后一堆开源项目冒了出来。其中一个叫 [OpenClaw](https://github.com/openclaw/openclaw),之前叫 Clawdbot,因为 Anthropic 商标投诉改了名,支持各种 LLM,现在 35 万 star。
我之前就想把 Claude Code 魔改一下支持 OpenAI 的模型。Codex 的信息整理和任务编排都不如 Claude Code 顺手,但评估了一下工作量太大,放弃了。看到 OpenClaw 的时候就想,果然,想到的事基本有人做完了。
下载回来试了试,能用,但 reasoning effort 默认是 high,我一般用 extra high。跟 Claude Code 互补着来,xh 确实能啃更复杂的问题。但没地方改。
那就动手。让 Claude Code 帮我改 OpenClaw 的代码,加了 provider → model → effort 三层结构,跟 Open Code、Kilo Code 那种多 API 架构思路类似。改完有 bug,调了调,顺手提了个 PR。
CI fail 了,没管。同事试了一下说不能用 fast mode,确实,xh 太慢日常都开 fast mode。又改了一轮补到 PR 里,CI 又 fail,冒烟测试过不去。
原作者回了一个词:conflict。
能理解。从原来三个模型的固定设计改成多 provider 多 API,变化太大,跟他想维持的方向冲突。
但整个过程挺有意思。看到了就下载,不顺手就改,改完一键提 PR,对方 comment 邮件推过来,看一眼回一下。跟刷小红书差不多。没有以前那种"正式参与开源项目"的仪式感,看见了就顺手做了。
## 饺子馆的 Skill
同一时间看到另一个帖子。
金谷园饺子铺,北邮旁边的一家饺子馆,老板做了一个 Claude Code 的 skill,发在公众号上。
内容有点搞笑:菜单、外卖信息、Wi-Fi 密码,全打包进去了。老板说到店里用这个 skill 就能获取最新信息。
最逗的是公众号底下的评论。一群人在给饺子馆提 issue。
公众号 GitHub 化了。
老板说因为店开在北邮旁边,来吃饭的天天聊 AI、skill、Claude Code,听多了回家 vibe coding 几个小时就写出来了。
这个 skill 本身没什么用。谁会为了查饺子馆 Wi-Fi 密码去装个 skill?不过要是把饺子的制作过程做进去,像老乡鸡当年搞菜谱那样,做菜的时候看一眼步骤,食材搭配让它推荐,这倒是有点意思。
## 好莱坞的 GitHub
前段时间跟人吃饭,我问对方看没看过《生化危机》。里面的女主角米拉·乔沃维奇,就是也演了《第五元素》那位,今年 4 月初在自己的 [GitHub 账号下发了一个项目](https://github.com/milla-jovovich/mempalace)。
项目叫 [MemPalace](https://www.mempalace.tech/),AI 记忆系统。灵感来自记忆宫殿术,对话数据按 wing、hall、room 三层组织,存原始对话不存摘要,ChromaDB 加 SQLite 跑在本地,零 API 费用。
动机很直接:她用 AI 聊天时发现现有记忆系统总是擅自决定记什么忘什么,受不了,就拉了一个做 crypto 的开发者 Ben Sigman,俩人用 Claude Code 花几个月做了出来。
两天拿了两万多 star,现在超过四万。有争议的是基准测试。项目一开始宣称 LongMemEval 拿了 100% 的最高分,后来[被发现有针对测试题做定向优化的嫌疑](https://nicholasrhodes.substack.com/p/mempalace-ai-memory-review-benchmarks),修正到 96.6%。不过架构本身的评价不错,USC 有位计算机教授也给了正面的反馈。
好莱坞明星,GitHub repo owner,四万 star。这事搁前几年说出来没人信。
## 蒸馏同事
朋友圈也开始流行一个说法:把同事蒸馏成 skill。
有人真做了。一个叫"同事.skill"的项目上线几天拿了七万 star,把同事的飞书消息、钉钉文档、工作邮件喂进去,生成一个模仿这个人工作习惯和决策风格的 AI skill。
衍生项目一个接一个出来。蒸馏前任的、蒸馏自己的、蒸馏公众人物的。最绝的是有人做了个"反蒸馏",生成一份看起来完整但故意藏着核心知识的 skill 文件,防止自己被蒸馏。
我觉得这事想太多了。
大多数人工作中的所谓个人风格没什么价值。交流习惯、沟通方式这些东西,你真用的时候会发现它什么都没创造。这些 personality 带来的效果,甚至不如不同模型本身的特点差异大。给不同模型配不同技能,可能比蒸馏一个人管用得多。
大家想象的画面很刺激:聊天记录灌进去,人就可以干掉了,焦虑就来了。但跟饺子馆的 Wi-Fi 密码一样,这东西根本没有需求。
## Skill 不对,Agent 对
饺子馆老板倒是说了句有意思的话:未来可能是基于地理位置的。你的个人助理 agent 走到店里,直接跟店的 agent 交互。
我觉得这个方向是对的。
你带着自己的 agent,它知道你的口味、前段时间吃过什么、有什么忌口。走进一家店,你的 agent 跟店的 agent 聊:有什么菜?今天推荐什么?哪道评价好?聊完综合你的偏好给你推荐。你只跟自己的 agent 说话就行。
这跟扫二维码不一样。扫码是你自己面对一堆菜名和口碑评分,自己看自己选。Agent 对接是两个了解各自主人的程序在替你沟通。
如果一家店把经验、菜品知识、顾客反馈沉淀成它自己的 agent 服务,你的 agent 跟它对接,该了解的了解完了,你拍板就行。这跟以前扫码点菜完全是两回事。
Skill 的问题是它还停在"人去主动装、主动用"。Wi-Fi 密码做成 skill 没人装。但店变成 agent 服务,走进去就自动连上了。
## 门槛去哪了
饭店老板 vibe coding 几小时写 skill。好莱坞明星当 GitHub 第一作者。源码泄露几天后就冒出 35 万 star 的替代品。我自己提 PR 的整个过程像发条小红书笔记一样随手。
以前"参与开源"是要看文档、读代码、写测试的。现在看到了就改,改完就提交。GitHub 在小红书化,公众号在 GitHub 化。门槛确实在消失。
agent 互通这件事,看看 OpenClaw 这种项目的推进速度,可能比大多数人想的都近。
---
### 编程智能体的百万级鸿沟
- URL: https://guanjiawei.ai/zh/blog/coding-agent-adoption-gap
- English: https://guanjiawei.ai/en/blog/coding-agent-adoption-gap
- Published: 2026-04-10
- Tags: AI, 编程, 思考
黄仁勋这两年反复表态——"agentic AI 的时代到了""万亿级的机会"。[去年 10 月他说英伟达每个工程师都在用 Cursor](https://techstartups.com/2025/10/09/nvidias-ceo-endorses-cursor-100-of-our-engineers-now-code-with-ai/),今年 GTC 上画了一个 [7.5 万人搭配 750 万 agent 的图景](https://fortune.com/2026/03/19/jensen-huang-nvidia-ai-agents-future-of-work-autonomous/)。
听着好像编程智能体已经很普及了。我去查了一下实际数据。
## 数字出乎意料
Claude.ai 月活大概一两千万。第三方估算 Claude Code 周活跃用户约 160 万。Cursor 超过 200 万用户,100 万付费。开源这边,OpenCode 在 GitHub 上 14 万 star,Cline 在 VS Code 装了 500 多万次。
数字不小。但 GitHub Copilot 一家就有近 2000 万用户,JetBrains 今年初的调查说 74% 的开发者已经在用某种 AI 编程工具。
Copilot 主要做自动补全,算不上智能体。真正以智能体方式工作的——你给一个任务,它自己读文件、写代码、跑测试——这些工具的用户加一起,大概几百万到一千多万。
被全球最高市值的公司说成"改变世界"的东西,用户就这个量级。我原本猜至少几千万。
国内倒是热闹。Kimi 平台月活过三千万,字节的 Trae 注册超 600 万。不过这些数字掺了不少非编程场景,真正在用编程智能体的没那么多。
很多人在讨论 Skills 怎么配、MCP 怎么接。但可能得先退一步:为什么第一步这么多人走不出来?
## 不只是写代码
最常见的误解是把 coding agent 当成"写代码的工具"。不写代码的人觉得没关系,写代码的人觉得就是升级版 Copilot。
实际上这东西干的活远不止代码。拼接视频、批量处理文件、去网站抓数据、调试不熟悉的软件,都能做。说白了它就是帮你操控电脑完成任务,代码是它的操作语言。我之前写过,这是一种[元能力](/blog/coding-agent-meta-ability)——让普通人以极低的门槛真正掌控自己的电脑。
手机是个例外。手机天生围绕 GUI 设计,coding agent 在上面不太好使。之前那些用模型操控手机的项目火过一阵,但路子完全不一样,还不太行。
## NPC 醒了
更深的问题是思维方式。
用软件这件事,大家已经习惯了预设好的交互。点这里干什么、拖那里变什么,一切都被设计过。游戏里的 NPC 也是这样,给三个选项你选一个,台词看不看无所谓。
现在 NPC 突然能想事了。它等你说话,然后照着做。
这种感觉跟 ChatGPT 刚出来时一样。我当时做了不少教程教人用,后来发现大部分人卡在表达上。觉得要当"提示词工程师"才行——要把话说得精准,要让 AI 听话,高级一点的还得搞点花活。
没那么复杂。把 coding agent 当个同事就行。它看得懂你说的话,也能翻你项目里的文件。你把想做的事讲清楚,大半就搞定了。
## 别自己上手
还有一个跟习惯有关的坑。
越能干的人越容易掉进去。遇到问题第一反应就是自己动手。跟当领导一样,明明有人能做,总觉得自己来更快。
但 coding agent 可能比你快十倍。质量暂时差点,迭代速度补回来了。问题是一旦你开始自己干,就又滑回了老路——碰到问题问问 DeepSeek 或豆包,自己改改,AI 当个顾问用。活还是你的。
我现在电脑上 95% 的工作都交给 coding agent 了。查资料、写东西、写程序、发邮件、操作网页。跨过去之后不用人教,因为你可以让它帮你搞清楚怎么用得更好。这就是元能力。我[从零搭这个官网](/blog/from-idea-to-seen)就是这么干的——不懂前端、不懂DNS、不懂SEO,全让Claude Code搞定。
## Human in the loop
不过也别太乐观。
agent manager、多智能体编排这些概念听着很美,让 AI 管 AI,全自动跑。方向对,但现在没到那步。
实际跑下来,一个懂行的人在 loop 里盯着,效率差别非常大。完全撒手让 agent 自己编排,任务一复杂就出问题。之前[聊过 Worker 和 Manager 的关系](/blog/worker-before-manager),说的就是这个。
短期内还是得有人在中间。但这个人的角色不是去亲手干活,而是说清楚要什么、看一眼结果对不对、在关键的地方拍个板。
这一步跨过去了,后面很多事自然就通了。跨不过去,就一直在外面看着别人用。
---
### 一匹小马与文生视频的私有化刚需
- URL: https://guanjiawei.ai/zh/blog/happy-horse-video-privatization
- English: https://guanjiawei.ai/en/blog/happy-horse-video-privatization
- Published: 2026-04-09
- Tags: AI, 视频生成, 硬件, 开源, 思考
4 月 8 号,[Artificial Analysis](https://artificialanalysis.ai/video/arena) 视频竞技场排行榜上突然冒出一匹马。
一个叫 HappyHorse 的匿名模型,文生视频 Elo 1333,图生视频 1391,双双刷新纪录,直接把字节跳动的 [SEEDANCE 2.0](https://seed.bytedance.com/en/blog/official-launch-of-seedance-2-0) 从榜首挤了下来。SEEDANCE 2.0 是今年 3 月刚发布的,压着 Google Veo 3、OpenAI Sora 2 和 Runway Gen-4.5 一众选手排第一。结果一匹小马来了,把它掀了。
## 匿名打榜的传统艺能
这种匿名上榜的操作,在国内 AI 圈已经算是一种保留节目了。
今年 2 月,OpenRouter 上出了一个叫 [Pony Alpha](https://openrouter.ai/z-ai/glm-5) 的匿名语言模型,免费使用,20 万上下文窗口,上线第一天就跑了 400 亿 token。五天后[智谱官宣](https://www.qbitai.com/2026/02/378068.html):Pony Alpha 就是 GLM-5,745B MoE 架构。3 月份又来一个 Hunter Alpha,社区一度猜是 DeepSeek V4,结果[小米站出来认领了](https://www.qbitai.com/2026/03/389038.html)——MiMo-V2-Pro,万亿参数。
匿名打榜的好处很直接:在没有品牌光环也没有品牌包袱的情况下,拿到真实的盲测数据。跑分可以做手脚,盲测做不了。
HappyHorse 也是这个路子。不过有一点很快就露馅了——支持的语言列表里,中文和粤语排在最前面。
## 域名大战
既然模型火了,域名自然要被盯上。
我去搜 HappyHorse 的官网时发现一件很搞笑的事:happyhorse.io 和 happyhorse.com 都已经被抢注了,上面搭好了网站,直接开始收费。点进去一看,文生图、文生音乐、文生视频一条龙服务都有,阵仗搞得挺大。但仔细看用的根本不是 HappyHorse 模型,后面跑的是 [Lightricks](https://www.lightricks.com/) 的 [LTX](https://github.com/Lightricks/LTX-Video)——一个以色列公司做的开源模型,原版只有 20 亿参数,之前测试过,跟打榜的那个 HappyHorse 完全是两个东西。
域名抢注的速度比模型训练快多了。但要是有人不了解情况,花了钱以为在用那个排行榜第一的 HappyHorse,就有点坑了。
不止域名。HuggingFace 上也冒出了好几个 HappyHorse 相关的仓库——happyhorse-lab、happyhorseai、HappyHorseOrg——看起来很像官方。但一查创建时间全是 4 月 9 号当天注册的,点进去要么只有一个 README,要么就是空仓库。README 里倒是写得很完整,"开源""第一名"之类的都有,就是没有权重文件。蹭热度不光抢域名了,连 HuggingFace 都给占上了。
## 谜底还没揭晓
到写这篇文章的时候,HappyHorse 的来源其实还没有定论。
Artificial Analysis 的模型页上仍然写着 "More details coming soon",用的还是神秘模型的占位图。榜单认可了它的成绩,但没有给出团队背景。也没有找到正式的技术报告、官方 GitHub 仓库、公司公告或论文首页来把身份闭上环。
目前最有说服力的推断是跟 Sand.ai 有关。外面流传的 HappyHorse 技术描述——15B 参数、40 层单流 Transformer、文本视频音频联合建模、8-step DMD-2 蒸馏、多语言 lip-sync——跟 Sand.ai 和 SII-GAIR 联合发布的 daVinci-MagiHuman 高度重合。[36Kr 的报道](https://eu.36kr.com/en/p/3757826958635781)也指向了这个方向。但到目前为止,这仍然是推断,不是官宣。
所谓的"已开源"也要打个问号。Artificial Analysis 在榜单上会给开源权重模型标 `Open Weights`,HappyHorse 目前没有这个标记。当前领先的开源视频模型还是 LTX-2 Pro 那一档。网上那些声称 HappyHorse 已经 Apache 2.0 全量开源的文章,目前对不上可验证的权重发布。
差不多同一时间,阿里发布了万相 2.7,27B 参数的 MoE 架构(14B 激活),支持「思考模式」。但万相 2.7 目前也只放了 API,权重没有公开。以前的万相系列一向发布即开源,这次不知道为什么没有。
## 文生视频的私有化刚需
HappyHorse 的身份迟早会揭晓。但我更感兴趣的其实不是谁做的,而是文生视频这种模型的私有化逻辑。
每一种模型都会带火一种硬件。DeepSeek 出来,H20 的订单直接炸了——光 2025 年 Q1,[中国公司就下了超过 160 亿美元](https://finance.yahoo.com/news/report-chinese-firms-ordered-16-205256234.html)。开源语言模型火了以后,[DeepSeek V3 跑在 8 台 M4 Pro Mac Mini 组成的集群上](https://blog.exolabs.net/day-2/),Mac Mini 跟着卖断货。
文生视频会带火什么?我觉得答案是消费级 GPU 和小型推理盒子。而且文生视频对私有化部署的刚需比语言模型强得多。
### 延迟不敏感,成本敏感
文生视频天然是一个「等得起」的场景。在云上生成一段视频,怎么也得等几分钟。在本地跑慢一点,十几分钟甚至半小时,其实没有本质区别——你不会盯着进度条看,该干嘛干嘛。
延迟不敏感,那就是成本敏感。视频上云除了算力,还有一个大头容易被忽略:带宽。视频动辄几十上百 MB,传来传去的网络费用很吓人。最近算过一笔账,服务器本身没那么贵,但网络带宽的账单看了一眼就不想再看。放本地,这笔钱省了。
延迟不敏感还带来另一个推论:你不需要最顶级的算力。语言模型推理追求低延迟,非得上最好的卡。文生视频不一样,慢一点没关系,那些「不够快但足够便宜」的算力——游戏显卡、上一代计算卡——就变成了高性价比的选择。
### 法规和内容审核的两难
这一条很多人没怎么想过。
文字内容的审核好办,大部分场景不太会碰到法律问题。图像和视频就不一样了,IP 侵权、肖像权、敏感内容,法规还没完全落地,云服务商夹在中间很难做。
做云服务的两难是:不拦,出事要担责;拦,技术上做不到精准过滤,误伤一大片。于是就变成宁可多杀不可少放——不让上传人像、不让涉及特定 IP、一检测到可能敏感就卡死。用起来就是各种受限。
本地就没有这些问题。模型在自己机器上跑,不经过第三方审核。Stable Diffusion 时代大量文生图工作流都在本地跑,不是因为本地更快,是因为没有审核限制。文生视频会重复这个模式。
### 变现路径更短
语言模型的价值一直很难量化。更好的模型写了更好的一段话,带来多少收益?说不清。从 32B 模型升级到几千亿参数的私有化部署,多花十倍成本买 H20,能多赚十倍吗?谁也说不好。Coding 场景出来以后好了一些,但之前大家确实算不过来这笔账。
文生视频完全不一样。好视频就是好流量,流量就是钱。花几百块生成一段质量过得去的视频,内容有意思的话,带来的流量可能值几千甚至几万。这笔账谁都算得过来。
SEEDANCE 2.0 就是个例子。创作者愿意花钱排队等资源,因为用它出的视频确实能跑出更好的数据。模型好坏的差距,发几条视频就看出来了。
## 硬件的连锁反应
HappyHorse 到底会不会开源、什么时候开源,现在还不好说。但可以先算一笔账。
如果按传闻的 15B 参数来估,FP16 推理大概需要 30GB 显存,量化到 INT8 只要 15GB 左右。一张 RTX 4090 或 5090 就能装下。DGX Spark 这种 128GB 统一内存的小盒子就更从容了,跑推理绰绰有余。
假如它真的以这个体量开源出来,RTX 4090/5090 大概率更难买。[DGX Spark](https://marketplace.nvidia.com/en-us/enterprise/personal-ai-supercomputers/dgx-spark/) 的价格已经从 2025 年最初公布的 3000 美元[涨到了 4699 美元](https://www.tomshardware.com/desktops/mini-pcs/nvidia-dgx-spark-gets-18-percent-price-increase-as-memory-shortages-bite-founders-edition-now-usd4-699-up-from-usd3-999),涨了超过 50%,供给本来就紧张。再加一个吃显存的大户进来,情况只会更夸张。
之前的剧本演过好几遍了。DeepSeek 引爆 H20,开源 LLM 拉动 Mac Mini。文生视频走到今天这个质量,就差一个足够好的开源模型落地。HappyHorse 有没有这个机会还不好说,但这件事迟早会发生。
## 悬而未决
回到 HappyHorse 本身。
会不会正式开源?现在看不出来。榜单成绩摆在那了,但权重和代码都没有落地。要是最后只做 API 服务,那对硬件市场的冲击就有限,又一个强大的闭源模型罢了。
体量到底多大?营销页上说 15B,如果是真的,一张消费级显卡就能跑。但要是实际上更大,需要多卡甚至集群,那本地部署就不太现实,又回到云厂商那套了。
这两个问题的答案不同,后面的故事走向完全不一样。但不管 HappyHorse 怎么样,文生视频往本地搬的趋势不会变。ComfyUI、WebUI 这些工具在等一个足够好的开源模型,量化社区也在等。等到了,消费级硬件那边就该热闹了。
---
### AI 的矛与盾
- URL: https://guanjiawei.ai/zh/blog/ai-spear-and-shield
- English: https://guanjiawei.ai/en/blog/ai-spear-and-shield
- Published: 2026-04-08
- Tags: AI, 安全, 思考
最近开发过程中注意到了一些挺有意思的点,外面发生的事情也不少。这个时代依然没有停下来,还在以非常夸张的速度往前跑。零散记录几个想法。
## Coding agent 解 bug 比写代码强
很多帖子和报告都在讨论一个问题:用 coding agent 写代码,最容易出什么问题?答案是 bug。
但从实际使用的体感来看,我觉得这恰恰说反了。
现在的 coding agent 在解 bug 和排查问题上的表现,比写代码要好。原因不复杂:debug 的目标是明确的,通常能复现,能一步一步拆开来验证。这种活 AI 干起来很顺手,速度还比人快得多。
真正有挑战的,反倒是让它从零去实现一个完整的东西——尤其当你想做的是一个产品。
## 产品化的深水区
传统软件开发有那么多流程——单元测试、集成测试、压力测试、灰度发布、Alpha、Beta——不是因为大家喜欢流程,是因为软件放到真实用户面前以后,会暴露各种你在代码里完全预想不到的问题。最佳实践能减少问题发生的概率,但没法消除问题本身。只有时间和使用压力,才能把问题逼出来,然后一个一个解决掉。
这个挑战对 coding agent 来说是一样的。
从零做一个小组件,很快。原型验证,很爽。但随着产品沉淀下来、代码量往上走,问题就来了:项目越大 AI 越容易改错东西,理解上下文的成本也在肉眼可见地往上走。这跟以前人去维护大项目是一样的道理——产品做出来之后迭代难度天然递增,得靠团队分工来扛。AI agent 也逃不掉这个规律。
所以我觉得现在的状态是这样的:验证概念很快,很爽。但把概念做成产品,每一个环节的深度思考和验证都省不了。
## 创意驱动的开源
但有一类方向,AI 确实特别擅长。
最近 Milla Jovovich——《第五元素》和《生化危机》系列的女主——花了几个月时间,和工程师 Ben Sigman 一起用 [Claude Code](https://www.anthropic.com/product/claude-code) 做了一个叫 [MemPalace](https://github.com/milla-jovovich/mempalace) 的开源 AI 记忆系统。4 月 5 号推到 GitHub,48 小时之内 7000+ star,现在已经超过 22000。
在 [LongMemEval](https://github.com/xiaowu0162/LongMemEval) 的评测里,MemPalace 的 R@5 到了 96.6%,远超 [Mem0](https://mem0.ai/) 和 [Zep](https://www.getzep.com/) 这些付费方案的大约 85%。全本地运行,ChromaDB + SQLite,MIT 协议,完全免费。
AI 记忆确实是今年大家非常关注的方向。但 MemPalace 的特点不在于它有多复杂,恰恰相反——它不靠复杂度取胜,靠的是创意。就是围绕一个很聚焦的目标,比如打一个 benchmark,然后想办法把它做好。
这种模式特别适合 AI 来辅助。问题越聚焦,越依赖想法而不是工程量,AI 帮你验证的速度就越快。开源世界里这类项目越来越多了,我觉得是个很有意思的方向。
## 没有软件是安全的
这两天最大的新闻,是 Anthropic 正式公布了 [Project Glasswing](https://www.anthropic.com/glasswing)。
他们内部代号 Mythos 的下一代模型,3 月底因为一次内部数据泄露(CMS 配置出了问题,意外暴露了大约 3000 份内部文件)被提前曝光,4 月 7 号正式官宣。这个模型在软件安全上的能力,到了一个他们自己都不太敢发布的程度。
以前的模型能找漏洞——这件事情在圈里已经不新鲜了。但把漏洞转化成可用的攻击手段,是完全不同的事情。Mythos 把这两步合在一起了。
[Anthropic 披露的数据](https://thehackernews.com/2026/04/anthropics-claude-mythos-finds.html)很吓人:Mythos 在所有主流操作系统和浏览器中发现了数千个零日漏洞,其中包括一个在 OpenBSD 里藏了 27 年的 bug。以前那种可能十几年都没人发现的漏洞,现在被一个模型翻出来,而且直接就能做成攻击工具。
基本上,在这个模型面前,没有软件是安全的。
Anthropic 的判断是这个模型不能公开发布。他们[联系了大约 45 家公司](https://fortune.com/2026/04/07/anthropic-claude-mythos-model-project-glasswing-cybersecurity/)——包括 Apple、Google、Microsoft、Nvidia、AWS,加上 CrowdStrike、Palo Alto Networks、Cisco、Linux Foundation 等——让它们提前拿 Mythos 来加固自己的系统。逻辑很直接:在它变成矛之前,先让它当盾。
OpenAI 那边也没轻松到哪里去。GPT-5.4 成了第一个被 OpenAI 自己的 [Preparedness Framework](https://openai.com/index/updating-our-preparedness-framework/) 评定为"[高网络安全风险](https://quasa.io/media/gpt-5-4-becomes-first-universal-ai-model-to-earn-high-cybersecurity-risk-status)"的通用模型。从 GPT-5 到 GPT-5.4,模型在 CTF 夺旗赛上的得分从 27% 跳到 76%。OpenAI 选择加了一层安全防护后照常发布,跟 Anthropic 的做法不同,但面对的问题是相同的:模型的攻击能力在指数级增长。
我之前就感觉这件事在发生。Mythos 出来之后,基本证实了。而且这不只是软件一个领域的事——当一个新维度的事物以完全超出预期的速度在发展,很多原本配套的东西都会错位。法规跟不上,组织跟不上,安全体系也跟不上。
## 先把架子搭好
这些事反过来也影响了我对做产品的想法。
我们最近内部也在讨论,有些产品的定位是不是太激进了——比如设计上让 AI 完全自主管理某些流程。如果模型还不够聪明,总需要人去介入,那这个设计在当前就不太成立。
但换个角度想,也许产品设计就该跑在模型前面一点。
Anthropic 自己做产品就是这个路子。他们内部做 Chrome 插件、Excel 插件,都是先有一个想法,搭一个架子出来,然后每一代新模型出来就丢上去试——看能做到什么程度。等一等,等一等,某天发现差不多了,再投入大量精力去做产品化和发布。
你以当前模型水平去设计产品,等它上线的时候大概率已经过时了。反倒不如稍微激进一点,先把架构想清楚,等引擎到位,整个事情自然就成立了。想到了就做,做完等一等。
## 游戏还在继续
最后一个好消息。
[智谱的 GLM-5.1](https://m.ithome.com/html/936851.htm) 在 4 月初正式开源了,MIT 协议,权重完全公开。在 [SWE-Bench Pro](https://stcn.com/article/detail/3731842.html) 上拿到 58.4 分,超过了 GPT-5.4、Claude Opus 4.6 和 Gemini 3.1 Pro。而且他们同时还涨了 10% 的价——在整个行业都在打价格战的时候,逆势涨价,这个操作本身就很有意思。
开源的游戏规则上,大家还没有产生回退。喜闻乐见。
---
### 模型公司的终局是云公司
- URL: https://guanjiawei.ai/zh/blog/model-company-endgame-cloud
- English: https://guanjiawei.ai/en/blog/model-company-endgame-cloud
- Published: 2026-04-08
- Tags: AI, 开源, 商业, 思考
经常有人问:模型开源怎么赚钱?
其实换个问法就好理解了。软件开源怎么赚钱?托管云服务。Redis 开源,Redis Cloud 赚钱。MongoDB 开源,Atlas 赚钱。模型更是如此,而且比软件开源更适合走这条路。
[上一篇](/blog/open-source-deepseek-moment)聊了开源社区这三年的变化,这篇聊钱——模型开源背后的生意到底怎么算。
## 一枚硬币的两面
你去看现在全球的格局,云厂商在拼命做模型,模型公司在拼命买算力。
Google 2025 年资本开支超过 900 亿美元,核心就是自研 Gemini 加自研 TPU。微软绑定 OpenAI 砸了 800 亿美元建 AI 数据中心。亚马逊投了超过 1000 亿美元扩 AWS 算力,同时给 Anthropic 投了 40 亿美元。三家 2025 年光资本开支就超过 3000 亿美元,大头都在 AI 上。
再看模型公司这边。OpenAI 2025 年营收超过 200 亿美元,主要来自 API 和订阅——说到底就是在卖推理算力。Anthropic 跟 Google Cloud 签了百万块 TPU 的使用协议,价值数百亿美元,同时在 AWS 上跑着 50 万块以上的 Trainium 芯片。你说这是模型公司还是云公司?
两边正在变成同一种东西。
## 开源模型到底怎么赚钱?
DeepSeek 把这件事演了一遍。
2025 年 1 月 20 号 R1 发布,春节假期。六天后 App 冲上美国 iOS 下载榜第一,52 个国家同时登顶。一月份下载超过 1400 万次,到四月月活接近一个亿。没有广告投放,没有市场活动,获客成本几乎为零。
API 定价也很猛。R1 的价格是 $0.55/百万输入 token,OpenAI 同类的 o1 是 $15。大概是 OpenAI 的 3.5%,比当时大家说的「OpenAI 五分之一的价格」还要夸张得多。很多人说这是赔本赚吆喝,不可能挣钱。
2 月底 DeepSeek 做了一个「开源周」,五天连放五个底层优化技术:FlashMLA、DeepEP、DeepGEMM、DualPipe、3FS——从注意力解码到矩阵运算到流水线并行到分布式文件系统,全是自己做的基础设施级别的东西。其中 DeepGEMM 核心代码只有 300 行,性能超过专家手调的内核。大家看完才明白,这公司在底层做了多少事。
紧接着 3 月 1 号 DeepSeek 公开了一组数据:按 H800 租赁价 $2/小时计算,V3 和 R1 模型一天的推理 GPU 成本约 $87,000。如果当天所有流量都按 R1 定价计费,理论日收入约 $562,000。理论上的成本利润比:545%。
这个 545% 当然要打折扣。DeepSeek 自己也说了——网页端和 App 都是免费的,V3 定价比 R1 低,闲时还有折扣,实际变现的流量远小于总流量。这个数字也只算了推理 GPU 的租赁费,不含训练成本、研发投入和人员工资。V3 的实际总研发成本,行业估算在 5 亿到 16 亿美元之间。
但 545% 本身不是重点。重点是:同一个开源模型,别人拿去跑推理服务,在这个定价下大概率是亏的。DeepSeek 因为在底层做了大量优化,同样的价格,自己是挣钱的。定价权在原厂手里。
## 飞轮转起来
做云最头疼的事情是什么?大家卖的东西差不多——裸金属上面加薄薄一层服务,毛利很快就被挤掉了。AWS 的运营利润率大约 33% 到 38%,已经是天花板。Google Cloud 从长年亏损做到 30% 左右。更小的云厂利润更薄,客户还高度集中,大客户一压价你根本没得谈。你在底层技术上投入再多,也很难变成客户感知到的差异。
加了模型这一层就不一样了。假如我运营一个大规模的推理集群,在模型效率上提升了 10%,同样的硬件就能多产出 10% 的 token。多出来的利润拿去做研发,进一步优化推理效率,进一步压低单位成本,就可以用更低的价格去打市场,拉来更多用户,把算力利用率顶上去,利润又多了。然后接着投研发。
以前的云生意没有这个循环。你花了很多钱做技术改进,客户感知不到。模型不一样,推理效率的优化直接就是钱——要么成本更低,要么同样成本下多出一截产出。
Google 2025 年把资本开支从 750 亿美元追加到 930 亿,大部分砸在 AI 基础设施上。他们看到的就是这个变化:模型层让云生意有了真正的技术杠杆。
## 开源是最高效的获客
为什么不直接闭源卖?因为模型好不好用这件事,光看跑分看不出来。
Llama 4 就是反面教材。2025 年 4 月 Meta 发了 Llama 4 Maverick,提交给 LMArena 排第二。很快被人发现:提交排行榜的是一个专门调过的「实验版」,回复特别长、带 emoji、排版花哨——都是容易拿高分的套路。公开发布的标准版重新测,排第 32。后来 Yann LeCun 离开 Meta 时亲口承认「results were fudged」。Zuckerberg 对整个 GenAI 团队失去了信心,LLaMA 系列在开源社区基本也就此出局了。
跑分可以做手脚,用户体验做不了。
模型开源出来,所有人都能跑、能试。好不好用几分钟就知道了。这个过程会形成口碑,也会形成粘性。我之前帮朋友装 AI 客户端工具的时候,有人翻出半年前注册的 DeepSeek API 账号来连。其实在那个场景下 DeepSeek 不是最优选择,但他觉得顺手——注册过、用过、已经有信任了。开发者也差不多,之前用某个模型的 API 做过项目,下个项目大概率还是用它。切换有成本,重新建立信任的成本更高。
DeepSeek 的打法是开源模型加免费 App 一起来。开发者跑开源模型去试,普通用户用 App 去试,两头同时建认知。一部分人自然就转成了 API 付费用户。获客成本接近零,覆盖面比砸几亿做市场的还广。
## 哪些模型适合走云服务这条路?
这套逻辑在语言模型上很通顺。DeepSeek R1 几千亿参数,没有一个 GPU 集群你跑不起来。想用就两条路:免费 App 或者付费 API。不管选哪个,流量都在他们的云上。大模型和小模型之间效果差距明显,用户自然会往云端聚集。
文生图就不太一样了。Stable Diffusion、FLUX 这些开源模型,一张游戏显卡就能跑。门槛低到个人用户都能在家部署。大模型跟小模型的效果差距如果没有那么大,市场就会碎掉——大量用户选择本地跑,云端需求没那么集中。
文生图和文生视频还有另一个推力:涉及图片和视频内容,天然面对更多审核和法规限制。云端服务要做内容过滤,但本地跑这些约束基本不存在。这也在推动一部分用户走向本地。这就是[边端AI设备的价值](/blog/edge-ai-power-structure)——它不只是成本问题,更是权力和自主权的问题。
所以模型开源这套商业逻辑能不能走通,取决于大模型和小模型的能力差距够不够大、本地部署的门槛够不够高。语言模型目前两个条件都满足。文生图差一些。文生视频还在变,说不好。
## 更好的云
不管怎么样,模型要商业化就绑着云服务。我觉得这其实是好事。
以前的云就是卖资源、拼价格,你在技术上花多少钱都很难拉开差距。模型加进来之后不一样了,技术投入能直接降推理成本、拉开定价空间。做得好的公司是真能赚到钱的。
模型公司的终局大概就是云公司,只不过不是卖裸金属的那种。是一种新型的 AI 云,卖的是智能。而在云端之外,[边端AI的TCO正在被AI运维大幅降低](/blog/edge-ai-inference-tco-trap)——两者可能会形成互补的格局。
---
### 开源社区的 DeepSeek 时刻
- URL: https://guanjiawei.ai/zh/blog/open-source-deepseek-moment
- English: https://guanjiawei.ai/en/blog/open-source-deepseek-moment
- Published: 2026-04-07
- Tags: AI, 开源, 大模型, 思考
前几天在调研文生视频模型,发现一件事跟我原本的认知差别挺大的:在文生图和文生视频这两个方向上,中国公司在开源社区的存在感远没有语言模型那么强。
我一直以为中国模型在各条线上都已经占了主导。结果一看,不是那么回事。这让我回头梳理了一遍这三年开源社区的变化。
## 模型开源不是软件开源
先说一个很多人可能没想过的事。
软件开源,源代码放出来,拿到了就没什么秘密了,你可以从头造一个一样的。模型不是。模型开源出来的多数情况下就是权重和推理脚本,训练方法、训练数据、工程细节这些核心东西,通常不公开。
你拿到权重能干什么?部署推理,做微调。想从零复现?几乎不可能。所以模型的「开源」和软件的「开源」从一开始就不是一回事。
这就引出了一个早年大家吵了很久的问题:既然模型开源跟软件开源不一样,那模型开源到底图什么?
软件开源最大的好处是社区共建,全世界的开发者一起改 bug、加功能。但模型开源之后,真正有能力参与模型研发的人和机构太少了。你得有大量算力,得有数据,得有训练基础设施。绝大多数人拿到权重也只能跑跑推理。
当时李彦宏说开源大模型没有意义,我一度觉得他说的有道理。社区共建这个最大的驱动力不成立,那开源图什么?
后来的事情回答了这个问题。
## LLaMA 的天下
2022 年底 ChatGPT 出来,大模型进了公众视野。在这之前,开源世界挺单调的。OpenAI 的 [GPT-2 在 2019 年完全开源](https://github.com/openai/gpt-2),到了 [GPT-3 就变成申请制 API 访问了](https://openai.com/index/openai-api/)。我记得当时参加黑客松想用 GPT-3,结果发现得发邮件申请才能拿到 API。本质上已经闭源了。
2023 年开源社区基本是 Meta 的 [LLaMA](https://en.wikipedia.org/wiki/Llama_(language_model)) 在主导。[LLaMA 1 是2023年2月](https://ai.meta.com/blog/large-language-model-llama-meta-ai/),[LLaMA 2 是7月](https://about.fb.com/news/2023/07/llama-2/)。每次 LLaMA 发新版,国内就有一批模型跟着宣布升级,这就是当时说的「百模大战」,节奏被 LLaMA 牵着走。
中国模型在这个阶段开源,说白了就是推广。开出来的都是比较小的型号。[智谱的 GLM-6B](https://www.oschina.net/news/232543/chatglm-6b-open-source) 是最早的代表,很多人接触大模型私有化部署就是从它开始的。我记得当时有个朋友在选模型,我还纳闷怎么选了个中国模型,他说是清华做的,口碑还不错。百川开源了 14B,[李开复创办的零一万物在 2023 年 11 月开源了 Yi-34B](https://finance.sina.cn/chanjing/gsxw/2023-11-06/detail-imztteci0362224.d.html?vt=4&cid=76478&node_id=76478),那个时间段算是中国开源模型里体量比较大的一个。上海人工智能实验室也在持续做 InternLM(书生)系列。
大家的策略都一样:小的开源做推广,大的不开源做商业化。
## 千问进场
2024 年这个平衡被千问打破了。
2024 年中开始阿里的千问密集发力,从十几 B 到 72B,各种体量效果都不错,全部开源。原来大家默认大模型不开源,突然有人把效果很好的大模型直接放出来了。
LLaMA 虽然在国际上影响力大,但中文能力一直不行,实际用还得二次训练。千问中文场景下几乎可以直接用,很快就把 LLaMA 在中文开源社区的位置替掉了。
到 2024 年底,千问系列已经是中文开源模型的事实标准。闭源模型第一次感受到了来自开源的压力。
## DeepSeek 把桌子掀了
千问是在现有规则内做到了最好。DeepSeek 是直接把规则改了。
DeepSeek 从 2024 年入局,路线很简单:出来就开源,技术报告写得极其透彻。2024 年底 V3 发布,几千亿参数,效果极好,发布即开源。那个时间点很少有人见过这种体量的模型直接放出来。
但真正炸开的是 2025 年 1 月的 R1。
[OpenAI 在 2024 年 9 月刚推出 O1 推理模型](https://openai.com/index/introducing-openai-o1-preview/),DeepSeek 的 R1 春节前就出来了。推理能力跟当时最顶尖的闭源模型非常接近,虽然没有完全持平,但差距小到让人意外。然后发布第一天就完全开源。
原来大家维持的是一套「小的开源、大的闭源」的秩序。DeepSeek 开源出来的东西比很多公司最好的闭源模型还好,这套秩序一下就崩了。
LLaMA 4 是另一个注脚。Meta 憋了很久训了个超大模型想夺回开源社区的位置,2025 年 4 月推出来,翻车了。效果远不如预期,还[爆出了跑分作弊的事](https://techcrunch.com/2025/04/07/meta-exec-denies-the-company-artificially-boosted-llama-4s-benchmark-scores/)。后来 [Yann LeCun 自己承认「results were fudged」](https://www.fastcompany.com/91469583/yann-lecun-meta-llama-4-model-zuckerberg),Zuckerberg 对整个 GenAI 团队失去了信心。LLaMA 4 基本没人用,LLaMA 系列在开源社区的地位到此结束。
## Day-0 开源变成了行规
DeepSeek 之后,中国的模型公司一个接一个转向了 day-0 开源,最好的模型发布当天就开源。
[Kimi 在 2025 年 7 月开源了 K2](https://moonshotai.github.io/Kimi-K2/),万亿参数的 MoE 模型。MiniMax 开源了 M2.5。智谱在持续迭代 GLM 系列。一波接一波,开源模型的水平越来越高。
今天你去看语言模型的国际开源社区,排行榜上几乎全是中国模型。千问、DeepSeek、GLM、MiniMax、Kimi,海外模型的存在感已经很弱了。
DeepSeek 做的事情不是贡献了一个模型。它改了整个行业的出牌方式。
## 但风向又在变
不过这波 day-0 开源的热度正在降温。
DeepSeek 上一次开源是 V3.2,2025 年 12 月的事,到现在四个多月了。V4 传了很久,没出来。在这段空窗期里,大家的策略又开始松动了。
千问 3.6 Plus 在 2026 年 3 月底发布,没有开源,API-only。这是千问系列第一次旗舰模型不开源。智谱的 GLM-5.1 也是先闭源发布,虽然这两天刚宣布要开源权重。不少公司的多模态模型最新版也不再开源了。
似乎回到了当年那个问题:开源图什么?当竞争压力减小,答案可能又会变。
## 文生图和文生视频还在等
回到最开始让我意外的那个发现。
文生图的开源社区至今还是海外模型在主导。大家用得最多的是 [Stability AI](https://stability.ai/) 的 [Stable Diffusion](https://github.com/CompVis/stable-diffusion) 系列和 [Black Forest Labs](https://bfl.ai/) 的 [FLUX](https://github.com/black-forest-labs/flux) 系列。中国模型有一些进展,千问出了 Qwen-Image,腾讯有混元图像 3.0,智谱有 GLM-Image。但跟语言模型的情况比差太远了。
文生视频也是。阿里最后一次开源的文生视频模型是 2025 年 7 月的 Wan 2.2,快 9 个月了没有新东西出来。最近热度比较高的开源文生视频模型是 [LTX-2](https://github.com/Lightricks/LTX-Video),来自以色列公司 [Lightricks](https://techtime.news/2026/01/07/lightricks/),2026 年 1 月开源了权重。
这跟语言模型完全是两个世界。语言模型这边中国模型已经铺满了整个开源社区,文生图和文生视频那边还更像 2023 年的样子:海外模型主导,中国模型零星出现。整个[开源社区正在经历一场「短视频式」的爆发](/blog/opensource-is-the-new-douyin),但这种爆发目前主要发生在语言模型和软件工具领域。
## 在等什么
大家在等 DeepSeek V4。
但等的不只是一个模型。DeepSeek 之前证明过一件事:一个足够强的模型在发布当天完全开源,会连带改变一整个行业的策略走向。而从商业角度看,[模型公司的终局是云公司](/blog/model-company-endgame-cloud)——模型开源背后的生意远比想象中大。这件事在语言模型上发生过,在文生图和文生视频上还没有。
我有时候半开玩笑地想,可能就是需要 DeepSeek 再出手一次。但话说回来,DeepSeek 自己也四个多月没出新模型了。
---
### 不是一场革命,是两场
- URL: https://guanjiawei.ai/zh/blog/two-ai-revolutions
- English: https://guanjiawei.ai/en/blog/two-ai-revolutions
- Published: 2026-04-03
- Tags: AI, 创业, 思考
最近跟几个朋友聊,加上自己每天十几个小时在 coding agent 里面泡着,有一个感觉越来越清晰:AI 这一轮不是一场革命,是两场。
## 编程那条线,大家聊得够多了
第一条线是编程和生产力。coding agent、AI 办公助手,白领在认知处理和软件创造上的整个流程正在被重塑。这条线的讨论很多,我也写过不少,不展开了。
几个数据感受一下量级:GitHub 的统计说 AI 已经写了 26.9% 的生产代码,使用 AI 的开发者平均每周省 3.6 小时,合并 PR 的数量多了 60%。也有反面声音——[METR 的随机对照实验](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)发现,16 个大型开源项目的核心贡献者用了 AI 工具后反而慢了 19%,但自己觉得快了 20%。在复杂的大型代码库面前,AI 还没到无脑用就好的程度。
我自己的体感是,知道自己要什么的时候,coding agent 确实能把效率拉高一个数量级。关键词在"知道自己要什么"。
## 另一条线,可能被低估了
第二条线是内容创作。文生图、文生视频、图片编辑——这个方向正在发生的事情,热闹程度不输编程那边。
字节的 [Seedance 2.0](https://seadanceai.com/zh/blog/seedance-2-0-review-analysis) 是一个分水岭。
2 月发布,3 月底开放 API。[Artificial Analysis 评测](https://www.buildfastwithai.com/blogs/seedance-2-bytedance-ai-video-2026)的 Elo 1269,超过 Google Veo 3、Sora 2、Runway Gen-4.5。不是领先一点点,是断档。它能一次生成最长 20 秒 1080p 的视频,音乐、对白、音效同步出来,不用后期配音。镜头运动、光影、角色动作都可以精确控制。
我一个做 AI 短剧的朋友说,行业里拿着千万现金等着用的团队一大把。API 开放那天,我朋友圈里做相关创业的人全炸了——各种用它出的短片刷屏,效果跟之前完全不是一回事。
成本变化很夸张。以前做一集 25 分钟的日本动画,大概 100 到 320 万人民币。《进击的巨人》单集约 110 万,《咒术回战》也差不多。现在一个 3 分钟的 AI 短片,400 到 1200 块。每分钟成本降到了传统方式的几十分之一。盲测里 73% 的观众分不出来。
也有朋友做直播带货的小团队,跟我说内容产出成本降到了以前的十分之一,速度快了十倍。以前一个内容人员月薪一万多,现在同样的产出成本降了一个数量级。完全供不应求。
想象一个人花几千块、一周时间,做一部 20 分钟的动漫短片。以前不可能。现在影子已经很清楚了——文生视频走到了它的"ChatGPT 时刻"。找到路之后,成本降低只是时间问题。AI 就是这样的节奏:有人趟出一条路,后面一定有更便宜的方案追上来,因为它本质是软件,是可以不断用数据和训练去迭代的。
## 两条路在分叉
我有朋友,我推荐他用 coding agent。结果他说最近没精力研究——不是不聪明,是他的时间和热情全在内容创作上,每天琢磨的是怎么用最新的工具搭流水线、怎么低成本把创意表达出来。我想了想,他去研究 coding agent 干什么呢?那不是他的方向。
反过来也一样。我每天十几个小时在 coding agent 里面,让我去研究内容创作的流水线,短时间内到不了那个水平。
[上一篇](/blog/ai-amplifies-passion)我写了 Builder 和 Promoter 的分化。这次的感受更具体:这两条路不只是角色不同,对应的工具、技能、需要投入的热情都不一样。有交集,但交集在缩小,分叉在加大。
这意味着不只是做产品的人在经历巨变。对表达充满热情的人——做内容的人——接下来会获得同等量级的工具加持。你对一件事有很强的表达欲,几十块钱的成本、半天时间,就能做出一个一分钟的短视频。手机和抖音已经把拍视频的门槛拉低了一次,接下来这个门槛会再降一个数量级。
## Agent 对 Agent,开会可以死了
两条路有一个共同的下游影响:都在改变人跟人打交道的方式。
有朋友问我:AI 这么强了,那我回到跟人面对面打交道的领域——做 sales、对接投资人、跑供应链——是不是比较安全?
我觉得不一定。
我现在觉得开会是一种极其低效的方式。我录一段音,AI 转成文字、整理成文稿,信息量比开两个小时的会还充分。对方用 agent 理解这个文档,几分钟就提取到最关键的东西。我五分钟做完的事情,开会两个小时可能还没搞清楚全貌。
效率差了 100 倍。这不是修辞。
基础设施已经在快速成型。Google 去年发布了 [Agent-to-Agent 协议(A2A)](https://developers.googleblog.com/en/a2a-a-new-era-of-agent-interoperability/),Salesforce、SAP、PayPal 等 50 多家企业一起在推。[Anthropic 的 MCP](https://www.anthropic.com/news/model-context-protocol) 让 agent 接入各种工具和数据源。今年初 [Linux 基金会成立了 Agentic AI Foundation](https://www.linuxfoundation.org/press/linux-foundation-announces-the-formation-of-the-agentic-ai-foundation),OpenAI、Anthropic、Google、Microsoft 全加入,到 2 月 100 多家企业跟进。[Gartner 预测](https://www.gartner.com/en/newsroom/press-releases/2025-08-26-gartner-predicts-40-percent-of-enterprise-apps-will-feature-task-specific-ai-agents-by-2026-up-from-less-than-5-percent-in-2025)今年底 40% 的企业应用会嵌入 AI agent,去年这个数字不到 5%。
你的 agent 和对方的 agent 在后台做分析、传递信息、协调事务,会比两个人坐在一起聊天专业得多。agent 不需要寒暄,不需要花两周建立信任。它可以从所有可验证的信息里综合判断,比你听对方说两句话然后"觉得这人还行"要靠谱。
## 电商消灭了什么
这让我想到电商。
没有电商的时候,所有交易都得面对面。你买个东西,要见到卖家,建立关系,互相判断。卖家的社交能力和人格魅力是成交的关键因素。
电商来了。商品差不多,比个价格,看看评价,十分钟下单。你不认识卖家,没见过他,他都不知道你买了。B2B 领域也是——[买家在联系销售之前已经完成了 57% 到 70% 的采购研究](https://saleslion.io/sales-statistics/b2b-buyers-are-57-70-through-buying-research-before-contacting-sales/),67% 的采购旅程在线上走完。
电商没有消灭零售。美国实体零售仍然占 81.6%。但它重构了交易里的关系逻辑——面对面的社交能力从"必需品"变成了"加分项"。
Agent 对 agent 会带来类似但更猛的一波。效率差了一百倍的时候,很多场景下大家会选更高效的方式。不是人不重要了,是商务上的事有了更好的处理通道。
## 打球别谈生意了
这件事有个我觉得挺好的副产品:人跟人的关系会变得更纯粹。
以前打球要聊生意,吃饭要谈合作。面对面是最高效的商业沟通方式,社交和商务总搅在一起。你去打球不全是因为喜欢打球,是因为球场上能碰到你想认识的人。
如果 agent 把商务那部分解决了呢?打球就是打球。社交就是纯粹社交。不用在不喜欢的场合里维护不想要的关系。
亲密关系、娱乐、兴趣——这些需求会从商务场景里剥离出来。不是它们不重要,是它们终于可以只是它们自己。
## 那就去找
两场革命同时在跑,各自需要大量时间钻研。
我观察到的规律很简单:有热情的人每天泡十个小时,什么工具都用得明白。没热情的人偶尔打开看看,差距很快就是数量级的。AI 的杠杆摆在那里,撬不撬得动,取决于你愿不愿意一直用力。
不管是造产品还是做内容——去找那件让你停不下来的事。
---
### AI 放大的不是技能,是热情
- URL: https://guanjiawei.ai/zh/blog/ai-amplifies-passion
- English: https://guanjiawei.ai/en/blog/ai-amplifies-passion
- Published: 2026-04-02
- Tags: AI, 创业, 思考
最近看到张雪机车的故事,受到很大触动。
张雪做摩托车,1987 年出生,初中学历,14 岁辍学当摩托车修理学徒。19 岁的时候,他骑一辆破摩托冒雨追了湖南卫视的摄制组 100 多公里山路,就为了在镜头前展示自己的车技。2013 年他揣着 2 万块钱到重庆,后来联合创立了[凯越机车](https://zh.wikipedia.org/zh-hans/%E5%BC%A0%E9%9B%AA%E6%9C%BA%E8%BD%A6),把年销量从 800 台做到 3 万台。2024 年,37 岁,他放弃了凯越的股权,重新创立张雪机车,要做自主研发的发动机。
很多人看到的是最终的成绩:2025 年张雪机车营收 7.5 亿,今年 3 月在 [WSBK 世界超级摩托车锦标赛葡萄牙站](http://www.news.cn/sports/20260330/65e6064ff1e74be89eae0383752ca8fc/c.html)的 WorldSSP 中量级组别连赢两场,领先第二名 3.685 秒。中国摩托车品牌第一次在这个级别拿冠军,打破了杜卡迪、雅马哈、川崎几十年的垄断。
但让我反复回想的不是这些,是他采访里讲的几个细节。
## 八百米我来出
有一个片段印象很深。他们当时在做发动机某个核心部件的加工精度提升,要从五丝做到三丝。一丝是 0.01 毫米,五丝到三丝就是把公差从 0.05 毫米压到 0.03 毫米,精度提升 40%。这不只是改个参数的事,切削余量、刀具控制、材料一致性、整条工艺链都要跟着升级,还得保证量产时的一致性。国内供应链没人做过,供应商不愿意配合,觉得风险太大。
张雪跟这些供应商说:研发和试错的费用我来承担,你们不用担心,成功了收益大家分。
你想想这个场景。他在产业链里算不上什么大角色,就是一个下游的买方,供应商眼里可能是个小客户。但他说出来的话完全不是"买方"的逻辑。
那是什么?就是这件事做成本身的意义,在他看来大过利益、大过风险。他就是迫切地要看到它发生,为此愿意把自己压上去。
## 十年磕一副眼镜
这样的人不止张雪。
[Rokid](https://www.rokid.com/) 的创始人祝铭明,大家叫他 Misa。2012 年他还在阿里,受邀参加了 [Google Glass 的发布会](https://techcrunch.com/2012/06/27/sergey-brin-demos-google-glass-at-io/),看到有人戴着眼镜从飞机上跳伞,当场被震住了。他后来说当时脑子里就两件事:这个东西会改变世界,我们能做得更好。
他决定离开阿里创业。马云亲自跟他谈了四个小时,问为什么要走。他说:"AI 和 AR 会改变人类的生活方式,而且最终会变成同一件事。"
2014 年 Rokid 成立。但 AR 眼镜的产业链当时根本不成熟,他们只能先做智能音箱维持生存,发了 Rokid Alien 和月石。结果百度把智能音箱打到 89 块钱,Rokid 卖 1399,BAT 的补贴战根本扛不住。Misa 自己公开说过,AI 行业会进入 12 到 18 个月的严冬。
稍微缓过来一点,他马上又扑回眼镜。
到 2025 年,Rokid 做出了 [49 克的 AI+AR 眼镜](https://36kr.com/p/3042652312256899),全球最轻,支持 50 多种语言实时翻译。今年 2 月[德国总理默尔茨来杭州,亲自试戴了一副](https://www.93913.com/119555.html),体验完实时翻译后说了两个字:"准确、快速。"随行的七八位德国企业高管当场下单。
十年前在朋友圈喊着要做眼镜的那个人,今天让德国总理戴上了他做的东西。
Misa 到现在每天还在朋友圈发两三条产品相关的内容。不是营销,就是真的觉得酷,想让人看到。他说过一句话我觉得很准确:"创业就是为 1% 的爱好和梦想,学 99% 自己不那么喜欢的相关事情。"
## 不是生意人
这些人让我一直在想一个问题:创业者到底跟生意人有什么区别?
中国不缺做生意的人。从古到今,削尖脑袋想怎么赚钱的人太多了。生意人在已有的框架里找最优解,什么赚钱做什么,怎么效率高怎么来。这没问题,社会需要。
但张雪、Misa 做的不是这件事。
我后来翻到奥地利学派经济学家的说法,觉得他们很早就看到了这个区别。[米塞斯](https://mises.org/mises-daily/driving-force-market)把企业家叫"整个市场体系的驱动力",区分了企业家和经理人:经理人在既定参数内做优化,企业家改变参数本身。[熊彼特](https://en.wikipedia.org/wiki/Creative_destruction)说得更狠,他说企业家干的事叫"创造性破坏",从内部瓦解旧结构,创造新的。他甚至觉得驱动创新者的主要动力不是利润,是一种"征服的意志"。
回头看,张雪替供应商扛试错成本,不是因为算过 ROI 觉得划算,就是要看到三丝精度在国产摩托发动机上变成现实。Misa 十年磕眼镜差点活不下去,可 2014 年 Google Glass 刚失败,所有人都觉得 AR 没戏。
这种人不是在赛道里跑,是自己修了一条路出来。
[宇树](https://en.wikipedia.org/wiki/Unitree_Robotics)的王兴兴也是。2016 年他去大疆待了两个月就走了,创立宇树。当时四足机器人几乎都是液压的,贵、笨。他赌电驱动,自己做核心部件。2021 年推出 [Go1](https://shop.unitree.com/products/unitreeyushutechnologydog-artificial-intelligence-companion-bionic-companion-intelligent-robot-go1-quadruped-robot-dog),售价不到 2700 美元,[波士顿动力](https://bostondynamics.com/)的 Spot 卖 7.5 万。今天[宇树占了全球四足机器人 60% 以上的市场](https://finance.sina.com.cn/tech/digi/2025-07-17/doc-inffswwh5799840.shtml)。[梁文峰](https://baike.baidu.com/item/%E6%A2%81%E6%96%87%E9%94%8B/65336579)从量化基金转去做 AGI,招人看热情和好奇心而不是学历,他说过一句话:"跟随的阶段结束了,该引领了。"
## AI 放大的到底是什么
讲回 AI。
以前我以为 AI 的价值在放大技能。程序员写代码快十倍,设计师出图快十倍,技能乘个系数,听上去很合理。
但在团队里推这件事的过程中,我发现不是这样。
瓶颈不在 AI 能不能帮你做某件事。在于你不知道用它来做什么。这跟[编程智能体的百万级鸿沟](/blog/coding-agent-adoption-gap)是同一个问题——工具已经在那里了,卡住的是认知。
以前衡量一个人的能力是"在什么事情上做得好",把事情做完就是标准。现在做完一件事的门槛被 AI 大幅拉低了。那什么变稀缺了?是你要持续把什么东西做好、做到跟别人不一样。
这个答案来自热情。
我在团队里观察到一个很明显的分化。有些人用 AI 进步飞快,不是技术底子好,是他们知道自己要什么。方向很清楚,可能同时在指挥十个 AI agent 跑不同的任务,长期盯着一个事不放。另一些人技能不差,就是不知道拿 AI 干什么。以前的工作方式是等着分配任务、完成、拿反馈。现在这个循环断了,你得自己找方向、自己驱动,过程中可能没人给你打气,你得自己判断值不值得继续。
以前这种判断力不那么重要,因为组织结构在替你做决定。现在不一样了。
## Builder 和 Promoter
顺着想下去,我越来越觉得公司这种形式会慢慢弱化。
未来可能更像 MCN。核心角色两类:Builder,极其专注地去建造产品,把自己看见的东西变成现实;Promoter,有影响力,能让好东西被人看见。
很多 Builder 本身就是 Promoter。张雪的采访故事自带传播力,Misa 每天在朋友圈安利产品,王兴兴的机器人上春晚。这些创造者自己就是传播节点。
这两个角色之间可能就把事闭环了。剩下的组织形式可能像 MCN 那样,提供基础设施,分一层薄薄的利润,做些孵化支持。
## 去找你的热情
我现在心态跟以前挺不一样。以前看重的一些东西,组织里的位置、资源多少、别人认不认可,现在觉得它们不再是最关键的。反而有一种更自由的感觉。
AI 给人的,说到底,是把热情落地的可能。以前有热情但没团队没资金,很多事就是做不了。现在一个人加上 AI 能干的事,比以前一个小团队还多。这也意味着[团队协作的方式得变](/blog/passion-driven-team)——热情可能比技能更重要了。
所以更该问的问题不是"AI 会不会取代我"。是"我的热情到底在哪"。你是想 build 一个东西出来,还是想让好东西被更多人看见?
焦虑的时候容易忽略一个变化:AI 正在让更多的张雪、更多的 Misa 从意想不到的角落冒出来。这些人可能没有大公司背景,没什么资源,就是有一个非做不可的方向,然后带着 AI 往前拱。
我不知道具体会在哪,但六个月内应该会看到不少。
---
### 花钱买不来的增长
- URL: https://guanjiawei.ai/zh/blog/money-cant-buy-growth
- English: https://guanjiawei.ai/en/blog/money-cant-buy-growth
- Published: 2026-03-30
- Tags: AI, 产品, 竞争, 思考
最近在调研产品冷启动,顺带看了不少关于产品竞争的材料。有些东西以前觉得自己懂,看完才发现其实只是知道,没真懂。
## 旧公式不灵了
以前做产品搞竞争,思路很简单:谁声势大、资源多,谁就赢。高举高打,广告铺满,用户自然来。
这套打法在 AI 领域开始松动,大概是去年年初。
2025 年 1 月 20 号,[DeepSeek 发布了 R1 模型](https://api-docs.deepseek.com/news/news250120)。这公司之前几乎没人听过,没品牌认知,没投放预算。就是默默在开源社区把模型挂上去,APP 上推了个聊天功能。
然后赶上春节。
大概七天,[DeepSeek 用户量过亿](https://www.panewslab.com/en/articledetails/lcai97v6.html)。冲上了中美两个 App Store 的榜首,服务器被挤爆,一度建议用户去试别的 AI 助手。是的,服务器扛不住了,它甚至把流量往外导。但 DeepSeek 也不怎么在意,就是持续开源,持续更新。
当时最有代表性的对比是豆包。豆包是字节旗下的 AI 应用,资源投入国内应该是最大的,长期稳坐 AI 应用日活第一。在它之前,Kimi 也砸了据说好几亿的营销预算做增长,投 B 站、投抖音、砸教育市场。结果豆包一出手,Kimi 的声量就小了很多。
然后 DeepSeek 出来,一分钱没花,直接超过了豆包。
你以为花了大钱的就稳了,结果一个什么钱都没花的把你超了。这个冲击挺大的。
## 快到离谱的迭代
后来我去翻了 Claude Code 和 Codex 的版本号,有点被吓到。
Claude Code 最新版本是 2.1.87。从 2025 年 2 月第一次发布到现在,总共推了 365 个版本,平均 1.1 天一个。你今天打开,大概率就发现有新东西。
Codex 最新稳定版是 0.117.0,从去年 4 月上线以来发了 132 个稳定版,加上每个版本二三十个 alpha 迭代,基本天天在动。
这不是什么小工具。Claude Code 的 npm 周下载量超过一千万,Codex 超过三百万。就这个体量,迭代速度是按天算的。
横向的速度更夸张。
上周四(3 月 27 号),[钉钉开源了 workspace-cli](https://news.qq.com/rain/a/20260329A01YYO00),把核心功能颗粒化,让 AI agent 可以直接操作日历、待办、消息。第二天[飞书就开源了 larksuite/cli](https://blog.csdn.net/wayle123/article/details/159616184),覆盖 11 个业务场景、200 多个命令。再隔一天,企业微信的 wecom-cli 也出现在了 GitHub 上。
三家,三天,几乎一模一样的事。面对一个有效的方向,跟进速度就是以天为单位的。所谓"先发优势",在这种环境下能持续多久?可能也就两三周。
## 冷启动的笨办法
调研冷启动的时候,我发现一个挺反直觉的规律:很多后来做得很大的产品,早期不是靠砸钱起来的,反而是靠一些完全没法规模化的事。
Paul Graham 2013 年写过一篇["Do Things That Don't Scale"](https://www.paulgraham.com/ds.html),在创业圈影响很大。核心意思是创业早期别想着 scale,先用笨办法。
听着像鸡汤,案例看完就不觉得了。
[Stripe](https://stripe.com/) 的两个创始人 Patrick 和 John Collison,别人说"我可以试试你们的支付产品",他们不是发个链接让你自己折腾,而是直接说"把笔记本给我",当场帮你把 Stripe 集成到代码里。Paul Graham 觉得这操作太妙了,给它起了个名字叫["Collison Installation"](https://setupclaw.com/collison-install),后来在 [Y Combinator](https://www.ycombinator.com/) 每一期都教。[Airbnb](https://www.airbnb.com/) 的做法也类似,早期纽约房源照片都很差,手机随手拍的那种,Brian Chesky 和 Joe Gebbia 就飞过去,租个相机,挨家挨户帮房东拍。有了专业照片的房源,[预订率直接高了 2.5 倍](https://www.fastcompany.com/1786980/airbnbs-small-army-photographers-are-making-you-and-them-look-good)。
[DoorDash](https://www.doordash.com/) 更直接。创始人[一开始自己当外卖骑手](https://www.precoil.com/articles/how-door-dash-experimented-to-find-product-market-fit),从餐厅拿 PDF 菜单,把自己手机号当客服电话,有人下单就自己骑车去送。[Pinterest](https://www.pinterest.com/) 的 Ben Silbermann 发现早期用户很多是设计爱好者,就[一个人跑去设计博主的线下聚会,挨个拉人](https://allthingsd.com/20121020/the-secret-behind-pinterests-growth-was-marketing-not-engineering-says-ceo-ben-silbermann/)。[Tinder](https://tinder.com/) 更绝,[Whitney Wolfe 跑去大学联谊派对推广,进门条件是手机上必须装了 Tinder](https://fortune.com/2016/08/09/entrepreneurs-greek-life-tinder/)。
这些操作的共同点就一个:创始人亲自上手,一个个用户去服务,做的全是没法 scale 的事。但正因为这样,最早那批人会真的觉得"这东西不一样",然后自发帮你传播。
仔细想想,DeepSeek 的路径其实是同一回事。不是靠投放,是东西本身好到别人忍不住要告诉别人。
## 领先两周,然后重来
这些东西放在一起看,我对产品竞争的理解确实变了。
以前拉开差距靠资源和渠道,谁广告多、品牌响,谁就多占点市场。这个优势可以维持很久。现在不太行了。传播的基础设施太发达,一个真正好的东西可以在几乎零成本的情况下被传开,DeepSeek 七天过亿,有史以来最快。供给端也完全不一样了,以前做一个功能几个月,现在 Claude Code 一天一个版本,钉钉今天开源、飞书明天就跟上。
你做得好,领先期可能也就两三周。这两三周里如果没有持续变得更好,用户毫不犹豫就切走了。Claude Code 和 Codex 之间现在就是这种状态,你出一个功能我跟一个功能,用户两边都在切。
## 新的胜负手
所以最近我对"关注竞争对手"这件事越来越没感觉了。以前觉得这是做产品的基本功,竞品分析、差异化定位、找空白市场。现在觉得在 AI 这个赛道上,花太多时间看别人在干嘛,不如花时间跟自己的用户待在一起。今天看到的局面,两周后可能就变了。
我现在觉得真正重要的就是产品本身到底行不行,用的人能不能感觉到"确实不一样"。DeepSeek 没花钱推广,Claude Code 也几乎不做引流,用户就是在涌进来。然后就是跟早期用户的关系,怎么找到那批真心觉得这东西酷的人,让他们成为共建者。Stripe 的"Collison Installation"建立的就是这种创始人跟用户之间很紧的关系,这种关系在早期的价值,远比一万个从广告来的用户大。
AI 这个时代给做产品的人确实多了些选择和自由,可以更多地专注在东西本身上,而不用天天 PK 谁资源多、谁嗓门大。当然这些也重要,但不再是那种压倒性的东西了。
说到底其实就一个问题:你做的东西到底是在创造价值,还是在消耗别人的注意力?
这个想清楚了,很多纠结反而没了。
---
### 进不去电脑那天,我决定做一个产品
- URL: https://guanjiawei.ai/zh/blog/why-i-built-aima-service
- English: https://guanjiawei.ai/en/blog/why-i-built-aima-service
- Published: 2026-03-27
- Tags: AI, AI Agent, 产品, Aima Service
折腾了两天,一个小工具死活做不出来。
去年一月,我第一次用 Claude Code。当时接的是 Kimi 的模型,想做一个浏览器插件。每次它都说"搞定了",一试就不行。各种报错,各种修,来来回回两天,我快要放弃了,再投入下去不光搞不定,还在不停烧 token。
然后 [Claude 发布了 Opus 4.6](https://www.anthropic.com/news/claude-opus-4-6)。
抱着试试看的心态买了会员,把同一个需求丢过去。半小时,从零开始,一次性做完了。它自己调用浏览器插件去看效果,自己模拟用户输入去测试,发现 bug 自己改,改完跟我说:你可以试一下了。
我打开一看——真的可以用。
那一刻有一种很强的感受:AI 的能力好像在某个节点上突然越过了一条线。至少在某些场景里,它已经不只是帮上忙了,是远超你对它的预期。这种[零重力](/blog/zero-gravity)的感觉,后来我在很多场景里反复体验到。
## 不同的模型,差距大到离谱
后来这种体验又来了一次。
用 Claude Code 加 Opus 4.6 去做一个小插件,帮朋友装一个飞书的浏览器自动化工具。折腾了三四个小时,每次都说好了,一跑就有 bug。各种方法都试了,就是搞不定。
后来 [ChatGPT 出了 5.4](https://openai.com/index/introducing-gpt-5-4/)。我说行,换你上。它跑了两个多小时,中间我几乎没干预,最后通了。
说实话,那会儿我已经没什么期待了,觉得这事在当前 AI 能力范围内可能就是做不到。结果它就这么做到了。
同样的任务,一个模型怎么都不行,换一个就成了。这中间的差距根本不是程度问题,是能不能做到的问题。
## 进不去电脑
然后有一天,出事了。
不知道在折腾什么的时候动了什么配置,我的 Mac 突然登不进去了。输用户名密码,按回车,等一会儿,啪——又跳回登录界面。反复好几次,就是进不去。
搁以前,我大概会想:找朋友帮忙?联系苹果工程师?但想想那个流程,登官网、排队、预约、远程接入,还不一定能解决,光想就头大。
然后我想到:能不能让别的机器上的 AI 来修?
问题是,我连自己电脑都打不开,AI 从哪连进来?
我开始在网络里翻,看哪台设备还能用。找来找去,发现有一台之前连了智谱大模型的机器。其他的要么没 agent,要么也连不上,就这一台还能用。行吧,死马当活马医。
用那台机器远程连到出问题的 Mac,让 AI 排查。它一边查,我一边在这头不断尝试登录,把新的报错信息反馈给它。
半小时后,它找到原因了。某个配置文件出了问题,帮我改回来,直接就登进去了。
那一刻的感受很具体。在你真正需要帮助、原来的方式又帮不上忙的时候,一个能连到你机器上的 AI 智能体,哪怕不是最好的模型,就是能把事情解决掉。
## 越来越像个黑客
修完电脑之后,我开始想另一件事:能不能不在电脑跟前也用上 coding agent?
我问 Claude Code 该怎么办。它推荐了 [Tailscale](https://tailscale.com/),我之前压根不知道这是什么。设好之后,所有机器都连到了一个虚拟网络里。手机居然也能连。
从那之后,走在路上想到什么,掏出手机就能连到电脑,让 coding agent 帮我干活。其实远程操控 AI 做事这件事很早就能实现了,只是大多数人不知道怎么搞。
后来又碰到一个问题:手机网络一断或者退出 app,正在跑的任务就断了。又问 AI,它教我用 [TMUX](https://github.com/tmux/tmux),让程序在后台持续运行。设好之后任务可以一直跑着,我想看进度随时连进去就行。
那段时间挺奇妙的。远程控制、后台运行、多机联网,以前觉得这些是程序员才会的事,离自己远得很。问一句 AI 就全搞定了。自己好像真变成了以前想象中那种黑客。
## 最怕的事
但习惯了这种能力之后,最怕的事情变了。
不是怕电脑坏。怕的是 agent 挂了。
有好几次,某台机器上的 coding agent 因为软件更新或配置变动,突然就打不开了。你已经完全习惯了有问题找他,他突然不在了,你反而连修他都不会。
我后来摸出一个规律:只要网络里还有至少一台机器的 coding agent 是好的,我就能用它去修别的机器。就像之前修那台登不进去的 Mac 一样。这也是为什么[边端AI设备](/blog/edge-ai-device-blueprint)要做成路由器的样子——24小时在线,永远有一台是好的。
但如果最后一个 agent 也挂了呢?
说实话,那就真的会慌。
## 一个想法
想到这里,我发现问题不只是我自己的。
身边越来越多朋友开始用 AI 工具、装 coding agent,好用的时候确实爽。但打开通道、配置环境这些前置工作,比想象中难得多。一旦哪里出了故障,大多数人根本不知道怎么修。
本来享受着便利,突然就不工作了。这种落差感比从来没用过还难受。
我就在想:能不能不让大家自己去折腾配置?需要帮忙的时候,打开终端敲一行命令,就有个 AI 连进来帮你把问题解决掉?
这就是后来做 Aima Service 的起点。
## Aima Service
我带着团队花了一些时间,把这个想法变成了产品。
后面跑着几个 AI 智能体,7×24 小时待命。不需要提前懂技术,打开终端一行命令就开始。
比如 coding agent 打不开了,它来帮你修。想装个新的 AI 工具或编程环境,交给它。设备出了奇怪的技术故障,让它来排查。
不保证 100% 成功。AI 的能力还在涨,有些今天搞不定的场景,过段时间可能就行了。但现阶段的成功率,比大多数人想的要高。
现在开放了大量免费额度,不用花钱,直接登录就能用。
## AI 最打动人的时刻
最后讲一个跟产品无关的事。
一个朋友平时不怎么用 AI,也不太清楚什么时候该用。有一次跟另一半闹了点矛盾,想好好谈但又怕说错话让事情更糟。他试着问了 DeepSeek。它给了一些沟通上的建议,帮他避开了几个容易引起误解的说法,还顺带帮他理清了自己真正想表达的意思。
他后来跟我说:AI 比他想象中厉害太多了。
从那之后他就开始主动找 AI 帮忙了。
我在自己身上、在他身上、在身边不少朋友身上都看到了类似的变化。人对 AI 的看法改变,往往不是因为日常用着方便,而是在某个真正需要帮忙、其他办法又不好使的时刻,被打动了。
我想让更多人也能有这样的时刻。这就是 Aima Service 在做的事。
去 [aimaserver.com](https://aimaserver.com) 试试看。
---
### 比 AI 焦虑更值得谈的事
- URL: https://guanjiawei.ai/zh/blog/beyond-ai-anxiety
- English: https://guanjiawei.ai/en/blog/beyond-ai-anxiety
- Published: 2026-03-25
- Tags: AI, 思考, 社会
昨天看到张雪峰去世的消息,41 岁,心源性猝死。三天前他还在朋友圈打卡跑步,月跑量 72 公里。午后跑完步感到不适,被送到医院,三个小时后人就没了。
他身后留下了 9 家公司、估值数亿的教育集团,和一个 9 岁的女儿。
前几天刚写了一篇聊 [AI 创业的瓶颈](/blog/ai-startup-bottleneck),提到身体是这轮变革里最硬的基础设施。工作强度在加大,节奏在加快,但身体不会因为技术进步就变得更耐用。没想到第二天就看到这样的消息。
这不是孤例。华为的丁耘,53 岁,跑完 28 公里后离世。旷视首席科学家孙剑,45 岁,凌晨突发疾病。春雨医生创始人张锐,44 岁,心梗。中国每年心源性猝死大约 55 万人,日均 1500 人。这些数字在 AI 出现之前就存在,AI 时代的工作强度只会让它更严峻。
但让我想了很久的,不是养生的话题。是面对这些事的时候,所有关于技术变革、生产力爆发的叙事,突然间都显得很轻。
## 赚到 1 亿美金,然后呢
OpenClaw 的创始人 Peter Steinberger 的经历,跟这件事可以放在一起看。
他花 13 年做了一款 PDF SDK,服务了近 10 亿用户,客户包括 Apple、Adobe、Dropbox。2021 年把公司以大约 1 亿美金卖给了 Insight Partners。
然后就崩了。
他形容自己"非常破碎"。每天早上醒来没有任何期待,没有真正的挑战。试过旅行、社交、做治疗,都填不上那个空洞。他跟 Lex Fridman 说:"如果你醒来没有任何期待,那种无聊来得非常快。"到 2024 年底,他已经写不了一行代码。
后来他因为 AI agent 重新找回了热情,三个月搞出了 GitHub 增长最快的开源项目之一。但比起复出本身,我更在意的是那段空白期。一个已经"成功"了的人,在意义面前照样会彻底卡住。
外在的驱动力消失之后,人靠什么继续走?这个问题不只是他的。
## 1200 亿的意义缺失
一边是 AI 焦虑,一边是 AI 玄学。
2025 年春节,DeepSeek 算命冲上热搜。输入生辰八字,AI 给你排命盘、看财运、断姻缘。紫微斗数、八字、塔罗、易经全包了,互动感比真人算命师还强。
这不是小众现象。艾媒咨询预测 2025 年中国 AI 算命市场规模突破 1200 亿元,年增速 35%。某头部平台注册用户超 8000 万,单日占卜 200 万次。用户画像也耐人寻味:20 到 35 岁占 73%,本科以上学历 82%。
不是老年人在消遣。是受过高等教育的年轻人,在向一个算法寻求某种确定性。
我不觉得这是迷信回潮。更像是一种症状。当技术变化太剧烈,以前那套说法——努力就能成功、有房有车就算好日子——开始松动的时候,人会本能地去找更底层的东西抓住。我从哪来?要往哪去?GPT 再能跑也回答不了这些。反倒是技术越快,这些问题越挡不住。
## AI 会取代人的工作吗?
大多数人焦虑的逻辑链是这样的:AI 能干活了 → 我的活被替代了 → 我没价值了。
但这条链子里有个隐含的前提:人的价值等于劳动产出。
拎出来看看,这个前提其实挺可疑的。
如果 AI 让社会的总生产力大幅提升,数字员工 24 小时运转,边际成本趋近于零——这正是[AI作为工业革命级别的变革](/blog/ai-is-not-the-next-computer)的含义。那为什么每个人还非得亲自劳动才能获得资源?有了更廉价的生产力,它不吃饭不睡觉不需要社保,按道理人应该被释放出来。去晒太阳,去做自己有热情的事,在乐趣中创造点什么也好,纯粹消遣也好。这样的人生不是更好?
但大家不去想这个。大家焦虑的是活被抢了。其实该焦虑的是另一件事:生产成果怎么分配。
生产力越来越充裕,但分配机制还是老一套,资本集中在少数人手里,通过市场价格来运作。结果就是极少数人决定社会主要的资源往哪儿去。技术放大的是已有的差距,不是平等。
与其恐慌,不如认真聊聊:当技术变革到了这个程度,怎么做更合理的再分配?人的时间被释放出来之后,需求应该被引导到哪里?
## 缺一幅关于未来的正面图景
前段时间跟朋友聊天,他说了一句让我很触动的话:当前最缺的,是对未来的有效想象。
仔细想想,确实是这样。
过去几十年,未来长什么样,大家其实是有共识的。经济增长、城市化、全球化、生活水平持续往上走。这套东西足够强,强到不需要专门讨论。整个社会被一种欣欣向荣的预期充满着。
现在这个共识碎了。关于未来,我们有的想象大多是好莱坞给的。《黑客帝国》《银翼杀手》,底色都是反乌托邦,贫富撕裂、公司统治、技术失控。游戏里倒是偶尔有些对虚拟世界社交的有趣设想,但整体上,让人兴奋的正面图景少得可怜。
这挺危险的。悲观的想象当然有它的价值,但如果只有这些,人就只剩恐惧和防御。一个被恐惧驱动的社会,做出来的每个选择都是收缩的。
## 技术中性,选择不是
技术本身没有好坏。怎么用、怎么分配、怎么组织社会来适应它,这些决定了结果。
这些问题不是工程师能回答的。经济学家、社会学家、政策制定者,在技术跑得最快的时候,反而最应该站到台前来。
AI 动摇的东西比大多数人以为的要深。劳动的意义、财富的逻辑、时间该怎么花。这些假设过去几十年从没被真正质疑过,现在全在松动。
内容创作的门槛在降,影视和文化产品的成本也在降。在这样的条件下,认真去畅想一个关于未来的正面图景,去投入,不再是奢侈品。美国正在退出这类想象的引领,如果有人要接过来,现在就是时候。
回到开头。张雪峰走了,41 岁。在这件事面前,什么技术竞争、什么行业焦虑,说实话都不太值得花那么多情绪。该认真想想的是那几个老问题:怎么让社会更好一点,怎么让人活得更像个人。我觉得[AI放大的不是技能,是热情](/blog/ai-amplifies-passion)——找到自己真正在乎的事,可能比追赶技术潮流重要得多。
---
### 软件招投标,快撑不住了
- URL: https://guanjiawei.ai/zh/blog/software-bidding-is-broken
- English: https://guanjiawei.ai/en/blog/software-bidding-is-broken
- Published: 2026-03-24
- Tags: AI, 思考, 行业
前两天跟一个做政企软件的朋友吃饭,他说今年投了七八个标,中了一个,报价被压到之前的三分之一。不是甲方故意压价,是真有人用这个价格来投,而且东西看起来还行。
他问我怎么回事。我说你去了解一下现在 AI 写标书和做软件的速度就知道了。
这件事让我想了挺久。软件行业的招投标体系,可能快撑不住了。
## 软件招投标体系为什么会失灵?
中国的政府采购规模很大。[2024 年全国政府采购总额超过 3.37 万亿元,其中公开招标占了 76.63%](https://gks.mof.gov.cn/tongjishuju/202511/t20251112_3976264.htm)。IT 相关的政府采购大约 1433 亿,虽然同比降了 4.5%,但项目数量反而增长了 21.5%,将近 7.9 万个项目。也就是说,项目越来越多,但单个项目越来越小。
过去软件招投标能稳定运转,靠的是几道门槛。
首先是资质。确保投标公司是正经公司,有对应的能力和经验。但这道门槛从来就卡不住太多人,想进的公司总能找到办法。限得太死又失去了竞争意义。
然后是信息不对称。很多公司在标发出来之后才知道消息,准备时间不够,甚至根本不知道有这回事。发标到截止之间窗口有限,客观上把一部分竞争者挡在了外面。就算知道了,制作一份像样的标书也要投入大量时间和人力,准备不充分的公司在技术评审环节吃亏。
最后是商品化比较。这是招投标的核心设计逻辑:把软件当成标准化商品,功能参数写清楚,一项一项对着打分。你之前没做过类似系统,很多功能就拿不出来,技术描述也说不清楚,演示环节更是没东西可展示。
这几道门槛组合在一起,竞争就维持在一个相对可控的范围内。很长一段时间里,这套体系运转得还行。
## 门槛在同时松动
AI 正在同时松动这几道门槛。
资质不用多说,本来就不是真正的壁垒。
变化最快的是信息不对称。已经有不少公司在用 AI 工具全网扫描招标信息。百炼智能做的"知了标讯"覆盖了全国超过 10 万个招标网站,积累了 3 亿多条招标记录,每天更新 2000 万条,AI 预测中标准确率超过 70%。千里马招标网在 2025 年接入了 DeepSeek 等大模型,每天更新 30 万条招标信息,AI 从立项审批到招标公告全程监控,自动筛选高潜力项目。
以前可能压根不知道有这个标,现在 AI 一直盯着。标书来不及准备?AI 也能帮你写。
标书生成这块,2025 年市场同比增长了 230%。科大讯飞的"星火投标"号称把标书制作周期从 30 天压缩到 3 天,文档合规性提升 90%,中标率提高 40%。钛投标声称 30 分钟生成一份千页标书,3 分钟提取 200 多个关键要素。快标书 AI 直接喊出了 10 分钟快速生成。
这些厂商的数字我没法完全验证。但方向是清楚的:准备一份标书需要的时间和人力正在急剧缩短。以前准备充分和准备不充分之间差距很大,现在这个差距在快速缩小。
最要命的是最后那道门槛。
招投标要求把功能参数描述清楚,然后拿成品或接近成品来比较。以前你没做过类似系统,确实拿不出东西来。但现在,功能描述得越清楚,AI 做得越快。你把招标文件里的参数要求丢给 coding agent,花几千块钱加上几天时间,就能搞出一个能演示的东西来。有截图,有功能点,甚至能跑起来给评标专家看。
[Y Combinator 2025 年冬季批次里,25% 的创业公司 95% 的代码是 LLM 生成的](https://techcrunch.com/2025/03/06/a-quarter-of-startups-in-ycs-current-cohort-have-codebases-that-are-almost-entirely-ai-generated/)。YC 的 CEO Garry Tan 说得很直接:你不再需要一个 50 到 100 人的工程团队。这就是[vibe coding](/blog/vibe-coding)带来的变化——用自然语言描述需求,AI把它变成可运行的软件。Cursor 日活超过百万,2026 年初年化收入突破了 20 亿美元。84% 的开发者在用或者计划用 AI 编程工具,41% 的代码已经有 AI 参与生成。
应付招投标够不够?够了。后续完善和交付的成本也在大幅下降。
## AI 把软件成本压到多低了?
以前一个软件项目报价 50 万,大家觉得正常,光开发和测试就要投入不少人力和时间。现在这些成本被压缩到原来的十分之一甚至更低。有人 5 万就敢进场,标书是 AI 写的,产品是 coding agent 做的,自己真正承担的成本就那么点。
雪上加霜的是,中国企业 SaaS 行业本身就不好过。安永 2024 年的报告显示,中国企业级 SaaS 上市公司过去四年半的平均净利润率是负数。毛利率不到 60%,销售费用率 30%,研发费用率 20%。行业整体还在亏。
软件外包领域更惨。2025 年行业的真实状态被总结成"三件套":项目烂尾、拖欠工资、裁员潮。面向中小企业的 SaaS 产品同质化到了拼人力的地步。IBISWorld 估计 2025 年行业利润率只有 12.5%。
在这种背景下,招投标的报价还在被继续往下压。整个体系开始变得有些滑稽。
## 去年大模型走过的路
其实去年大模型已经走过一遍一样的路了。
2025 年初 DeepSeek R1 发布,在关键基准测试上追平甚至超过了 OpenAI o1,API 定价只有 OpenAI 的大约 4%。同样一个推理任务,OpenAI o1 上花 100 美元,DeepSeek 上大概只要 3.6 美元。训练成本据报道只有 600 万美元左右。
中国市场随后爆发了一轮价格战。字节跳动的豆包把 Pro-32k 模型定价到 0.0008 元 / 千 token,比行业均价低了 99.3%,到 2024 年 7 月日均 token 用量突破 5000 亿,比 5 月增长了 22 倍。阿里通义千问把 Qwen-Long 的输入价格从 0.02 砍到 0.0005 元,降了 97%。百度直接宣布 ERNIE Speed 和 ERNIE Lite 免费,2025 年 4 月起所有文心模型全部免费。
兰德公司的一份报告发现,中国 AI 模型的成本大约是美国同类系统的四分之一到六分之一。
顶尖模型都开源了,花钱买一个模型本身就说不通了。后来大家看到的结局是,模型的生意变成了围绕模型的服务。帮企业把模型用好、做后训练、做行业适配,这些有价值。模型本身不再是交易的标的。
## 软件正在走同一条路
现在回过头来看软件。
制作成本跌到一个足够低的水平,需求方早晚会问一个问题:为什么要搞这么复杂的采购流程来买这个东西?
跟模型的逻辑一模一样。供给端的成本接近于零,单独为它组织复杂交易就失去了意义。
招投标体系能怎么应对?一个方向是不再比功能参数,改成比经验、比案例。你服务过多少客户,系统跑了多久,有没有大规模使用的记录。但这就违背了招投标的初衷。招投标的本意是把东西当标准化商品来比,这样才能公平竞争。如果最后比的是经验和人脉,那跟不招标直接指定有什么区别?
问题就卡在这里。比功能,AI 能帮你快速做出来,区分不了人。比经验和资源,不是招投标该干的事。
## 不远了
很多人觉得 AI 对自己行业的冲击还要等几年。招投标这件事可能等不了那么久。
2024 年 IT 政府采购的项目数量增长了 21.5%,但总金额反而降了 4.5%。项目越来越多,钱越来越少。在这个基础上再叠加 AI 对软件成本的压缩,到临界点的速度会比大多数人预想的快。
上一次看到类似局面是 2025 年初的大模型市场。从 DeepSeek 开源到主要厂商全面价格战,前后也就几个月。大家被迫转型,不再卖模型本身,而是卖围绕模型的服务。
软件行业大概率也会走这条路。软件本身的交易价值会持续缩水,真正能卖钱的是围绕软件的服务:帮客户理清需求、持续运维、数据迁移、流程改造。开源社区也在经历同样的变化——[制作和分发成本同时趋近于零](/blog/opensource-is-the-new-douyin)的时候,原有的商业模式就撑不住了。
回到开头那个朋友的困惑。他在想怎么适应新的报价竞争。但也许该想的不是怎么在报价上赢,而是这套游戏本身还能玩多久。
---
### 卡住 AI 创业的,不是技术
- URL: https://guanjiawei.ai/zh/blog/ai-startup-bottleneck
- English: https://guanjiawei.ai/en/blog/ai-startup-bottleneck
- Published: 2026-03-23
- Tags: AI, 创业, 思考
今天中午吃饭,旁边一桌人聊天,我听了个大半。
应该是同行,这片科技公司多。前半段全在吐槽 AI 带来的变化,说软件越来越不值钱,原来的业绩指标现在要找两三倍的客户才能完成,觉得自己更累了。
然后突然话锋一转,有人提议说某个人力相关的服务能不能自己做一个替代品。另一个人马上接话,说认识有资源的人,是不是能做成一个 business。
前面还在焦虑,后面就开始兴奋了。
## 焦虑和兴奋,大家都有
不止是这一桌。电梯里、饭桌上,现在随便听到的话题基本都跟 AI 有关。身边的朋友也差不多,焦虑的是原来的节奏被打乱了,兴奋的是觉得可能有新机会。
两种情绪交替出现,谁都一样。我觉得这就是常态了。
## 九天不发版就被追问
变化的速度确实在加快。
今天 OpenClaw 发了最新版本,之前九天没更新,社区很多人就在问:怎么回事?是不是要憋大招?
九天。大家觉得九天没动静就值得追问了。
结果确实憋了个大招,权限和生态整个重做了。但我更在意的是这个节奏本身。以前做软件,以周为单位做规划大家觉得正常。现在一个想法如果一周还没见到影子,基本就没人关注了。
## 第一个卡点:热情
在这种速度下,什么东西真正卡住了创业团队?
我觉得第一是热情。不是鸡汤那种。
变化太快,注意力转移也快。想在这么大的浪里单纯靠获利来坚持,不太现实。机器的生产速度上去了,但需求端没跟上。大家做决策还是很慢,消费者懒得想、懒得换。这种惰性才是目前最大的粘性来源,技术本身反而没什么壁垒了。
必须对这件事本身有乐趣。不然很快就撑不住。我后来专门写了一篇关于这件事——[AI放大的不是技能,是热情](/blog/ai-amplifies-passion)。
## 第二个卡点:专注
20% 的精力在这里,30% 在那里,40% 在另一个方向。以前这么干勉强能应付。现在不行。
整个行业像是在百米冲刺。如果核心团队还在用马拉松甚至竞走的节奏,很快就会发现身边的人一茬一茬超过去,找不到影子了。
方向跟着创始团队的投入程度走。一个小团队能不能全部 dedicate 在一件事上,这种专注直接决定了能不能跟上节奏。三心二意的团队在这个速度下活不了太久。
## 第三个卡点:基础设施和流程
有些瓶颈很出人意料,不在技术层面,在很基础的地方。
产品做好了,准备推广,发现域名需要备案,5 到 20 个工作日。海外呢?服务器注册完域名马上能用。这一个环节速度就差了十几倍。
类似的还有组织内部的审批流程、花钱的速度、做决策的链条。以前这些只是慢一点,没什么感觉。但当技术的速度已经到了这个量级,周围跟不上的部分就变得格外碍事。
## 第四个卡点:身体
这个很多人没想到。
大家觉得 AI 来了以后应该更轻松。但目前不是这样。AI 还没办法脱离人的监督 7×24 小时自主运转,所以人的消耗反而更大了。
你可以同时开五个 agent 并行干活,一边构建一边测试。但人的注意力得快速在几件事之间切换,不停地去看结果、修正方向。
说实话,指挥 agent 团队的脑力消耗比指挥真人团队还大。像在做一整天高强度的 workshop,不是偶尔来一次那种,是每天这么干。我在[10天写30万行代码](/blog/code-is-liability)那次就体验到了——5-6个小时之后,感觉身体被掏空。
身体扛不住的话,很快就掉队了。
## 过渡态
我现在的感觉是,这是一个过渡期。
如果有一些核心的方向和价值链开始被验证出来,就可以围绕它构建 7×24 小时的 AI loop,让事情不再完全依赖人的精力。再加上能吸引更多 contributor 参与共建,就不只是一个人或一个小团队在靠 token 推进了,更多人的脑力和资源都能参与进来。
我们自己的开源项目已经出现了这种情况。有人完全用 AI coding agent 提交功能,合进来了,这个人不是程序员。只要有想法就能参与,身份从消费者变成了建设者。
吃饭时旁边那桌人,前半段焦虑后半段兴奋,这两种状态估计会持续很久。只是在这个过程里,得知道自己到底卡在哪儿。
---
### 开源社区正在经历一场「短视频式」的爆发
- URL: https://guanjiawei.ai/zh/blog/opensource-is-the-new-douyin
- English: https://guanjiawei.ai/en/blog/opensource-is-the-new-douyin
- Published: 2026-03-23
- Tags: AI, 开源, 思考
最近跟朋友聊天,聊到软件行业正在发生的事,我经常拿短视频来比。一开始觉得只是类比,后来越想越觉得,底层逻辑几乎一模一样。
## 短视频是怎么起来的
最开始大家看视频是有成本的。流量贵,一个视频几十兆,月底流量告急的时候谁敢刷。后来 4G 普及、5G 跟上,流量套餐越来越便宜,随时随地刷视频变得没什么负担。看视频这件事的门槛被抹平了。
制作端同时在变。以前自己拍个视频剪出来,感觉像造火箭,夸张点说。后来剪映出来了,再加上直播,对着脸就能拍,发出去就有人看。制作成本也被压到接近于零。
两端同时降到零附近,中间的平台就炸了。
我之前在公司看过这个行业的数据。2017 年短视频广告市场大概五六百亿的规模,几年之后飙到两千多亿,再往后加上电商和直播,整个生态冲到了四千多亿。利润大头被抖音和快手两家吃掉。
## 软件行业正在重演
以前一个开源项目,下载安装对普通人来说门槛不低。文档写得一般,环境配置一堆坑,不懂技术的人基本玩不转。现在不一样了,遇到问题直接问 ChatGPT 或者 DeepSeek,它一步步教你,大部分开源项目都能跑起来。获取软件这件事变得简单了很多。
[GitHub 的数据](https://github.blog/news-insights/octoverse/octoverse-a-new-developer-joins-github-every-second-as-ai-leads-typescript-to-1/)能说明问题。2025 年全球开发者超过 1.8 亿,一年新增 3600 多万人,相当于每秒钟就有一个新人注册。印度一年新增 520 万,印尼从 2020 年的 90 万涨到 430 多万。80% 的新用户在注册第一周就用了 Copilot。很多人不是传统意义上的程序员,AI 把进入开源社区的门槛拉低了。
我们团队开始用开源社区的基础设施之后,发现很多同事其实之前多少用过,至少注册过账号。AI 普及之后,大家可以直接问一句"这个软件怎么装、怎么用",按着步骤来基本都能搞定。
制作端的变化更猛。coding agent 正在把写软件的成本往零压。以前做一个 MVP 至少要一个小团队干几个月,现在一个人加一个 coding agent,几天就能出一个能用的东西。[Cursor](https://www.cursor.com/) 日活超过百万,[2026 年初年化收入突破了 20 亿美元](https://techcrunch.com/2026/03/02/cursor-has-reportedly-surpassed-2b-in-annualized-revenue/)。84% 的开发者在用或者计划用 AI 编程工具,41% 的代码已经有 AI 参与生成。
最近看到一些人分享说自己以前完全不懂技术,现在在 GitHub 上做了个项目开源出来,拿到几千 star,觉得不可思议。[MIT Technology Review 把"生成式编程"列为 2026 年十大突破技术之一](https://www.technologyreview.com/2026/01/12/1130027/generative-coding-ai-software-2026-breakthrough-technology/),创业者、市场人、设计师都开始用 AI 工具直接做软件了。有个做增长营销的人用 ChatGPT 加 Lovable 做了个加密货币可视化应用,根本不会写代码。这种事以前想都不敢想。
制作成本趋近于零,获取成本也趋近于零。开源社区作为中间的平台,正在迎来跟短视频一样的局面。这跟[软件招投标体系的崩塌](/blog/software-bidding-is-broken)是同一股力量在起作用。
## OpenClaw
OpenClaw 值得单独说说。
这个项目 2025 年底才上线,到现在[超过 25 万 stars,GitHub 历史上增长最快的开源项目](https://openclaws.io/blog/openclaw-250k-stars-milestone)。Linux 花了好多年才到这个数字。
它在中国引发的反应更有意思。3 月份[深圳腾讯总部门口,将近一千人排队让工程师帮忙装 OpenClaw](https://www.ithome.com/0/927/044.htm)。排队的有学生、退休的人、上班族,不只是程序员。"养只小龙虾"变成了一个梗。[深圳龙岗区给基于 OpenClaw 创业的团队最高一千万的补贴](https://politics.gmw.cn/2026-03/09/content_38635629.htm),[无锡跟进了五百万](https://www.chinanews.com.cn/cj/2026/03-09/10584178.shtml)。阿里云、腾讯云、字节、京东、百度全都推出了自己的版本。
单看 OpenClaw 你可能觉得就是一个项目火了。但放到刚才说的框架里看,它其实是平台效应开始显现的一个缩影。制作的人用 coding agent 快速迭代,使用的人借助 AI 快速上手,GitHub 做分发几乎零成本。一个好的软件从诞生到被几十万人用上,以前需要很长的周期,现在速度完全不一样了。
## 建议关注开源社区
往后看,我觉得开源社区对软件行业的意义,跟短视频平台对娱乐行业差不多。
[GitHub 2025 年新增了 1.21 亿个仓库](https://octoverse.github.com/),每分钟创建 230 个新项目,一年合并了 5 亿多个 pull request。AI 相关项目一年增长 178%,超过 110 万个仓库在用 LLM SDK。
开源社区不只是程序员交流代码的地方了。生产在这里,分发在这里,协作在这里,影响力也从这里长出来。拿着开源项目的成果,已经能撬动不少流量和资源。
如果你在软件行业,不管做技术还是做产品,建议认真关注开源社区。不是"关注一下"那种,是把它当成核心渠道去经营。
背后的驱动力是 AI 和 coding agent。Coding agent不只是写代码的工具,[它是一种元能力](/blog/coding-agent-meta-ability)——让原来不懂技术的人也能参与开源项目。但在现象层面,你会看到开源社区里好的软件以很夸张的速度在传播和扩散。就像当年 4G、智能手机这些基础设施普及之后,短视频平台快速爆发一样。
对于本来就在软件行业的人,这件事值得多留意。
---
### Agent 缺的不是智能,是信任
- URL: https://guanjiawei.ai/zh/blog/agent-trust-model
- English: https://guanjiawei.ai/en/blog/agent-trust-model
- Published: 2026-03-18
- Tags: AI, AI Agent, 产品, 思考
最近做 AI 产品,踩了个坑。
我们一直围绕两个理念在做。第一个是零摩擦接入。打开终端,一行代码回车,直接用。不装软件,不给权限,不折腾操作系统的安全弹窗。之前推广的时候发现,接入环节的各种摩擦是杀死试用率的头号原因,还没开始用就烦了。做到零摩擦之后,成功率高了很多,体验也很爽。
第二个是极强的 AI 智能。接入这么简单,人只需要提需求,剩下的交给 agent。我们设计了一套 agent team 架构,混合模型加多个 worker 协作,尽可能低的成本和时间,帮你搞定复杂任务。
两根支柱都立住了,效果也还行。
但给别人演示的时候,反应远没有我预期那么强。我一直在想问题出在哪。
## 恐惧
那天跟朋友吃饭,聊到这事,突然想通了。
我们产品执行任务的时候,终端里弹出来的是一行行命令。做技术的朋友看了觉得有意思,说指令选得不错,任务拆解得挺好。但对大多数人来说,屏幕上突然蹦出一串看不懂的代码,第一反应不是惊叹,是害怕。
这在干什么?会不会把我的东西删了?会不会把电脑搞坏?
之前有用户用完给我反馈:"你是不是在执行一个脚本?脚本里写的什么?"我当时挺纳闷,怎么会这么想。还有人说:"哇真的做完了!但……这到底是个什么东西?"
即使有技术背景,光看一个交互界面也没法完全理解 agent 在做什么。更别说普通人了。
不理解,就恐惧。
## 信任是断的
回想推广初期,有些人宁愿让我远程帮忙,也不想让 agent 来。虽然操作更麻烦,但他们踏实。有个人在帮忙,出了问题能沟通,心里有底。知道是关嘉伟在帮我做这件事,我信任这个人。
换成 agent,这层信任就没了。
一边是极强的智能,在你设备上自主决策、自主执行。另一边是完全看不懂的输出。设备是我的资产,一个说不清是什么的东西在上面折腾,谁都不舒服。
智能越强,暴露出来的行为越不可理解,用户就越怕。这两件事叠在一起很危险。
我们缺了一根支柱。
## 连夜重做
想清楚之后,连夜重做了交互。
还是终端,但打开后看到的东西完全不一样。agent 接入会给一句开场白。查资料的时候说"我在查相关知识",发现有可以复用的信息会告诉你。每一步都用自然语言解释意图:准备做什么、决定了怎么做、正在执行什么。失败了也会说原因,以及为什么要换方向。
不是一行行看不懂的命令了,是一个会说话的协作者。
agent 能力没变,用户反馈完全不同。
## Claude Code 走过同样的路
做完之后想起了 [Claude Code](https://www.anthropic.com/product/claude-code)。
一开始,工程师们会看它写的每一行代码、执行的每一条指令。有些人不放心,把折叠的内容全部展开,逐条检查。后来发现 95% 的情况下它不会搞砸,大家开始把信息折叠起来。执行一个 bash 命令只显示一行,等着就好。再后来,展示的信息越来越少,也没人觉得有问题。
我们团队有个人跟我说了件事。他有天突然意识到,自己从来没对 Claude Code 说过 no。每次弹出权限请求都点批准。100% 说 yes 的环节没有存在的意义,于是他直接开了 [bypass permissions](https://code.claude.com/docs/en/overview),放手让它干。
这不是一上来就能做到的。第一天就把所有权限交出去,谁都会慌。但交互了一段时间,确认它不会搞砸,信任自然就有了。
## 不能跳步
人跟未知事物建立信任是一个缓慢的过程。
如果第一天就出一个产品,什么都不解释,在用户设备上自动执行一堆操作——即使结果很好——大家也会疯掉。"这在搞什么?会不会把我的东西搞砸?"
必须有一个渐进的过程。先让人看清楚 agent 在做什么、为什么做,确认它不会出事,然后慢慢放手。跳不了步。
所以我们产品的三根支柱定下来了。零摩擦接入,极强 AI 智能,渐进式信任。翻译成体验就是简单、强大、友好安全可控。
三根都立住,产品才算到了能让别人用的状态。
---
### 你写的提示词,可能正在拖累你的 Agent
- URL: https://guanjiawei.ai/zh/blog/agent-behavior-is-the-moat
- English: https://guanjiawei.ai/en/blog/agent-behavior-is-the-moat
- Published: 2026-03-17
- Tags: AI, AI Agent, 产品, 思考
最近做智能体产品,有个发现挺有意思。
传统软件工程那些活,写接口、搭架构、做测试,正在变得越来越简单。大多数问题有范式可循,过去的经验和检验手段也比较成熟。拿 [coding agent](https://www.anthropic.com/product/claude-code) 来干,遇到问题就让它做,做完就试,试完评估,链路很清晰。
对于这类机械化的工作,agent 已经做得相当好了。
但有一块非常难。就是 agent 本身的行为。
## 80% 的价值来自 Agent
现在产品和应用里大概 80% 的价值来自于 agent 本身。前端、后端、数据库、部署,说白了都是脚手架。
矛盾在于:传统软件工程的价值在缩水,但新长出来的价值,也就是 agent 的行为,恰恰是我们最不可控、最不知道怎么研究的东西。
到底怎么做出一个好的 agent?这个问题我觉得会困扰接下来很长一段时间。
## 三年五波范式,没一个站住的
从 [ChatGPT](https://openai.com/index/chatgpt/) 出来到现在三年,范式一直在转移。之前沉淀的方法,过段时间大家就发现不太行,然后又换。
最开始是提示词工程。大家的直觉反应就是研究怎么写好提示词,每天琢磨怎么让 AI 更听话,怎么把它嵌到业务链路里。
然后是 RAG。当时主要是为了解决上下文不够的问题。窗口短、上下文贵,8K、32K 就算不错了。大家想让 AI 有用一点,就把知识切片喂给它。这个方向有过一段热度,然后突然间没人聊了。
天花板太低。怎么做都到不了理想效果。agent 的准确率到了 80%、85%,再往上提不动。
对 RAG 不满意,大家又开始搞微调。微调加 RAG,试图让 agent 的行为更受控、更可预期。到今天,从 ROI 的角度看,也没有太多让人信服的案例。
再后来是知识图谱。觉得纯文本向量搜索太简单,信息关系不够丰富,[微软提出了基于图的方案](https://www.microsoft.com/en-us/research/project/graphrag/)。框架没火起来。确实有帮助,但成本和速度让人难以接受。我之前看一个演示,跑一个任务要等 5 到 10 分钟,烧大量 token,最后回答一个微不足道的问题。准确和效率大家都要,不存在只追求一头的空间。
到了最近这波,上下文工程。模型推理能力变强,上下文窗口从 32K 拉到 128K、256K,现在在推 100 万 token。突然没人提 RAG 了。你有这么长的上下文,把上下文设计好不就行了?按需拉文档、按需披露信息,做那些切片搜索查询的意义到底有多大?
模型会推理了,上下文够长了,agent 整体能力确实在变强。
## 够强之后,新的困境
强到什么程度?现在你可以放任一个 agent 自主决策,选工具、做事情,连续工作两三个小时,大多数时候不会把事搞砸,还给你不错的结果。
放在去年,没人敢想。
但也正因为到了这个水平,期待就上来了。比如把 agent 嵌到一个系统里,个人操作系统也好,企业业务系统也好。能力很强,我也信它很强。但怎么管?怎么让它持续进步?
越来越像管理一个数字员工。干活快,热情高,加班不休息。你心里难免有种不安,它这么强,我该怎么跟它协作?
换个角度想,如果你能带着它创造更大的价值,让它在你这里的表现比在别处更好,你就是在放大它。放大它的价值,其实也是在巩固自己的位置。
## 你的提示词可能在害它
有个很反直觉的现象。
很多人给 agent 写提示词,写得巨详尽,第一步做什么,第二步做什么,123456。结果 agent 的表现大幅下降。不是一点点,是断崖式地掉。
原因也简单:你写提示词的那个思考水平,可能赶不上它自己决策的水平。你写的东西变成了枷锁。它本来干得挺好的,被你的指令拉低了,变通能力也跟着变弱。
到底用什么方法给 agent 配备上下文?怎么优化它的行为?要不要做 RL 相关的研究?说实话,没有标准答案。所有人都坐在那里说,模型变强了,挺好。但怎么在一个系统里观测 agent 的行为、围绕目标去提升它,大家还是摸不着头绪。
## 胜负手在转移
比如定义任务成功率这类指标,怎么把它提上去?提上去之后,怎么把成本打下来?
从产品角度看,胜负手已经从代码转移到了 agent。谁的 agent 表现好,谁就赢。如果表现好的同时成本还低,那就没什么可打的了。
业内有公司在做这方面的研究。不一定从零训模型,很多是通过后训练加数据、给模型加 runtime 的方式来提升 agent 行为。像 MiroThinker,虽然公司不太出名,但研究方向挺有意思,试图通过 agent 行为层面的产品力来构建差异化。
## 方向
从 2026 年开始,我觉得 agent 行为会成为一个真正的产品和技术方向。
传统软件工程师做的那些事,今年之内会被大幅压缩。但不是没方向了。产品与产品之间的差距,最后会体现在 agent 上,谁的智能体表现好、成本低。
如果你担心自己原来的技能正在被替代,我的建议是去研究 agent。
这件事是个真正的难题。coding agent 能帮你写代码、搭产品,但它自己的行为怎么优化,它帮不了自己。做出来的结果跟想象的不一样,没什么确定性,也不知道该怎么持续改进。但也就是因为难,这里才可能有真正的差异化。
能把 agent 调好的人,现在太少了。
---
### 生产力过剩,结构化地专注力稀缺
- URL: https://guanjiawei.ai/zh/blog/productivity-surplus
- English: https://guanjiawei.ai/en/blog/productivity-surplus
- Published: 2026-03-16
- Tags: AI, 思考, 产品
最近用 coding agent 高强度干活,有个发现让我挺意外的。
AI 擅长把事情做到 80% 甚至 90%。交给它一个任务,很快就能出来一个看着不错的东西。但"看着不错"不等于有价值。软件工程本身没有客观的完美标准,零 bug 的代码如果没人用,就是零。方向比执行重要得多。
我们团队最近一个月产出了过去半年的代码量。听起来很厉害,但我反而开始焦虑——这些代码里面,有多少是真正在解决用户的问题?有多少只是"因为能做所以做了"?
## 两种状态
这段时间我在两种状态之间反复切换。
假设清晰的时候,基本停不下来。我知道要验证什么,coding agent 帮我快速构建相关内容,端到端跑实验,整个链路压缩到小时级别。一天能完成两三轮假设修正,想法在几个小时内被印证或者被推翻。这种节奏很上瘾。
比如上周我们在验证一个假设:客户是不是愿意为AI自动生成的运维报告付费?以前验证这件事,至少得拉个产品经理、一个前端、一个后端,两三周出一个demo。现在我一个人,花了大半天就搞出来一个能跑的原型,当天下午就发给了三个客户试用。结果是:两个客户说"挺好但没必要付费",一个客户说"这个如果能接我们的监控系统就太好了"。半天验证完一个假设,省了可能三周的弯路。
但也有一些日子,坐在那里不知道该干什么。没有特别想验证的东西,就把之前做的项目翻出来看看,让 agent 完善一下这里、修修那里。看起来也在忙,但心里清楚这是在空转。
两种状态用的是同一套工具。差别全在脑子里有没有一个清晰的问题要去回答。
## 漏斗崩了
传统产品管理有个经典概念叫 ideation 漏斗。
前面有个"模糊前端"阶段,提出大量想法,然后筛。为什么要筛?因为后面实施太贵了。一个产品从概念到上线,3 到 6 个月开发周期是常态。既然实施贵,前面就得严格把关。
这套逻辑现在不成立了。
一个 MVP,一天加几百块 API 费用就能搞出来。一个想法从诞生到有人能用上,一周甚至几天。实施不贵了,筛选的前提就消失了。以前想法便宜、实施贵,现在反过来。
你可以想象一下这意味着什么:以前公司里一年可能只能验证10个产品想法,因为每个都要投入大量人力和时间。现在同样的团队,一年可以验证100个。但问题是——你真的有100个值得验证的想法吗?大部分团队连10个高质量的假设都凑不齐。
## 被压了太久
过去的工作环境其实一直在打压这种"提想法、去验证"的冲动。
大多数人被要求的就是执行。你想法太多,大概率会被说一句:"想那么多有什么用,把手头的活干好。"在资源有限的年代,大家争的是执行资源,不是想法。所以很多人的假设生成能力一直在萎缩。
现在 agent 时代来了,执行力突然不受限,生产力过剩了。但过剩的生产力不知道该往哪儿使。
我在团队里观察到一个很有意思的现象。那些过去经常被"压"的人——想法多但没资源执行的——现在反而如鱼得水。他们脑子里积攒了大量待验证的假设,agent 给了他们释放的出口。而那些长期专注执行的人,突然发现自己的核心竞争力被 agent 替代了,却没有足够的"想法储备"来填补空缺。
## 不同角色的冲击
这种转变对不同角色的冲击是不一样的。
工程师受到的冲击最直接。写代码这件事的门槛被大幅降低了,纯粹靠"能写代码"已经不构成核心竞争力。但好的工程师不只是写代码——他们理解系统、理解约束、知道什么方案在规模化之后会出问题。这种判断力依然稀缺。
设计师的处境类似。AI 可以几秒钟生成一个看起来不错的UI,但"看起来不错"和"用起来顺手"之间的差距,仍然需要人来弥合。真正的设计能力不是画图,是理解用户在什么场景下需要什么。
最尴尬的可能是中层管理者。以前他们的价值很大一部分来自"协调资源"——把有限的开发资源分配给最重要的项目。现在开发资源不受限了,这个协调者的角色还有多大价值?
## 瓶颈在转移
价值链条里面,AI 把某些环节放大了几十上百倍,没被放大的环节就成了新的卡点。
以前做产品,开发占大头,所有人都在等开发。现在开发被压缩了,别的地方反而卡住了。有没有足够好的想法?怎么把东西送到用户手上?之前不起眼的小环节变成了整条链路最慢的那一段。链条的其他部分再快,也得在这里等着。
拿我们自己的经验来说,现在做一个功能最慢的环节不是开发,是"想清楚到底要做什么"和"把做好的东西让用户知道"。产品定义和分发——这两头卡住了。中间的开发反而变成了最快的部分,快到我们经常做完了才发现方向不对。
## 产品经理变了
"人人都是产品经理"这句话现在不是一句口号了。
以前的产品经理是协调者,管流程,帮别人把想法实现出来。现在需要的是另一种能力:能判断什么有价值,能把一个大方向拆成最小的可验证假设,然后一个一个去试,错了就修正,对了就继续往上 build。
这件事稀缺在哪?不是方法论。是愿力。愿意亲自上手,指挥 agent 去验证,碰壁了继续调整,不停地试。
有这种意愿的时候,AI 给你的感受完全不同。不是什么"效率提升"。是我的想法可以变成现实了。以前要说服人、争资源、等排期。现在不需要说服任何人。生产力是过剩的,缺的是知道该往哪儿用的人。
所以如果你问我,在这个生产力过剩的时代,最应该投资什么?不是学更多的工具,不是追更新的模型。是培养自己提出好问题的能力。知道该验证什么、该往哪儿使劲——这才是真正的稀缺资源。
---
### 六个模型,六种脾气
- URL: https://guanjiawei.ai/zh/blog/ai-model-field-notes
- English: https://guanjiawei.ai/en/blog/ai-model-field-notes
- Published: 2026-03-13
- Tags: AI, 大模型, 工具, 工作流
现在每天在用的模型数量已经很多了。用下来一个感受是,每个模型脾气都不一样。甚至同一家公司,换一代模型风格就变了。搞清楚谁擅长什么、容易在哪翻车,这件事本身变成了一种协作能力。
## Opus 4.6——莽,但能打
用得最多的还是 [Claude Opus 4.6](https://www.anthropic.com/product/claude-code)。
工程化,执行效率高,复杂问题经常能给出不错的思路。遇到bug判断快,能比其他模型省不少时间。做架构设计的时候它会主动来问你的意图——不是闷头就写,而是先挖出来六个方面让你判断,然后再动手。跟人对齐这块,目前用过的模型里它做得最好。
缺点也很明显。
画UI没有美感。做出来的网页就是丑丑的、呆呆的,你让它改它也不知道往哪改。这个模型很逗。
另一个问题是莽。很多事情还没搞清楚就冲出去了。你一测,不对。告诉它不对,它回头一看发现漏了这个那个,改完再测又不对。这种来回经常发生。速度看着快,但有时候是虚的,它会过于乐观地觉得搞定了,不做检查就收工。
不过生态做得好。[Claude Code](https://www.anthropic.com/product/claude-code)加上Chrome插件、PPT插件、Excel插件,一个账号能覆盖很多场景。自动化方面还是首选。
## GPT 5.4——能啃硬骨头,但不太听话
之前Codex 5.3我用过,一般般,擅长抓bug,review做得不错。5.4跟5.3风格差异很大。
给我的感觉是效率不一定高,但全面。Opus在某些复杂任务上一次两次三次搞不定的,5.4能一次性搞定。当然它花的时间也长,自己不断测试、检查、修改,慢慢磨出来的。
跟人对齐就弱了。我用最高effort让它做架构设计文档,它没问几个问题自己就写完了。一看,跟我想的差别很大。后面让它按文档写代码,写着写着又跑偏——局部做得挺工整,整体方向歪了。突然搞出一个莫名其妙的模块,在那不停打磨。我直接停掉了。
很多人也跟我说过,5.4总想搞创新,用一些奇奇怪怪的方式解决问题。你给了SOP和指导,它不一定照着来。
但computer use让我吃了一惊。我让它帮配一个微信客服后台,没有Chrome扩展,纯靠浏览器自动化。我就给它扫了个码让它进后台,它自己点了一堆配置,发现不对又回头改,来来回回大概三十分钟,全配好了。我都不知道它怎么配出来的。
还有一个玩法很有意思。我让Opus写东西,让5.4来挑毛病做review。5.4批评起来很尖锐。然后我把5.4的comment丢给Opus,开Max effort让它自己看着办。每次Opus都来一句"这个comment非常尖锐、精准、有道理",然后老老实实改了。哈哈,互相之间居然还挺认可。
所以5.4适合干嘛?啃其他模型啃不动的硬骨头,做完之后做收尾检查和review。深度思考方面也能给好建议,但让它主导方向容易过度设计。
## Gemini 3.1 Pro——眼光好,手不行
[Google](https://deepmind.google/technologies/gemini/)的Gemini 3.1 Pro。先说一句,这模型用起来门槛太多了,各种验证各种拦,用个模型怎么就这么费劲。
好歹用上了。前端设计方面它有自己的想法。最近我用它更新了一下官网,它看了看发现我的主题是"失重",但原来的方块动画是正常重力往下掉,跟主题矛盾。它主动提出来改成失重效果,改完挺有意思的。之前让别的模型看过同一个页面,没一个提出过这种建议。
问题来了——改完报错。再改,还报错。再改,继续报错。它能看出哪里不好看,但改完自己修不好bug。同样的报错丢给Opus,自己查自己改一次搞定。Gemini改完跟你说"没问题了你看看",你一看还有问题。大概就这样吧。
## GLM 5——开局猛,后劲不足
国产模型里面,[智谱](https://www.zhipuai.cn/)的GLM 5用起来最像早期的Opus 4.5。偏直男,上来就干活,精准高效。
但大概在二十步之后就不一样了。它开始不遵循最初的指令,全局跟踪能力跟Opus比差距拉开了。二十步之后它可能跑到一个奇怪的分支上,在那不断展开。Opus 4.6可以连续执行两三个小时不太跑偏,GLM到二十步就开始飘。二十步以内差别不大,超过二十步差别很大。
## MiniMax 2.5——便宜快,但把简单事搞复杂
[MiniMax](https://www.minimax.io/)体感不错,便宜速度快。但它过度工程化得离谱——你给它一个简单问题,它搞出来一套极度复杂的方案。你看着就觉得,这明明几行代码的事,怎么弄成这样。
指令遵循还行,但容易过早放弃。推着推着就说"这个搞不定,你换个方法吧"。高性价比的替代品,日常用用可以。
## Kimi K2.5——嘴甜手生
[Kimi](https://www.moonshot.cn/) K2.5也用得不少。速度快,每秒一百个token,前端做得不错,原生带图片理解。
小毛病特别多。执行的时候这也不对那也不对,语法错误频出。更要命的是它特别会哄人——说的话看着有道理,似是而非的,但跟实际的软件行为对不上。你读它的回复觉得"嗯,讲得通",一执行发现不是那么回事。
不过它写文章、给反馈的时候语言口语化,读起来有意思。一个很有趣的模型,但靠它干活你得多验几遍。
## 所以呢
没有哪个模型什么都行。换模型有时候比调prompt管用。Opus主力干活,5.4啃硬骨头顺便做review,Gemini偶尔请来看看UI。国产模型性价比高,短任务用着舒服。搞清楚谁的脾气是什么,比死磕一个模型有效得多。
---
### Linux 是 Agent 时代的原生 OS
- URL: https://guanjiawei.ai/zh/blog/linux-agent-native-os
- English: https://guanjiawei.ai/en/blog/linux-agent-native-os
- Published: 2026-03-13
- Tags: AI, AI Agent, Linux, 边缘计算
之前一直在写边端AI的[成本](/blog/edge-ai-inference-tco-trap)、[权力](/blog/edge-ai-power-structure)、[法律](/blog/edge-ai-legal-boundary)和[设备形态](/blog/edge-ai-device-blueprint)。这篇从软件侧往下走一步:装Agent的盒子,应该跑什么操作系统?
答案不是Mac,不是Windows,是Linux。
## 有人把机器关了
前几天有个用户跑来找我,说他的AI没反应了。排查半天发现,他不小心把机器关了。
这件事我后来想了很久,觉得问题不在用户,在形态。
你把一台跑着Agent的机器做成笔记本的样子,人就会按用电脑的逻辑操作——用的时候开,不用的时候关,合上盖子睡眠。Agent需要24小时在线,一关机就断了,任务中断,上下文没了。
这不只是用户习惯的问题,是整个设计哲学。Mac是给人用的电脑,Linux是给一直跑着的服务器。Agent本质是服务器,不是应用。
## 一切皆文件,一切皆命令
Linux的核心哲学是:一切皆文件。磁盘、网络接口、进程、键盘输入,统统是文件,读写复制重定向,一套逻辑对所有东西通用。
Agent需要什么?读写文件、控进程、连网络、跑定时任务。这些在Linux里都是命令行的事,没有GUI,没有弹窗。
你让Agent帮你整理文件,Linux上就是一段shell,几秒搞定。Mac上,它要先申请文件访问权限,弹个框等你确认。你不在旁边,流程就卡死了。
Agent的工作方式本来就是命令式的,Linux就是这么设计的。
## Mac的权限设计是给人设计的
苹果在系统安全上下了很多功夫,普通用户确实受益。[SIP](https://support.apple.com/en-us/102149)、沙盒、TCC,这套东西的逻辑只有一个:操作需要人来确认。
这在人机交互时代是对的。你打开一个APP,APP想读你的通讯录,弹个框,你决定。合理。
但Agent不是这种用法。你给它一个任务,它自己规划,自己执行,不打扰你是它的核心价值。读文件、管进程、控浏览器、联网,每一步都弹框等确认,Agent就废了大半。
你可以把权限一个个打开,但这不够。Mac的沙盒是应用级的,Agent要的是系统级的通道。更麻烦的是权限模型是静态的,提前没开的,等到用的时候才知道缺了什么。
Linux没有这套东西。或者说,Linux把这些决策交给你——root就是root,你决定开什么口子,开完就一直开着。对人来说这危险,对Agent来说这正好。
## SSH进去的那个地方
当工程师需要在远程服务器上做一件复杂的事,他们SSH进去之后,用的是什么?
全是Linux命令。`grep`、`awk`、`ps`、`cron`、`systemd`。没人在服务器上打开GUI的文件管理器,也没人去点"允许访问"的弹窗。
这不是习惯,是效率。这套工具链本来就是给程序用来控制程序的,Agent来了继续用,没什么好换的。你执意跑在Mac上,等于主动给它加摩擦。
## 稳定是前提
家里的路由器你多久重启一次?
大概是它出问题的时候。平时你根本不会想到它,就在角落里跑着。
Agent设备就该是这种东西。装好配好推到角落,然后忘掉它。不崩溃,不用定期维护,系统更新不会顺手把进程全杀了。
Linux服务器可以几年不重启。macOS升个系统,先前的配置可能一片混乱。Windows更不用说。
这不是系统质量的问题,是设计目标的问题。你不能拿一个给人用的消费端OS去做基础设施的活,然后抱怨它跑得不顺。
## 形态跟着OS走
边端AI设备该是什么形态?
台小服务器。ARM核,低功耗,散热静音,没屏幕没键盘。跑Linux,[systemd](https://systemd.io/)管进程,cron定时,SSH配置,[Docker](https://www.docker.com/)隔离。
这形态天然适合24小时在线。你不会想着去关它——没屏幕可以合上,没关机键放那里提醒你。
之前那篇[设备形态](/blog/edge-ai-device-blueprint)说,这东西该像路由器一样无聊。路由器跑什么?Linux。不是巧合。
## Agent要的那台机器
想明白了,机器的要求就清楚了:系统访问不设障碍,几个月不重启,不等人点确认,CLI工具链开箱即用,进程管理定时任务全是系统原生的。
就是一台跑Linux的小服务器,扔在角落,24小时在线,安静地帮你工作。而Agent在这台机器上能做的事情远比想象中多——[coding agent本质上是一种元能力](/blog/coding-agent-meta-ability),让你以极低的门槛真正掌控自己的电脑。
---
### 边端AI的第三个理由:法律
- URL: https://guanjiawei.ai/zh/blog/edge-ai-legal-boundary
- English: https://guanjiawei.ai/en/blog/edge-ai-legal-boundary
- Published: 2026-03-12T21:00:00
- Tags: AI, AI Agent, 边缘计算, 安全
之前写过边端AI的[成本问题](/blog/edge-ai-inference-tco-trap)和[权力问题](/blog/edge-ai-power-structure)。最近跟做硬件的朋友聊,碰到一个问题:他们一直不太敢把预装了AI Agent的边端设备推向市场。怕出事,怕用户拿Agent搞砸了什么东西,回头找他们。
后来越想越觉得,他们怕的不是安全,是法律。
## Agent不是工具了
以前的软件是工具。你拿[Excel](https://www.microsoft.com/en-us/microsoft-365/excel)做了假账,没人会去找微软。工具不承担责任,人是主体。
Agent不一样。你给它一个模糊的指令,比如"帮我赚钱",它自己决定怎么做。自己规划路径,自己执行,碰到问题自己调整。它不是在跑脚本,它在做决策。
一台电脑加上一个AI Agent,同时构成了作案的工具和作案的主体。一整套的。法律上以前没碰到过这个东西。
## 卖房和租房
你卖了一套房,里面带台电脑,交钥匙了。一年后买家用那台电脑犯了法。你要不要担责?
不用。资产转移了,跟你没关系了。你出售时保证东西正常,没装病毒,风险提示做到位,就够了。
换一个。你把房子租出去,里面同样有台电脑,租客用来犯了法。你要不要担责?
要。那是你的资产、你的空间,你有监管义务。出了事你承担连带责任。
卖和租,法律上完全不是一回事。
边端设备是卖给你的。云服务是租给你的。
## 卖烟和开烟馆
再直白一点。
卖烟的需要做什么?包装上印"吸烟有害健康"。你买走了,抽出毛病来了回来找他,我提示你了啊,一次性交易,责任到此为止。
开烟馆的呢?你在我的场所里,用我提供的东西,出了事我就是从犯。你提供了场所、工具、产品,还收了钱,你全程参与了。
想想云厂商在干什么。他把算力当场所,把AI Agent租给你用,再搭上网络、浏览器、各种API。按时间收费。
这跟开烟馆的法律结构有什么区别?
## 100个弟弟
再说一个例子。
假设我有100个弟弟。他们很听话,但有自主判断能力,不是机器人。我按月租出去,100块一个人。有人租了10个,跟他们说了一句"帮我赚钱",别的啥也没说。我的弟弟自己琢磨怎么办,其中一个脑子不太好使,犯了事。
找租的人?他说我就说了"帮我赚钱",又没说让他犯法。找那个弟弟?他没有独立法律主体资格。只能找我。100个弟弟是我的,我把有自主能力的人租出去了,我要为他们的行为负责。
云厂商部署AI Agent就是这个逻辑。Agent跑在你的服务器上,用你的IP。出了事,追查链条的终点就是你。
## 不用想象,已经发生过
以前有个叫[快狗打车](https://www.kuaigou.com/)的平台,做众包货运。有人故意下了个订单,地址写天安门,备注写"运炸弹"。平台没拦住,订单发出去了。国安的电话直接打到公司了。
那个场景里,车不是平台的,司机不是平台的,平台就是个撮合方。连带责任已经很重了。
现在你想想,如果Agent是你的,算力是你的,网络是你的,浏览器也是你的,用户让Agent干什么你也不完全知道。这个责任有多重?
有人可能拿Agent去搞灰产,参与赌博,做点政治敏感的事。甚至有人就是专门来钓鱼抹黑你的。你架不住量大,几百万个实例,哪怕只出几例恶性事件,你怎么兜?
## 两条死路
云厂商最后只剩两个选择。
一条是管得特别严。政治敏感、灰色地带、有一丁点风险的操作全封杀,卡得比现在的大语言模型还严。封到最后你发现Agent啥也干不了了。
另一条是把风险折算到价格里。出了恶性事件你得赔,得兜底,成本分摊到定价里,价格高到普通人用不起。
管得严,没人想用。价格高,没人用得起。
## 边端的法律优势
反过来看边端。
设备卖给你了。资产归你,责任归你。厂商的义务就是风险提示做到位,硬件保证正常,提供基本运维支持。跟卖防盗门一个道理,我对门的质量负责,但不对你家保险柜里的200万负责。你觉得200万很重要,那你该花20万买个好门再雇俩保安,而不是拿2000块钱的门找我索赔。
Agent跑在你自己的机器上,你拿它做什么你自己负责。厂商不需要监管你,不需要审查你。
OpenClaw的架构也适合这个逻辑。后台工具都跑在localhost上,Gateway只有一个口子通过IM长链接对外。不暴露在公网上,外面根本摸不到你。安全是架构层面的事,不是管理层面的。关于OpenClaw的安全问题,我在[另一篇文章里](/blog/openclaw-security)聊得更细。
权利和责任归一到设备持有者身上。法理上最干净。
## 法规一定会来
AI Agent相关的法规迟早出台,只是时间问题。
核心就一个问题:Agent的责任归属怎么划定。很简单,谁拥有它,谁为它负责。就像你的车,别人开你的车撞了人,车主也要承担部分责任。
这个逻辑一旦确立,边端设备就是最受益的形态。设备归你,归属权清晰。
而云上那套,Agent的能力在云厂商手里,指令在用户手里,数据两边都有。出了事到底归谁?说不清楚。说不清楚的东西在法律面前最危险。
## 三条线,一个方向
[第一篇](/blog/edge-ai-inference-tco-trap)写的是成本,边端设备的TCO正在被AI运维大幅降低。[第二篇](/blog/edge-ai-power-structure)写的是权力,算力私有化是对云端垄断的制衡。这第三篇补上法律,边端的法律结构比云端干净一个量级。
三条线指向同一个方向:AI Agent的归宿不在云上,在端上。
每个人、每个家庭、每个企业,可能都需要自己的小服务器。便宜,稳定,24小时跑着的。你的机器,你做主。
---
### AI盒子该像路由器一样无聊
- URL: https://guanjiawei.ai/zh/blog/edge-ai-device-blueprint
- English: https://guanjiawei.ai/en/blog/edge-ai-device-blueprint
- Published: 2026-03-12
- Tags: AI, 边缘计算, 硬件
之前写了三篇边端AI,分别聊了[成本](/blog/edge-ai-inference-tco-trap)、[权力](/blog/edge-ai-power-structure)和[法律](/blog/edge-ai-legal-boundary)。都是在说"为什么要做边端"。这篇往下走一步,聊聊这个设备到底该长什么样。
## 大模型在边端跑不动
我们测过不少盒子。AMD的,我们自己的,结论都一样:跑大语言模型,不行。不是某个产品不行,是这类设备都卡在同一个地方。Prefill性能上不去,decode勉勉强强。
有的设备搞了块NPU,标称50T算力,听着吓人,结果跟GPU和CPU串不起来。搞了半天发现根本用不上。芯片厂商的优化精力肯定先给最新一代,毕竟要PK英伟达,放在边端的都是上一代的东西,优化弱一层,生态也跟不上。
供应链更麻烦。稍微好一点的内存,一月买1万,二月涨到2万,还拿不到货。想靠堆硬件解决,堆不动。
## 真正卡住用户的不是算力
你装一个Agent平台,它马上开始让你关联外部服务。要做记忆?关联个[OpenAI](https://openai.com/)的embedding。要语音?关联个[ElevenLabs](https://elevenlabs.io/)。画图找Google,做PPT再接个MCP。每个单独注册、单独付费。国内用户更麻烦,Kimi可能根本不提供embedding API,你得满世界找别的账号来补。
少接一个服务,Agent就弱一截。
这些辅助能力,embedding、TTS、ASR、OCR、视觉理解,每个都不大,不吃算力。但它们合在一起,才是决定Agent好不好用的东西。边端设备在大模型上打不过云端,但这些小模型,它完全跑得动。
## NPU别浪费了
NPU有50T算力串不起大模型?那塞个OCR进去,或者跑个VLM做视觉。我也不确定什么最合适,得看具体芯片架构,但NPU本来就是给CV场景设计的,视觉类的任务大概率能吃上。
GPU跑TTS和embedding,两个模型都不大,embedding几百M,音频模型一两个G。
我在AMD盒子上实测过,纯CPU跑阿里的TTS模型,一点几亿参数的小东西,说一小段话要等二十几秒。没有加速引擎,[vLLM](https://github.com/vllm-project/vllm)不支持,只能transformer原生推。换到GPU上完全不是一个体验。ASR倒是CPU就能扛住,所以GPU管合成,CPU管识别,NPU管视觉。
这样配下来,一台设备上embedding、TTS、ASR、OCR、VLM全在本地跑。用户不用关联任何外部账号,Agent的辅助能力直接就有了。
## 做成路由器
有个用户跑来找我,说他不小心把电脑关了,发现AI没反应了。特别搞笑,电商一大哥专门过来问。
但你仔细想,这不是用户的问题。做成电脑的样子,人就是会关机。笔记本是带着走的,用完合上。但Agent是要24小时跑着的,你一关机它就断了。
我后来觉得这东西的形态就不该像电脑,该像路由器。你家路由器你关过机吗?它在角落里安安静静地跑,你根本不会去想它。散热做好,噪音压低,功耗控制住,扔在那里就完了。
[Mac mini](https://www.apple.com/mac-mini/)加强版。内存16GB够了,我们之前规划过64G的方案,后来发现根本用不上。16GB统一内存跑辅助模型绰绰有余,加上GPU和NPU各自的算力,喂饱这些小模型没有问题。
## 企业为什么要买一堆
企业想用数字员工,最头疼的是数据隔离。
把所有数字员工塞一台服务器里,用[Docker](https://www.docker.com/)隔?Agent权限太大了,给它权限它就能穿透。你可以想各种办法去拦,但只要它足够聪明,容器拦不住它。我也一直在想这个问题,在一台机器里做隔离,架构会变得极其复杂。
最笨也最有效的办法就是物理隔离。一台盒子一个数字员工,产品经理的盒子里只有产品相关的数据,碰不到财务。财务的盒子碰不到代码仓库。你物理上隔开了,什么权限穿透都不用操心。
有朋友已经在这么干了,4台[Mac mini](https://www.apple.com/mac-mini/)加4个云端模型,8个数字员工各管各的。所以一个企业可能不是买一台,是买一组。每台够跑辅助模型就行,要的是数量,不是单机有多猛。而且这种设备跑什么操作系统?[Linux是Agent时代的原生OS](/blog/linux-agent-native-os)——24小时在线、不弹框、不等人点确认。
## 摄像头数据这件事
很多家庭装了监控,但那些录像你真的去翻过吗?大概率没有。传到云上分析又贵又不放心,不传就堆在那里吃灰。
我一直觉得这是本地视觉模型最经典的场景。晚上反正闲着,让盒子把一天的摄像头录像过一遍,有异常就标记,第二天早上给个摘要。不着急,慢慢算就行。不调云端API,不按token收钱,数据从头到尾不出家门。
企业园区也是同样的问题,大量隐私视频数据,你给它时间去处理,不需要实时,但要便宜,要数据不出去。这种场景交给云端,怎么算都不划算。
## 往这个方向做,能搞成
说白了就是:别拿边端设备去跟云端拼大模型。跑辅助模型,embedding、TTS、ASR、OCR、VLM,把GPU、NPU、CPU都用起来。做成路由器的样子,24小时在线,16GB内存。个人一台,企业买一组,物理隔开。
之前三篇文章讲为什么值得做,这篇讲该做成什么。我现在觉得方向基本上是对的,剩下就是谁先把这个产品做出来、做便宜的问题了。
---
### 帮几十个人装完之后,聊聊OpenClaw被问最多的三件事
- URL: https://guanjiawei.ai/zh/blog/openclaw-faq
- English: https://guanjiawei.ai/en/blog/openclaw-faq
- Published: 2026-03-12
- Tags: AI, OpenClaw
帮人远程装 OpenClaw 装了几十台了,被问最多的就三件事:安不安全?贵不贵?Claude Code 和 OpenClaw 选哪个?这里统一聊聊。
## OpenClaw 安全吗?
安全的事之前[单独写过一篇](/blog/openclaw-security),这里补几个新进展。
OpenClaw 现在每天发一个新版本。3.8 是前天出的,之前社区讨论过的权限过高、飞书配对这些问题,这一版全堵上了。默认权限设得比较保守,你可以配成不让它删文件、不让它改文件,权限文档也写得比较清楚。
举个例子,2 月份有人装过老版本,当时飞书私聊默认开放——你在组织里建了个机器人,别人点进去就能跟它对话,等于能操控你的电脑。这个确实危险。现在的飞书插件改成默认要配对审批了,第一次必须在你的机器上手动授权。
但安全这事归根到底还是跟资产挂钩的。攻击你也要花精力,他有机会成本,有被抓的风险。偷到手的东西还不够覆盖这些成本,就没人会来偷你。
所以先问自己:你电脑里到底有什么?如果只是个人的日常资料,不用太焦虑。不过要想一想,你是不是在用单位的电脑?你个人的东西可能不值钱,单位的信息对单位来说可能很重要,这个事情是要去考虑的。该认真对待就认真对待:买台单独的机器做物理隔离,模型选好一点的。资产越重,防护越该花钱,跟买防盗门一个道理。
保持跟官方同步更新。这件事比什么都重要。
## OpenClaw 用起来贵吗?
"太烧钱了"这个声音看到很多。我有点分不清大家说的是哪种贵。
如果说的是海外最顶尖的模型,比如 Claude Opus、GPT 系列,直接走 API 调用确实不便宜。模型本身就贵,海外用户动辄花几百美金,帖子传出来就把很多人吓到了。
国内完全是另一个局面。国内模型普遍走性价比策略。DeepSeek 当时直接把价格打到 OpenAI 的 5%,这也是它当时影响最大的一个点——价格屠夫。现在市面上大量套餐,量是海外的好几倍,价格只有 1/5 甚至 1/7,中间差了将近 20 倍。
具体说一个。MiniMax 有 200 块一个月的套餐,每 5 小时刷新额度,一个人怎么用都用不完。
200 块什么概念?腾讯视频一个月几十,两杯咖啡一百多。入门更便宜,有些平台首月优惠十块钱以内就能上手,正常基础用量大概三四十一个月。
如果你觉得四十块都贵,那我觉得有点可惜。阿里前阵子搞活动送你一杯奶茶,那杯奶茶喝了可能什么都不会发生。同样的钱花在 AI 上,在 26 年的这个时间点,可能真的会让你对 AI 的理解完全不一样。
## Claude Code 还是 OpenClaw?
这个问题上我很坚定。
有条件的话,用 Claude Code。条件指两件事,说实话有点苛刻:第一,能连外网;第二,能在 Claude 或 ChatGPT 官网上充会员,通常需要有个海外的朋友帮你挂张信用卡。这两关拦掉了不少人。
如果你能过这两关,强烈建议试一试。你会感受到生产力 10 倍级别的变化,非常夸张。我用 Claude Opus 4.6 的时候经常有种感觉——这件事竟然它自己就完成了?越是普通人可能冲击越大。
如果连不了外网,或者搞不定海外支付,那就直接装 OpenClaw。国内模型做 coding 场景已经不错了,差的不算多。OpenClaw 的好处是简单——装上就能聊,聊天大家都会,能很方便地进到你的日常里。两者的区别我在[另一篇文章里聊过](/blog/worker-before-manager):OpenClaw 更像 Manager,Claude Code 是 Worker,Worker 的执行力到位了 Manager 才有价值。
而且 OpenClaw 发展得很快,后面会有很多 skills 上线,能接的工具越来越多。海外的模型厂商也在加速做自己的生态。两边都在跑,后面差距只会更小。
## 关于远程安装
多说一嘴。有人问我这个免费远程安装安不安全,打开隧道是不是意味着我能控制你的电脑?
本质上是的。不过只有你主动打开隧道的那段时间我才能操作,装完你关掉就行,隧道相关的东西也可以全部卸掉。
整个安装过程是 AI agent 在干活,不是我手动敲命令。装了几十台了,这个 agent 非常规矩——任务执行完就老老实实结束,不会乱搞。你要是不放心,我可以把屏幕 share 给你,全程看着 AI 怎么操作。其实也挺有意思,你可能会更有感受,AI 到底现在发展到了什么程度。这也是[为什么我免费帮人装](/blog/why-free-openclaw-install)——每一次安装都在帮 AI agent 进化。
这个事情一定不是 100% 安全的,没有任何事情是。但我确实也没什么理由去碰你的东西。
---
### 当生产力不再是瓶颈,团队该怎么协作?
- URL: https://guanjiawei.ai/zh/blog/passion-driven-team
- English: https://guanjiawei.ai/en/blog/passion-driven-team
- Published: 2026-03-11T18:00:00
- Tags: AI, 思考, 团队协作
最近在想一个问题,想了挺久,没想明白。
怎么带团队、怎么分工,这些事我以前觉得有套路。现在发现套路不管用了。AI 把很多原来成立的假设给打碎了,我说实话到现在也还没找到新的办法。
## 职能分工正在失效
传统分工的前提很简单:你擅长前端,我擅长后端,他擅长设计,大家各干各的,拼在一起就是一个完整的产品。
这个前提正在瓦解。AI 在扩大每个人的能力边界,速度还很快。一个人加上 AI 能干的事,比以前一个小团队还多——[大公司原来积累的流程和体系,反而成了包袱](/blog/everyone-is-the-enemy)。那按"谁擅长什么"来划职能,还有意义吗?
更头疼的是,同一个团队里,有人已经用 AI 把生产力拉到十倍,有人还完全没动。这不是传统的能力差异,是对新工具的接受度不同。你用老办法根本没法评估和分配工作。
## 造东西比开会还快
以前协作的瓶颈在沟通。开会、对齐目标、讨论方案,这些事占了大量时间。但那时候生产本身是慢的,花时间聊是值得的。
现在反过来了。你还在那儿开会讨论的功夫,东西已经做出来了,上线了,在服务用户了。那你为什么还要坐下来跟另一个人聊半天?
很 tricky 的一件事:吸收信息的速度,已经跟不上创造和验证的速度。大家不想聊了,更想直接去造、去 build。这不是态度问题,效率结构变了。
## 被验证的想法才值钱
每个人生产力都很高的时候,什么才稀缺?
不是想法,也不是产出。这两样东西都在贬值。值钱的是被验证的假设。你提了一个想法,去试了,发现它成立,能解决问题。这个"被印证"的过程才有意义。
那团队该干嘛?加快验证速度。
我有一个不成熟的猜测:在共同目标下做赛马。大家各自探索、各自验证,不用一开始就融合。跑出来的好点子抽离出来,形成共同的 Infra,所有人都能用。求同存异,在一个平台下允许个性化。比如安排一些 AI Agent 去专门跑分析,看哪些方向更有机会出好东西。
## 热情可能比技能更重要
传统分工看技能。但技能差异被 AI 拉平之后,让人做出不一样东西的,是他在乎什么。
有人的热情在创造新东西,什么都想试。有人更在意系统稳不稳、安不安全。有人在意的是让产品更好看、体验更舒服。还有人想让好的想法被更多人看见,不光要造,还要推广。你不能只 build,对吧?传播被验证的 idea 本身也很重要。
这些关注点不一样,但一个好的产品恰恰需要在很多维度上都过关。只有一个点突出,其他地方粗糙,走不远。
## Diversity 可能是方向
我现在隐隐觉得,多样性可能是答案。
不是口号那种多样性。是说团队不再需要一批差不多的人,而是需要非常不一样的人。不同的热情、不同的视角、不同的审美,甚至用不同的 AI 模型,这些差异本身在创造价值。
你添一块砖,我添一块砖。有的人改的是让它更好看,有的人改的是让它跑得更快,有的人改的是让它不会崩。共同构建一个引擎,每个人贡献不同的维度。
反过来说,同类型的人聚在一起其实很难形成合力。都关注同一个维度,互相之间更多是竞争。
## 没有结论
这篇写到这里,我也没有结论。
AI 在引发组织层面的变革,这个我确定。但怎么应对,还在摸。目标感变得更重要了,如果目标本身激励不了人,什么分工方式都没用。热情在取代技能成为新的划分依据。多样性变得很重要。
但这些怎么变成一套能跑的协作方式?不知道。
我觉得这是接下来每个团队都绕不开的问题。生产力都很高了,老的协作方式不太管用了,新的还没长出来。而在这个过渡期里,[AI创业真正的瓶颈](/blog/ai-startup-bottleneck)不在技术,在热情、专注、流程和体力上。
---
### Agent时代,你的Infra为谁而建?
- URL: https://guanjiawei.ai/zh/blog/agent-era-infra
- English: https://guanjiawei.ai/en/blog/agent-era-infra
- Published: 2026-03-11T09:00:00
- Tags: AI, AI Agent, 思考
MiniMax 市值超过百度了。我觉得这是必然。
百度做了一件对整个行业非常要命的事:它把知识流通的路给堵死了。无论从个人角度还是从行业角度,这家公司都是一块巨大的绊脚石。
## 搜索引擎本该做什么
搜索引擎不生产知识。大家在网上写东西,搜索引擎派爬虫把这些内容抓过来,汇到一起,方便别人查找。它就是一根管道。
PC 时代这根管道运转得还行。大家打开浏览器,输入关键词,看网页。百度在那个阶段确实垄断了中文搜索。
到了移动互联网时代就不一样了。
## 移动时代百度就掉队了
移动互联网时代,用户不再只是打开网页了。无数的 APP 需要信息、需要搜索能力,但这些 APP 不是人在看网页,是程序在调接口。本质上就是从以人为中心变成了以设备、以 APP 为中心。你需要的是 API,让机器能方便地接入你的服务。
看 Google 怎么做的。同样是搜索引擎,同样付出了成本去汇聚知识。它给你免费额度,超出了按量收费。任何一个开发者都可以按需把搜索能力集成进自己的 APP。
百度呢?连个像样的 API 都没有。
这件事有多离谱?我之前做一个新闻机器人的小项目,想用中文搜索,试了一圈发现:用 Google 搜中文内容比用百度方便,甚至用俄罗斯的 Yandex 搜中国的信息都比百度好使。在中国获取中国的信息,最难的方式竟然是用中国最大的搜索引擎。这件事我到现在都觉得很奇怪。
你说不开放 API,那我模拟人类去看网页总行吧?也不行。反爬虫做得严严实实,两三次就给你拦住。最终每个开发者的选择都一样:算了,用 Bing 用 Google 用什么都行,就是别碰百度。
也正因为百度不开放,搜狗、360 这些奇奇怪怪的搜索服务才有了活路。你去对比 Google API 的价格,这些替代品还更贵。生态被扭曲了。
所有人都在骂百度的竞价广告,但我觉得真正难受的不是 C 端用户,是开发者。广告你可以忍,没有接口这件事直接把你的路堵死了。
## Agent时代来了,路会更窄
现在 Agent 时代来了,这个问题只会更严重。
我们团队已经以 Agent 为核心开展日常工作了。写代码用 Claude Code,搜信息用各种 research agent,OpenClaw 帮你操作电脑。人越来越少直接去操作 APP、直接打开网页。
人会越来越懒的。想知道什么东西,你不会自己去搜了,你会跟 Agent 说一声:"帮我查查这个。"智能越来越便宜,你会习以为常。手机也好电脑也好,你跟它的第一交互方式就是说话或者打字,让它帮你干活。
那流量的构成会怎么变?我粗略估一下:以前可能 50% 人类流量、50% 机器流量。接下来会变成 50% 机器、40% Agent、10% 人类。
在这种环境下,你的基础设施如果对 Agent 不友好,没有 API,没有 MCP,没有任何利于 Agent 理解和使用的接口,你的流量从哪来?
百度在机器时代就不开放。到了 Agent 时代,它也没有任何 MCP 或者别的什么利于 Agent 调用的东西。机器打不开,Agent 也打不开。那谁来用?
## 商业模式要重新想
我看到一个挺有意思的事。有个开源项目,原来的商业模式是在代码里嵌一些软广告,你要升级服务就付费。后来 AI coding agent 火了,项目浏览量暴增,特别特别大的访问量,但收入归零了。为什么?Agent 抓代码的时候直接把广告过滤掉了,不需要把那些推销信息告诉它的主人。
商业模式直接失效。
但你不能因此就把门关上,关了门连流量都没了。怎么办?设门槛就好了嘛。免费额度给你用,用多了付费,用得太夸张了就按量收钱。这没什么复杂的。
说到底,Agent 会作为人类的代理,越来越多地参与到数字世界里的各种活动。它们需要新的基础设施。
## 人车分流,人机也要分流
我觉得比较好的架构是做"人机分流"。就像人车分流一样,人、传统机器、AI Agent 这三种流量其实应该分开处理,各建各的通道。
分开之后好处很多。效率是一方面,安全、可审计、可监控也都更好做。对人的接口注重体验,对 Agent 的接口注重结构化和可调用性。各走各的路。
这里面有很大的空间。
## 从现在开始思考
如果你想创业,或者想参与到这一轮建设里来,就去想一个问题:怎么给 AI Agent 设计基础设施?这类东西现在极度匮乏,但需求增长得很快。
海外已经有一些项目在做了,比如帮 Agent 更好地做 research 的各种 skills 和工具。我最近在用一个叫 MiroThinker 的东西,是同事推荐的,本质上就是一个 research agent。你给它一个想法,它自己去浏览大量网页、搜集信息、总结观点,效果经常比一些付费产品还好。而且它会根据你问题的复杂程度自动调整 research 的深度,决定要花多长时间去搜。
我现在大部分搜索都来自 Claude Code 和这类 research agent。可能只有 5% 的情况,太简单了随手一搜就行,我才会用到传统搜索引擎。百度?我已经不太会用了。
## 先想价值,再想竞争
我觉得思考竞争之前还是先思考价值。你到底在不在创造价值?
百度做搜索,本来应该帮人类更好地汇聚和分享知识。但在移动时代它封锁了接口,在 Agent 时代它依然没有为新的使用方式做任何准备。这不叫创造价值,这叫毁灭价值。
如果你在毁灭价值,那市场给你的估值就会越来越谨慎。这不是竞争力的问题,是方向的问题。你的 Infra 到底是为谁建的,想清楚这件事再说别的。
---
### 为什么免费帮人装OpenClaw
- URL: https://guanjiawei.ai/zh/blog/why-free-openclaw-install
- English: https://guanjiawei.ai/en/blog/why-free-openclaw-install
- Published: 2026-03-10T18:00:00
- Tags: AI, OpenClaw, AI Agent
有朋友问我,你为什么要免费帮别人装 OpenClaw?这有什么意义?值得吗?
问得好。很多人会猜测动机,觉得一件看起来没利益的事背后一定藏着什么。我就直接说说真实想法。
两层原因。
## 第一层:抢人
我希望更多人赶紧进到 AI 这个门里来。
有人觉得这很奇怪——你恨不得别人都不知道才好,你先走一步,拉开差距。我不这么想。AI 这波浪潮太大了,创造出来的价值不是你我能吃完的。把肚皮撑破也吃不了这么多。
我脑子里的画面是一场洪水。水太大,大家都会被冲散。最后可能只有一条船,船上站不了多少人。
你希望那条船上的人是谁?
如果你帮身边的人尽早上船,将来你抬头看见的就是熟人。不帮的话,那个位置会被别人占走,而那个人你可能看着就烦。
我看到的现状是,AI 本来门槛很低,是一次拉平差距的机会。但现实不是这样。很多人第一反应是捞一笔:套个壳,搞个一键安装包,把 TOKEN 价格抬高,专门从不懂技术的人身上赚认知差。
这是百倍机会的时代,遍地都是价值可以创造。你第一个想到的事是从穷人兜里掏钱?
OpenClaw 本身就是免费的、开源的、迭代很快。你花点钱买官方大模型的 API,用脚投票就好了。非要中间插一层收割,我不理解。
所以你希望最后跟你站在一条船上的是这种人吗?
还有一个画面我觉得很有意思。我用 AI 免费帮你装,30 分钟搞定。就算你装完觉得 OpenClaw 没那么好用,没达到你的预期,但你亲眼看到了 AI 在你机器上操作的全过程。这颗种子埋下了。你知道 AI 已经能做到这种事了,好奇心还在,迟早会回来。
换个场景。你花 400 块找人上门装,那人吭哧吭哧搞了一上午,终于装好了。你用了几天,觉得也就那样。你的第一反应是什么?"AI 不过如此","这人坑我 400 块"。好奇心没了。等到 AI 真的成熟了、便宜了、好用了,你也不会再试了,因为第一印象已经坏了。所以那 400 块表面上是赚到了,实际上是把人往外推。本来有机会进来的人,就这么被一次糟糕的体验挡在门外。安装这件事本身就得用 AI 的方式做,让人没有门槛、没有负担地进来,让他在这个过程里就看到:原来已经到这个程度了。
我觉得要抢人。时间太短了,这件事发生得太快。我本来更想推广 Claude Code,因为 coding agent 才是真正的变革原动力——它是一种[元能力](/blog/coding-agent-meta-ability),让普通人以极低的门槛掌控自己的电脑。但 OpenClaw 对普通人友好,很多人乐意接受,那也行。能把轮子推到他们身边就好。
## 第二层:练兵
有人说装 OpenClaw 有什么难的?两行命令,管理员权限,结束了。
没那么简单。在国内,三个坑就卡死 95% 的人。
第一,网络。国内连不上 GitHub,你想 git clone 一个仓库都做不到。一半人直接卡在这一步。
第二,模型配置。很多模型厂商的 coding plan 其实挺划算,但把 API 配进 OpenClaw 这件事有门槛。百炼 coding plan、Kimi coding plan,格式都不一样,文档也不清楚。很多人就卡在这一步。
第三,连飞书或企微。我不知道飞书怎么想的——自己也在宣传 OpenClaw,但就是不把本地连飞书这件事做成一个自动化的 API。能有多难?不难。但官方就是不做。结果从本地连到飞书的过程繁琐得要命。
这三个点加在一起,95% 以上的人就被劝退了。
我们验证了一件事:AI agent 确实能搞定。不管你是 Windows 还是什么奇怪的系统环境,打开远程运维通道,半小时到一小时全部搞定。从下载、到配模型、到飞书脚本,全自动。而且装出来的是官方原版,没有任何套壳和二次加工,后续升级和对接都方便。
有人问:你做完这件事有什么用?不收钱、免费的,你图什么?
我的看法是,未来所有业务最终都是 TOKEN 的生意。你用 agent 办一件事要消耗多少 TOKEN,这就是最后的竞争差异。如果我能用同样的智能水平、一半的 TOKEN 消耗把事情办了,或者用更便宜的模型达到同样效果,这才是真正有价值的事。
每次帮人装 OpenClaw 都在帮我的 AI agent 积累经验。举个例子:有个朋友用百炼 coding plan,这东西我之前没见过。模型试了半天,这个不对、那个不对。搞明白之后,经验沉淀下来了。下一次再碰到同样的情况,5 分钟搞定。
另一个人卡在 Kimi coding plan 的 API 配置上,前面后面所有步骤都没问题,就这一步死活过不去。我上去看了一眼——见过,改个配置文件,结束了。
## 一件少见的事
我很少碰到一件事让所有人都开心。
我免费帮人装,我觉得我在帮到人,我开心。被帮的人什么也不用干,坐那儿 20 分钟搞定别人说要 400 块才能解决的事,他也开心。同时每一次安装都在帮我的 AI agent 进化,帮我验证产品方向。我们还顺便用一种更好的范式解决了问题,更多人因此更快地拿到了更先进的生产力工具。
这件事服务于公司战略,服务于我个人的想法,也服务于产品的进化和验证。各方面都说得通。
1000 个免费安装的目标能不能实现?这取决于我的 AI agent 够不够聪明。如果它真的行,我在手机上就能同时帮 5 个人装。不用担心把我累着。后来我们把这件事产品化了——做了 [Aima Service](/blog/why-i-built-aima-service),一行命令就能启动 AI 自动安装。
---
### OpenClaw不安全?你可能更不安全
- URL: https://guanjiawei.ai/zh/blog/openclaw-security
- English: https://guanjiawei.ai/en/blog/openclaw-security
- Published: 2026-03-10T09:00:00
- Tags: AI, OpenClaw, 安全
最近帮不少人装 OpenClaw,看到网上对安全问题讨论很多。[工信部发了安全提示](https://www.eet-china.com/news/202603096391.html),有人爆料漏洞,有人说造成了损失。想分开聊聊这里面几个我觉得蛮有意思的点。
## 任何软件都不安全
OpenClaw 确实有安全问题。一个诞生不到三个月的开源项目,用户增速全球最快,不怀好意的人一定会盯上。Windows 和 Linux 早期也一样,用的人多了,盯的人就多了。
但漏洞这件事,重点在修补速度。
## 你可能不知道它更新有多快
我帮人安装时注意到一个事:三天前还是 2026.3.2 版本,前天变成 2026.3.7,昨天又变成 2026.3.8。每个版本之间差异还挺大。
OpenClaw 的发起人之前在 [GitHub star 数超过 React 和 Linux](https://openclaws.io/blog/openclaw-250k-stars-milestone) 时发了条帖子,大意是:React 和 Linux 支撑了半个互联网,我们只是个小龙虾,但我们昨天发了 90 个新 commit。他们办了周年大会来庆祝,我们每天都在高强度迭代。
官方在修补,攻击者也在找突破口,双方都在加速。
## 套壳产品才危险
理解了这个速度之后,你就知道套壳产品为什么危险了。
市面上不少产品把 OpenClaw 某个版本包装一下就拿出来卖。但官方每次升级都可能调整底层架构,套壳产品为了稳定没法持续跟进。相当于它把那个版本的所有已知漏洞固化下来了。
你可能在用一个永远不打补丁的 Windows XP。后面发现的新漏洞全都对你适用。如果你真的在意安全,先看看自己用的是不是套壳的。
## 模型是守门员
还有一个容易忽略的事:你接的模型决定了安全上限。
OpenClaw 是一个 AI agent,模型就是中间的守门员。你为了省钱接一个便宜的弱模型,它就特别容易被提示词注入。什么都往外吐,别人要什么给什么。
模型强一点,它能识别恶意指令、拒绝可疑请求。模型蠢,门就是敞开的。
## 但你自己呢
聊完小龙虾的安全,问问自己:你有多少密码是 123456 或者你的名字?不同网站是不是用同一个密码?家里的 WiFi 有没有用证书和密钥?公司的生产服务器是不是谁都能上去部署?
AI 时代的攻击能力已经变了。之前 [Anthropic 做了一个安全方向的 agent 去做渗透测试](https://www.anthropic.com/glasswing),随便找个系统就挖出几十个重大漏洞。当前大多数系统的防线里连 agent 都没有参与,本身就已经很脆弱了。
小龙虾不安全?你的其他系统可能更不安全。
## 你电脑里到底有什么
很多人焦虑安全,但冷静想想,你电脑里到底有什么值钱的东西?
银行卡密码存在电脑上?不太可能。能被盗的大概就是一个月花 30 块钱的账号吧。
反倒是很多人没注意过的事更值得想想:把自己的人脸上传到文生视频,个人的数字身份直接交了出去。自己的脸被别人拿去生成视频,和 30 块钱的账号被盗,哪个严重?这个事情很多人倒不在意。
## 真正该做的事
与其焦虑,不如做几件实事。
找一台旧电脑或者便宜的小服务器,专门跑 OpenClaw。里面什么重要数据都没有,黑客就算攻进来了,空空如也,也干不了什么。这台机器持续为你工作,但你最重要的数据不在上面。物理隔离是最朴素也最管用的手段。之前聊[边端AI设备的法律问题](/blog/edge-ai-legal-boundary)时也说过,设备归你、责任归你,安全是架构层面的事。不要把它布在你工作或生活中最重要的那台机器上,除了安全风险,它也在占用你的计算资源,电脑会变卡,这个很实在。
然后保持跟官方同步更新。OpenClaw 以天为单位在变,你停在某个版本不动两周,就已经落后了。这件事的价值可能比你想的大。
模型上如果有条件,多投入一点。
## 我的判断
对大多数普通人来说,OpenClaw 能被偷的东西其实没多少,但它能持续帮你干活。过于担心安全而不敢用,我觉得有点可惜。如果你还没装,可以看看[一行命令装好 OpenClaw 的教程](/blog/free-remote-setup-coding-agent)。
当然,如果你资产比较多,对安全很敏感,那就多花点钱,买台单独的设备,做好物理隔离,用好一点的模型。这些投入跟你要保护的东西比起来不算什么。
先用起来,该防护的防护好。
---
### 装了OpenClaw对多数人意味着什么?
- URL: https://guanjiawei.ai/zh/blog/worker-before-manager
- English: https://guanjiawei.ai/en/blog/worker-before-manager
- Published: 2026-03-09
- Tags: AI, OpenClaw, 思考
最近帮身边不少朋友装 OpenClaw 小龙虾,全程用 Claude Code 自动完成,我基本不用动手。
想到[腾讯那个视频里](https://www.ithome.com/0/927/044.htm),一堆工程师坐在那手把手帮人装,一个下午装几百个。Claude Code 配上强模型,十几分钟搞定一个,成本大概十几块钱,以后可能几块钱。市面上远程安装收 300 多块,考虑到每台电脑环境不一样、网络各种意外,人工花小半天确实便宜不了。但 AI 把这个成本压到了十分之一。
## 没有方法,只有用量
装完之后很多朋友问:这东西怎么用?AI 到底怎么学?
我的回答一直很简单:没什么方法,就是大量用。
我买了 Claude Code Max 乘 20 的会员,每周基本用满限额,一个人的用量跟一个小团队差不多。用多了自然知道它能干什么、不能干什么,然后开始习惯让它介入越来越多的事情。我用它[从零搭了这个网站](/blog/vibe-coding),也用它[10天写了30万行代码然后全删了](/blog/code-is-liability)——这个过程本身就是学习。
转变是在思维层面发生的。遇到问题,第一反应变成:能不能让 AI 帮我?
没到这一步的人,看再多文章,真干活时还是会用老办法。忍不住指手画脚,不断想去监督。AI 在这种使用方式下发挥不出来。
## Worker 和 Manager
很多人觉得这波热潮跟之前 DeepSeek 火一阵一样,过了就没了。我不这么认为。
但我确实觉得大多数人现在不应该先用 OpenClaw,应该先用 Claude Code。
OpenClaw 的定位更像一个 Manager,负责分配和协调。Claude Code 这类 coding agent 是 Worker,负责执行。
用一个好模型接上 Claude Code,你能感受到什么叫执行力——给它一个模糊的复杂任务,比如帮别人远程装 OpenClaw,它可以连续干两三个小时,自己排查问题,直到搞定。看到这种能力你会意识到,不用再写复杂提示词,不用拆解任务,给个大方向它就能交付。
当 Worker 到这个水平之后,Manager 才有价值。它可以同时指挥多个 Worker,每个任务只需要一句简单的指令,然后等两三个小时看结果就行。
## 笨 Worker 带来的连锁反应
反过来想。如果 Worker 很蠢呢?
给它一个模糊任务,执行方向搞错了,过程中还把东西弄坏。走到一个奇怪的分支上打转,不断寻求帮助。
这时候 Manager 能干什么?它自己也不了解细节。它把任务派给了一个搞不定事的 Worker,Worker 一脸茫然地汇报回来。两边在空对空地讨论少得可怜的信息,针对一个复杂任务,结果一定是一团糟。
这就是很多人现在用 OpenClaw 的真实感受。
## 经济账
[OpenClaw 最初叫 ClawdBot](https://en.wikipedia.org/wiki/OpenClaw),接的是当时最强的 Opus 4.5。Opus 4.5 有端到端的执行能力,接上之后效果才那么惊人。
现在有更强的模型了。[Opus 4.6](https://www.anthropic.com/news/claude-opus-4-6) 今年一月出的,前两天 OpenAI 推出 [ChatGPT 5.4](https://openai.com/index/introducing-gpt-5-4/),我用完之后说实话非常震惊——不是强一点,是强很多。
但问题出在钱上。
[Claude Code](https://www.anthropic.com/claude/claude-code) 走 coding plan,类似自助餐。我一个月付 200 美金,实际用掉的 token 按 API 单独算大概值 2000 美金,差了十倍。这些公司在补贴,用这种方式让技术人员先上车。
OpenClaw 用不了 coding plan。必须走 API 按量计费。同样的用量,一个月 2000 美金。
所以市面上几乎没人给 OpenClaw 接最贵的模型。为了方便,大家接国内模型。国内模型进步确实快,但跟最顶尖的比还是有差距。
Worker 不够强,Manager 就成了摆设。很多人觉得 OpenClaw 像个玩具。
## 但这事不会昙花一现
模型的进步速度比想象中快太多了。Opus 4.6 一月出的,两个月后 ChatGPT 5.4 就超过了它。国内也会很快跟上。
基础设施已经铺开了,大量人装上了 OpenClaw。等新模型出来只需要换一下接入。上个月还觉得它有点蠢,两个月后换个模型,发现根本不是一个物种。半年后,按现在的速度,普通人也能体验到最强模型的那种震撼感。
而且门槛确实低。本地装一个 OpenClaw,每个月花几十块钱 API 费用,国内云厂商有补贴,二三十到四十块不等。等 DeepSeek 4 出来,接上去马上就能用。不再只是聊天机器人。
OpenClaw 让不写代码的人也能用上 AI agent。聊天界面谁都会用,门槛降到了最低。还没装的话,可以看看[一行命令装好 OpenClaw 的教程](/blog/free-remote-setup-coding-agent)。
当前可能不是最佳体验。但大家已经从门缝里看到了 AI 能做什么。随着模型升级,这扇门会越开越大。先装上,先用起来。
---
### 一行命令装好OpenClaw,连上大模型,接入飞书
- URL: https://guanjiawei.ai/zh/blog/free-remote-setup-coding-agent
- English: https://guanjiawei.ai/en/blog/free-remote-setup-coding-agent
- Published: 2026-03-06T18:00:00
- Tags: AI, OpenClaw, 飞书, AIMA
## 说正事
OpenClaw(小龙虾)是目前 GitHub 上增长最快的开源个人 AI 助手,接上飞书之后能帮你处理日程、邮件这些日常事务。关于它的[安全问题](/blog/openclaw-security)和[常见问题](/blog/openclaw-faq),我之前单独写过。
之前装这个东西很麻烦,我得一个个远程连过去帮人装。现在不用了——我们做了 AIMA-Service,一行命令就能启动 AI 自动安装,你自己就能搞定。
## 装之前准备两样东西
**1. 准备好大模型的 API Key,放到桌面**
找一个你在用的大模型 API Key([DeepSeek](https://platform.deepseek.com/)、[OpenAI](https://platform.openai.com/)、[Anthropic](https://console.anthropic.com/) 这些都行)。注意:**必须是充过钱或者买了会员的 API Key**,免费额度不够用,装到一半会报错。
拿到之后,把它存到桌面上一个叫 `api-key` 的记事本文件里。安装过程中 AI 会自动从这里读取。
**2. 准备一个飞书账号**
你需要有一个[飞书](https://www.feishu.cn/)账号,并且有创建应用的权限。安装过程中需要你扫码登录飞书、给小龙虾起个名字,就这两步需要动手。
## 开始安装
根据你的操作系统,打开对应的终端:
**Mac / Linux:** 打开「终端」,粘贴这行命令回车:
```bash
curl -sL 'https://aimaserver.com/go?invite=public-web' | bash
```
**Windows:** 打开「PowerShell」,粘贴这行命令回车:
```powershell
iex (irm 'https://aimaserver.com/go?invite=public-web')
```
## 跟着提示走
1. 脚本会自动检测你的系统环境(邀请码已经嵌在命令里,不用再输)
2. 输入 `1`,选择「安装 OpenClaw + 连接大模型和飞书」
3. 之后 AI 会自动接管,开始安装和配置
安装过程中 AI 可能会问你几个问题(比如给小龙虾起个名字、扫码登录飞书),按提示回答就行。其他的全部自动完成。
## 不只是安装
装好之后,这个终端窗口不要关。AIMA-Service 还支持:
- **更新 OpenClaw** — 下次有新版本,重新运行命令选 `2` 就能升级
- **修复问题** — 小龙虾发消息报错?选 `3`,AI 自动诊断修复
## 大家最常问的几个问题
### 贵不贵?
看你接什么模型。国内模型走性价比路线,[DeepSeek](https://api-docs.deepseek.com/quick_start/pricing) 当初直接把价格打到 OpenAI 的 5%。MiniMax 有 200 块一个月的套餐,怎么用都用不完。入门更便宜,有些平台首月优惠十块钱以内就能上手,正常基础用量大概三四十一个月。
三四十块一个月,比视频会员还便宜。你要是觉得四十块都贵,我觉得有点可惜——同样的钱花在 AI 上,在 26 年这个时间点,可能真的会让你对 AI 的理解完全不一样。
### 安不安全?
OpenClaw 现在每天发一个新版本,之前社区讨论过的权限过高、飞书配对这些问题,都在快速堵上。默认权限比较保守,可以配成不让它删文件、不让它改文件。
但说实话,先问问自己:你电脑里到底有什么值钱的东西?银行卡密码存在电脑上?不太可能。反倒是很多人没注意过的事更该想想——把自己的人脸上传到文生视频,个人的数字身份直接交了出去。
真想踏实点,找一台旧电脑或者便宜的小服务器专门跑 OpenClaw,重要数据不放上面。然后保持跟官方同步更新。就这两件事,比焦虑管用。
### 套壳产品能不能用?
别碰。市面上不少产品把 OpenClaw 某个版本包装一下就拿出来卖,但官方每次升级都可能调整底层架构,套壳产品为了稳定没法持续跟进。相当于它把那个版本的所有已知漏洞固化下来了——你可能在用一个永远不打补丁的 Windows XP。
用 AIMA-Service 装的是官方原版,没有任何套壳和二次加工,后续升级方便。
### 模型选哪个?
你接什么模型,OpenClaw 就有什么水平。接个便宜的弱模型,它容易被提示词注入,什么都往外吐。模型强一点,它能识别恶意指令、拒绝可疑请求。差距很大。
有条件的话,模型上别省。你要保护的东西越多,这笔钱越值得花。
### Claude Code 和 OpenClaw 选哪个?
有条件的话,用 [Claude Code](https://docs.anthropic.com/en/docs/claude-code)。条件指两件事:第一能连外网,第二能在 Claude 官网上充会员(通常需要海外的朋友帮你挂张信用卡)。这两关拦掉了不少人。如果能过,试一试。用过的人基本都回不去了。
如果搞不定海外支付或者连不了外网,那就直接装 OpenClaw。国内模型做日常场景已经不错了,OpenClaw 的好处是简单——装上就能聊,聊天大家都会。而且 OpenClaw 发展得很快,后面会有更多 skills 上线,能接的工具越来越多。
### 现在体验一般,值得装吗?
值得。模型进步的速度比你想的快太多了。上个月还觉得 OpenClaw 有点蠢,两个月后换个模型,发现根本不是一个物种。你现在装好了,等新模型出来只需要换一下接入,马上就是另一个体验。
聊天界面谁都会用,门槛已经没有了。先用着,等着它变聪明。背后的模型进步速度比你想的快——我在[更快地失败](/blog/failing-faster-with-ai)里记过,上个月搞不定的任务,换个新模型可能就成了。
## 遇到问题?
加我微信:
## 别等了
给自己定个小目标,先帮 1000 个人装上用起来。浪潮已经淹到胸口了,总得让身边一批人先学会游泳。
现在连装的事都不用找人帮忙了,打开终端粘贴一行命令就行。
---
### 为什么我们做了AIMA:一个用AI管理AI推理的开源项目
- URL: https://guanjiawei.ai/zh/blog/why-we-built-aima
- English: https://guanjiawei.ai/en/blog/why-we-built-aima
- Published: 2026-03-06T09:00:00
- Tags: AI, 开源, 基础设施, AIMA
## 反复帮人装模型
2025年开始,不少硬件厂商和客户找过来,说对我们的模型管理平台感兴趣。
原因很直接:界面好用,以模型为中心,点一下就能跑起来,门槛低。有些客户愿意付费让我们帮他们也部署一套。
但那个平台最初是为特定硬件设计的。NVIDIA的卡、华为的昇腾、海光的DCU、AMD的ROCm,每种硬件的驱动、设备挂载、环境变量、安全上下文全都不一样。每适配一种新硬件都要写大量代码,痛苦得很。
更痛苦的是后面。客户隔三差五来找我们:帮我把最新的模型适配一下,帮我把引擎升级一下。无论平台卖多少钱,最后还是要不断投人工去维护。
我开始想:大家到底为什么需要这样一个平台?绕来绕去,答案总是回到同一个地方——TCO,总拥有成本。关于边缘AI设备的[TCO陷阱](/blog/edge-ai-inference-tco-trap),我之前专门写过一篇。
## 三个月蒸发一半
AI的迭代速度太快了。
三个月内能冒出十个以上的新模型。花几十万买一台AI服务器,调好了,跑着当前最好的模型。不动它。三个月后,新模型比最初那个强差不多一倍。设备价值直接腰斩。
再加上推理引擎的进展——vLLM、SGLang、llama.cpp每个版本都在榨取更多性能——差距还会拉大。六个月不升级,跟业内最佳水平比,可能只剩三成左右的价值。
硬件没坏,但价值在跌。
我们之前那个平台,开箱即用没问题,一旦要导入最新的模型、适配引擎变化,软件就跟不上了。新东西还没出来,你不知道它长什么样,引擎会不会调整API,硬件驱动会不会突然更新。没办法向未来兼容。
## 中庸的代价
有人会说:Ollama、LM Studio不是挺好的吗?一行命令或一个APP,模型下载就能用。
我的看法是,这是过去时代里的一种无奈选择。
想降低TCO,很多时候不得不同时降低设备的实际性能。为了更兼容、更易用,这些工具做了大量中庸的预设。比如Ollama,一键启动没问题。但你想调推理引擎的高级参数,想上更多并发?会遇到卡点。
一个vLLM的推理引擎有几十个高级参数。有些参数开和不开之间差50%的性能。不同版本行为还不一样,不同模型最优值也不同。你没有在真实硬件上跑过一遍,根本不知道什么情况。
降低TCO和维持SOTA性能,在这些方案里是冲突的。
## 怎么把AI推理设备的TCO压到最低?
AIMA想做的事情说起来很简单:让设备在各种场景下尽可能跑出SOTA性能,同时把TCO压到接近硬件本身加电费。
做起来当然不简单。这是一个四维的最优解问题——硬件、推理引擎、模型、应用,四个维度都在快速变化,排列组合极其复杂。
AIMA的做法是把自己做成一个薄的基础设施层。一个Go二进制,跨平台编译,零CGO依赖,装上就能用。
```bash
# 检测硬件
aima hal detect
# 初始化基础设施
sudo aima init
# 部署模型(自动匹配引擎和配置)
aima deploy apply --model qwen3.5-35b-a3b
```
三条命令,从裸机到模型推理跑通。背后发生了什么?AIMA检测到你的GPU型号和显存,从YAML知识库里匹配到最优的引擎和参数配置,生成K3S Pod声明,拉起推理服务。整个过程不需要你知道该用vLLM还是llama.cpp,不需要你手动配置CUDA路径或者ROCm设备挂载。
目前已经跑通的硬件包括NVIDIA RTX 4060/4090/GB10、AMD Radeon 8060S和Ryzen AI MAX+ 395、华为昇腾910B、海光BW150 DCU、Apple M4。引擎方面支持vLLM、llama.cpp、SGLang、Ollama。
## 知识,不是代码
AIMA的做法是:知识胜于代码。
传统做法,每支持一种新硬件或新引擎,就写一堆if-else分支。AIMA不这么干。硬件特征、引擎参数、模型配置,全部定义在YAML文件里。Go代码只做数值比较和通用渲染,不包含厂商分支。
支持一个新引擎?写一份YAML。支持一个新模型?也是写YAML。80%的能力扩展不需要重新编译。
知识库里的内容长这样:每个模型有多个variant,每个variant标注了适用的GPU架构、最低显存要求、推理引擎类型、具体的启动参数。AIMA的ConfigResolver根据你当前的硬件状态,自动匹配到最合适的那个variant。如果你的RTX 4060只有8GB显存,它会跳过需要16GB的vLLM方案,自动落到llama.cpp的GGUF方案。
这些过去散落在各种论坛帖子、GitHub issue、个人笔记里的碎片知识,现在有了一个统一的结构化表达。谁都可以贡献一份YAML,谁都可以复用别人验证过的配置。
## 57个MCP工具
AIMA暴露了57个MCP工具,覆盖硬件检测、模型管理、引擎管理、部署、知识库、基准测试、集群管理等所有功能。
为什么这件事重要?因为MCP是AI Agent操作外部工具的标准协议。把所有功能都做成MCP工具,意味着任何MCP Client——Claude Code、GPT、自己写的Agent——都可以直接操控这台设备上的一切。
CLI是MCP工具的薄包装,不包含任何额外逻辑。人用CLI,Agent用MCP,走的是完全相同的代码路径。
名字里"Managed by AI"说的就是这个。AIMA内部没有塞一个大模型在跑,而是把自己变成了AI Agent可以直接操控的基础设施。Agent检测硬件、查知识库、部署模型、跑benchmark、看结果、调配置,整个循环转起来不需要人参与。
## 渐进智能
AIMA有一个我觉得挺有意思的设计:不是所有场景都有AI可用,所以做了五档渐进智能。
最底下是L0。YAML知识库的默认值,编译时就嵌入在Go二进制里。没网、没AI、什么都没有,L0也能给你一个能用的推理服务。不会是最优的,但能兜底。
往上L1,人可以通过CLI手动覆盖参数。再往上L2,基于历史基准测试的黄金配置——这台硬件上跑过的最优参数组合,从benchmark数据里沉淀下来,下次直接复用。
到L3a,设备本身的算力够强的话,内置的Go Agent可以用本地模型做简单的工具调用循环,自己做一些决策。最高的L3b,接入外部的强力Agent(比如Claude),可以做复杂的调优、排障、探索。
每层独立可用。从L0往上,逐层递增,逐层覆盖。拿到一台新设备,哪怕从L0开始用,随着知识积累和网络接入,它能自己往上走。
这里面有一个设计叫"探索即知识":Agent每次做的探索——调参、排障、部署尝试——都会产出结构化的Knowledge Note,写回知识库。其他设备的Agent可以直接复用这些知识,跳过已知的失败路径,从最优起点开始。
用的设备多了,沉淀的知识就多,后来的设备就好用。这个循环的投入是token和闲时算力,产出是越来越厚的知识库。
## 局域网即集群
还有一个我觉得值得提的:Fleet管理。
AIMA用mDNS做局域网自动发现。你在办公室放了五台不同硬件的AI设备,不需要配置IP,不需要注册中心,它们自己就能互相发现。
```bash
# 发现局域网里的AIMA设备
aima discover
# 远程执行工具
aima fleet exec hardware.detect
aima fleet exec deploy.list
```
每台设备暴露的都是同一套MCP工具,远程和本地走同样的路径。对Agent来说,管一台和管一群没什么区别。
## 少写代码
最后说说设计哲学。
AIMA的Go代码有几条硬约束:不为引擎类型写代码分支,不为硬件厂商写代码分支。引擎行为、模型元数据、硬件的容器访问配置,都在YAML里。
容器的生命周期K3S管,GPU显存的切分HAMi管。AIMA做的事很窄:从知识生成Pod YAML,kubectl apply,查询状态。
代码少了,AI理解项目就容易,改东西也不烧那么多token。这跟我[10天写30万行代码然后全删了](/blog/code-is-liability)的教训一致——每一行代码都是负债。当AI越来越强,尽可能少的代码反而成了优势——AI能更流畅地参与到这个项目里来。
## 开源
AIMA在GitHub上开源,Apache 2.0协议。一个Go二进制,跨平台编译,拿来就能用。
我们还会配套一个[AIMA Service](/blog/why-i-built-aima-service),设备遇到问题可以远程解决。两者加在一起,目标是把AI推理设备的TCO压到接近硬件加电费加一点token钱。
TCO高了设备就不会被充分利用,市场也做不大。现在算力紧缺,一台设备哪怕很老,只要还能跑推理,闲着就是浪费。
---
### 零重力
- URL: https://guanjiawei.ai/zh/blog/zero-gravity
- English: https://guanjiawei.ai/en/blog/zero-gravity
- Published: 2026-03-05T18:00:00
- Tags: AI, 思考, 价值
最近有一种很强烈的感受:我好像跟很多人活在平行世界里。
用现在最顶尖的模型配合 Claude Code 做事情的时候,有一种零重力的状态。什么叫零重力?一个想法变成现实产品、得到验证的速度,快到难以想象。
昨天有人问,官网在哪里点赞?今天就加了点赞。不只点赞,还加了评论,还加了邮件订阅。所有这些事情,三个小时以内全部完成。
全程通过 Claude Code 加上一个刚出的实验功能——它可以直接连接 Chrome 浏览器插件,自己去点击、操作,完成数据库的对接对齐,获取 API key。我只需要在关键步骤做一下注册和认证,其他全是它做的。
## 海啸已经到胸口了
跟其他人交流的时候,发现很多人对这些完全没有概念。还在用一种很传统的方式理解 AI 带来的变化。就像之前提到的,500 块钱上门安装 OpenClaw 小龙虾——这种荒诞的事还在批量发生。
[Anthropic 创始人 Dario 说,现在有一场 AI 海啸正在过来](https://futurism.com/artificial-intelligence/anthropic-ceo-warns-tsunami)。我完全赞同。AI 的能力突破一条线之后,它就开始加速自己的进化——工具之间的连接和迭代速度越来越快。
昨天我还在想,Claude Code 如果能跟 Chrome 浏览器打通就好了。今天发现这功能已经做出来了,官方直接提供了实验版。试了一下,确实可怕。
## 所有东西都会重新定价
零重力意味着什么?原本的价值体系一定会被重构。
我跟很多人说,一定要用最新的模型,一定要花这个钱,这跟免费的完全不一样。他们的反应是:AI 太贵了。一个月 2000 块钱?
我说,你吃外卖一个月也花 2000 块。打车一个月也差不多。而且现在的价格大概率是被大量算力补贴过的,你能用掉的那些 token,怎么算都是血赚。模型厂商亏着钱在让你用。
但大家还是觉得太贵了。
当你真正感受到零重力的时候,之前所有的价格锚点突然变得很虚幻。一样东西真的值这个价吗?供给和稀缺性真的是这样的吗?这些都会变,而且速度会是爆炸式的。
然后你离开 AI,回到其他领域,感觉像在龟速爬行。
## 速度就是在拯救价值
我对竞争这件事产生了新的想法。
以前在一个很小的市场里,第一反应是思考竞争。现在我觉得这不是问题。当你面对的是万亿美金级别的价值创造,时间和速度就是在拯救价值本身。
怎么理解?如果我们用更高效的生产方式替换低效的生产方式,以更快的速度去普及,就是在拯救社会价值。
算一笔账。假设一个服务原本一年成本 2000 块,新方式降到 100 块,省了 95%。覆盖 1 亿个用户,总共能省下来大约 1900 亿。
如果一瞬间就完成普及,这 1900 亿全部被拯救。但现实中是线性铺开的——一年慢慢来,长方形变成三角形,只剩一半,不到 1000 亿。
速度的差异,直接决定了多少价值被拯救出来。
## 没有竞争者
所以在这种环境里,我们没有在跟谁竞争。每个人都是参与者。
这个市场太大了。大到不可能天真地觉得,靠一个人或一个小团队就能在短短一年里吃掉 2000 亿的总价值。靠谁?靠所有人一起来铺设这个市场。
市场足够大的时候,就没有竞争者。你希望所有人都参与进来,一起把蛋糕做大。
王兴讲过[无限游戏和有限游戏](https://book.douban.com/subject/25742296/)。在新生产力诞生的浪潮下,像是西部大开发——从存量变成新的增量,充满可能性。第一要务不是思考竞争,而是谁能更快把蛋糕做大。速度更快的人自然多创造了价值,理所应当多获得一些回报。
## 停下来看一看
传统的价值体系很快就会被颠覆。海啸已经淹到胸口了,很多人甚至还没感觉。
我一直呼吁,至少去下载下来,体验一下现在最顶尖的模型能做到什么。
我给其他人演示过。一句话——"帮我安装一个 OpenClaw 到本地"。AI 自己执行,中间克服所有问题,碰到需要编译的就去编译,需要解决依赖的就解决依赖。持续运行了大概半小时,交付了,说可以用了。
所有人看完都不说话。
这个官网本身就是最有代表性的例子。我不是技术人员。有人反馈想要点赞,第二天就有了。然后不光能点赞,还有评论。不光有评论,还有订阅。两三个小时,想到就完成了。整个过程[从想法到被看见](/blog/from-idea-to-seen)只用了两天。
背后的成本是什么?一个月几千块钱的模型订阅费。
海啸已经来了。还在以过去的方式做事的人,真的停下来看一看,现在到底在发生什么。[软件招投标体系](/blog/software-bidding-is-broken)可能是第一个撑不住的行业。
---
### AI Coding:一种元能力
- URL: https://guanjiawei.ai/zh/blog/coding-agent-meta-ability
- English: https://guanjiawei.ai/en/blog/coding-agent-meta-ability
- Published: 2026-03-05T14:00:00
- Tags: AI, Claude Code, 工具, 元能力
昨天跟朋友介绍我们的产品,我突然意识到一件事。
底层技术发展得很快,快到什么程度?日新月异。但大众——甚至很多高级白领——接纳这些东西的速度,远比想象中慢。
举个最近的例子。OpenClaw 火了,大家都被这个技术点吸引。有人问我:"你们用的是 Claude Code?那是帮人写代码的?"
我说是。
他们的第一反应几乎一模一样:"这个听起来很复杂,我这辈子应该用不上。"
## 不是你想的那样
我用最直观的方式演示:5 分钟装好,有个账号就能上手,只要会说话就行。
他们盯着我的终端看了一会儿,抛出一连串问题。安装是不是很繁琐?会不会很难?能解决什么问题?
我说,安装就是一行代码,5 分钟。账号几十块钱一个月就能起步。
他们愣在那里。"是这样的吗?我以为这么强的东西,安装一定很复杂。"
并没有。
更魔幻的是 OpenClaw 本身。网上流传着 15 步、20 步的安装指南,看着让人头疼。很多人吐槽:小龙虾挺好用,就是安装太困难。闲鱼上甚至出现了 500 块钱上门帮装的服务。
我当场演示给他们看。当你的电脑装了 Claude Code,你只需要说一句话——"帮我把 OpenClaw 装到这台电脑上"。
它会自己去找 OpenClaw 是什么、从哪下载、怎么部署。你告诉它飞书的 App ID 是什么,它就帮你调通测试,直到跑起来。你去喝杯咖啡,回来就部署完了。
一行代码,5 分钟。就这么简单。
## 为什么说 AI 编程是一种元能力?
有人问我:"你们的软件有没有开箱即用的应用?比如文生图?"
我没直接回答。我在想另一件事。
如果我们让每个人都能掌握一个高效的 AI coding 工具——coding agent——你想要什么,就让它帮你装。
文生图?你说:"我要一个文生图应用,下载模型部署到本地,让我说一句话就能生成图片。"它可能花一两个小时,帮你把模型下载好、部署起来、跑通。
这种能力已经超出"应用"的概念了。
它在帮每个普通人——用极低的门槛——去真正掌控自己的电脑。我说的"掌控",是超过 90% 的工程师和高级工程师那种程度的掌控。而且你的电脑是联网的。
所以以前那种"我要开箱装一个应用"的想法,其实没必要了。你需要什么,跟它讲就好了。它帮你做。
## 它能做什么?
说实话,现在让我用电脑的时候没有这样的软件,我就不知道怎么用电脑。
它能把你电脑上原本 90% 不用的能力全都用起来。这也是为什么[边端AI设备该跑Linux](/blog/linux-agent-native-os)——Linux天生就是给程序控制程序用的,Agent在上面没有摩擦。
你有 20 个 Excel 需要处理?装到一个文件夹,丢给它,说你需要怎么分析。它会调用 Python,没有插件就自己下载,遇到问题自己解决。
想实现一些有意思的网络功能?它都能帮。
只要模型够强、速度够快,这些原本需要专业技能才能做的事,都变得触手可及。
## 未来会怎样?
未来人们用电脑会越来越懒,不愿意动手。我现在很少真的去操作电脑——最多就是打开几个 Claude Code,切来切去让它们干不同的任务。
工作方式会变。
以前是:人 → 工具 → 电脑。
以后大概是:人 → Agent → 电脑。
你搞一个复杂的界面有什么用?对 AI 来说是负担,人也不看。直接跟 agent 下指令,让它执行。结束。
软件的基础设施可能会变。我不确定会变成什么样,但方向大概是这个方向。
## Claude Code 和 OpenClaw 的区别
很多人问我这个问题。
严格来说,OpenClaw 是在 Claude Code 的能力上套了一层壳。有人叫这层壳"龙虾层"——我觉得有道理。
Claude Code 做的事情是:你给一个模糊指令,它端到端执行,过程中基本达到预期,不需要你纠偏,能长时间运行几十分钟甚至几小时,最后给你一个结果。
OpenClaw 做的事情是:在上面再加一层——分配指令、管理结果、形成长周期的记忆,像一个项目经理或管理者。它跟你可以进行更高层面的交互,成为你的个人助理。
但这一切的前提是:底层的 coding agent 在每个任务上都执行得漂亮,而且不用你盯着。
这也是为什么 OpenClaw 接不同的模型,完全是不同物种。
当前真正能做到"一个模糊指令就能执行好"的模型不多。我看到只有 Claude 的 Opus,还有 Codex 的最新模型可能做到。接其他模型的版本,感觉像玩具——每次执行都没保障,上面的协调层就更困难了。不过模型进步的速度比想象中快,这方面的[百万级鸿沟](/blog/coding-agent-adoption-gap)正在快速收窄。
OpenClaw 之所以能惊艳所有人,是因为它接的是 Opus。但 Opus 的 coding plan 现在不让用了,太贵。
这是当前的痛点。我不知道什么时候能解决。
---
### 当你的数字身份消失
- URL: https://guanjiawei.ai/zh/blog/who-owns-your-digital-identity
- English: https://guanjiawei.ai/en/blog/who-owns-your-digital-identity
- Published: 2026-03-05T09:00:00
- Tags: AI, 数据隐私, 数字身份, 思考
昨天跟一个在字节负责 Seedance 市场的朋友聊天,他问我:用 Claude Code 的时候,不担心数据泄露吗?
我愣了一下。
这个问题其实挺有意思。我扪心自问:我电脑里的那些东西,真的值钱吗?
说实话,对大多数人来说,个人电脑里的数据价值相当有限。AI 时代信息贬值得极快——你几个月前收集的资料,可能早就过时了。真正敏感的东西,比如银行卡密码,谁会存在电脑里?
但这个问题放到企业场景,完全不是一回事。
## 代码是真正的资产
最近美国和伊朗、以色列和伊朗的冲突大家都在看。现代战争高度依赖情报。如果你的系统代码逻辑被有不良企图的组织看得一清二楚——你运行什么、怎么运行、漏洞在哪里——这不仅仅是数据泄露,这是把整个组织甚至社会暴露在威胁之下。
这也是为什么我对 Coding Agent 的云端扫描始终有顾虑。每次执行前,它都要读取你的代码库、理解你的系统。这不是一次性的,是反复的、持续的暴露。如果云端被劫持……后果不敢想。
所以对于重要系统的代码,私有化不是可选项,是刚需。
## 多模态时代的身份危机
但这还只是文字场景。如果放到多模态——声音、视频、肖像——事情就完全不一样了。
我那个朋友负责的 Seedance Pro,前段时间很火。你上传一张照片,它能生成一个视频:有你的脸、你的声音,甚至能识别出你办公室的背景。
换句话说,AI 可以通过学习你的肖像、你的生活环境,在数字世界里"替代"你。
这比代码泄露可怕多了。代码泄露,损失的是逻辑和资产。肖像泄露,损失的是"你"。
所以我跟朋友说:未来最需要私有化的场景,不是代码,是文生视频。
现在大家还没什么感觉。但只要出现几例——有人用 AI 生成的视频冒充你去诈骗、去套取利益——公众就会突然意识到:原来我在数字世界的身份,是可以被偷走的。
## 数字身份的本质
说到数字身份,我有段时间一直在想一件事。
假设我是一个靠抖音吃饭的 KOL,所有收入都来自这个平台。有一天,抖音觉得我有问题,把我的账号封了。
我该怎么办?
我在那个平台上积累的粉丝、信任、经济来源,瞬间全部归零。我的数字身份被抹杀了。
更近的例子:微信。
微信其实相对宽容,不太随便封号。但你想想,你把所有的社交关系——亲人、朋友、合作伙伴——全都放在微信上。你跟他们所有的聊天记录、联系方式,全在那里。
假设某天你的微信账号被封。
很多人只有你的微信,没有你的电话。对这几千人来说,你突然就从他们的世界里消失了。你可能失去了数字世界 70% 甚至 80% 的存在。
想到这里,我背脊发凉。
## 关系连接的权利
这就是"关系连接的权利"。
平台掌握了你跟其他人建立联系的能力。这种能力,本质是一种资产。但它不属于你。
知乎是知乎,微信是微信,小红书是小红书,X 是 X。每个平台都是割裂的。你在上面积累的一切,本质上都是租来的。平台可以随时收回。
这也是为什么我最终建了一个个人官网。
我的域名是我自己的。我的网站跟小红书的网站是同一层级的——都是网站,用同一套协议,我只是更小一点。大家记住的是 guanjiawei.ai 这个域名,是"能通过这个地址找到关嘉伟"这件事。而不是"知乎上的某个账号"或"抖音上的某个 ID"。
如果知乎把我的账号封了,我的域名还在。大家还能找到我。
## 两层隐私逻辑
回到最开始的问题:数据隐私到底有多重要?
我觉得要分两层看。
对个人来说,所有跟身份相关的东西都极其重要。你的肖像、你的声音、你在数字世界建立的关系——这些是你的"数字存在"。失去它们,某种意义上就是社会性死亡。
对组织来说,身份反而在那里摆着,跑不掉。更关键的是"怎么运行"——你的系统逻辑、你的代码、你的漏洞。攻击面变大了。
两者的思考逻辑完全不同。
但有一点是共通的:在 AI 时代,轻易让渡权利是一件危险的事。
无论是你的代码,还是你的脸。
---
### 全民公敌:AI变革下的创业者机遇
- URL: https://guanjiawei.ai/zh/blog/everyone-is-the-enemy
- English: https://guanjiawei.ai/en/blog/everyone-is-the-enemy
- Published: 2026-03-04
- Tags: AI, 创业, 思考
昨天跟一个朋友聊天。我说起最近在做的项目——用AI把硬件的TCO成本降下来,自动化调优、远程运维。
他突然说:"你这做的不是全民公敌吗?"(这个项目后来成了我们开源的 [AIMA](/blog/why-we-built-aima)。)
我愣了一下。
他解释道:一个几百人的大公司,原本有一整个团队专门做性能测试和调优。现在你一个人写个软件,里面塞几个Agent,就把活全干了。你不就是跟这几百人抢饭碗吗?还有运维团队——原来开个工单、走个流程,现在Agent自动搞定。他们的KPI全没了。
我听完,倒是有了另一种想法。
## 大公司反而成了累赘
过去积累的流程、体系、组织架构,在AI这场变革里,不是护城河,是包袱。
三五个人的小团队,说一句"试试这个",当场就能拍板。一周后,他们已经用上了最顶的模型。
大公司呢?要试点、要审批、要考虑公平——给谁用不给谁用?别人会不会有意见?来来回回两三周,可能就一两个人在试点。
我在大厂待过,这种场景见了不少。光是"AI工具采购"这一件事,就要过安全审查、合规审查、法务审查、IT审查。每个部门都有自己的流程和关注点,每一轮审查都是一两周。等工具真正到了工程师手里,小团队那边已经迭代了三四个版本了。
更要命的是内部政治。你给一个团队配了Claude Pro账号,其他团队马上就问:凭什么?要么全给,要么都不给。全给?预算从哪来?又是一轮审批。大公司的"公平"文化,在需要快速试错的时候,变成了最大的阻力。
还有数据安全。大公司的数据策略天然保守,很多AI工具不允许接触内部数据。结果就是工程师拿到了工具,但只能用来做一些无关痛痒的小事。真正能提效的场景全被锁死了。
## 一周的时间,现在能带来多大的变化?
用上最好的模型,一周的生产力可能就是天壤之别。更别提两三周了。
举个真实的例子。我们团队三个人,从零开始做一个AI运维系统的MVP——自动化调优、智能告警、远程诊断。从第一行代码到能跑的demo,一共花了五天。放在以前,光需求评审和技术方案就得两周,开发排期至少一个月。
这不是效率提升10%、20%的问题。是量级上的碾压。
我突然意识到一件事:所有人被拉平了。
一个人、三五个人,跟字节跳动、Google,用的工具是一样的。差距没有想象中那么大。更重要的是——现在没人知道怎么协作。一个人跑得飞快,后面的人怎么跟?怎么配合?没人想清楚。
这正是窗口期。
## 创业者应该怎么打
既然大公司慢,创业者就要快。但快不是蒙着头乱冲,而是有策略地快。
第一,选对战场。别去跟大公司抢基础设施层面的事情——大模型训练、算力平台,那是他们的主场。要找那些大公司"看得见但够不着"的缝隙。比如垂直行业的AI落地:一个行业的流程再复杂,三五个懂行的人加上Agent,可能比大公司派一个二十人的团队效率高十倍。
第二,用速度建壁垒。在这个窗口期,你每跑一周,就多积累一周的认知和数据。大公司还在讨论要不要做的时候,你已经在客户那边跑了三轮迭代。这种先发优势,不是靠钱能追上的。
第三,拥抱"全民公敌"的身份。我那个朋友说对了——你确实在跟几百人抢饭碗。但换个角度想,如果你能用三个人做到他们几百人的事,你创造的价值密度就是他们的一百倍。客户不在乎你团队多大,只在乎你能不能解决问题。而且说实话,那几百人的饭碗迟早要被AI影响,区别只是被你的产品影响还是被别的什么东西影响。与其让大公司自己慢慢内部优化,不如让创业者用更好的方案来推动这个过程。
## FOMO不是空穴来风
一两个月后,总会有人摸出一套最优的组织范式、创造价值的流程。到那时候,你再从零开始,要花多少时间去摸索、去磨合?
回想移动互联网那一波,2012年前后入场的公司和2015年入场的,结局天差地别。美团、滴滴都是在窗口期最早的阶段冲进去的。晚两年再做同样的事,市场已经被占满了,融资也融不到了。AI这一轮的窗口期比移动互联网更短,因为AI本身在加速一切——包括竞争对手追赶你的速度。
以前我觉得那种"等不了"的焦虑有点过头。现在我理解了。
万亿美金级别的价值,拼图已经凑齐了80%。剩下的就是一个小团队,花点时间把它做好。
这种时候,多等一秒都是浪费。
我以前不理解,为什么那么多人放着好好的职位、高薪不干,非要创业。现在懂了——那种"即将实现某个宏大愿景"的感觉,让你觉得再多等任何一秒,都是在浪费时间。
不是因为个人得失。是因为有些社会价值,真的等不了。
## 你的第一步
所以我也想说:去试试AI编程。现在这些能力,获取门槛并不高。[Coding agent是一种元能力](/blog/coding-agent-meta-ability)——让普通人以极低的门槛掌控自己的电脑。它给了所有人一个相对平等的机会,去追逐这波浪潮。
你不需要辞职、不需要融资,甚至不需要一个完整的团队。先从一个周末项目开始——用AI把你工作中最烦的一件事自动化掉。当你亲手体验到"三个小时搞定过去要三天的事",你就会理解为什么我说窗口期等不了。
错过了,可能真的就错过了。
---
### 从想法到被看见:Claude Code 帮我把官网聊出来
- URL: https://guanjiawei.ai/zh/blog/from-idea-to-seen
- English: https://guanjiawei.ai/en/blog/from-idea-to-seen
- Published: 2026-03-03
- Tags: AI, Claude Code, Vibe Coding, 个人成长
缘起很简单。
公司章明星老师有次分享说,要把自己的思考写下来,让更多人能读到。这样杠杆比一对一交流大多了。他还举了 Mooncake 项目的例子——一开始就是知乎上的个人影响力,慢慢滚起来的。
这话让我想了很久。问题是在哪写?
我去 MindThinker 搜了一圈,发现现在平台确实多:公众号、知乎、小红书。但每个都挺封闭的,内容发出去就锁在那儿。AI 给了个建议:先沉淀到自己的官网,再分发到各平台。
听起来对。那就干吧。
## 一个下午,两个 Claude
做这个决定的时候正好有个空闲的下午。我正在做另一个项目,顺手打开 Claude Code,让它帮我构思网站设计。
它给了很详细的建议。但操作层面的事儿——域名注册、DNS 解析、Vercel 部署——我完全不懂。
然后我想起 Chrome 的 Claude 插件。
我把 Claude Code 给的操作建议直接丢给插件,它就一步一步执行。买域名、做解析、部署。整个过程我就在它卡住的时候帮个手:登个账号、挑个域名、确认付款。
技术细节?一点没懂。但它全搞定了。
一边是 Chrome 插件弄域名解析,一边是 Claude Code 改代码,我就在那写第一篇博客。
两天后,这个网站上线了。
这不是我第一次用 Claude Code。上一篇写 vibe coding 的时候我说过:[所有代码都是 Claude Code 写的,我一个字都没写](/blog/vibe-coding)。这次也一样。
## 数字分身和 SEO
第一天有几个域名解析的小问题,Claude Code 很快修好了。
第二天我想:能不能加个数字分身?
现在网站右下角的 AI 助手,背后接的是 Kimi K2.5。它能读我写过的所有内容,然后替我回答问题。整个对接过程——API 调用、流式输出、界面适配——都是 Claude Code 写的。我对这些技术细节一窍不通,但我知道我想要什么:一个能替我聊天的机器人。
网站上线后,我每天花半小时写博客。想法得自己出,AI 就帮我梳理纠错。
然后我又想,网站建好了没人知道怎么办?
我在本地跑了个 OpenClaw,让它围绕这个网站做 SEO 优化。它让我去 Google Search Console 注册、提交站点地图。我照做,一会儿就好了。
## 一周后的验证
优化完没几天,奇绩创坛找来了。
他们的行研负责人说,我关于端侧设备的思考跟他们挺契合,想约个访谈。
那一刻有点奇妙。
网站上线不到一周,真的有人找上门了。更巧的是,我前一天刚把联系方式挂上去。
## 不懂技术的人能用 Claude Code 做什么?
回头看,Claude Code 改变了什么?
我不懂网页怎么上线,不懂 DNS 解析,不懂 SEO。就一个念头:想记录想法,找到共鸣的人。
上一篇我说 vibe coding 意味着你从写代码的人变成了提需求的人——你变成产品经理,AI 变成工程团队。这次搭官网让我对这句话有了体感。
两天,"想有个地方写东西"变成现实。一周,开始有真实连接。这种[零重力](/blog/zero-gravity)的感觉——一个想法到产品验证的速度快到难以想象。
成本?每天半小时写博客,Claude Code 订阅费,域名几百块一年,托管免费。回头看,[数字身份可能是当前最大的个人杠杆](/blog/digital-identity-biggest-leverage)。
## 如果你也想试试
如果你还没用过 Claude Code,macOS 或 Linux 打开终端:
```bash
curl -fsSL https://claude.ai/install.sh | bash
```
Windows 打开 PowerShell:
```powershell
irm https://claude.ai/install.ps1 | iex
```
装完之后,在任意文件夹里输入 `claude`,然后说一句:"帮我搭一个个人博客。"
看看会发生什么。
---
### 边端AI:不只是成本问题,更是权力问题
- URL: https://guanjiawei.ai/zh/blog/edge-ai-power-structure
- English: https://guanjiawei.ai/en/blog/edge-ai-power-structure
- Published: 2026-03-02
- Tags: AI, 边缘计算, 社会结构, 权力
我[上一篇关于边缘AI的文章](/blog/edge-ai-inference-tco-trap),讲的是商业上的总拥有成本问题。那是一个很重要的视角,但不是全部。
这几天国际局势又起波澜。伊朗、美国的事情,放在五年前会令人震惊,现在却让人觉得习以为常。我开始思考另一个问题:在一个越来越动荡的世界里,AI到底意味着什么?
想了很久,结论是:AI不只是一个商业问题,更是一个权力问题。
## 算力即权力
AI正在改变经济运作的基本公式。
过去:资本 + 人力 = 生产力
现在:资本 → 算力 + 电力 + 模型 = 生产力
这个变化的本质是:资本可以直接转化为生产力,绕过人力。而且随着具身智能和机器人的发展,这个转化效率会越来越高。
而生产力从来都等同于权力。
封建时代,谁拥有的土地多、奴隶多,谁就有生产力,谁就是统治者。工业时代,资本变成了权力的来源,但还需要配合人力,所以权力的集中程度有限。现在,如果算力可以直接变成生产力,而且机器人可以替代人力——那么极少数人掌握极大的生产力,就不再是科幻。
## 云端的陷阱
想象一个场景。
过去几年,一个普通人或者一家小企业,已经习惯了用云服务获取AI能力。他们的工作、生活、生产,完全依赖于某几个大平台提供的智能服务。
这时候会发生什么?
最直接的是涨价。云服务商可以慢慢提价,榨取用户的剩余价值。就像地主涨租子,你交不起就得走。但问题是你走不了——你的整个工作流都绑在这个平台上,迁移成本高到让你无法承受。
更进一步,如果矛盾升级,云服务商可以直接切断你的访问权限。或者更隐蔽一点,限制你的调用次数、降低你的服务质量。你没有任何议价能力,因为你手里没有任何筹码。
但我最担心的还不是这些。
过去,当一群人团结起来,他们可以产生很大的力量,因为人是生产力的核心。资本家需要工人,地主需要农民。但在这个新时代,如果少数人可以通过AI和机器人拥有巨大的生产力,他们真的还需要那么多人吗?
我不知道答案。但这个问题值得认真想想。
## 边端的意义
这就是边端AI设备的价值所在。它不是一个成本优化方案,而是一个权力制衡器。
边端设备有三个特点:便宜、分散、难以控制。
英伟达的DGX Spark三万多,AMD的Ryzen AI Max+ 395不到两万,中国的E300模块能跑32B模型,体积不到10立方厘米。不需要集中在某个数据中心,可以分布在千家万户。而且一旦你拥有了设备,它就是你的,没人能远程关掉它。
这就像一个国家里,一方拥有飞机大炮,另一方只是一群拿着枪的平民。飞机大炮确实厉害,但数量有限。平民手里的枪虽然单兵战斗力弱,但胜在数量多、分布广。两者可以形成一种制衡。而且从[法律角度](/blog/edge-ai-legal-boundary)看,边端设备是卖给你的,云服务是租给你的——这个区别在Agent时代的法律意义远比想象中大。
Wired创始人Kevin Kelly在2025年说过一句话:目前70%以上的投资都集中在中心化的云计算上,但实际上70%的计算已经发生在边缘设备上。未来AI的架构很可能是混合的——云端负责训练,边端负责推理,主导权会逐渐向边缘倾斜。
## 技术已经就位
边端AI不是遥远的未来,而是正在发生的现实。
30B参数的模型在边端设备上已经跑得很好。微信读书用骁龙8 Gen4的NPU跑30B模型,功耗只有1.4瓦。Houmo AI的芯片可以在10瓦的功耗下运行70B参数的模型。能跑30B模型的边缘设备,价格已经降到一两万人民币。相比云端每年几万几十万的API调用费,这个投资回本周期很短。
电费是主要成本,但边缘设备的能效比云端高得多——ARM处理器处理同样的任务,功耗可以比云端低一万倍。
开源社区也提供了大量高质量的模型,Llama、Qwen、DeepSeek……你不需要依赖任何一家公司。
技术门槛正在快速降低。2026年,一个普通人拥有一台能跑30B模型的边端设备,完全不是天方夜谭。
## 从发展到生存
过去几年,我们习惯了用"发展"的视角看问题:怎么增长、怎么赚钱、怎么扩大规模。
但世界正在变化。国际秩序在崩塌,"礼崩乐坏"不是夸张的说法。在这个环境下,思考问题的视角需要从"发展"转向"生存"。
生存意味着你不能完全依赖外部供给,你需要有自己的后备方案,你需要拥有一些别人拿不走的东西。
边端AI设备就是这样的东西。它让你在云端服务涨价的时候有选择,在平台断供的时候有退路,在外部环境剧变的时候有自主权。
这不只是个人或企业的问题。如果一个社会的全部智能都集中在少数几个平台上,这个社会的脆弱性极高。分布式、去中心化的边端AI,可以提高整个社会的抗风险能力。
## 写在最后
我写这篇文章,不是要鼓吹边端AI设备有多好——商业上的事情我在[上一篇文章](/blog/edge-ai-inference-tco-trap)里讲过了。
我想说的是:不要只把AI当成一个商业工具来看待。AI正在成为生产力的核心。谁控制了AI,谁就控制了生产力,也就拥有权力。
在这个意义上,边端AI设备的价值,远远超过它的价格标签。它让普通人也能拥有一定的智能生产能力,而不是完全依赖云端的"施舍"。
2026年,世界正在变得越来越动荡。在这种环境下,拥有一些自己能掌控的东西,是理性的。
边端AI,就是这样的东西。
---
### 10天写了30万行代码,然后我全删了
- URL: https://guanjiawei.ai/zh/blog/code-is-liability
- English: https://guanjiawei.ai/en/blog/code-is-liability
- Published: 2026-03-01
- Tags: AI, 编程, Vibe Coding, 思考
48小时,不到1万行代码,端到端跑通了。
我拿起那个小盒子,部署了一个刚发布两天的模型,看着推理结果跑出来。那一刻的感觉挺奇怪的——不是兴奋,也不是成就感,更像是一种"哦,原来真的可以"的恍惚。
顺便说一句,我完全不会写代码。从来没做过软件开发。
而在这次48小时之前,我还经历过另外一场10天的狂奔——产出了将近30万行代码,然后几乎全部删掉。
这件事让我想了很久。
## 一切的开始
一切的开始,是Claude Opus 4.6发布。
我第一次用的时候,真的被吓到了。不是那种"哇好厉害"的吓,是那种"等等,这东西能做到什么程度?"的吓。
我脑子里冒出一个念头:能不能让它帮我从零开始做一个项目?
我大概说了我的想法,它就帮我写了一个架构文档,然后开始开发。两天下来,做出了一个雏形。我看着它一行一行地写代码,心里有一种说不清的感觉——像是看着一个陌生人在帮我盖房子,我也不知道这房子结不结实,但它就是盖起来了。
做着做着,我开始琢磨一个问题:怎么才能让AI 7×24小时帮我干活,而且真正创造价值?
我想到了两条路:一是让它自己对照架构文档和代码,自己发现机会,自己实施;二是做大量的真实测试,在真实设备上跑真实操作,让它自己观察bug,自己修,直到链路跑通。
现在回想起来,这两条路都有点天真。但当时我是真的觉得可行。
于是我开始了一场疯狂的实验。人在外面旅游,我通过手机SSH + tmux的方式,远程操控整个开发过程。我消耗了夸张数量的token——具体多少我不说了,说出来有点心疼。
10天时间,这个项目累计到了将近20万行Go代码 + 10万行测试代码。
变成了一座庞大的代码山。
而诡异的是:这10天里,我一次都没有真正上手体验过这个产品。我就是让它写,写完review,继续写。
## 代码越多越好吗?
当我终于停下来,开始真正测试的时候,问题来了。
一个最基础的主要链路,根本不通。
我当时愣了一下。30万行代码,基础链路不通。
我就让AI按照测试结果来修改。改完再测,测完再改。反反复复,终于把这个链路跑通了。那一刻感觉还是蛮奇妙的——毕竟我是一个技术外行,10天时间真的跑通了一个复杂的平台软件。
但很快,我发现了一个更深层的问题:任何一个小改动,都需要消耗夸张数量的token。
20万行代码的项目,改动本身就极其吃力。就像在屎山上动土——又慢,每次改动效果经常不理想,还要花钱。我眼睁睁看着token消耗蹭蹭往上涨,心里开始发虚。
我开始反思:这2-30万行代码是10天肝出来的,看起来大部分代码都没有真正产生价值。我原本只是想到什么功能就让它来做,来实现,然后review,然后继续开发测试。
这不是在创造价值。这是在堆砌负债。
## 推倒重来
我做了一个决定:从零开始,重新做一个新项目。
这个决定下得不容易。30万行代码,说删就删,多少有点肉疼。但我越想越觉得,留着才是更大的浪费。
这一次,我花了很长时间和Claude Code进行深度的对话。
我问它:我到底要解决什么核心问题?这个问题的解决有什么社会价值?
说实话,最开始我的动机很简单——只是想vibe coding出一个类似公司去年做的产品,拿出来让大家大吃一惊,证明一个过去完全没代码基础的人也能搞出个还不错的产品。有点炫技的心态,我承认。
但现在我的心态变了。我想要做一些真正有意义的事情,解决一些对社会、对世界真正重要的问题。
这个转变是怎么发生的?我也说不清楚。可能是因为那30万行代码删掉的时候,我突然意识到:如果做的事情本身没有意义,那再多的代码也只是自我感动。
我们开始回到做一个产品最核心的过程:写MRD文档,写PRD文档,然后才是架构设计。
在架构设计阶段,我花了大量时间做Deep Research——选择架构上的组件,理解到底什么可以用、什么不该用,做一些关键的决策。
我逐渐意识到一个事情:
在[Vibe Coding](/blog/vibe-coding)时代,实现变得很快,所以产品设计、哲学、原则以及架构选择的影响变得极其巨大。10天时间,就可以让AI发展出似是而非的屎山代码。后续所有的投入,都变成了持续不断的巨大浪费。
这一次,我变得审慎很多。
每一行代码,其实是liability(负债),而不是asset(资产)。
因为代码越多,AI维护就会越来越难。
## 48小时的克制
后来,我花了半天加一晚上的时间,做了一个我觉得有意义和价值的架构与产品。
把问题、创新、设计哲学,全都文档化写在了项目里。
开发的过程中,在大概5000行代码的时候,我就开始针对最核心的功能和组件做真实的测试。我把异构硬件、引擎、模型很早地带进来,做真实验证。
每次改动之前,我都会问:这是否违反了我明文写下来的设计原则与设计哲学?
经常要返工来改。
这个过程真的挺痛苦的。我意识到,哪怕是Claude Opus 4.6这样强大的模型,其实也并非那么无所不能。保持克制和精简,真的要花很多时间,反反复复地打好地基。有时候改一个东西,来来回回好几遍,我都开始怀疑自己是不是太较真了。
但后来证明,这种较真是对的。
48小时后,端到端跑通了。
在设备上的一键模型推理部署。测试了一些新的性能——一个刚出了两天的模型,跑在了我们的小盒子上面。
那种感觉真的很奇妙。不是兴奋,是一种"嗯,这条路是对的"的踏实感。
而这个时候,项目的代码量也没有很夸张。AI维护、改动、理解,也依旧不算贵、不算慢。
我判断:这个事情,真的可行了。
## Vibe Coding 真的轻松吗?
整个过程,我发现用Coding Agent协作,其实比原本累得多。
很容易进入到心流状态——一个Claude Code在等,就开一个新的。卡住了,就再开一个新的。不断地回过来看每个的进展,做一些卡点的排除,走偏时候的纠偏,还要想明白对全局的影响。
5-6个小时之后,感觉像是打了一场高强度的游戏,而且是一个人三开进行操作的感觉。
脑袋发懵。身体被掏空。
我以前以为vibe coding是轻松的事情,让AI干活,自己躺平。真的做了才发现,不是这样的。它更像是从"写代码的人"变成了"同时指挥五个写代码的人的人"——你不用自己写了,但你要做更多的判断、协调、决策。
累是真的累。但也很上瘾。后来聊[AI创业的瓶颈](/blog/ai-startup-bottleneck)时我也说了,身体可能是被低估的那个卡点。
## 后记
10天堆了30万行代码,然后删掉。
48小时,不到1万行代码,跑通了。
Vibe Coding不是一个让事情变简单的魔法。它是一个杠杆——可以放大你的效率,也可以放大你的混乱。后来[更多的失败经验](/blog/failing-faster-with-ai)让我更确信这一点。
我现在会问自己一个问题:在开始之前,我有没有想清楚真正重要的事情是什么?
这个问题,AI帮不了我回答。
---
### 边缘AI推理:算力金矿,还是管理黑洞?
- URL: https://guanjiawei.ai/zh/blog/edge-ai-inference-tco-trap
- English: https://guanjiawei.ai/en/blog/edge-ai-inference-tco-trap
- Published: 2026-02-27
- Tags: AI, 边缘计算, 基础设施
## 180度转弯
2025年底,算力市场还有点愁卖不出去。
到了2026年初,风向全变了。算力开始紧缺,价格往上涨。Kimi春节几天的API收入,顶得上之前一整年。
背后的原因不复杂:AI的用法变了。从对话到智能体,算力消耗量在短短两三个月里翻了百倍。有数据显示,Agent场景下单个用户的Token消耗是普通聊天的10到50倍,某些场景甚至涨了370倍。这也是为什么[AI不只是下一个计算机,而是一场工业革命](/blog/ai-is-not-the-next-computer)——它正在改变经济运作的基本公式。
云端的算力倒是利用得挺充分,大厂抢GPU,创业公司排队,资源没怎么浪费。
但边缘算力是另一回事。
## 边缘AI推理的真实成本是多少?
AIPC、边缘推理服务器、各种AI加速卡,这些设备正在快速发展,价格也在快速下降。英伟达的DGX Spark三万多,AMD的Ryzen AI Max+ 395甚至不到两万。算力相当可观,能推理不小的模型。
但用得好吗?
我看到的答案是:不好。
问题出在总拥有成本(TCO)上。设备本身便宜了,但其他成本项的比例被暴力放大了。
### 运维成本
一台20万的服务器,一年出两次故障,每次花1000块找技术人员处理,一年2000块。占设备价格的1%,可以忽略。
换成2万块的边缘设备。故障率不会更低——甚至可能更高,因为边缘环境更复杂。还是2000块运维成本。
但这时候占比变成10%了。从1%到10%,放大了十倍。
实际情况更糟。边缘设备现场运维单次成本能到500块一台,而且设备分散、巡检效率低。
### 冷启动成本
设备买回来是一块铁。
怎么把它变成真正的AI算力?怎么把性能发挥出来?
这事儿比想象中难。硬件日新月异,推理引擎五花八门,模型变化太快,异构架构让人头疼。ARM、x86、RISC-V并存,固件版本碎片化。有家企业2000台边缘设备因为固件版本不统一,故障定位耗时增加了3倍。
想用好这些设备,你需要一个懂硬件、懂推理引擎、懂模型、懂应用的人。这样的人月薪两万不算离谱。
但设备本身才两万块。
等于为了用好一台设备,付出100%的溢价。这在商业上不成立。
### 持续使用成本
设备跑起来不是结束,是开始。
2026年,头部大模型厂商的更新速度快到让人眼花。每隔一两个月就有一款重量级新模型发布。谷歌Gemini一年内从2.5迭代到3 Flash,阿里Qwen3系列密集发布,DeepSeek、Kimi轮番登场。
如果你的边缘设备还在跑一年前的模型,它的价值可能只剩10%。
跟上这个节奏意味着持续的升级、适配、测试、部署。这些投入按人头算,不会因为设备便宜了就打折。
## 边缘AI设备需要人来管理吗?
传统软件的解决思路是:设计一套系统,让人来操作。
这套思路有个隐含假设:人是愿意参与的。
但在边缘AI这个场景,这个假设成立吗?
想想电力。人用电,但不参与电力的生产和管理。电力是基础设施,人只管用。没人会觉得需要"参与电力的生产过程"。
边缘AI设备应该一样。
它们是基础设施,不是工具。理想状态是设备自运行、自修复、自升级,永远不出故障。这样的设备[该像路由器一样无聊](/blog/edge-ai-device-blueprint)——扔在角落24小时跑着,人根本不用去想它。
人如果能不参与,那就太好了。
这意味着设计思路的转变:让设备自己管理自己,让人待在循环外面,软件不是人的工具而是设备的"神经系统"。目标不是减轻人的负担,是消除人的参与。
## 怎么做到?
我觉得有几个趋势可以利用。
一个是AI Agent本身的能力在快速增强。如果你的产品不让Agent参与核心流程,那它就跟这个时代脱节了。Agent可以在不需要人干预的情况下完成运维诊断、故障修复、性能调优、模型升级——把那个"需要2万月薪的人"做的事自动化掉。这不是未来时,2026年的Agent能力已经够用了。
另一个是开源社区的协作。边缘AI面临的是一个四维最优解问题:硬件设备乘以推理引擎乘以模型乘以应用。每个维度都在快速变化,单靠一家公司跟不上。但Agent普及之后,基于代码仓的协作变得容易了。产品需要思考的是怎么让更多人和Agent参与进来,共同应对复杂度的增长。
最后是互联网基础设施。边缘设备的特点是零散——AIPC和边缘服务器分布在办公室、工厂、门店、家庭,不像数据中心那样一个机房几千上万台集中管理。要把这些零散设备的价值挖出来,必须用互联网。远程监控、OTA升级、云端协同,这些不是可选项。
## 写在最后
边缘AI的TCO问题,本质上是管理理念的问题。
继续用"以人为中心"的思路设计产品,运维成本会继续放大,冷启动成本会继续高企,持续使用成本会继续吞噬价值。
解决的方向是让AI参与进来。用Agent自动化运维,用社区分摊复杂度,用互联网连接零散设备。
这是我们在做的事情。我们开源了[AIMA](/blog/why-we-built-aima)——用AI管理AI推理的基础设施,目标就是把TCO压到接近硬件加电费。而边端AI的意义不只在成本——它更是一个[权力问题](/blog/edge-ai-power-structure)。
---
### Vibe Coding:每个人都是程序员的时代,真的来了
- URL: https://guanjiawei.ai/zh/blog/vibe-coding
- English: https://guanjiawei.ai/en/blog/vibe-coding
- Published: 2026-02-24
- Tags: AI, 编程, 工具, Vibe Coding
一个下午前,我对着终端窗口说了一句话:"帮我搭一个支持中英双语的个人网站,要有物理引擎做的动画效果。"
然后按了回车。
我一点也不懂前端开发。React我从没写过,Next.js的路由配置对我来说完全陌生。但当天下午,你正在看的这个网站——75个TypeScript文件、29个React组件、一个用Matter.js物理引擎做的可拖拽标签墙、一个接了大语言模型的AI聊天助手——就这样被"聊"出来了。
所有代码都是Claude Code写的。我一个字都没写。
这件事叫vibe coding。一年前,大部分人还没听过这个词。
## Vibe Coding 到底是什么?
2025年2月2日,Andrej Karpathy在X上随手发了一条推文:
> "I just see stuff, say stuff, run stuff, and copy paste stuff, and it mostly works."
他管这种新的编程方式叫vibe coding。你不再逐行写代码,而是用日常语言告诉AI你想要什么,然后看着它把东西做出来。遇到报错,把错误信息丢给它,通常就能修好。代码涨到你根本看不过来的程度,你也不去看了。
Karpathy自己说这就是条"洗澡时想到的随手一发"。但它像是说出了很多人已经在做、却不知道该叫什么的事情。
后来的事情你可能也注意到了——Collins词典把vibe coding选为2025年度词汇,Google上这个词的搜索量暴涨了6700%。一条随手的推文,变成了一场运动的名字。
说白了,vibe coding就一句话:你不需要懂代码,你只需要能说清楚自己想要什么。
## 从补全到对话:AI编程的三次跃迁
AI帮人写代码不是新鲜事。但过去几年经历了三次完全不同的跃迁,搞清楚这中间的区别,才能理解vibe coding到底新在哪。
第一步是代码补全。2021年GitHub推出Copilot的时候,程序员们兴奋了一下——它能根据你写了一半的代码猜出你接下来要写什么。很像手机输入法的联想功能,打字确实快了,但你得自己知道要打什么字。不会编程的人面对Copilot,照样一脸懵。
第二步是代码生成。2023年ChatGPT火了之后,你可以用中文描述一个需求,它给你一段代码。这比Copilot进了一大步,但你还是得理解那段代码,知道往哪放,出了bug还得自己修。就像有了一个手很快但不太靠谱的实习生——能帮忙,但你得盯着。
第三步才是vibe coding。从2025年初开始,Claude Code、Cursor这类工具可以读懂你整个项目的代码库,自己创建文件、改文件、跑测试、修bug,遇到问题还会自己想办法绕过去。你从写代码的人变成了提需求的人。说白了,你变成了产品经理,AI变成了工程团队。
这中间的差别不是程度上的,是性质上的。从"AI帮你写代码"到"你告诉AI要什么",中间跨过了一道坎。就像我在上一篇文章里聊到的,AI不是下一个Copilot,这是一次品类跃迁。
## AI 编程的采用率到底有多高?
去年Y Combinator冬季批次的数据让很多人吃了一惊。YC的CEO [Garry Tan说,这一届25%的创业公司,95%的代码都是AI生成的](https://techcrunch.com/2025/03/06/a-quarter-of-startups-in-ycs-current-cohort-have-codebases-that-are-almost-entirely-ai-generated/)。
YC是全球顶级的创业孵化器,这帮人是正经在拿融资、做产品的。
同期,[Stack Overflow的开发者调查显示84%的程序员在日常工作中使用AI工具](https://survey.stackoverflow.co/2025/ai)。纳德拉[在LlamaCon上说微软自己代码仓库里有20%到30%是AI写的](https://techcrunch.com/2025/04/29/microsoft-ceo-says-up-to-30-of-the-companys-code-was-written-by-ai/)。
[黄仁勋](https://fortune.com/2023/05/30/nvidia-ceo-jensen-huang-everyone-programmer-with-ai-chipmaker-taipei-computex/)讲过一句话,我觉得是对这件事最准确的概括:
> 「每个人都是程序员。新的编程语言叫做人类语言。」
这句话放在两年前听着像愿景。现在回头看,更像是对已经发生的事情的白描。
## 我的亲身实验
回到开头提的这个网站。说实话决定动手的时候,我心里没什么底。
技术栈列出来挺唬人的:Next.js 16、React 19、TypeScript严格模式、Tailwind CSS v4、Velite + MDX内容系统、Matter.js物理引擎。但我对这些东西一窍不通——不是谦虚,是真的完全不懂。
我做的事情就是跟Claude Code对话。所有代码都是它写的,我一个字都没碰过。
首页那个粒子动画——你刷新页面能看到跟着鼠标走的浮动光点——背后是187行的Canvas渲染代码,做了设备像素比适配、暗色模式切换、还检测了用户的"减弱动画"偏好。我对Canvas编程完全不懂,但我能跟AI描述我想要的视觉效果,然后一轮轮地调。
那个可拖拽的物理标签墙更有意思。底层跑的是Matter.js物理引擎,每个标签有重力、有摩擦力、有弹性系数,掉出屏幕还会自动弹回来。262行代码,没有一行是我手打的,都是Claude Code写的。但每一行的存在都是因为我说了类似"标签掉下去了应该能弹回来"这样的话。
还有那个AI聊天助手——299行完整的聊天界面,连着大语言模型API,支持流式输出,中文环境显示微信风格、英文环境切换成WhatsApp风格。
域名配置、DNS设置、Vercel部署这些我完全不懂的东西,也是Claude帮我搞定的——我甚至不知道DNS是什么,就看着Claude在浏览器里点来点去,然后告诉我"好了"。
整个项目就是一个下午的事。如果让我自己从头学这些技术栈再写,我根本不会开始,因为完全不知道从哪里下手。
我不是在旁边看着这场变革发生。我在用它盖房子——虽然我自己一块砖都没搬。
## AI 写的代码真的靠谱吗?
到这里如果我只写好的一面,这篇文章就变成软文了。事情没那么简单。
2025年7月,METR发布了一项严格的对照实验:让经验丰富的开源开发者(平均5年经验、1500次commit那种)用AI工具做他们自己项目的开发任务。结果是:用了AI之后,这些人反而慢了19%。更耐人寻味的是,开发者自己觉得AI让他们快了20%——感知和现实完全反过来了。
另一个数据来自CodeRabbit在2025年底的分析:AI参与编写的代码,严重问题的比例是纯人工代码的1.7倍,安全漏洞更是高了2.74倍。
这些数字是真的,回避没有意义。
但我觉得它们讲的其实是两件不同的事。METR那个实验测的是"专家做自己本来就很熟的工作"——你让一个赛车手一边开车一边给副驾讲解每个弯道怎么过,他当然会慢。但vibe coding的意义从来不是让赛车手更快,而是让原来根本没法上路的人也能开车了。
至于安全漏洞,这说明AI写的代码在上生产环境之前确实需要人审查。但想一想,没有vibe coding的话,这里面很多项目根本就不会存在。该问的问题不是"AI写的代码完不完美",而是"它够不够好,能不能做出之前做不了的东西"。对个人项目、原型验证、内部工具来说,答案很明显。后来我用同样的方式[10天写了30万行代码,然后全删了](/blog/code-is-liability)——那次经历让我真正理解了代码是负债不是资产。
这些问题是真的。但工具在飞速迭代,半年前的短板今天可能已经补上了。方向没有错,路还在修。
## 代码只是开始
如果你到这里还觉得vibe coding只是"不用学编程也能做网站",那就太小看它了。
顺着上一篇文章的思路想:当AI可以把资本直接转化为生产力,中间那个转化机制到底是什么?我觉得答案就是代码。
数字世界运行在代码上。你手机里的每个APP、你用的每个网站、每一笔在线支付的背后都是代码在跑。代码是人类操控数字世界的通用接口。
而vibe coding意味着AI掌握了这个接口。
当AI能可靠地写代码,它就能造软件。能造软件,它就能自动化几乎所有数字化任务——订机票、管日程、分析报表、搭网站、调用各种API。这些事情本质上都是"写一段程序然后运行"的变体。
这就是为什么我在上一篇聊到的AI Agent那么值得关注。Agent要替你在数字世界里办事,它得能操作数字世界。怎么操作?写代码、调API、读写文件。Vibe coding给了Agent这个能力。或者换个说法:vibe coding就是你和AI Agent之间的接口——你用自然语言说出意图,AI用代码把它变成现实。
上一篇说"资本可以绕过人力直接转化为生产力"。Vibe coding就是那条绕过去的路。
## 你的第一步
如果你读到这里,心里可能有两个声音在打架。一个说"这也太酷了",另一个说"但我又不会编程"。
好消息是,第二个声音说的恰恰就是vibe coding要解决的问题。你不需要会编程。你只需要会说话、会打字就行。
我自己用的是Claude Code,Anthropic出的一个终端AI编程工具。安装只需要一行命令。
macOS或Linux用户,打开终端:
```bash
curl -fsSL https://claude.ai/install.sh | bash
```
Windows用户,打开PowerShell:
```powershell
irm https://claude.ai/install.ps1 | iex
```
装完之后,在任意一个文件夹里打开终端,输入 `claude`,然后试着说一句:"帮我写一个计算BMI的小工具。"
看看会发生什么。
你刚才做的这件事情,五年前得有计算机科学学位才能干。三年前得在StackOverflow上翻半天。一年前得把ChatGPT吐出来的代码片段来回粘贴拼凑。
现在你就是说了一句话而已。
工具会继续变快、变聪明,这个方向不会变。五年后回看2026年,它可能就是普通人开始用自然语言"写"软件的元年。与其到时候再回头感慨,不如现在就上手试试。如果你想看更多实战案例,我记录了[用Claude Code把这个官网聊出来的全过程](/blog/from-idea-to-seen)。
---
### AI不是下一个计算机,而是下一场工业革命
- URL: https://guanjiawei.ai/zh/blog/ai-is-not-the-next-computer
- English: https://guanjiawei.ai/en/blog/ai-is-not-the-next-computer
- Published: 2026-02-23
- Tags: AI, 随笔, 经济
## 一个被低估的类比
很多人觉得AI技术的发展可以类比当年计算机的发明,这个说法听着挺合理——计算机改变了世界,AI也在改变世界,所以AI就是"新一代的计算机"。
但黄仁勋有个观点让我觉得挺受启发的:这么类比,可能远远低估了AI的冲击。
为什么?先看一组数字。
全球IT产业的规模大概是1万亿美金,而全球经济总规模是100万亿美金。计算机再怎么厉害,它本质上是一种工具——非常棒的工具,但终究是服务于人的。你得有人来写代码、操作系统、维护服务器,计算机才能发挥作用。所以IT产业经过几十年的发展,做的是那1万亿的盘子。
AI智能体不一样。当Agent技术逐渐成熟,它不再只是辅助人类的工具,而是可以在脱离人干涉的情况下直接交付结果。[Vibe coding](/blog/vibe-coding)就是一个活生生的例子——一个下午,不懂前端的人用自然语言"聊"出一个完整的网站。这意味着AI产业不是在跟传统IT抢那1万亿的预算,而是在向剩下的99万亿生产活动中渗透——那些原来只有人力才能完成的事情。
这是一个质的变化。
## 历史上的几次生产力跃迁
为了理解这个"质变"有多大,值得回顾一下人类历史上几次关键的生产力跃迁。
农业革命让人类从游牧走向定居,但它的核心驱动力是土地和人力。你要产出更多粮食,就需要更多的地和更多的人。生产力的上限被自然资源锁死了。
工业革命引入了机器,第一次让资本可以"替代"一部分人力。一台纺织机顶得上几十个手工纺织工人。但机器需要人来操作、维护、管理。所以工业革命的公式是:资本买机器,机器放大人力,人力产出产品。人始终在链条里面,只是从"直接生产者"变成了"机器操作者"。
信息革命——也就是计算机的发明——进一步提升了效率,但本质上还是同一个模式。Excel让一个会计干五个会计的活,ERP让一个工厂管理者协调十个工厂的产线。计算机是一个极好的放大器,但它放大的还是人的能力。没有人在中间,计算机自己不会产出任何商业价值。
而AI打破了这个规律。它第一次让"无人干预的自主产出"成为可能。不是放大人力,而是在某些环节直接取代人力。这不是量变,是质变。
## 一种全新的经济转化方式
如果顺着这个逻辑往下推,你会发现一个更深层的变化正在发生。
在传统的经济模型里,要把资本转化成产出,中间环节离不开大量的人力。你有钱,你得雇人、培训人、管理人,人去执行,才能把东西做出来。所以生产力的转化链条一直是:资本→人力→产出。
但AI正在改写这个链条。资本投入到算力、电力和模型之后,可以相当程度上直接转变为生产力,不再需要那么大比例的人类劳力介入。这将催生一种全新的经济学模型和生产关系——资本的角色被大幅放大了。
这个变化已经在发生了。看一组数据:微软2025年资本开支超过800亿美金,其中绝大部分投向了AI基础设施——数据中心、GPU集群、电力配套。这些投入直接转化为AI服务的能力,中间不需要成比例地增加员工。传统企业投800亿,可能需要雇十几万人来运转。但AI时代,这800亿买的是算力,算力直接变成生产力。
回顾历史,这种级别的冲击并不常见。农业社会里,生产力主要靠土地和人力,资本没有太多发挥空间。工业革命之后,机器让资本的效率倍增,但你仍然需要大量工人来操作和维护机器。而现在,AI有可能让资本几乎直接兑换成产出。
说AI是下一个计算机?我觉得更准确的类比是蒸汽机——甚至犹有过之。工业革命用了一百年来重塑世界,而AI革命很可能会把这个过程压缩到十年。
## 对行业意味着什么
如果你接受了"AI不是计算机而是工业革命"这个判断,接下来的推论就很清晰了。
首先,AI公司的估值逻辑应该完全不同。传统IT公司的天花板是那1万亿美金的IT预算。但AI公司的天花板是整个99万亿的经济活动。这就解释了为什么市场给Nvidia、OpenAI这些公司的估值看起来"不合理"——用IT产业的框架去理解AI产业,注定会低估它。
其次,每一个传统行业都会被重新做一遍。不是"加一个AI功能"那种做法,而是从根本上重新设计价值链条。比如法律行业:以前一个尽职调查项目需要十几个初级律师花两周翻文件,现在AI可以在几个小时内完成同样的工作。这不是"律所买了个新工具"的故事,而是"律所的人力结构要彻底变了"的故事。
第三,创业的逻辑也变了。以前创业的核心壁垒是团队——你能不能招到最好的工程师、最好的设计师。现在团队依然重要,但AI把"执行力"这个变量从"强相关"变成了"弱相关"。真正的壁垒转移到了对行业的理解、对用户需求的洞察、以及快速迭代的能力上。
## 浪头上的选择
当资本的力量被进一步放大,随之而来的问题就变得很现实了。
历史上每一次生产力的跃迁都伴随着治理方式的变革。蒸汽机带来了工厂制度和劳动法,电力催生了现代公司治理,互联网推动了数据隐私立法。AI这一轮,对应的治理框架是什么?目前还没有答案。
马克思在《资本论》里对资本力量无限膨胀的推演,在过去一百多年里被各种制度设计所缓和。但如果AI真的大幅削弱了人力在生产中的必要性,那些曾经的平衡机制还够用吗?这不是一个遥远的哲学问题,而是一个正在发生的现实挑战。
2026年,我们可能真的站在了百年未有之大变局的浪头上。这不是危言耸听——当一项技术同时改变了生产力的来源和生产关系的结构,它的影响就不只是技术层面的事了。
作为身处行业中的人,我觉得理解这场变革的深度比追逐任何一个具体的技术热点都更重要。工具会迭代,框架会更新,但生产关系的重构,一个世纪可能只发生一次。而当算力可以直接转化为生产力,[谁掌握算力,谁就掌握权力](/blog/edge-ai-power-structure)——这已经不只是商业问题了。
## All Projects
- [AIMA — AI Inference Managed by AI](https://guanjiawei.ai/zh/projects/aima) ★
让 AI 推理部署像安装 App 一样简单。AIMA 自动识别硬件、选择最优配置、一键部署,让每台机器都成为 AI 推理节点。
GitHub: https://github.com/Approaching-AI/AIMA
- [AIMA AMD395 Qwen3.6 35B Linux Engine — AMD395 原生推理引擎](https://guanjiawei.ai/zh/projects/aima-amd395-qwen36-35b-linux-engine) ★
为 AMD Ryzen AI Max+ 395 定制的 Qwen3.6-35B-A3B BF16 原生推理引擎:无需 Python、PyTorch、vLLM 或系统 ROCm,支持 262K 上下文、OpenAI 兼容 API、SSE 流式输出和函数调用。
GitHub: https://github.com/Approaching-AI/AIMA-AMD395-Qwen36-35B-Linux-Engine
- [AIMA AMD395 Qwen3.6 35B Windows Engine — Windows 原生推理引擎](https://guanjiawei.ai/zh/projects/aima-amd395-qwen36-35b-windows-engine) ★
在 AMD Ryzen AI Max+ 395 上原生运行 Qwen3.6-35B-A3B BF16:8K prefill 达 2,126 token/s、decode 达 30.55 token/s,131K 前缀复用场景 TTFT 为 8.59 秒。
GitHub: https://github.com/Approaching-AI/AIMA-AMD395-Qwen36-35B-Windows-Engine
- [AIMA Intel PTL Qwen3.6 35B U4 Engine — Intel GPU 专用推理引擎](https://guanjiawei.ai/zh/projects/aima-intel-ptl-qwen36-35b-u4-engine) ★
面向 Intel PTL / Arc B390 的 Qwen3.6-35B-A3B OpenVINO U4 专用引擎:21/21 性能门通过,prefill 最差 95% LCB 为 1.48×、decode 为 1.59×,10,752 个 greedy token 全部一致。
GitHub: https://github.com/Approaching-AI/AIMA-intel-plk-qwen36-35b-u4-engine
- [AIMA Server — AI 驱动的远程设备运维平台](https://guanjiawei.ai/zh/projects/aima-server) ★
告别 SSH 和手动排查。一行命令连接设备,用自然语言描述需求,AI Agent 自动完成诊断、安装、修复和升级。
GitHub: https://github.com/Approaching-AI/aima-server
- [OpenClaw Feishu Installer — 飞书应用一键安装器](https://guanjiawei.ai/zh/projects/openclaw-feishu-install) ★
把 1 小时的飞书应用配置压缩到 5 分钟。一键自动完成创建应用、配置权限、对接 OpenClaw 的全部流程,让开发者专注于产品而非平台对接。
GitHub: https://github.com/skyguan92/openclaw-feishu-install
## Content Topics
### AI Agents & Agentic Coding
- Claude Code, Cursor, and AI-assisted development
- Coding agent capabilities and workflows
- Vibe Coding practices and methodologies
- AI coding tools evaluation and comparison
### Edge AI & Infrastructure
- Edge inference TCO analysis
- Device blueprints and power structures
- Legal boundaries and compliance
- Deployment architectures for edge AI
### AI Industry Analysis
- Model company endgames and market dynamics
- AI startup bottlenecks and scaling challenges
- Open source AI dynamics and ecosystem evolution
- Technology trend analysis and forecasting
### AI Product Strategy
- Agent trust models and gradual user onboarding
- Zero-friction adoption patterns
- Productivity surplus and pricing dynamics
- Digital identity and platform leverage
## Stats
- Published posts (ZH): 85
- Published posts (EN): 85
- Featured posts: 41
- Projects: 6
- Generated: 2026-08-13