跳转到主内容
所有文章

标签:

大模型

11 篇文章

我花顶配的钱,买了个偷偷变笨还给我打暗记的模型

一个我预期一夜跑完的任务,连着三天在原地打转。折腾完 harness 才发现不怪我:Codex 里的 GPT-5.5 被人扒出思考 token 恒定停在 516,平均思考长度从 268 跌到 107。同一周,Claude Code 被逆向出一段专门给中国用户打隐形标记的代码。付了顶配的钱,拿到的却是一个你完全不知道它状态的黑盒。

13 分钟阅读

最强的模型发布了,而我没有“资格”用

GPT 5.5 发布那天,一夜之间 Codex 里就能选了。这次 5.6,三档规格、benchmark 漂亮,我去切模型,下拉框却是空的——只给 20 家合作伙伴,每进一个还要美国政府审批。前阵子我还在担心最强的智能开始论钱,现在我得收回一半:钱能买到的智能,已经算是公平的智能了。

6 分钟阅读

顶尖智能,说断就断

我让 Fable 5 跑一个长任务,回来发现干活的已经被悄悄换成了 Opus 4.8。三天后,这个模型被美国商务部一纸出口管制令全球关停,连盟友都用不了,理由是它太擅长找漏洞。顶尖闭源智能的可得性,正在变成一件系统性的风险。而几乎在同一周,国产开源模型集体接棒。

4 分钟阅读

智能开始论贫富

Fable 5 跑了个硬核任务,15 小时,420 美元。模型确实变强了。但 6 月 22 日之后从Coding Plan订阅移除,按 API 费率买,成本差了一个数量级。谁能用最好的智能,变成了一个纯粹的钱的问题。

3 分钟阅读

模型还在变强,但「最强」已经没有标准答案

一个朋友用模型做小工具,觉得已经够牛了;任务一复杂,就开始反复被告知「我搞定了」但其实没搞定。这背后是一个正在发生的分叉:benchmark 分数挤在天花板、彼此快测不出差异,真实体感却越拉越开。会解最难的题、能可靠办成一件糙活、会探索没有标准答案的问题,正变成三种不同的能力。而最要紧的那一维,恰恰最难测、也最难练。

6 分钟阅读

Opus 4.7 上线前后这两天

昨晚 Opus 4.7 发布,我就没睡成。起来试了试,顺手给 OpenClaude 提了几个 PR 合进了主干,还把 Strix Halo 上 Qwen3-30B 的 prefill 推到了接近 DGX Spark 的水平。Agent 够强之后,一个人能同时做几件事,变成了一个挺具体的问题。

7 分钟阅读

开源社区的 DeepSeek 时刻

调研文生视频的时候发现,中国模型在语言模型开源社区的统治力并没有延伸到所有地方。回头看这三年,从 LLaMA 到千问到 DeepSeek,开源社区经历了什么?现在又在等什么?

5 分钟阅读

六个模型,六种脾气

每天都在切模型。Opus莽但能打,GPT 5.4全面但老跑偏,Gemini有审美改不对bug,三个国产各有各的毛病。用多了你会发现,换模型比调参数更管用。

3 分钟阅读