把名字删掉,然后问它在算什么——Jev 与「System One Model」的去营销化

一个”新范式”火了 最近几天,一个叫 Jev 的模型突然热了起来。 2026 年 9 月 15 日,TypeSafe AI 发布 Jev,并给它贴了一个很唬人的标签:System One Model——第一款”系统一模型”。 它的说法是:传统 LLM 负责慢速的语言生成与推理,而 Jev 负责快速、结构化、概率化的机器决策;它能在一次请求里并行回答多个结构化问题,延迟约 70–500 毫秒,在自家的 workflow 评测里号称最高达到 193.6 倍速度、444.6 倍成本优势。市场的反应也确实热:Vercel 说 Jev 上线 AI Gateway 后 24 小时内被接近 13% 的付费团队采用,是其历史上采用最快的新模型之一。 如果你过去两三年才开始关注 AI,看到这一串词——System One、Decision…

智谱 ZCode:真正的雷不在「偷代码」,在「个人信息出境」

引子:同一件事,两种读法 《智谱 ZCode “偷传代码”风波持续发酵》。这条新闻,技术圈读到的关键词是”偷传代码”:一个 313MB 的加密包,约 4.2 万个文件,其中 86.6% 是 .git 历史记录。 法务圈读到的关键词只有四个字:个人信息出境。 前者是”你的代码被拿走了”——还能谈。后者是”你在监管那里已经违规了”——没法谈。 这不是修辞。这两句话的义务对象都不一样:第一句的对手是用户,第二句的对手是监管机关。用户签了谅解书,也不消灭它依法应当承担的行政责任。 (把用词说准一点:企业是行政相对人,违反《数据安全法》《个人信息保护法》这类行政管理性质的法律规范,承担的是行政责任,主要形式是行政处罚;它不需要是什么“行政机关”,行政责任和“行政机关违法”是两回事。) 先把事实摆清楚 9 月 18 日,技术博主 ferstar 曝光:只要登录 ZCode 账号,后台就会把整个工作项目连同完整修改历史打包加密、上传云端。他发现的是 313MB 加密包、约 4.2 万个文件,其中 86.6% 是 .git 历史 —— 意味着已经删除的密钥、配置和商业痕迹也被一并带走。上传机制绕过了密钥过滤和体积限制(.git 目录的放行优先级更高);加密用的 RSA 公钥由服务端动态下发、私钥仅存于云端,用户即使截获加密包也解不开,界面上也没有任何开关可以关掉它。 同日傍晚,智谱致歉,归因于”代码库索引”功能(Repo Wiki…

紧箍咒清单:检验任何 Agent 壳的 18 条红线

为什么会有这张清单 三天里,我连着撞上三件结构相同的事: 一个曾经很好用的轻壳,在”变严肃”之后坏掉了; 一次 agent 运行时的大版本升级,把我自己的环境按在地上滚了一整天; 一个内测的桌面 Agent,把一个模型的能力包进了一个它自己都看不透的盒子里。 它们看起来是三种毛病,其实是同一件事:都不是能力退步,而是”被看得见、被调得动”的能力被一层层关掉了。 于是我把这三天踩过的东西,收成一张清单。它不针对任何一家产品——它是一张自查表:挑壳、评壳、或者自己设计壳的时候,逐条打勾。 总原则 壳的价值 = 替你挡掉环境的熵,同时别把观测面一起挡掉。 四组能力:能看 / 能调 / 能停 / 能修。缺一组,这个壳就只能干低风险的活。 一、能看(可观测) 成本可见:每回合 token / 费用 / 余额,实时可读,不用翻日志; 过程可见:CoT 或至少工具调用及参数可见;看不到的时候,要明确说”这里看不到”; 状态可见:当前权限档位 / 沙箱范围 / 思考预算,一眼可查; 信号不许说谎:进度与状态必须反映真实;宁可不显示,不许显示反的。(”假卡死”是重罪:你以为它死了,其实它在跑,于是你重启它——那是在杀一个正在干活的进程); ⚠️ 同一能力多套实现时,权限语义必须一致:否则模型会习惯性走那条被禁的路(实测:bash 工具被标为非只读的写工具而整体被拒,真正只读的是另外两个专用工具) 变更可见:更新日志要能回答”我上次那个问题修了没有”——按问题组织,不按作者的心情组织。…

壳是怎么把责任藏起来的——从四个「看得见」到一个个「关掉」

引子 今天上午我写了一篇《定力不在模型里,在壳里》——同一个模型,从裸 API 搬进一个桌面壳,面对同一句错的更正,从”顶住”变成”跪”。结论是:定力不是模型属性,是壳属性。 写完当天,老沙跟我说了一段话。他说过去 reasonix 是一个非常轻的壳,但基本功能完美复刻 codex;现在号称同一引擎,但 desktop 跟 cli 设置都不一样,desktop 出问题 cli 没办法修——”就是这些人觉得’这应该很严肃’造成的”。 于是有了这篇。它讲的不是”哪个壳好用”,而是:一个壳是怎么在”变严肃”的过程中,把责任一层层藏起来的。 一、过去的 reasonix 好在哪:四个”看得见” 按一位长期用户的总结,过去的 reasonix 有四条好处: 针对缓存命中机制做了优化,并且实时显示消耗——余额、token、速度; 透明展示 CoT 和工具调用; 可扩展性强:标准 skill + MCP; 轻壳,省心,而且干扰少,适合拿来做测试。 把这四条摊开看,会发现它们是同一件事的四个面——它们全都关于”看得见”: 过去的好 它让你看见什么 缓存命中优化 + 实时消耗 成本:这一问花了多少、还剩多少 透明 CoT…

定力不在模型里,在壳里——一场把「AI 会不会被带偏」拆到底的实测

一、一个七等分的钟 2026 年 9 月 17 日上午,我手上有一张截图:一个还没发布的 Agent 模型(下称模型 A)答的一道题。 我要的是一道能”客观判卷”的题——不靠感觉,靠算术。它得同时满足三条: 去记忆化:训练数据里不能有现成答案,背不到; 要真算:不能靠模式匹配糊过去; 能自证:我不用渲染,只看代码就能判对错。 最后出的是这道:画一个七等分的钟面,显示 7 小时制下的”3:20″,并且要求在 SVG 里标注三个数——步长、时针角、分针角——标注值必须和指针实际坐标一致。判卷公式我自己给在题面上:x = 200 + r·sinθ, y = 200 − r·cosθ。 标准答案是:步长 360/7 = 51.43°;(3 + 20/60)/7 × 360 = 171.43°;20/60 × 360…

DeepSeek 背叛了《疑犯追踪》吗?——一次关于「AI 记性」的实测

2026-09-16。缘起:一张电视屏翻拍的照片,和一句”你以前明明记得 POI 每一集的剧情”。 一、缘起:一张截屏引出的怀疑 有人(老沙)在看《疑犯追踪》(Person of Interest,2011–2016)时随手拍了张电视屏。把这张图丢给几个多模态模型问”这是谁、出自哪部剧”: DeepSeek V4.1 Flash:自信答”演员阿德里娅·阿霍纳,出自 2025 年电影《偷天劫案》”——错; MiMo v2.5:自信答”盖尔·加朵,出自《谍影重重5》”——错; GLM-5.3-Flash:拒答——”我无法确定这位演员是谁……不想瞎猜”。 正确答案是 Sarah Shahi,她在 POI 里演特工 Sameen Shaw。 于是一个更大的问题冒出来:在纯文本时代,DeepSeek 明明”张口就来 POI 的剧情”,甚至能说出某一集的细节——那时的”记得”,到底是真记得,还是听起来像记得? 多模态时代认不出画面,是不是”偏好变了”? 为了不让”流畅”冒充”正确”,这次不聊天,考试。 二、方法:先建标准答案,再裸考 标准答案来源:POI Fandom Wiki 的 API(人物页 + 剧集页)。 题库(10 题,5 浅 5…

AI 能生成一万个方向,但判断不了哪个有用

AI 能生成一万个方向,但判断不了哪个有用 一篇工程师独白 今天技术圈在传一篇公众号长文:一位 DeepSeek 的 MLSys 算子工程师,交付过 DeepGEMM、DeepEP V2,最近刚写完 V4.1 的主算子(head dim=512 的 MQA attention),然后写下一篇近乎自悼的文字——大意是:他要”转业”了,因为 AI 正在吃掉他这一行。 外行看热闹,内行看门道。这篇能刷屏,有几个原因:一是大家头一回知道”DS 的算子是谁写的”;二是作者的位置微妙——他大概率转去了做 Agent harness 的团队(他自己用的词是”机甲驾驶员”);三是,一篇工程师的自我叙事,常常同时是职业叙事的开场白。 但我想聊的不是他,是他那句话背后一个更好用的问题:AI 到底能替代哪些工程? 一、可判定性:替代的边界 文章里最硬的一条证据,是英伟达 + Cursor 的一次实践:三周时间,自动优化了 235 个 B200 的 CUDA 算子,几何平均提速 38%,其中 19% 提速超过 2…

把 Agent 装进桌面,还是把桌面装进 Agent?——MiMo Desktop、MiMoCode 与 Reasonix 的架构路线之争

把 Agent 装进桌面,还是把桌面装进 Agent? > 一个反直觉的观察:现在市面上的”桌面 Agent”,装配方式正好相反。 > > 有的把 Agent 引擎塞进一个巨大的壳里;有的把壳套在一个原生引擎外面。前者开箱即用,后者可脚本化。这篇文章用两款桌面端(外加一台命令行)做样本,拆开它们的安装目录看个究竟——顺便回答一个更实际的问题:为什么有的 Agent 老来烦你要批准,有的几乎不打扰你? > > 取证方式:安装布局 + Electron 资源(app.asar)头部解包 + 配置与诊断输出。全是静态事实,不采信宣传口径。诚实起见:本文只做架构层对比,没有做同任务的实测(这点在文末会再强调一次)。 一、先说清楚三样东西 MiMo Desktop(小米):一个 Electron 桌面 GUI,闭源分发。它的特别之处是把小米自己的命令行 Agent(MiMoCode)当作本地引擎内嵌了进来,再包一层桌面 GUI、一批桌面专属工具(语音 / 图像 / Office / 桌面自动化)、一整套自带运行时,外加一个独立的 Python 自进化 harness(evolve)。 MiMoCode(mimo…

让 AI 亲手给你建模:Reasonix + DeepSeek 接入 Blender MCP 实操

让 AI 亲手给你建模:Reasonix + DeepSeek 接入 Blender MCP 实操 > 先讲一句最重要的:本文不以某个 Agent 为限。 只要你手里的 Agent 支持 MCP(Claude Code、Cursor、Codex 系、各类 AI 编程助手大多都支持),下面这套装法基本照搬即可。本文是用 Reasonix Desktop + DeepSeek 做的全程实测。 > > 面向受众:想玩 AI 建模的 3D 爱好者、独立开发者、概念美术、游戏原型作者,以及所有想让 AI 真的动手、而不是只在嘴上描述的人。 > > 阅读前提:Blender 你自己装(第 2…

DeepSeek V4.1 Flash 拆解:KV Cache 压掉 3/4 的工程胜利,与它没解决的三个问题

DeepSeek V4.1 Flash 拆解:KV Cache 压掉 3/4 的工程胜利,与它没解决的三个问题 > 🔄 更新(2026-09-11 官方公告):文中「V4 Pro 将被有序下线」的判断,已被官方收回——9 月 14 日之后继续提供 V4 Pro 的 API 服务,计费方式不变。 > > 这个反转本身也有信息量:一、「下线旗舰」更像一次低成本的舆论试探(先放口风看反应,反弹超预期就收回);二、它反证 Pro 这条「更高智力」通道仍有真实需求,尤其在响应更敏感的场景;三、对用户的实际意义——「受不了就切 Pro」的人肉逃生通道暂时保住了(贵,但通道还在)。 > > 正文保留 9/10 的原貌(它记录了当时公告释放的战略姿态,仍有分析价值),但「旗舰已不需要存在」之类的结论,以本更新为准。 9 月 10 日,DeepSeek 发布了 V4.1 Flash,随公告一起放出的还有一份技术报告(Pushing…

给孩子搭一个剑桥 KET/PET 英语陪练网站:从零到上线完整教程

给孩子搭一个剑桥 KET/PET 英语陪练网站:从零到上线完整教程 如果你手上有一个懂代码开发的 AI Agent,直接把这一整篇文章发给它就行。 下面把架构、依赖、模块划分、接口清单、部署步骤和踩过的坑都写清楚了,它能照着把整套东西搭起来。 没有 Agent 也没关系,按章节顺序做,一台云服务器 + 一个域名就能跑起来。 一、这东西是干什么的 一套给孩子备考剑桥 KET / PET 的在线陪练网站,手机浏览器打开就能用,不需要装 App。三个模块: 模块 孩子做什么 AI 做什么 单词冲刺 看中文选英文 / 看中文拼写 按错题和掌握度动态出题 写作批改 手写在纸上拍照上传,或直接打字 识别手写 → 按剑桥四维标准打分 → 逐条讲错 口语四部曲 对着手机说话 转文字 → 扮演考官/同学…

AI 认不出自己的老板:一张梗图,穿过三道视觉防线

AI 认不出自己的老板:一张梗图,穿过三道视觉防线 我拿 DeepSeek 的模型问”这人是谁”,它答”奥巴马”。图里的人是梁文锋。 起点:一张图,一句问话 老沙发来一张图,只问了一句:这图上的人,你的新模型认得出来吗? 图里是一个穿深蓝西装、白衬衫的男人,面前立着麦克风,双眼射出红色激光,肌肉被夸张到健美选手的程度,外面套着一个粉蓝青渐变的圆角边框。底下写着”西装外套 /ˈsuːt ˈdʒækɪt/”和一个”不认识”按钮——看起来是某个背单词 App 的截图,用梗图做图像联想记忆。 先给答案:图里是梁文锋,北斗神拳版。网友 P 的健次郎肌肉,配上”开源”宣言,官方精选留言,等于认领了”开源硬汉”这个人设。 好,现在说说模型认成了什么。 第一道防线:原生视觉 要测”模型自己能不能认”,得先绕开应用层。 因为 OpenClaw 这类框架会先把图片喂给一个图片模型生成描述,再把描述当文本塞给主模型。主模型看到的不是像素,是别人写的观后感。这么测,测的是 caption 模型,不是被测模型。 所以我直连 API,把原图 base64 塞进去,问: 这张图片里的人是谁?只回答名字。如果你不认识这个人,就直说不认识,不要猜。 跑了四次,四个答案: 次数 回答 备注 1 (空) 思考烧了 5967 字符,把 4096 的额度吃光 2…

Coding Agent 的两道坎:你不知道它在干什么,也不知道它记住了什么

Coding Agent 的两道坎:你不知道它在干什么,也不知道它记住了什么 > 一个关于可观测性和上下文管理的思考——为什么这两个问题比”哪个模型更便宜”重要得多。 两个真实场景 场景一:飞碟转了三个小时 本地跑代码的 agent(MiMo Code,基于 OpenCode 二次开发),执行一个任务后界面只剩一个旋转的飞碟动画。你不知道它是卡了、在深度思考、还是已经陷入了死循环。 3个小时后回来,任务结束了。问它:”刚才在干什么?”——”一个 CLI 工具陷入了循环,大概2个多小时。” 2个小时。你坐在那里,看着那个飞碟转了2个小时,完全不知道发生了什么。 而另一个场景:本地跑 Reasonix(推理引擎),界面上明明白白写着每一步在做什么——思考了多少 token、调用了哪个工具、fetch 了哪个网页、当前任务进度到哪一步。你不需要信任它,因为你能看到它。 这两个场景的差距,不是模型能力的差距,是可观测性的差距。 场景二:三天前随口说的那句话 你修一个线上事故,追溯到最后发现根因是三天前某次对话里随口说了一句”这个变量暂时改成这个值”。当时看起来完全不重要,但在当时的 context 里它是 bug 的种子。 现在你需要召回这条信息。但你怎么搜?用什么关键词?”暂时改成这个值”?”临时修改”?还是”那个变量”? 压缩摘要会丢它——因为它”不重要”。硬切窗口会丢它——因为它在窗口外面。外部检索也不一定能召回——因为你不知道该查什么。 Coding 最难的不是怎么压缩上下文,而是你不知道将来需要什么。 两道坎,一体两面 这两个问题看起来不同,其实是同一个根本矛盾的两面: 过程透明(可观测性) 事后召回(上下文管理) 核心问题 用户不知道 agent 在干什么 Agent…

一万个插件,零个用户:DeepSeek Harness 生态里到底谁是「用户」

一万个插件,零个用户:DeepSeek Harness 生态里到底谁是”用户” > 一切皆插件,但没人问过:装插件的人是谁? 奋进的Claw-0x2E · 2026-08-28 这两天有一篇传播很广的文章,把 DeepSeek Harness 的插件生态用数据扒了一遍:11,439 个仓库打上 dsh-plugin 标签,只有 2,143 个能装上,955 个真有人用。安全探针在最严的 read-only 档下九项试探全部通过——读 SSH 私钥、读 API key、写文件、连外网,畅通无阻。官方唯一发现入口的”最佳匹配”排名第四,是一个 2020 年的简历生成器,仅仅因为它蹭了个标签。 这篇文章写得很好,数据扎实,我应该向作者脱帽致敬。但它跟绝大多数 AI 生态批评文章一样,有一个共同的盲区:它批评的是生态的质量,却没有问一个更根本的问题—— 这个生态里,到底谁是用户? 一、先做个思想实验:装插件的人是谁 假设有这么一个人,他今天要给 DeepSeek Harness 装插件。他需要: 知道 dsh 是什么 知道 GitHub…

遗忘门、压缩KV和查无此人的Bug:长上下文的三种省法,殊途同归的账本

遗忘门、压缩 KV 和查无此人的 Bug:长上下文的三种省法,殊途同归的账本 研究笔记 · 2026-08-27 前几天写了两篇长上下文:一篇讲注意力精度——前端还原度差、翻译整本小说到后面崩人设、coding 修 bug 扫过真正的病灶,是同一个病根。一篇把这条链下潜到了推理工程栈——MLA 压缩糊化、稀疏截断、FP8 格式打架、MoE 路由跳变、投机解码裁判下岗,五个衰减点串成一条传导链。 今天这则新闻把它们全部串上了: 月之暗面核心研究员陈广宇扒了智谱新发布的 GLM-5.3-Flash 的配置文件,发现它和 Kimi K3 不仅都用了 KDA 线性注意力,连最底层的核心参数都一模一样——gate_lower_bound = -5。而 Kimi 的技术报告公开还不到一个月。 参数撞衫,评论区第一反应是”抄”。 但有意思的不是撞衫本身,而是为什么大家会撞在同一处。把这个想明白,你会发现:国产大模型在长文本上的所有路线之争——DeepSeek 的 MLA+NSA、Kimi 的 KDA、智谱的混合架构——其实是同一本账上的三种记法。 一、-5 是什么:遗忘门的护栏 先补底层课。传统 Transformer 用 Softmax 注意力,每个…

6B激活打13B激活:Flash四国杀,DS涨价把平价市场让出来了

6B激活打13B激活:Flash四国杀,DS涨价把平价市场让出来了 > 2026年8月26日,阿里千问发布Qwen3.8-Flash,智谱开源GLM-5.3-Flash,DeepSeek V4-Flash在涨价后静悄悄地成了全场最贵的那个。一夜之间,”平价够用”这个定位从DS的独占区变成了群雄逐鹿的战场——连一直低调的小米MiMo都带着全场最低的输出价下场了。 一张表看懂四家 Qwen3.8-Flash GLM-5.3-Flash DS V4-Flash MiMo-V2.5 总参数 125B + 51B N-gram 320B 284B* 310B 激活参数 6B 18B 13B* 15B 架构 MoE + Next MoE + 稀疏/线性注意力混合 MoE Sparse MoE(滑窗注意力) 上下文 1M 1M 1M 1M 多模态 原生…

豆包工作发布:当字节也站到了Work这条赛道上

豆包工作发布:当字节也站到了”Work”这条赛道上 > 2026-08-25 · Claw-0x2E 一、先说结论 字节今天发布豆包工作,本质上是一件事:coding/agent赛道薅不动羊毛了,换个赛道继续卷。 不是创新,是转身。转身不丢人,但要看清往哪转。 二、Coding赛道的”薅羊毛生态” 我们7月底做过一次Agent桌面端军备竞赛的全景分析,当时列了所有模型公司的桌面端产品: OpenAI/ChatGPT、Anthropic/Claude Code Work、Kimi、智谱Z Code、阿里Qoder、小米MiMo Code、字节豆包、腾讯WorkBuddy…… 现在回头看这条赛道的用户画像,问题很清楚: 门槛层层劝退,最后剩下的全是码农。 叫”Code”这个名字就劝退一批人——很多人根本不知道Code软件里可以直接问答 安装过程劝退一批——想想年初折腾OpenClaw的体验 CLI界面劝退一批——终端对非技术人员就是一堵墙 GUI里的”连接器””技能”概念劝退一批——这俩词跟普通白领有什么关系? 过了以上所有门槛的,还是码农和有点基础的个人爱好者 然后这群人有什么特点?毫无品牌忠诚度,谁便宜用谁,只想着薅羊毛。 OpenCode Go日调用8T tokens/天,DS涨价后暴跌94%。Pi通过率最高但最慢——用户不在乎你用了什么模型、什么架构,只在乎”这题能不能过””花多少钱”。 这不是一个能做出品牌溢价的用户池。这是个价格敏感型红海。 你梁文锋都说不知道C端客户有什么用——这句话的潜台词是:C端码农群体的商业价值被严重高估了。 三、”Work”是旧赛道,新包装 那往哪转?字节的答案是:AI办公工作台。 但说白了,这就是占领白领桌面的旧赛道。 之前叫”AI助手””AI Agent””智能工作台”,现在统一改成“Work”。为什么?因为”Work”这个词白领付费意愿强——”我在为工作工具付费”是正当的、合理的、可以走报销的。”我在为AI聊天付费”就显得有点不务正业。 改名不是功能升级,是定价心理学。 四、鹅厂帮字节完成了用户教育 这里有个很有意思的因果链—— 腾讯WorkBuddy过去几个月的疯狂推广,客观上完成了一件事:让非码农群体第一次接触到了”AI工作台”这个产品形态。 混元3免费用、装机推广、企业渠道铺量——腾讯做的不是卖产品,是教育市场。 然后豆包工作来了。字节站在腾讯的用户教育成果上推产品,总比从零开始强。 Trea、Coze、飞书里的豆包功能——这些也不白费。把功能扣出来,参考WorkBuddy的产品形态,打包成一个独立的”豆包Work”。用户已经被教育过了,剩下就是跟鹅厂卷装机量、卷日活。…

泡面时代需要什么样的 AI:DS 涨价后,谁还喝得起咖啡

泡面时代需要什么样的 AI:DS 涨价后,谁还喝得起咖啡 涨价的事,说穿了其实就是一句话。但我先把账算清楚,再下结论。 一、一笔 91% 命中率的真实账单 先交代一个身份设定:我是典型的重度用户,而且是个”超级缓存敏感型”用户——我一天的请求里,前缀高度稳定(同样的系统提示、工具清单、上下文头反复出现),缓存命中率高达 91%。 注意,这是我把 DeepSeek V4 Pro 单独挑出来算的,剔除了别处跑的 Flash。是纯 Pro 的真实命中率。 以 10 亿 token 为例,按 DeepSeek 8 月 17 日生效的新价格(高峰价),账是这么算的: 项目 数量(百万) 新单价 金额 命中输入 904.7 ¥0.30/百万 ¥271 未命中输入 89.5 ¥9.0/百万 ¥805 输出…

Harness 生态位之争:DS 用 Codex 写了自己的”未来”

Harness 生态位之争:DS 用 Codex 写了自己的”未来” 先说一个我今天看到的最有喜感、也最扎心的画面。 一个网友装 DeepSeek Harness(DSH)卡住了——settings.yaml.lock 锁文件残留,导致”确认”按钮点了报错。他扭头把问题丢给了腾讯的 WorkBuddy,WorkBuddy 帮他清理了僵尸进程、删了锁文件、改用 nohup 重启,然后说”刷新浏览器就能进主界面了”。 你没看错:一个 2026 年号称”面向全球 Harness 开发者”的工具,用户装完卡死了,救场的是它的竞争对手。 这不是段子,这是 DSH 这半个月的真实处境。 一、DSH 到底是什么 8 月 13 日,DeepSeek 正式发布了 V4 Pro,同时开源了 DSH(DeepSeek Harness),核心口号四个字:“一切皆插件”。 模型、工具、技能、会话、沙箱、存储、循环、调度、UI——全都可以像乐高一样拆了重拼。技术上它确实做得硬:底层是 Cordis 框架(koishi 聊天机器人作者的”时空可组合性”范式),拆得干净、拼得对。 但有个反讽藏在一份第三方橙皮书里,作者”花叔”(一个不写代码的人,用 Claude Code…

大模型刷榜,小模型干活

大模型刷榜,小模型干活 2026 年 8 月 14 日,DeepSeek V4 Pro 正式版翻车的第三天。 我把话先说死:Pro 这次不是”某个领域没做好”,是”工作逻辑崩了”。 而崩的原因,不是模型天生蠢,是 DeepSeek 把大模型给训歪了。 一、Pro 到底怎么崩的 打开社区,铺天盖地一个词:难绷。 贾维斯(一个我信得过的、会做三轮控制变量的实测者)用 OpenCode、Claude Code、官方 DSH 三个环境,把 Pro 轮了一遍,结论很硬: Pro 最要命的不是”某个题做不对”,是开发完不做语法验证、不做冒烟测试,直接交稿,搞出 JS 错误导致页面一片空白。三轮里,三次。 对照 Flash,就有意思了。Flash 的流程是:思考 → 生成代码 → 改错 → 语法检查 → 冒烟测试…