DeepSeek推倒重来:为抢入口不惜重构模型

作者:字母AI 发布时间:2026-09-15 06:09:14
DeepSeek发布V4.1 Flash,采用全新非对称结构,推倒V4架构积累,核心目标是从极客工具DSH切入,抢占Agent时代入口。

DeepSeek V4.1 Flash发布后好评如潮,最大特点是推倒重来,采用了与V4 Flash完全不同的非对称结构,导致V4积累的训练配方与工程适配大部分作废。即便公司已有数百人规模,梁文锋仍下决心重构。

新结构名为CED,将40层主干拆成前20层编码器只负责“读”、后20层解码器只负责“写”,记忆只产生一次,全局KV Cache压至890字节/token,仅为V4 Flash的四分之一。这一设计针对的是Agent时代输入密集的痛点——在代码任务中输入与输出token比高达154:1,旧聊天架构已不堪重负。

更关键的是,V4.1 Flash是被DSH“反哺”出来的。训练让模型在6种Agent框架中反复试错,DSH是最重要训练场。与此同时,DSH更新至v0.1.5,新增文件交付、侧边栏预览,并支持保留KV Cache更新系统提示词,从极客玩具蜕变为产品入口。

梁文锋并非孤例。姚顺雨的Hy4 preview同样走入口闭环路线,与CodeBuddy等产品共建数据,在203个真实工程任务盲测中领先。而智谱与Kimi虽有工具,却更像后挂外壳或闭关修炼,闭环未触达外界。

DeepSeek正效仿吉列模式:模型API可随时替换,但换Harness成本极高。DSH优化体验,既为反哺未来模型,更是为了抢占入口。DeepSeek已在向“入口公司”看齐。

阅读原文

本文由融业云AI采集并编辑,仅供学习使用!

本文来自tmtpost.com,作者字母AI

有问题,请联系客服!http://www.rongyeyun.com/kefu/