DeepSeek V4.1 Flash采用与V4完全不同的非对称结构,旧架构已装不下新训练目标,V4积累的训练配方与工程适配大部分作废。
该模型由DSH反哺而来,后训练沿用标准范式,实质变化在数据流水线:大规模合成Agent任务,让模型在6种框架中反复试错。
新结构CED将40层拆为编码器与解码器,配合CSA2把全局KV Cache压至890字节/token,仅为V4 Flash四分之一,以应对Agent时代高达154:1的输入输出token比。
DSH同步升级为大众产品入口,DeepSeek效仿吉列模式以Harness锁定用户,而腾讯、智谱、月之暗面虽各有布局,真正触达外部入口的只有DSH与WorkBuddy。
