DeepSeek V4.1 Flash上线后获Artificial Analysis 40分指数评分,超过参数量更大的V4 Pro,官方一度宣布V4 Pro下线后又撤回,决定继续提供API服务。
该模型在智能体与长上下文推理上进步明显,以69%在AutomationBench-AA排名第一,与GPT-6 Astra持平,单任务成本仅0.27美元,研究者Sebastian Raschka认为其创新程度应称V5。
核心突破是KV缓存压缩:全局KV缓存压至每token 890字节,约为V4-Flash的1/8,相比V1压缩437倍;模型为552B主干加196B Engram参数的多模态MoE,原生支持100万token上下文。
架构采用因果编码器-解码器结构,前20层编码、后20层解码,配合CSA2三压缩维度与FP4量化,使上下文放大256倍而单token decode FLOPs仅增1/4,后训练引入reasoning effort三档设计,八个推理基准平均Pass@1从67.1%升至76.3%。
