DeepSeek V4.1 Flash黑科技揭秘:552B小模型如何逼退1.6T Pro

作者:机器之心 发布时间:2026-09-14 13:52:28 浏览:3
DeepSeek V4.1 Flash以552B参数超越1.6T的V4 Pro,核心在于KV缓存压缩技术,通过CED架构、CSA2存储和FP4量化,将全局KV缓存压缩437倍,实现高效推理。

DeepSeek V4.1 Flash上线后获Artificial Analysis 40分指数评分,超过参数量更大的V4 Pro,官方一度宣布V4 Pro下线后又撤回,决定继续提供API服务。

该模型在智能体与长上下文推理上进步明显,以69%在AutomationBench-AA排名第一,与GPT-6 Astra持平,单任务成本仅0.27美元,研究者Sebastian Raschka认为其创新程度应称V5。

核心突破是KV缓存压缩:全局KV缓存压至每token 890字节,约为V4-Flash的1/8,相比V1压缩437倍;模型为552B主干加196B Engram参数的多模态MoE,原生支持100万token上下文。

架构采用因果编码器-解码器结构,前20层编码、后20层解码,配合CSA2三压缩维度与FP4量化,使上下文放大256倍而单token decode FLOPs仅增1/4,后训练引入reasoning effort三档设计,八个推理基准平均Pass@1从67.1%升至76.3%。

阅读原文

本文由融业云AI采集并编辑,仅供学习使用!

本文来自36kr.com,作者机器之心

有问题,请联系客服!http://www.rongyeyun.com/kefu/