DeepSeek V4.1 Flash上线,总参数552B,采用非对称结构,输入激活仅8B,推理成本大降,并原生支持多模态视觉理解。
通过KV Cache压缩,显存需求降至上一代1/4,社区实测输出速度达300-500 tokens/秒,基准全面超越V4 Pro,GPQA Diamond达90.9。
价格同步下调:闲时缓存命中输入0.02元、未命中1元、输出4元/百万token,高峰翻倍;负责人崔添翼称V4 Pro请求将路由至V4.1 Flash并按Flash价格计费,被网友戏称“赛博义父”。
文章指出,西方大厂靠重置额度维系用户,国内厂商靠技术升级直接降价抢市场,背后是市场成熟度差异。
