智东西9月10日报道,DeepSeek正式发布DeepSeek V4.1 Flash模型。该模型采用全新架构,是一款552B参数的MoE模型,为DeepSeek全新模型架构系列中尺寸最小的成员,在性能上超越了包括DeepSeek V4 Pro在内的一众旗舰模型。
一、性能全面超越旗舰,定价下调
价格方面,得益于模型架构的创新,DeepSeek下调了V4.1 Flash的定价,保留峰谷定价机制。全新定价为闲时输入(缓存命中)0.02元、未命中1.0元、输出4.0元;高峰时段输入(缓存命中)0.04元,未命中2.0元,输出8.0元。
该模型具备原生多模态视觉理解能力,采用全新的Causal-Encoder-Decoder架构,输入和输出不对称,输入激活参数只有8B,输出激活为16B,成本显著低于同尺寸模型。在新的预训练方式和更大规模强化学习后训练的加持下,这款更小尺寸的模型在Agentic Benchmark等基准测试中超越了DeepSeek V4 Pro、GLM5.3、Kimi-K3等多款前沿旗舰模型。
二、缓存大幅压缩,DeepSeek V4 Pro即将退场
新一代模型在KV Cache缓存效率方面大幅提升。与DeepSeek V4 Flash相比,V4.1 Flash对HBM的需求减少到1/4,对SSD的需求减少到1/8。
此次压缩由架构、缓存精度和部署策略三方协同完成。架构上采用CSA2机制,将全局KV缓存和Top-K索引跨层复用;缓存精度方面,从训练阶段直接用FP4格式存储全局KV缓存;部署一侧新增SWA有界重放机制。这些设计将上下文从4K拉长到1M,单token解码FLOPs只增加约四分之一。
目前,旧版本模型V4 Flash与V4 Flash Vision Exp已下线。DeepSeek宣布将于北京时间9月14日12:00起有序下线V4 Pro,所有请求都将被路由到新模型并按V4.1 Flash单价计费。
三、全力支持开源,生态全量接入
DeepSeek宣布全力支持开源社区进行新模型的推理适配。DeepSeek Harness v0.1.5版本同步上线,针对V4.1 Flash进行了专项训练和优化。
生态方面,腾讯(WorkBuddy、CodeBuddy等)和OpenCode作为官方合作伙伴,已全量接入DeepSeek V4.1 Flash。同期开源的还有DeepJIT,一个轻量级的xPU内核JIT编译库,支持NVIDIA CUDA GPU和华为昇腾NPU两大后端。
原始来源: 智东西 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。