DeepSeek 发布 V4.1 Flash:架构重构成本降 60%,轻量模型性能反超前代旗舰
深度求索正式上线 DeepSeek V4.1 Flash 模型。作为全新架构下的首款最小尺寸模型,其凭借 552B MoE 底座与全新的 Causal-Encoder-Decoder 结构,在实现原生多模态视觉理解的同时,综合性能超越了前代旗舰 V4 Pro。
深度求索正式上线 DeepSeek V4.1 Flash 模型。作为全新架构下的首款最小尺寸模型,其凭借 552B MoE 底座与全新的 Causal-Encoder-Decoder 结构,在实现原生多模态视觉理解的同时,综合性能超越了前代旗舰 V4 Pro。
大模型推理阶段的算力消耗,很大程度上取决于实际计算时激活的参数总量。DeepSeek V4.1 Flash 的设计初衷在于提高能力上限的同时大幅拉升吞吐速度。
输入与输出阶段激活相同数量的参数,计算资源在线性推导中被同等消耗,无法有效针对 Prompt 理解阶段进行特化省算力。
采用 Causal-Encoder-Decoder 架构:输入激活仅 8B,专注于高效编码上下文;输出激活 16B,保障生成阶段的高质量推理。
这种非对称设计使得模型在处理大规模长文本输入时,算力开销呈现阶梯式下降。
在智能体(Agent)等高频多轮对话场景中,上下文缓存(KV Cache)的命中与存储费用往往构成了整体调用的主要成本。V4.1 Flash 在存储空间优化上取得了突破性进展。
数据来源:企业公开技术说明与发布会演示,待第三方复测。存储需求的陡降直接促成了 API 调用最高 60% 的降价空间。
旧版本模型 V4 Flash 及 V4 Flash Vision Exp 现已下线,相关接口请求已被自动平滑路由至最新的 V4.1 Flash。
模型效率的提升反映了当前行业对算力成本的极致追求。与此同时,全球头部厂商在算力分配与商业化探索上呈现出不同的应对路径。
因 GPT-6 Astra 访问需求激增导致系统压力过大,OpenAI 官方宣布暂停接受每月 200 美元的 Pro 20X 新增订阅,优先保障已有订阅账户与 API 调用的稳定性。
联合杭州市及上城区推出城市级 AI 编程支持行动,针对季卡与年卡提供 44% 至 51% 的大幅度门槛减免,推动开发端工程普惠。
无聊公司(The Boring Company)完成由阿联酋领投的 30 亿美元 D 轮融资,估值达 230 亿美元,资金将用于推进 Prufrock 掘进机研发及当地 150 公里隧道建设。
劳资双方达成新版草案,将利润分享绩效奖金的现金支付比例提高至 50%,以规避过去一年股价大幅波动给员工带来的资产不确定性。
“Pro 订阅对系统压力最大,暂停新增订阅是「影响最小的办法」”
大模型战场的竞争焦点,正在从“单纯堆叠参数量”加速转向“极致的推理成本与架构工程效率”。DeepSeek V4.1 Flash 证明了通过 Causal-Encoder-Decoder 结构与 KV Cache 极小化,轻量端完全可以在极低算力消耗下反超旧旗舰。未来 AI 应用能否大规模商业落地,关键不再仅看智商上限,更看单位 Token 的真实交付成本。