查看: 114|回复: 0

deepseek v4.1 flash上线

[复制链接]

13

主题

0

回帖

335

积分

管理员

积分
335

论坛元老

发表于 2026-9-11 09:54:41 |陕西来自手机 | 显示全部楼层 |阅读模式

DeepSeek V4.1 Flash 发布:552B新架构,价格屠夫,全面超越Pro!
今天 DeepSeek 正式发布了 V4.1 Flash,这是全新架构系列里最小的一个。9月9日预告,9月10日正式上线。这不是一次常规升级,而是底层架构彻底重构。

一、到底发了什么?

三个关键变化:

· 全新非对称架构:Causal-Encoder-Decoder 结构,输入端只激活 8B 参数,输出端激活 16B,总参数 552B。
· 原生多模态:视觉能力直接塞进基础模型,不再需要单独切换 Vision 模型。
· 三模态合一:快速模式、专家模式、识图模式合并为统一智能模式,自动检测复杂度。说白了,以前你手动选“快速”还是“专家”,现在模型自己判断该用多大算力。

二、架构到底换了什么?

这次架构升级是真正的技术迭代,不是参数堆砌。

· 核心设计:非对称 MoE 结构,总参数 552B,输入激活 8B(输入轻量、输出重载),为什么这么设计?输入阶段主要是理解检索,不需要大算力;输出阶段要生成高质量内容,所以给更多算力。
· KV Cache:砍到初代的 1/437:这是对开发者最实在的升级。与上一代相比,HBM 需求降到 1/4,SSD 需求降到 1/8。直接影响:长对话、Agent 任务的运行成本大幅下降。

三、原生多模态:从“外挂”到“内置”

8月21日上的 V4-Flash-Vision-Exp,本质是两个独立模型拼在一起。V4.1 Flash 把视觉能力直接整合进基础模型:

· 视觉编码器:32层 ViT,hidden size 1024,patch 14。
· 每张图上限 1024 tokens,每个请求最多 600 张图片。
· 原生支持 1M tokens 上下文,最大输出 384K tokens。
· 实际体验:以前要读图,得换模型名、改参数;现在一个模型全搞定,代码不用改。

四、定价:缓存命中价 1 折

9月10日中午12点生效,Flash 全线降价:

· 输入/缓存命中:0.02元(之前0.05元,降 60%)
· 输入/缓存未命中:1.00元(之前1.50元,降 33%)
· 输出:4.00元(之前4.50元,降 11%)
  高峰时段(工作日9:00-12:00, 14:00-18:00)价格翻倍。

注意时间线:8月中旬刚涨价,三周后就降回来。但如果你的任务以生成为主,这波优惠感知不强。实际能省多少?长对话、Agent 任务反反复复带上相同的上下文,缓存命中率大,这波很划算。缓存未命中的纯生成任务只降 11%,聊胜于无。

五、V4 Pro 注意事项

V4.1 Flash 发布后,V4 Pro 被全面超越。官方决定有序下线 V4 Pro:

· 2026年9月14日 12:00 后,deepseek-v4-pro 的所有请求全部路由到 V4.1 Flash。
· 按 V4.1 Flash 单价计费。
· 过渡期建议:底层模型换了,输出风格可能有变化。如果你第一轮对话有严格要求,建议先做一轮回归测试。

六、生态合作

腾讯 WorkBuddy、CodeBuddy 和 OpenCode 作为官方接入方,开发者直接调用即可。

七、和竞品比呢?

这次降价的时间点很微妙:

· 同期智谱发布并开源了 GLM-5.3-Flash,能力对标,价格更便宜。这个模型在正式发布前曾以匿名“Ox-Alpha”身份测试,一度被误认为是谷歌的新模型,后来智谱官方认领,全程跑在国产芯片上。
· 腾讯混元 HY4 在 WorkBuddy 限免。
· DeepSeek 身边少了网友,身边多了朋友,直接抄 ChatGPT 后路。
  开发者首选哪个,就不言而喻了。DeepSeek 这波“降本增效”的组合拳,说白了就是:不跟上就等着掉队。
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|陕ICP备2025075593号-2

在本版发帖
关注公众号
返回顶部