jinnianhui今年会-DeepSeek新模型曝光? 发布时间:2026-09-11 19:02:26

据媒体报导

于DeepSeek-R1

发布一周年之际

新模子“MODEL1”

于开源社区悄然呈现

激发业界存眷

动作几次激发更新推测

2026年1月以来

DeepSeek动作不停

已经陆续发布了两篇技能论文

近日

DeepSeek官方又于GitHub

更新了一系列FlashMLA代码

有开发者统计

于触及的114个文件中

有数十处提到了

此前未公然的

“MODEL1”年夜模子标识符

且该标识符与现有模子

“V32”(即DeepSeek-V3.2)

被并列或者区别援用

经由过程代码上下文阐发

技能人士推测

“MODEL1”年夜几率对于应一款

采用全新架构的AI模子

其焦点技能特性

与现有模子存于较着差异

 

“MODEL1”的技能暗码

有阐发认为

作为全新架构标识

“MODEL1”与现有模子

有着较着区分

焦点优化重要聚焦三年夜标的目的

一是重构键值缓存存储逻辑

显存占用降低40%

推理速率晋升1.8倍

长文本、长代码处置惩罚时

上风更较着

二是插手稀少FP8解码技能

于晋升运算速率的同时

把信息丧失率压到5%如下

让平凡装备也能跑出高机能

三是适配英伟达最新GPU架构

专门针对于SM90及SM100

(别离对于应H100/H200显卡

B200显卡)

做了参数优化

部门功效仅对于“MODEL1”开放

V3.2没法利用

 

行业预测:V4还有是R2?

相干报导称

联合今朝模子文件布局来看

“MODEL1”极可能

已经靠近练习完成

或者推理部署阶段

正等候终极的权重冻结

及测实验证

与此同时

“MODEL1”的身份

激发广泛会商

不少不雅点认为

它年夜几率是

DeepSeek V4旗舰模子

内部代号

也有开发者推测

多是R系列模子的迭代版R2

业内阐发指出

“MODEL1”的暴光

印证了DeepSeek的技能线路

差别在竞争算力范围

其更专注

优化工程效率及节制成本

今朝

DeepSeek还没有对于

“MODEL1”作出回应

但这一不测泄露

让全世界AI圈

越发期待DeepSeek团队的技能冲破

-jinnianhui今年会