
据媒体报导 于DeepSeek-R1 发布一周年之际 新模子“MODEL1” 于开源社区悄然呈现 激发业界存眷 动作几次激发更新推测 2026年1月以来 DeepSeek动作不停 已经陆续发布了两篇技能论文 近日 DeepSeek官方又于GitHub 更新了一系列FlashMLA代码 有开发者统计 于触及的114个文件中 有数十处提到了 此前未公然的 “MODEL1”年夜模子标识符 且该标识符与现有模子 “V32”(即DeepSeek-V3.2) 被并列或者区别援用 经由过程代码上下文阐发 技能人士推测 “MODEL1”年夜几率对于应一款 采用全新架构的AI模子 其焦点技能特性 与现有模子存于较着差异 “MODEL1”的技能暗码 有阐发认为 作为全新架构标识 “MODEL1”与现有模子 有着较着区分 焦点优化重要聚焦三年夜标的目的 一是重构键值缓存存储逻辑 显存占用降低40% 推理速率晋升1.8倍 长文本、长代码处置惩罚时 上风更较着 二是插手稀少FP8解码技能 于晋升运算速率的同时 把信息丧失率压到5%如下 让平凡装备也能跑出高机能 三是适配英伟达最新GPU架构 专门针对于SM90及SM100 (别离对于应H100/H200显卡 B200显卡) 做了参数优化 部门功效仅对于“MODEL1”开放 V3.2没法利用 行业预测:V4还有是R2? 相干报导称 联合今朝模子文件布局来看 “MODEL1”极可能 已经靠近练习完成 或者推理部署阶段 正等候终极的权重冻结 及测实验证 与此同时 “MODEL1”的身份 激发广泛会商 不少不雅点认为 它年夜几率是 DeepSeek V4旗舰模子 内部代号 也有开发者推测 多是R系列模子的迭代版R2 业内阐发指出 “MODEL1”的暴光 印证了DeepSeek的技能线路 差别在竞争算力范围 其更专注 优化工程效率及节制成本 今朝 DeepSeek还没有对于 “MODEL1”作出回应 但这一不测泄露 让全世界AI圈 越发期待DeepSeek团队的技能冲破
