deepseek吧 关注:205,830贴子:703,827
  • 19回复贴,共1

4.1速度猜测。

只看楼主收藏回复

现状是向量化后计算出qvk后再分别计算最后出结果

梁子会不会把直接把输入的向量结果的qvk混在一起然后一起计算出结果


IP属地:河南1楼2026-09-09 12:26回复
    好处是真tm的快,另外这种方式模型上限更高下限也更低了。


    IP属地:河南来自Android客户端2楼2026-09-09 13:01
    回复
      2026-09-16 13:46:40
      广告
      不感兴趣
      开通SVIP免广告
      有没有一种可能只是因为用的人少的缘故?要改模型id已经设置了淘汰99.9%用户的门槛了。


      IP属地:浙江3楼2026-09-09 13:04
      收起回复
        按照上次历次发布时的Dspark增加吐字速度边写边思考。
        以及GPT6循环Transform
        模型们更新方向变更大发散性?


        IP属地:浙江来自Android客户端4楼2026-09-09 13:10
        收起回复
          你这家伙在说什么啊?
          有没可能进入下一层的只有各自的 V 和余弦相似度的加权求和值,余弦相似度由各自的 Q、K 两两计算得出


          IP属地:新疆6楼2026-09-09 14:34
          收起回复
            v4.1 的资源调度 = 四块机制
            1. MoE 稀疏激活 + DeepEP/EPLB/LPLB模型不是每算一个 token 都动用全部参数。MoE 只激活一小部分「专家」,谁被激活由路由决定。EPLB/LPLB 是专家之间的负载均衡——避免某些专家挤爆、某些闲着,把激活压力摊平。这是第一根稀疏轴。
            2. Engram 条件记忆(核心)静态知识(常识、固定模式)不留在模型权重里每次重新算,而是卸载到主机内存,用O(1) 查表、确定性寻址取回(arXiv 2603.10087 讲的就是用 CXL 内存池干这件事,稀疏访问+可预取,天然适合外置)。效果就是论文原话「让早期层免于静态模式重建,把有效深度留给推理」——早期层不用每次从头重算已知模式,省下的深度留给真正难的推理。U 型标度律说的是稀疏分配方案。
            3. DeepSpec 推测解码小模型(draft)快速猜一串 token 草稿,大模型(target)只验证对错。产出的活交给廉价路径批量干,验证的活留给昂贵路径。
            4. DSA 稀疏注意力 + OCR 上下文压缩注意力不全量算(另一根稀疏轴),长上下文先压缩再进模型。压缩换效率。
            一句话概括:让便宜的路径多干活,贵的路径只干关键活——记忆外置让早期层省力、推测解码让验证省力、稀疏化让每次计算省力、压缩让输入省力。四条都是同一个方向:把算力集中到推理的关键节点上。


            IP属地:江苏8楼2026-09-09 16:23
            收起回复