好梯子吧 关注:1,150贴子:140
  • 2回复贴,共1

月之暗面kimi宣布算力紧张,暂停会员开放?

只看楼主收藏回复

一定会有这么一天的,曾经2块钱一份的外卖大家又不是没吃过,可能程序员自己吃得最多。
其实一个被大家忽略掉的问题是,进入agent范式以后,改变的不仅仅是用户调用LLM的方式,另外一个被完全颠覆掉的,是云厂的算力资源结构和成本结构。
而这种改变,加上云厂莫名其妙自己作死的动作,让这种几乎不可能成功的脆弱成本结构,进一步的走向脆弱。
Agent把云端AI的主要瓶颈,从计算资源逐渐转移到了驻留资源。——单一用户占用的内存无论是数量还是占用周期都是指数级别的提高,而GPU的利用率大幅度的下降。
在聊天机器人时代,决定峰值并行用户上限的资源往往是算力资源(GPU),你每秒吐出来的token数量够多,你就可以吐完这个用户的查询,卸载kv cache,加载下一个用户的请求,继续吐token。抛开decode阶段的内存带宽瓶颈,你可以认为GPU是在尽可能的贴近瓶颈满负荷的工作。有多少GPU资源,决定了你峰值能同时维护多少用户。显存少一点?问题不大,我算快一点下一个用户的请求就可以继续加载了。因为聊天机器人的kv cache是可以丢弃的,用户重复使用单一的会话概率相对较小,很多会话都是一次性的,「明天天气会好吗」「特朗普昨天吃了麦当劳的什么汉堡啊」,哪怕是长程的对话,用户也不见得能在一天里多次迭代对话内容,为了满足更多的用户使用,先抛弃kv cache,等这个用户哪天想起来继续对话了,大不了从SSD加载或者直接认倒霉再给他从头到尾带着聊天记录算一遍,也没多大问题。


IP属地:山东1楼2026-07-26 00:02回复
    缘之苍穹orz、、天之伤悲. . . 被楼主禁言,将不能再进行回复
    就这样还卖得飞贵


    IP属地:四川来自Android客户端2楼2026-07-26 13:56
    回复
      2026-08-19 06:41:42
      广告
      不感兴趣
      开通SVIP免广告
      ai太烧钱了,现在显卡贵,存储贵,再过两年倒一批


      IP属地:广东来自Android客户端3楼2026-07-27 00:42
      回复