前言:strata 最近已经火出圈了,火到 RAM 又翻了个倍。目前京东自营,海力士颗粒的 64GB 的 DDR5 6000 内存已经几近破万。 十一长假回来,笔者也是暂时小试牛刀了一把,发现有一些关键参数,会直接影响整个 LLM 引擎的本质体验,但是默认值并不是特别合理。所以发个 tips 小文供大家交流。欢迎批评指正。 本文全程手打,无任何 AI 含量,请放心阅读。 1 、Harness 会频繁唤起子代理( sub agent ),导致切换会话 prefill 浪费太多时间,怎么办? 答:开启--conversation-cache-mib 这个参数会让 strata 使用 RAM 来缓存历史对话,从而不让 LLM 反复重新 prefill 老的 session 。增加会话切换时的速度,对于 agent 、harness 场景有奇效。 开启 conversation-cache-mib 后,monitor 面板会有如下展示: 分别表述当期缓存了多少个会话,以及目前占用了多少 RAM 。 这个机制有个痛点:不支持多显卡。 2...