Tech
[Local LLM] strata 极致优化指南(参数篇)64GB RAM + RTX pro 5000 48GB, IQ3_XXS 量化, prefill 4500t/s, decode 180t/s 同时缓存 5 个 262k 会话不重新 prefill
前言:strata 最近已经火出圈了,火到 RAM 又翻了个倍。目前京东自营,海力士颗粒的 64GB 的 DDR5 6000 内存已经几近破万。
十一长假回来,笔者也是暂时小试牛刀了一把,发现有一些关键参数,会直接影响整个 LLM 引擎的本质体验,但是默认值并不是特别合理。所以发个 tips 小文供大家交流。欢迎批评指正。
本文全程手打,无任何 AI 含量,请放心阅读。
1 、Harness 会频繁唤起子代理( sub agent ),导致切换会话 prefill 浪费太多时间,怎么办?
答:开启--conversation-cache-mib
这个参数会让 strata 使用 RAM 来缓存历史对话,从而不让 LLM 反复重新 prefill 老的 session 。增加会话切换时的速度,对于 agent 、harness 场景有奇效。
开启 conversation-cache-mib 后,monitor 面板会有如下展示:
分别表述当期缓存了多少个会话,以及目前占用了多少 RAM 。
这个机制有个痛点:不支持多显卡。
2...
Read the full discussion on V2EX
This article was aggregated from V2EX. Click to join the conversation.
View on V2EX