目前来说,模型本身用q5,kv缓存用了一篇文章里面测试的结果,上下文到128K,通过了压力测试。相关讨论。
llama-server \
-m ./models/Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q5_K_P.gguf \
--mmproj ./models/mmproj-Qwen3.6-27B-Uncensored-HauhauCS-Aggressive-f16.gguf \
-c 131072 \
--parallel 1 \
-b 2048 \
-ub 512 \
-fa 1 \
-ngl 99 \
-t 16 \
--spec-type draft-mtp \
--cache-type-k q5_0 \
--cache-type-v q4_1 \
--no-mmap \
--temp 0.4 \
--spec-draft-n-max 3 \
--top-p 0.95 \
--top-k 20 \
--host 0.0.0.0 \
--port 8080 \
--tools all
token速度50左右,看占用上下文多少,扯淡够用,输出代码感觉更快点就好了…