unixsysdev/llama-turboquant
為 llama.cpp 提供 3-bit KV-cache 壓縮以加速推理。
為何上榜
53★ · 近期活躍
商用授權
✓ 可商用MIT
可商用,通常只需保留著作權聲明/授權條款
Topics
kv-cachellama-cppllm-inferencequantizationturboquant
廣告
為 llama.cpp 提供 3-bit KV-cache 壓縮以加速推理。
53★ · 近期活躍
可商用,通常只需保留著作權聲明/授權條款