Home / 🧱 AI Foundation Stack / ⚑ Inference / Serving

unixsysdev/llama-turboquant

TurboQuant 3-bit KV-cache quantization for llama.cpp

🧱 AI Foundation Stack βœ“ Commercial OK β˜… 53C++

Commercial license

βœ“ Commercial OKMIT

ε―ε•†η”¨οΌŒι€šεΈΈεͺιœ€δΏη•™θ‘—δ½œζ¬Šθ²ζ˜Ž/授權撝款

Topics

kv-cachellama-cppllm-inferencequantizationturboquant
Ad