Home / 🧱 AI Foundation Stack / πŸ“š RAG / Retrieval / Vector DB

Sandermage/sndr_core_engine

SNDR Core Engine (Genesis) β€” vLLM runtime patch-overlay for Qwen3.6 + Gemma4 on consumer NVIDIA (Ampere sm_86, 2Γ— A5000/3090). Qwen3.6-35B-A3B FP8 ~240 tok/s, 27B-int4 hybrid GDN+Mamba, Gemma4 26B/31B AWQ, 256K ctx. 321 patches: TurboQuant k8v4 KV, MTP/DFlash spec-decode, FULL cudagraph, hybrid GDN. vLLM pin dev424 + Control Center GUI.

🧱 AI Foundation Stack βœ“ Commercial OK β˜… 125Python

Commercial license

βœ“ Commercial OKApache-2.0

ε―ε•†η”¨οΌŒι€šεΈΈεͺιœ€δΏη•™θ‘—δ½œζ¬Šθ²ζ˜Ž/授權撝款

Topics

awqconsumer-gpucudagemmakv-cache-quantizationllm-inferencellm-servinglocal-llmmemorypgvectorquantizationqwen
Ad