Home / 🧱 AI Foundation Stack / ⚑ Inference / Serving

matt-k-wong/mlx-flash

Flash weight streaming for MLX: run massive models larger than your RAM on Apple Silicon.

🧱 AI Foundation Stack βœ“ Commercial OK β˜… 119Python

Commercial license

βœ“ Commercial OKMIT

ε―ε•†η”¨οΌŒι€šεΈΈεͺιœ€δΏη•™θ‘—δ½œζ¬Šθ²ζ˜Ž/授權撝款

Topics

apple-siliconlarge-language-modelsllmllm-inferencelm-studiomachine-learningmacosmemory-optimizationmetalmlxoptimizationweight-streaming
Ad