Home / π§± AI Foundation Stack / β‘ Inference / Serving
matt-k-wong/mlx-flash
Flash weight streaming for MLX: run massive models larger than your RAM on Apple Silicon.
Commercial license
β Commercial OKMIT
ε―εη¨οΌιεΈΈεͺιδΏηθδ½ζ¬θ²ζ/ζζ¬ζ’ζ¬Ύ
Topics
apple-siliconlarge-language-modelsllmllm-inferencelm-studiomachine-learningmacosmemory-optimizationmetalmlxoptimizationweight-streaming
Ad