High performance inference engine for diffusion models
Explore Similar Repositories
waste:Run the full 2.78-trillion-parameter Kimi K3 model beyond available RAM by streaming activated weights directly from NVMe. A dependency-free, embeddable C inference engine.