Hugging Face Integrates Nunchaku 4-bit Diffusion into Diffusers Library
SVDQuant-based quantization now runs natively in Diffusers, cutting VRAM requirements from 24GB to 12GB while accelerating inference.
SVDQuant-based quantization now runs natively in Diffusers, cutting VRAM requirements from 24GB to 12GB while accelerating inference.
Researchers introduce a transformer architecture that estimates both probability density and score functions across distributions without retraining.
DiffusionGemma uses parallel text diffusion instead of sequential token generation, achieving 1000+ tokens/sec on H100 GPUs with trade-offs in output quality.
NVIDIA releases diffusion language models at 3B, 8B, and 14B scales that generate and refine tokens in parallel, offering latency improvements for GPU-constrained inference workloads.