Transformers documentation
Optimum
Get started
Base classes
Models
Preprocessors
Inference
Pipeline API
Generate API
Optimization
Chat with models
Serving
Training
Quantization
OverviewSelecting a quantization methodQuantization concepts Contribute
Quantize on the fly
FP4 and FP8 formats
Calibration-based methods
Load pre-quantized models
Hardware toolkits
Ecosystem integrations
Resources
API
Optimum
Optimum is an optimization library that supports quantization for Intel, Furiosa, ONNX Runtime, GPTQ, and lower-level PyTorch quantization functions. It is designed to enhance performance for specific hardware - Intel CPUs/HPUs, AMD GPUs, Furiosa NPUs, etc. - and model accelerators like ONNX Runtime.
Update on GitHub