# requires: pip install optimum-quanto out = model.generate( **inputs, do_sample=False, max_new_tokens=20, cache_implementation="quantized", cache_config={"nbits": 4, "backend": "quanto"}, ) print(tokenizer.decode(out[0], skip_special_tokens=True))