device = "cuda:0" if torch.cuda.is_available() else "cpu"# Reload model and tokenizermodel = AutoGPTQForCausalLM.from_quantized( out_dir, device=device, use_triton=True, use_safetensors=True,)tokenizer = AutoTokenizer.from_pretrained(out_dir)