import torch from peft import AutoPeftModelForCausalLM from transformers import AutoTokenizer, pipeline # Path to saved peft adapter model # peft_model_id = args.output_dir # or peft_model_id = "./doplhin-dpo" # Load Model with PEFT adapter model = AutoPeftModelForCausalLM.from_pretrained( peft_model_id, device_map="auto", torch_dtype=torch.float16 ) tokenizer = AutoTokenizer.from_pretrained(peft_model_id) # load into pipeline pipe = pipeline("text-generation", model=model, tokenizer=tokenizer)