def generate_text(model, input_text, max_length=50): input_ids = tokenizer.encode(input_text, return_tensors='pt').to(device) output = model.generate(inputs=input_ids, max_length=max_length, do_sample=True, top_k=30, pad_token_id=tokenizer.eos_token_id, attention_mask=input_ids.new_ones(input_ids.shape)) return tokenizer.decode(output[0], skip_special_tokens=True) # Generate text with original and quantized models original_text = generate_text(model, "I have a dream") absmax_text = generate_text(model_abs, "I have a dream") zp_text = generate_text(model_zp, "I have a dream") print(f"Original model:n{original_text}") print("-" * 50) print(f"Absmax model:n{absmax_text}") print("-" * 50) print(f"Zeropoint model:n{zp_text}")