gpq_res = generate_helper(qtq_pipe) print(f"Latency: {gpq_res['latency']}") print(f"GPU memory: {torch.cuda.memory_allocated() / 1024**3:.2f} GB") print(f"Generated Instruction: {gpq_res['text']}") # Latency: 36.0ms/token # GPU memory: 3.83 GB # Generated Instruction: Write a letter requesting time off