model = FastLanguageModel.for_inference(model)messages = [ {"from": "human", "value": "Is 9.11 larger than 9.9?"},]inputs = tokenizer.apply_chat_template( messages, tokenize=True, add_generation_prompt=True, return_tensors="pt",).to("cuda")text_streamer = TextStreamer(tokenizer)_ = model.generate(input_ids=inputs, streamer=text_streamer, max_new_tokens=128, use_cache=True)