from transformers import AutoTokenizer # Model id to load the tokenizer model_id = "bert-base-uncased" # Load Tokenizer tokenizer = AutoTokenizer.from_pretrained(model_id) # Tokenize helper function def tokenize(batch): return tokenizer(batch['text'], padding='max_length', truncation=True, return_tensors="pt") # Tokenize dataset raw_dataset = raw_dataset.rename_column("label", "labels") # to match Trainer tokenized_dataset = raw_dataset.map(tokenize, batched=True,remove_columns=["text"]) print(tokenized_dataset["train"].features.keys()) # dict_keys(['input_ids', 'token_type_ids', 'attention_mask','lable'])