from datasets import load_dataset #the dataset is big, to make things easier we're going to be streaming a subset dataset = load_dataset("wikipedia", "20220301.en", trust_remote_code=True, streaming=True)