from datasets import load_dataset from datasets import interleave_datasets # Load as streaming = True en_dataset = load_dataset('oscar', "unshuffled_deduplicated_en", split='train', streaming=True) fr_dataset = load_dataset('oscar', "unshuffled_deduplicated_fr", split='train', streaming=True) # Interleave multilingual_dataset = interleave_datasets([en_dataset, fr_dataset]) # Shuffle shuffled_dataset = multilingual_dataset.shuffle(seed=42, buffer_size=10_000)