# %% Cell 3: Load Dataset
from datasets import load_dataset
from unsloth import standardize_sharegpt
import gc

dataset = load_dataset("json", data_files=DATASET_PATH, split="train")
print(f"Loaded {len(dataset):,} conversations")

dataset = standardize_sharegpt(dataset)
print(f"Standardized. Sample text: {len(dataset[0]['text'])} chars")

# Free memory before model load
gc.collect()
print("\n→ Run Cell 4 to load the 12B model.")
