# ==========================================
# CELL 3: LOAD DATASET
# ==========================================
# Run this AFTER cell_01 and cell_02

dataset = load_dataset(
    "json",
    data_files=DATASET_PATH,
    split="train",
)

print(f"Dataset loaded: {len(dataset):,} conversations")

# Convert ShareGPT format to what Unsloth expects
dataset = standardize_sharegpt(dataset)
print(f"Standardized. Sample text length: {len(dataset[0]['text'])} characters")
print(f"\nPreview (first 300 chars):\n{dataset[0]['text'][:300]}")

# Free memory before model loading
gc.collect()
