Clean messy datasets — handle missing values, fix dtypes, remove duplicates, normalize formats, and flag anomalies.