DWDMData Warehousing & Mining
Unit II · CO2

Mining the Raw Ore

Data mining finds patterns in data — but raw data is messy. Learn the data-mining functionalities and the preprocessing that makes data ready: cleaning, integration, transformation, reduction and discretization, with a live normalization playground.

Course IT314 B
Outcome CO2
Lectures 9
Focus Preprocessing

What this unit covers

INTERACTIVE
0
KDD steps
0
Preprocessing tasks
0
Normalizations
0
Quiz questions
01

What Is Data Mining?

Data mining is the process of discovering interesting, previously unknown and useful patterns from large amounts of data — it's the core analysis step of the broader KDD (Knowledge Discovery in Databases) process.

Functionalities describe what can be mined: characterization & discrimination, association & correlation, classification & regression (prediction), cluster analysis, and outlier analysis. These split into descriptive (summarise the data) and predictive (forecast unknown values) tasks.

02

The KDD Process

Mining is one step in a pipeline. Most of the effort lives in preparing the data.

STEP 1
SelectionPick the relevant data from sources/warehouse.
STEP 2
PreprocessingClean: handle missing values and noise.
STEP 3
TransformationIntegrate, normalize, reduce, discretize.
STEP 4
Data MiningApply algorithms to find patterns.
STEP 5
EvaluationInterpret & present the knowledge.
03

Normalization Playground

Different features come in different ranges; many algorithms need them on a common scale. Pick a method and watch the same seven values rescale — the bars and the numbers update live with the real formula.

Data transformation — normalizationchoose a method
04

Key Concepts

DM functionalities

Characterization, association, classification, clustering, outlier & evolution analysis.

Descriptive vs predictive

Describe patterns in current data vs predict unknown/future values.

Task primitives

What to mine: data set, knowledge type, background knowledge, interestingness measures, presentation.

DM system integration

No-coupling, loose, semi-tight, tight coupling with a DB/DW system.

Major issues

Methodology, user interaction, efficiency & scalability, diversity of data, applications & social impact.

Data cleaning

Fill missing values, smooth noisy data (binning, regression), remove outliers, fix inconsistencies.

Data integration

Combine multiple sources; resolve schema/entity conflicts and redundancy (correlation tests).

Data transformation

Normalization, aggregation, generalization, attribute construction.

Data reduction

Dimensionality reduction (PCA), numerosity reduction, data compression — smaller yet representative.

Discretization & hierarchy

Turn continuous values into intervals; build concept hierarchies (city→state→country).

05

Watch & Learn

Concept · KDDData mining & the KDD processFunctionalities, descriptive vs predictive, and major issues.Open on YouTube ↗
Concept · preprocessingData preprocessing in data miningCleaning, integration, transformation, reduction, discretization.Open on YouTube ↗
Concept · normalizationMin-Max & Z-score normalizationHow the formulas rescale features for mining.Open on YouTube ↗
06

Unit II Quiz — 10 Questions

Test yourself: Mining & Preprocessing0 / 10