Mesures d'évaluation du clustering
1. Évaluation du clustering
L’évaluation du clustering vise à mesurer la qualité des clusters obtenus sur un jeu de données non étiquetées.
2. Contexte
- Le clustering est un apprentissage non supervisé : pas d’étiquettes de classes disponibles.
- On partitionne un ensemble de données de points en clusters .
- est une distance sur l’espace .
- désigne l’indice du cluster auquel le point est assigné.
- Pas de vérité fondamentale pour comparer les résultats.
3. Critères essentiels pour évaluer un clustering
-
Homogénéité (cohésion interne) :
Les points d’un même cluster doivent être proches/similaires. -
Séparabilité (cohésion externe) :
Les clusters doivent être distants les uns des autres.
4. Notions clés
| Notion | Définition |
|---|---|
| Centroïde | Moyenne des points dans un cluster : |
| $$\vec{\mu}_k = \frac{1}{ | \mathcal{C}_k |
| Medoïde | Point du cluster le plus proche du centroïde (représentant réel du cluster) |
5. Homogénéité (Tightness)
- Pour un cluster , l’homogénéité est la moyenne des distances des points au centroïde :
- L’homogénéité globale du clustering est la moyenne des homogénéités des clusters :
- Plus est faible, plus les clusters sont compacts.
6. Séparabilité
- La séparabilité entre deux clusters et est la distance entre leurs centroïdes :
- La séparabilité globale peut être définie comme la moyenne (ou minimum) des distances inter-centroïdes.
- Plus la séparabilité est grande, mieux les clusters sont distincts.
À retenir : Un bon clustering maximise la séparabilité entre clusters tout en minimisant l’homogénéité (distance intra-cluster).
DBSCAN : algorithme de clustering basé sur la densité
1. DBSCAN : algorithme de clustering basé sur la densité
Principe clé : DBSCAN regroupe les points en clusters selon leur densité locale, définie par le nombre de points dans un voisinage de rayon .
2. Définitions essentielles
| Type de point | Définition |
|---|---|
| Point cœur | Point ayant au moins MinPts points dans son voisinage de rayon . |
| Point frontière | Point avec moins de MinPts dans son voisinage , mais voisin d’un point cœur. |
| Point bruit | Point qui n’est ni cœur ni frontière (isolé ou trop éloigné des clusters). |
3. Fonctionnement de DBSCAN
- Identification des points cœur : repérer tous les points avec au moins MinPts dans leur voisinage .
- Formation des clusters : connecter les points cœur entre eux et avec leurs points frontières.
- Élimination du bruit : les points bruit sont exclus du clustering.
4. Propriétés et avantages
- Robustesse au bruit : DBSCAN identifie explicitement les points bruit, ce qui le rend résistant aux données aberrantes.
- Détection de clusters de forme arbitraire : contrairement aux méthodes basées sur la distance euclidienne seule, DBSCAN peut détecter des clusters non sphériques.
- Pas besoin de spécifier le nombre de clusters a priori.
À retenir : Un point est un point cœur s’il a au moins MinPts voisins dans un rayon ; les clusters sont formés autour de ces points cœur, tandis que les points bruit sont exclus.
5. Paramètres clés
| Paramètre | Rôle | Impact sur le clustering |
|---|---|---|
| (Eps) | Rayon du voisinage autour d’un point | Trop petit : trop de bruit ; trop grand : fusion de clusters |
| MinPts | Nombre minimal de points dans le voisinage | Trop petit : clusters trop nombreux et bruit faible ; trop grand : clusters rares et bruit élevé |
6. Résumé des étapes
| Étape | Description |
|---|---|
| 1. Trouver points cœur | Points avec ≥ MinPts voisins dans |
| 2. Construire clusters | Connecter points cœur et frontières |
| 3. Identifier bruit | Points non assignés à un cluster |
Réduction de la dimensionalité : concepts et méthodes
1. Réduction de la dimensionalité : concepts et méthodes
La réduction de la dimensionalité consiste à transformer une représentation des données en une représentation avec . L'objectif est de simplifier les données tout en conservant l'essentiel de l'information.
2. Raisons principales de réduire la dimensionnalité
| Objectif | Description |
|---|---|
| 1. Complexité computationnelle | Réduire le nombre de variables diminue le temps et l'espace nécessaires pour les calculs. |
| 2. Interprétabilité | Facilite la compréhension des données en visualisant dans un espace de dimension inférieure. |
| 3. Modèles plus simples et robustes | Moins de variables réduit la variance, améliorant la généralisation et la robustesse. |
| 4. Visualisation des données | Permet de représenter graphiquement des données initialement trop complexes à visualiser. |
3. Idée clé
Réduire la dimensionnalité permet d'améliorer l'efficacité, la compréhension et la robustesse des modèles tout en facilitant la visualisation des données.
4. Méthodes courantes (à connaître)
- Projection linéaire : Trouver un sous-espace de dimension qui conserve la variance (ex. ACP).
- Méthodes non linéaires : Capturer des structures complexes (ex. t-SNE, Isomap).
- Sélection de variables : Choisir un sous-ensemble pertinent de variables originales.
5. Exemple : Détermination des paramètres dans DBSCAN (contexte de données haute dimension)
- Pour un point, la distance à son -ième plus proche voisin est utilisée pour estimer la densité locale.
- Les points dans un cluster ont des distances similaires à leur -ième voisin.
- Les points de bruit ont des distances plus élevées.
- Tracer la distance triée des points au -ième voisin aide à fixer le paramètre (EPS) et .
Cette approche illustre l'importance de la gestion de la dimensionnalité et des distances dans les algorithmes non supervisés, notamment en haute dimension.
Sélection de variables
1. Raisons pour réduire la dimensionalité
- Visualisation et compréhension : Faciliter l’analyse de données complexes en réduisant leur dimension.
- Coût d’acquisition : Réduire le nombre de caractéristiques diminue les coûts de collecte, stockage et traitement.
- Élimination des attributs non pertinents : Supprimer les variables inutiles réduit le bruit et améliore la performance des modèles.
2. Méthodes pour réduire la dimensionalité
Deux grandes approches :
| Méthode | Description |
|---|---|
| Sélection de variables | Choisir un sous-ensemble de variables parmi les initiales. |
| Extraction de variables | Créer nouvelles variables à partir des variables initiales (ex. ACP). |
3. Sélection des variables : catégories principales
- Méthodes de filtrage
- Méthodes de containeur (wrapping methods)
- Méthodes embarquées (embedded methods)
4. Méthodes de filtrage
- Évaluer la pertinence de chaque variable indépendamment par rapport à la variable cible .
- Critères possibles :
- Corrélation avec
- Test statistique (ex. test du pour classification)
- Variance (supposer que variables à forte variance sont plus informatives)
5. Méthodes de containeur
- Objectif : trouver le meilleur sous-ensemble de variables pour un modèle donné.
- Appelée aussi sélection de sous-ensemble (subset selection).
- Deux approches principales présentées :
| Approche | Description |
|---|---|
| Recherche ascendante (forward search) | Partir d’un ensemble vide et ajouter les variables une par une. |
| Recherche descendante (backward search) | Partir de l’ensemble complet et retirer les variables une par une. |
À retenir : La sélection de variables vise à réduire la dimension en éliminant les variables non pertinentes, ce qui améliore la performance et réduit le coût des modèles.
Extraction de variables et analyse en composantes principales
1. Sélection des variables
-
Recherche descendante :
Partir de l’ensemble de toutes les variables, retirer une par une celles qui améliorent le plus la performance, jusqu’à ne plus pouvoir l’améliorer. -
Méthodes embarquées :
Apprennent simultanément avec le modèle quelles variables inclure.- Modèles paramétriques parcimonieux (certains coefficients nuls).
- Variables avec coefficient nul sont éliminées.
- Exemple clé : Lasso.
- Exemple de méthode : Recursive Feature Elimination (RFE).
2. Extraction des variables : Analyse en Composantes Principales (ACP / PCA)
-
Définition :
Méthode d’apprentissage non supervisé qui vise à réduire la dimensionnalité des données tout en minimisant la perte d’information. -
Objectif :
Trouver un espace de dimension réduite où la variance des données projetées est maximisée. -
Hypothèse :
Les données sont centrées (moyenne nulle). Sinon, on centre par : -
Standardisation :
- Centrer la moyenne à 0.
- Centrer la variance à 1 (chaque variable a variance 1).
-
Projection sur une direction :
Soit un vecteur unité (), la projection de sur est : -
Variance de la projection :
La variance de est calculée en fonction de et (maximiser cette variance pour choisir ).
À retenir : L’ACP cherche une base orthogonale où les projections des données ont une variance maximale, ce qui permet de réduire la dimension tout en conservant l’essentiel de l’information.