Principes de base et stockage des données
1. Principes de base de la gestion des données
- Multiplicité des logiciels : Chaque département utilise des logiciels différents, développés à des moments variés, ce qui entraîne une dispersion des données dans des fichiers multiples.
- Problèmes du traitement traditionnel :
- Redondance des données : mêmes données stockées plusieurs fois.
- Incohérence : données contradictoires entre fichiers.
- Interdépendance : modification des programmes liée aux données.
- Manque de souplesse : difficulté à extraire des données.
- Sécurité insuffisante.
- Partage difficile entre utilisateurs.
2. Persistance des données
- Mémoire vive (RAM) : rapide mais volatile (données perdues sans courant).
- Stockage permanent : disque dur.
- Composé de milliards de bytes (ex. 1TB = bytes).
- Bytes adressables individuellement, mais accès en blocs (ex. 512 bytes).
- Système de fichiers : organise les bytes en fichiers et répertoires.
3. Système de fichiers
| Élément | Description |
|---|---|
| Fichier | Suite finie de bytes, avec nom, date, droits, type éventuel |
| Répertoire | Contient fichiers et/ou autres répertoires, structure arborescente |
4. Structuration des données dans un fichier
- Un fichier est une suite finie de bytes.
- Types de données encodées :
- Entiers : codés en binaire.
- Nombres réels : codés en virgule flottante (approximation), sur 32 ou 64 bits.
- Caractères : codés via une table de correspondance entier-caractère (ex. ASCII, Unicode).
- Autres données : encodées en bytes selon leur nature.
5. Types de fichiers
| Type | Contenu | Usage principal |
|---|---|---|
| Fichier texte | Caractères lisibles par l'humain | Édition simple (ex. Bloc-notes), contenu non structuré |
| Fichier binaire | Données codées pour logiciel | Contenu non directement lisible, destiné à être interprété par un programme |
À retenir : Le stockage traditionnel des données dans des fichiers dispersés pose des problèmes majeurs de redondance, incohérence, sécurité et partage, d’où la nécessité d’une gestion centralisée et structurée.
Fichiers et structuration des données
1. Nature des données dans un fichier
- Un fichier contient des données codées en bytes, non directement lisibles par un humain.
- Ces données peuvent être de natures variées :
- Mélange d’entiers et de caractères
- Bytes représentant une image
- Bytes compressés d’autres fichiers
- Documents Word, Excel, PowerPoint, etc.
2. Fichier CSV (Comma Separated Value)
- Format texte où chaque ligne est un enregistrement composé de champs séparés par des virgules.
- Exemple : liste d’étudiants avec prénom, nom, formation, année, matricule.
- Utilisé pour échanger des données entre logiciels (Excel, bases de données, outils d’analyse).
- Format très courant en entreprise pour l’interopérabilité.
3. Notion d’enregistrement (record)
- Un enregistrement est un ensemble cohérent de données de différentes natures formant un tout.
- Exemples :
- Commande : numéro (entier), description (texte), quantité (entier), prix unitaire (flottant)
- Notes étudiants : numéro étudiant (entier), identifiant cours (texte), cote (flottant)
4. Fichier d’enregistrements
- Fichier binaire structuré contenant une succession d’enregistrements.
- Évolution du fichier texte CSV, il offre de meilleures performances.
- Utile pour gérer de très grandes quantités de données ne tenant pas en mémoire.
- Le programme manipule uniquement la portion du fichier correspondant aux données nécessaires.
5. Accès aux enregistrements dans un fichier
| Condition | Méthode d’accès | Remarque |
|---|---|---|
| Enregistrements de même taille | Calcul direct de la position : | |
| Accès immédiat et direct | ||
| Enregistrements de tailles variables | Lecture séquentielle ou utilisation d’une table d’index | Accès plus lent sans index |
6. Fichier d’index
- Un index stocke la position d’un enregistrement dans un autre fichier.
- Chaque élément de l’index est un enregistrement contenant uniquement la position correspondante.
- Permet un accès rapide aux enregistrements dans un fichier à taille variable.
À retenir : Un fichier structuré en enregistrements facilite la gestion et l’accès aux données, et l’indexation optimise la recherche dans les fichiers à enregistrements de taille variable.
Bases de données et SGBD
1. Base de données
- Une base de données (BD) regroupe plusieurs fichiers d’enregistrements appelés tables.
- Chaque table contient des enregistrements (lignes) composés de champs (colonnes).
- Une BD centralise et organise les données pour résoudre les problèmes de gestion dans différents domaines (comptabilité, finances, fabrication, ventes, marketing).
Une base de données est un ensemble structuré de données interconnectées, organisé en tables.
2. Système de Gestion de Base de Données (SGBD)
Un SGBD est un logiciel qui gère une ou plusieurs bases de données. Ses fonctions principales sont :
| Fonctionnalité | Description |
|---|---|
| Création de la structure | Définir l’architecture et le design de la base de données |
| Gestion des données | Créer, modifier, supprimer et stocker les données |
| Exploitation des données | Sélectionner, trier, rechercher les données |
| Présentation des données | Générer des formulaires, états, rapports |
| Sécurité | Assurer l’intégrité, contrôles d’accès, sauvegardes, récupération |
| Optimisation | Gérer les ressources pour améliorer la performance |
| Centralisation et partage | Permettre l’accès partagé aux données |
| Suivi | Contrôler l’utilisation des ressources |
3. SGBD relationnels (SGBDR)
- Un SGBDR est un SGBD spécialisé dans la gestion des bases relationnelles.
- Il organise les données en tables, composées d’enregistrements et de champs.
- Il gère aussi les relations entre les tables (liens logiques).
- Modules principaux du SGBDR :
| Module | Rôle |
|---|---|
| Organisation des tables | Structurer et gérer les tables |
| Gestion des données | Créer, modifier, supprimer les données |
| Recherche | Sélectionner et rechercher des données |
| Présentation | Afficher les résultats et rapports |
4. Schéma de base de données
- Le schéma décrit la structure et l’organisation des données dans la BD.
- Il représente les tables, leurs noms, et les relations entre elles.
- Permet de visualiser la conception globale de la base.
Le schéma est la représentation formelle de la structure d’une base de données, essentielle pour sa conception et son exploitation.
5. Résumé des notions clés
| Terme | Définition / Rôle |
|---|---|
| Base de données (BD) | Ensemble structuré de données organisées en tables |
| Table | Fichier d’enregistrements, composé de champs et lignes |
| Enregistrement | Ligne d’une table, correspondant à une unité d’information |
| Champ | Colonne d’une table, représentant un attribut ou une donnée élémentaire |
| SGBD | Logiciel gérant la création, modification, exploitation, sécurité et optimisation d’une BD |
| SGBDR | SGBD relationnel, centré sur les tables et leurs relations |
| Schéma | Modèle décrivant la structure et l’organisation des données dans une base |
Un SGBD assure la gestion centralisée, sécurisée et performante des données, facilitant leur partage et exploitation.
Schéma et langage SQL
1. Schéma conceptuel et représentation
- Tables : contiennent plusieurs champs (colonnes) qui définissent les attributs des données.
- Losanges : symbolisent les relations entre les tables.
- Flèches : indiquent une spécialisation (héritage) entre entités.
- Exemple : un graduate student est un cas particulier d’un student.
- Un student est un cas particulier d’une personne.
2. Langage SQL (Structured Query Language)
- Objectif : interroger et manipuler les données dans une base relationnelle.
- Exemple de requête :
SELECT DISTINCT Name FROM City, Person WHERE City.Id = Person.CityId - Fonctions principales :
- Filtrer (WHERE), regrouper (GROUP BY), agréger (SUM, AVG...), trier (ORDER BY).
- Recherches simples à reporting complexe.
- Manipulation des données : insertion (INSERT), modification (UPDATE), suppression (DELETE).
- Modification du schéma : création/modification de tables, contraintes.
- Gestion des index pour optimiser les performances.
- Gestion des droits d’accès aux données.
3. Panorama des SGBDR (Systèmes de Gestion de Bases de Données Relationnelles)
| Usage | Exemples de SGBDR |
|---|---|
| Applications légères | Access, SQLite |
| Applications professionnelles | Oracle, DB2, SQL Server, MySQL, Sybase, Informix, PostgreSQL |
- Source de classement : https://db-engines.com/en/ranking
4. Exemple d’application Web et gestion des données
-
Problématique :
Une enseigne comme Carrefour collecte plusieurs téraoctets de données d’achats quotidiennement. -
Utilité des données :
- Profilage clients
- Statistiques et tendances de vente
- Gestion des stocks
- Calcul de rentabilité
-
Problème : volume important impactant les performances.
5. Solution : séparation des données
| Base de données opérationnelle | Data Warehouse (entrepôt de données) |
|---|---|
| Données quotidiennes, nettoyées chaque jour | Données historiques sur le long terme |
| Opérations majoritairement en écriture | Accès en lecture seule |
| Haute performance pour ne pas ralentir les clients | Volume important, performances moins critiques |
6. Data Warehouse et Data Mart
-
Data Warehouse :
- Base séparée de la BD opérationnelle.
- Stocke les données sur le long terme.
- Permet l’analyse et l’interrogation des données historiques.
-
Data Mart :
- Sous-ensemble spécialisé du Data Warehouse.
- Facilite l’exploitation des données selon les besoins spécifiques des utilisateurs.
À retenir : Le Data Warehouse optimise la gestion des gros volumes de données historiques en séparant stockage opérationnel et analytique.
Data Warehouse et Data Mart
1. Data Warehouse
Un Data Warehouse est une base de données centralisée conçue pour stocker des données consolidées provenant de sources diverses, optimisée pour l’analyse et le reporting. Il permet de regrouper, nettoyer et historiser les données afin de faciliter la prise de décision.
- Consolidation des données : les données opérationnelles sont prétraitées pour obtenir des totaux ou agrégats pertinents (ex. total des ventes par article et par jour).
- Objectif : fournir une vision globale et cohérente des données pour le reporting mensuel, les analyses stratégiques et la gouvernance d’entreprise.
2. Data Mart
Un Data Mart est une sous-partie du Data Warehouse, ciblée sur un domaine métier spécifique (ex. ventes, finance, marketing). Il contient des données consolidées et adaptées aux besoins d’un groupe d’utilisateurs particulier.
| Aspect | Data Warehouse | Data Mart |
|---|---|---|
| Portée | Entreprise entière | Domaine métier spécifique |
| Volume | Très volumineux | Plus restreint |
| Utilisateurs | Décideurs stratégiques | Utilisateurs métier ciblés |
| Objectif | Analyse globale, reporting global | Analyse spécialisée, rapide |
3. Exploitation des données et aide à la décision
- Les données opérationnelles (clients, commandes, stocks) sont d’abord stockées en base.
- Le Data Warehouse permet ensuite une exploitation différente, orientée vers l’amélioration de la gouvernance et la prise de décision.
- Exemple : un dashboard de management opérationnel dans un hôpital utilise les données patients pour produire des indicateurs de qualité et orienter les priorités.
4. Data Mining
Le data mining est une technique d’analyse avancée qui cherche à découvrir des relations cachées dans de grands volumes de données, en s’appuyant sur des modèles mathématiques.
- But : inférer des règles pour aider à la décision.
- Types d’informations recherchées :
- Associations : comportements fréquemment liés (ex. achat d’imprimante associé à achat de papier).
- Séquences : ordre temporel des comportements (ex. prédiction d’achats futurs).
- Classification : catégorisation d’éléments selon leurs caractéristiques.
- Clustering : regroupement d’éléments similaires.
- Prédictions : anticipation d’événements futurs.
a) Exemple d’association
- Une entreprise vendant du matériel de bureau peut détecter que l’achat d’une imprimante est souvent accompagné d’encre et de papier.
- Ces associations sont utilisées dans les recommandations sur des plateformes comme Amazon ou Netflix.
b) Exemple de séquence
- Une chaîne de distribution analyse les achats passés pour prédire les achats futurs.
- Cas célèbre : un magasin a anticipé la grossesse d’une adolescente grâce à ses achats, avant même sa famille.
À retenir : Le Data Warehouse consolide et historise les données pour l’analyse globale, tandis que le Data Mart cible un domaine précis. Le data mining exploite ces données pour révéler des patterns cachés et soutenir la prise de décision.
Exploitation des données et aide à la décision
1. Exploitation des données et aide à la décision
a) Analyse de la population client
- Coût d'acquisition client élevé : campagnes publicitaires, démarchage, promotions à faible marge.
- Rentabilité liée à la fidélité : plus un client reste longtemps, plus il génère de revenus récurrents.
- Analyse des départs clients : identifier les caractéristiques associées au churn (perte de clients).
- Exemples de facteurs liés au départ :
- Arrivée d’un nouveau concurrent.
- Contacts répétés avec le support.
- Changement d’adresse.
- Exemples de facteurs liés au départ :
b) Clustering (regroupement)
- Définition : méthode automatique pour identifier des groupes homogènes dans une population.
- Objectif : segmenter les clients pour mieux cibler les actions marketing.
- Utilité : en combinaison avec la classification, permet d’identifier précisément les publics cibles.
c) Prédictions
- But : estimer des données inconnues à partir de données connues et corrélées.
- Exemple : prévoir le montant qu’un client est susceptible de dépenser lors d’une promotion pour anticiper le chiffre d’affaires.
- Remarque : ne se limite pas à prédire le futur, mais à compléter des informations manquantes.
d) Big Data
| Caractéristique | Description |
|---|---|
| Volume | Données si volumineuses qu’elles dépassent les capacités humaines et des outils classiques. |
| Analyse (Big Analytics) | Traitement analytique avancé via calcul distribué et statistiques pour extraire du sens. |
| Données quantitatives | Manipulation de données complexes et massives. |
e) Intelligence Artificielle (IA)
- Popularité récente : ex. ChatGPT.
- Dépendance aux données : nécessite de grandes quantités de données pour l’apprentissage.
- Usage en entreprise : exploitation des données du data warehouse pour créer des IA spécifiques.
- Exemple : un bot IA capable de répondre en langage naturel en s’appuyant sur toutes les données internes de l’entreprise.
L’exploitation des données permet de mieux comprendre les clients, segmenter les populations, prédire des comportements et créer des outils d’aide à la décision basés sur l’IA.