
Test à modifier après
- Enseignant éditeur: Haidar Siba
À l’issue de cet enseignement, les étudiants seront capables de :
-
Mobiliser les fondamentaux de Python pour réaliser des traitements de données.
-
Manipuler des tableaux NumPy et utiliser des opérations vectorisées.
-
Importer et explorer des données tabulaires avec pandas, notamment à partir de fichiers CSV.
-
Sélectionner, filtrer, trier, transformer et agréger des données.
-
Identifier et traiter les principaux problèmes de qualité des données : valeurs manquantes, doublons et types inadaptés.
-
Produire des statistiques descriptives et des visualisations adaptées à une question d’analyse.
-
Combiner plusieurs sources de données pour répondre à une problématique concrète.
-
Présenter une démarche d’analyse dans un notebook Jupyter structuré, en expliquant les traitements effectués et en interprétant les résultats obtenus.
L’enseignement s’organise en cinq séances de trois heures :
-
Python et NumPy pour l’analyse de données
Environnement de travail et notebooks Jupyter. Rappels ciblés de Python. Tableaux NumPy, indexation, filtrage, vectorisation et statistiques descriptives. Introduction à pandas et aux fichiers CSV. -
Manipulation de données avec pandas
Structures Series et DataFrame. Sélection, filtrage, tri, création de variables et agrégation de données. -
Nettoyage et préparation des données
Diagnostic de qualité, traitement des valeurs manquantes et des doublons, conversion des types et harmonisation des données. -
Analyse exploratoire et visualisation
Description des distributions, exploration des relations entre variables, choix de représentations graphiques et interprétation des résultats. -
Intégration de données et étude de cas
Combinaison de plusieurs sources et mise en œuvre d’une démarche complète : préparation, exploration, analyse et restitution dans un notebook.
-
Connaissances de base en algorithmique et en programmation : variables, conditions, boucles, fonctions et structures de données usuelles.
-
Notions élémentaires de statistique descriptive : moyenne, médiane et dispersion.
-
Maîtrise des opérations courantes de gestion de fichiers et de dossiers sur ordinateur.
Une première expérience de programmation est attendue. La maîtrise préalable de Python n’est pas exigée : un rappel ciblé est proposé en début d’enseignement. Aucune connaissance préalable de NumPy ou de pandas n’est requise.
L’évaluation repose sur :
-
Des interrogations individuelles, portant sur les notions et les compétences travaillées en cours et dans les notebooks.
-
Un projet d’analyse de données, réalisé dans le cadre de l’étude de cas finale et donnant lieu à la remise d’un notebook Jupyter structuré et commenté.
Les interrogations évaluent la compréhension des concepts, la capacité à écrire ou compléter du code et à interpréter les résultats. Sauf indication explicite contraire de l’enseignante, elles sont notées.
Le projet évalue la préparation et la manipulation des données, la pertinence des analyses et des visualisations, ainsi que la clarté des explications et des conclusions.
Les modalités de réalisation du projet, les échéances et la pondération des évaluations seront précisées en cours.
Ouvrage de référence
McKinney, W. (2022). Python for Data Analysis: Data Wrangling with pandas, NumPy, and Jupyter, 3ᵉ édition, O’Reilly Media. Version accessible gratuitement en ligne.
Documentation et ressources complémentaires
-
Python Software Foundation. Le tutoriel Python — fondamentaux du langage, documentation en français.
-
NumPy. NumPy: the absolute basics for beginners — tableaux et calcul numérique.
-
pandas. Getting started — manipulation et exploration de données tabulaires.
-
Matplotlib. Tutoriels officiels — création de visualisations.
Les notebooks et exercices mis à disposition dans l’espace de cours constituent les supports principaux de l’enseignement.