Réalisez une analyse de données en Python
Les Plus Beaux Logis de Paris, société de gestion immobilière fictive, a besoin d’estimer la valorisation future de son portefeuille d’actifs parisiens et de qualifier automatiquement des biens entrants. Le projet s’appuie sur 26 180 transactions historiques couvrant 2017-2021 pour construire un modèle prédictif de valeur foncière. Une seconde étape introduit le clustering K-means pour classer automatiquement des biens selon leur type.
Enchaînement analytique en quatre phases : exploration descriptive du marché, tests de corrélation pour valider les variables candidates, régression linéaire pour la prédiction de valorisation, puis K-means pour la classification non supervisée. Parti pris : transparence sur les limites du modèle.
- Notebook Python : audit données, analyse descriptive marché parisien 2017-2021, corrélations de Pearson, régression linéaire (MAPE 9,05%), prédiction valorisation portefeuille, classification K-means de 40 biens
- Support de présentation 20 pages : restitution orientée décision métier
- Régression linéaire atteignant l’objectif OC : erreur moyenne de 9,05% sous le seuil de 10%
- Résultat métier concret : portefeuille corporate estimé à 98,69 M€ vs particuliers 71,23 M€
- Corrélations de Pearson documentées : date/prix au m² (r = 0,90) et valeur foncière/surface (r = 0,98)
- Classification K-means avec interprétation des clusters en labels lisibles
- Honnêteté sur les limites du modèle
Problème : Colonnes non identiques entre le portefeuille d’actifs et les données historiques d’entraînement.
Résolution : Mapping manuel des variables et création de colonnes adaptées pour alimenter le modèle entraîné sur les données historiques.
Problème : Découpage train/test — la consigne recommande un split chronologique.
Résolution : Split aléatoire utilisé — le split chronologique est identifié comme limite présentée honnêtement en soutenance.
Problème : Interpréter les clusters K-means sans labels réels disponibles pendant l’entraînement.
Résolution : Attribution des labels métier par lecture du prix moyen au m² de chaque cluster, avec formulation prudente à la restitution.
Techniques
- Python : pandas, numpy, scipy, scikit-learn, plotly
- Feature engineering : prix au m², transformation date, one-hot encoding
- Tests de corrélation de Pearson
- Régression linéaire et MAPE
- Clustering non supervisé K-means
Soft skills
- Vulgarisation : restitution statistique à un interlocuteur non-technique
- Nuance analytique : assumer les limites sans dévaloriser le travail
- Recul critique : identifier ce qui n’est pas valide
C’était le projet le plus difficile de ma formation jusqu’à ce stade, ce qui en a fait un défi particulièrement intéressant. Être confronté au machine learning pour la première fois, devoir comprendre la régression linéaire et le K-means suffisamment pour les expliquer à un interlocuteur non-technique, c’est exactement le type d’effort qui fait vraiment monter en compétence.
J’aurais structuré mon notebook totalement différemment, avec plus de méthodologie et de clarté entre les blocs. J’aurais également appliqué le split chronologique recommandé et mieux documenté les choix de feature engineering.