Régression vs Classification : comprendre simplement les bases du Machine Learning

Lorsque l’on parle de modèles de Machine Learning, deux grandes familles reviennent constamment : la régression et la classification.
Ces deux types de modèles servent à faire des prédictions, mais pas du même type. Comprendre la différence est essentiel pour choisir un modèle adapté à son problème, notamment lorsqu’on aborde des sujets comme la prévision de prix.

1. Régression : prédire une valeur numérique

Imagine que tu veux estimer le prix d’un appartement. Selon la surface, le quartier, l’année, le nombre de chambres… tu veux obtenir une valeur : 350 000 €, par exemple.

Ce type de problème appartient à la famille de la régression.

La régression, c’est simplement le fait de prédire une valeur continue.
C’est-à-dire un nombre réel qui peut varier sans limite précise : un prix, une température, un délai, une consommation, une distance, etc.

Quand on dit “prédire un prix avec le Machine Learning”, on parle donc de régression. C’est pour cela que les modèles que tu utilises pour la prévision (Random Forest Regressor, XGBoost Regressor, etc.) existent en version explicitement dédiée à cette tâche.

On cherche un nombre.

Exemples :

  • Prédire le prix d’une maison.

  • Estimer la température demain.

  • Prédire la consommation électrique d’un bâtiment.

  • Estimer le chiffre d’affaires d’un magasin.

La sortie peut être :

  • un nombre entier,

  • un nombre décimal,

  • ou même une plage de valeurs.

Modèles courants de régression :

  • Régression linéaire

  • Régression polynomiale

  • Random Forest Regressor

  • Gradient Boosting / XGBoost

  • Support Vector Regression (SVR)

  • Réseaux neuronaux (MLP, LSTM, etc.)

2. Classification : prédire une catégorie

Maintenant, prenons un tout autre exemple : tu veux décider si un email est un spam ou non.
Ce n’est pas une valeur que tu veux : c’est une classe. Une étiquette. Un choix parmi un ensemble limité.

C’est exactement le type de problème couvert par la classification.

La classification consiste à prédire dans quelle catégorie un élément appartient.

On cherche un groupe, une classe.

Exemples :

  • Classer un email comme spam ou non-spam.

  • Identifier si une image contient un chien, un chat ou un oiseau.

  • Prédire si un client va se désabonner (oui/non).

  • Diagnostiquer une maladie sur des données médicales.

La sortie est discrète, comme :

  • « positif » / « négatif »

  • « A », « B », « C »

  • 0 / 1 / 2

Modèles courants de classification :

  • k-Nearest Neighbors (KNN)

  • Decision Trees / Random Forest Classifier

  • SVM

  • Naive Bayes

  • Réseaux neuronaux / CNN pour les images

3. Comment choisir entre les deux ?

La question à se poser est très simple :

Est-ce que la valeur à prédire est un nombre ?

Oui → régression
Non → classification

4. Les métriques utilisées

Quand un modèle prédit une valeur par exemple un prix il ne suffit pas de regarder si “ça a l’air bon”.
On a besoin d’une manière objective de mesurer à quel point les prédictions sont proches de la réalité.
C’est là qu’interviennent quelques métriques très utilisées en Machine Learning : MAE, MSE, RMSE, et .

Pour la régression :

  • MAE (Mean Absolute Error) : l’erreur moyenne entre les prédictions et les vraies valeurs.

  • MSE : l’erreur moyenne quadratique.

  • RMSE : la racine carrée du MSE.

  • R² : la proportion de la variance expliquée par le modèle.

Pour la classification :

  • Accuracy

  • Precision / Recall

  • F1-score

  • Matrice de confusion

Elles mesurent la qualité de la séparation entre classes.

5. Pourquoi cette distinction est importante quand on parle de modèles de prévision de prix ?

Parce que la prévision de prix est 100% un problème de régression.

Donc :

  • Les modèles utilisés doivent prédire un nombre.

  • Les métriques utilisées ne sont pas celles de classification.

  • Certains algorithmes existent en deux versions (ex: Random Forest, RN) :
    Regressor et Classifier, et il faut choisir le bon.

Régression et classification sont les deux piliers de la plupart des modèles de Machine Learning. L’un prédit une valeur, l’autre une catégorie. L’un explore des relations continues, l’autre découpe l’espace en classes distinctes.

Comprendre cette différence n’est pas seulement théorique c’est ce qui permet de choisir les bons modèles, de bien les évaluer, et d’interpréter leurs résultats