Yoann Abriel
en

Tous les projets

2026

Fake News Detection

Système de détection de fake news par NLP avec pipeline complet : baseline TF-IDF, fine-tuning BERT/RoBERTa/DeBERTa, évaluation cross-dataset et analyse d'interprétabilité SHAP/LIME. Entraîné sur le dataset LIAR (12 800 déclarations politiques).

Weighted F1 des modèles LR, XGBoost, RoBERTa et Ensemble, in-domain sur LIAR puis hors distribution sur FNN

fig. 01 · In-domain sur LIAR puis hors distribution : la chute de F1 des transformers face aux baselines

Ce projet de spécialisation NLP propose un système complet de détection de fake news. Le pipeline couvre l'analyse exploratoire, le prétraitement, les modèles baseline (Naive Bayes, Régression Logistique, XGBoost), le fine-tuning de modèles transformer (BERT, RoBERTa, DeBERTa), l'évaluation sur un dataset externe (généralisation out-of-distribution) et l'analyse d'interprétabilité avec SHAP et LIME. Le dataset LIAR contient 12 800 déclarations politiques étiquetées par les fact-checkers de PolitiFact. Le projet intègre également une analyse de biais éthique.

Exploration du dataset LIAR

Deux diagrammes en barres : la distribution des six classes LIAR (de true à pants-fire) et la distribution binaire FAKE / REAL sur le jeu d'entraînement

fig. 02 · Distribution des six classes LIAR et de la version binaire sur le jeu d'entraînement

Le dataset LIAR contient 12 800 déclarations politiques étiquetées par les fact-checkers de PolitiFact, sur six niveaux de vérité. Le pipeline commence par l'analyse exploratoire et le prétraitement, avec une classification à six classes et une version binaire.

Baselines contre transformers

Deux diagrammes en barres du weighted F1 sur le test, en six classes et en binaire, pour LR, LightGBM, BiLSTM, RoBERTa, quatre configurations d'ensemble, un vote et une variante avec historique de crédibilité

fig. 03 · Weighted F1 sur le test, six classes et binaire : baselines, RoBERTa et ensembles côte à côte

Plus de six modèles comparés sur le même jeu de test : baselines Naive Bayes, régression logistique et XGBoost sur TF-IDF, puis fine-tuning de BERT, RoBERTa et DeBERTa, et ensembles. Le pipeline est progressif : la baseline TF-IDF sert de référence aux transformers.

Interprétabilité LIME

Deux graphiques LIME à barres horizontales rouges et vertes listant les mots qui influencent RoBERTa, pour une déclaration FAKE bien classée et une déclaration FAKE classée REAL

fig. 04 · LIME sur RoBERTa binaire : contribution des mots sur une prédiction correcte et sur une erreur

Pour rendre les décisions du modèle lisibles, chaque prédiction peut être expliquée avec SHAP et LIME. Ici LIME montre les mots qui poussent RoBERTa vers FAKE ou vers REAL, sur une déclaration bien classée et sur une erreur.

Généralisation hors distribution

Diagramme en barres du weighted F1 hors distribution sur FakeNewsNet et PHEME pour LR, RoBERTa text-only et Ensemble, où LR est nettement au-dessus

fig. 05 · Weighted F1 hors distribution sur FakeNewsNet et PHEME : LR, RoBERTa et ensemble

Les modèles entraînés sur LIAR sont évalués sur des datasets externes jamais vus à l'entraînement, pour mesurer leur robustesse out-of-distribution. Le résultat surprend : la régression logistique résiste mieux que RoBERTa et l'ensemble.

Biais et éthique

Deux graphiques : l'accuracy de RoBERTa sur les dix sujets les plus difficiles, et le biais par locuteur, en rouge la sur-détection de FAKE, en vert la sous-détection

fig. 06 · Audit de biais RoBERTa : accuracy par sujet et écart de détection FAKE par locuteur

Un audit de biais est intégré au pipeline d'évaluation : précision par sujet et écart entre le taux de FAKE prédit et réel par locuteur, pour repérer où le modèle sur-détecte ou sous-détecte.

fig. 07

SHAP summary plot du LightGBM binaire, 25 features les plus influentes

SHAP summary du LightGBM binaire : les 25 features les plus influentes

fig. 08

Quatre matrices de confusion RoBERTa selon la fusion de l'historique de crédibilité, sur le jeu de test

RoBERTa et l'historique de crédibilité : quatre variantes de fusion, matrices de confusion sur le test

Défis

  • Classification multi-classes de déclarations politiques avec nuances contextuelles
  • Généralisation du modèle sur des datasets externes non vus à l'entraînement
  • Interprétabilité des décisions du modèle pour garantir la confiance
  • Détection et analyse des biais dans les prédictions

Solutions

  • Pipeline progressif : baseline TF-IDF → fine-tuning BERT/RoBERTa/DeBERTa
  • Évaluation cross-dataset pour mesurer la robustesse out-of-distribution
  • Analyse SHAP et LIME pour l'explicabilité des prédictions
  • Audit de biais éthique intégré dans le pipeline d'évaluation

Résultats

  • 5 notebooks couvrant le pipeline complet EDA → interprétabilité
  • Comparaison de 6+ modèles (baseline + transformers)
  • Analyse d'interprétabilité SHAP/LIME sur les prédictions
  • Évaluation de généralisation sur dataset externe

Technologies

Python · PyTorch · BERT · Transformers · SHAP · LIME · Scikit-learn · XGBoost