Parcours d'Apprentissage
De zéro absolu jusqu'aux Attaques Adversarielles Hard-Label en NLP.
Module 1 : Les bases (Maths & Machine Learning)
Avant de comprendre l'IA, il faut comprendre comment la machine "apprend".
- Vecteurs et Matrices (Algèbre linéaire) : Les mots dans le NLP ne sont pas stockés comme du texte, mais comme des listes de nombres (vecteurs). Exemple :
Chat = [0.2, 0.8, -0.1]. - Probabilités : L'IA ne sait jamais rien à 100%. Elle prédit : "Il y a 95% de chances que ce texte soit positif".
- Fonction de coût (Loss Function) : C'est la note que l'on donne à l'IA quand elle s'entraîne. Si elle se trompe, la note (le coût) est élevée. Le but de l'apprentissage est de trouver comment réduire ce coût.
Module 2 : C'est quoi le NLP ?
Le Traitement du Langage Naturel (NLP) est la branche de l'IA qui permet aux machines de comprendre le texte.
- Tokenisation : Découper une phrase en petits morceaux (mots ou sous-mots appelés "tokens").
- Embeddings : Transformer chaque token en vecteur mathématique pour que des mots au sens proche (ex: "Roi" et "Reine") soient proches géométriquement dans l'espace.
- Classification : L'une des tâches de base du NLP. Par exemple, dire si un tweet est un spam ou non.
Module 3 : Les Attaques Adversarielles (Le cœur de ton PFE)
Une attaque adversarielle consiste à piéger l'IA en modifiant très légèrement le texte d'entrée, de façon à ce que l'humain ne voie pas la différence, mais que l'IA se trompe complètement.
- White-Box vs Black-Box :
- White-Box : L'attaquant a accès à tout le code et aux mathématiques internes de l'IA.
- Black-Box : L'attaquant n'a accès qu'à l'entrée (le texte) et à la sortie (la prédiction), sans voir l'intérieur.
- Le "Hard-Label" : C'est le niveau le plus difficile (ton sujet !). Dans une attaque Black-Box classique, l'IA renvoie "Positif (99%)". En Hard-Label, l'IA renvoie juste "Positif", sans le pourcentage de confiance. C'est très dur pour l'attaquant de savoir si ses modifications rapprochent l'IA de l'erreur.
Module 4 : Comment attaquer en Hard-Label ?
Puisqu'on n'a pas les probabilités, on doit chercher des mots à remplacer (substitution de synonymes) en envoyant plein de requêtes à l'IA pour voir quand la décision bascule.
- WIR (Word Importance Ranking) : Une méthode qui cherche quels mots sont les plus importants dans la phrase en les effaçant un par un et en regardant si la prédiction change.
- Recherche heuristique (ex: Algorithmes génétiques) : Tester des centaines de combinaisons de synonymes pour trouver celle qui trompe le modèle.