Confondre LLM et chatbot
Le LLM est le moteur. Le chatbot est l'interface. ChatGPT est un chatbot qui utilise un LLM. Vous pouvez utiliser le même LLM via une API, sans interface conversationnelle.
Le minimum à savoir sur LLM, inférence et SaaS IA pour ne plus confondre intelligence et automatisation.
Une IA générative produit du texte, des images ou du son en prédisant, élément par élément, la suite la plus probable de ce qu'on lui donne. Derrière ChatGPT, Claude, Gemini ou Vibe, c'est toujours la même mécanique : un modèle de langage entraîné sur d'immenses corpus, un calcul exécuté sur des serveurs distants à chaque requête, et une interface commerciale par-dessus. Elle ne comprend pas ce qu'elle écrit, elle calcule ce qui est plausible. Cette leçon sépare les trois couches que tout le monde confond : le modèle, le calcul, le produit.
Promesse
Vous saurez expliquer en une phrase ce qu'est un LLM, l'inférence et un SaaS IA, et distinguer une IA d'une simple automatisation.
Pourquoi maintenant
L'IA générative grand public a atteint 53 % d'adoption en trois ans selon le Stanford AI Index 2026. C'est plus rapide que la diffusion du PC ou d'Internet à leur époque. L'investissement IA mondial s'est élevé à 581,7 milliards de dollars en 2025.
Pour un cadre francophone en 2026, comprendre ces outils n'est plus optionnel. Vous prenez des décisions, vous validez des livrables, vous écrivez des notes. L'IA touche chacun de ces gestes. Mieux vaut savoir ce qu'elle est avant de savoir comment la prompter.
Le concept central
Un LLM (Large Language Model) est un correcteur automatique sous stéroïdes. Il a lu une partie massive du web et de la littérature numérisée. À chaque mot que vous écrivez, il prédit le suivant le plus probable. Cette prédiction se déroule un token à la fois, un token valant environ 0,6 mot en français contre 0,75 en anglais : nos accents et notre morphologie coûtent 20 à 40 % de tokens en plus, donc autant sur la facture.
L'inférence, c'est ce calcul de prédiction. Quand vous envoyez un prompt, vous déclenchez une inférence sur des cartes graphiques distantes. Le SaaS IA, c'est le packaging commercial autour de ce modèle : interface web, application mobile, API, gestion des comptes et facturation. Vous ne stockez pas le modèle, vous payez l'usage.
Anatomie d'une requête
Six étapes invisibles, exécutées en quelques secondes, à chaque message que vous tapez.
Dans l'interface (chatgpt.com, claude.ai, gemini.google.com, chat.mistral.ai).
Le texte part vers les serveurs de l'éditeur via une requête sécurisée.
Hébergé sur GPU distants, il découpe votre prompt en tokens.
Le modèle prédit le premier token de réponse, puis le suivant, en chaîne.
Au fur et à mesure vers votre écran : effet de frappe en direct.
Au prorata des tokens entrants et sortants, selon votre abonnement.
Panorama 2026
Quatre outils dominent l'usage professionnel en Europe : ChatGPT, Claude, Gemini et Vibe. Il faut savoir les nommer. Tous reposent sur la même mécanique LLM : maîtrisez les bases, vous les comprenez tous.
OpenAI · USA
Anthropic · USA
Google · USA
Mistral AI · France
Le quartet couvre l'usage professionnel courant en Europe, il ne couvre pas le marché. DeepSeek, Qwen (Alibaba) et Kimi (Moonshot) se sont hissés en trois ans au niveau des modèles américains sur plusieurs tâches de raisonnement et de code, à un coût nettement inférieur. Sur OpenRouter, la plateforme qui répartit les requêtes entre fournisseurs, les modèles chinois sont passés de moins de 2 % du trafic fin 2024 à environ 51 % en avril 2026, pendant que la part des modèles américains tombait de 70 % à 30 %.
Deux différences comptent pour vous. La plupart sont publiés en poids ouverts : vous pouvez les héberger vous-même, ce qu'aucun outil du quartet ne permet. Et leur éditeur relève du droit chinois, donc passer par leur service en ligne fait sortir vos données de l'espace européen. La grille de décision reste la même que pour n'importe quel outil, juridiction en tête : elle est traitée dans la leçon sur la souveraineté de vos données.
Repère historique
ChatGPT a été lancé le 30 novembre 2022. C'est l'événement qui a fait basculer le grand public dans l'usage des LLM. Avant cette date, les LLM existaient depuis plusieurs années dans les laboratoires.
La rupture n'a pas été technique, elle a été produit. OpenAI a empaqueté un modèle déjà existant dans une interface conversationnelle gratuite. Le passage du modèle au SaaS, c'est exactement ce moment.
En trois ans, le quartet ChatGPT, Claude, Gemini et Vibe (ex-Le Chat) est devenu un standard. Un cadre qui prépare une note, un commercial qui rédige une relance, un développeur qui débogue un bout de code : chacun touche au moins un de ces outils dans sa semaine.
À éviter
Le LLM est le moteur. Le chatbot est l'interface. ChatGPT est un chatbot qui utilise un LLM. Vous pouvez utiliser le même LLM via une API, sans interface conversationnelle.
Elle imite la compréhension via des statistiques. Elle n'a pas de modèle du monde, pas d'intention, pas de mémoire stable hors session.
Sans outil de recherche activé, un LLM répond à partir de ses données d'entraînement, qui ont une date de coupure. Pour des chiffres récents, activez la recherche en ligne et vérifiez les sources.
8 questions. 60 % de bonnes réponses pour valider la leçon.
Synthèse
Mise en pratique
Ouvrez deux outils du quartet (par exemple ChatGPT et Vibe). Posez exactement la même question factuelle, par exemple « Quel est le PIB de la France en 2025 ? ». Comparez les réponses. Activez la recherche web sur les deux et reposez la question. Notez les écarts.
Critère de réussite : vous savez expliquer en une phrase pourquoi les deux outils peuvent diverger avant la recherche web, et converger après.
Un modèle de langage prédit le mot suivant à partir de tout ce qu'il a lu. Chaque réponse est un calcul, l'inférence, exécuté sur les serveurs du fournisseur et facturé au passage. Le résultat est du texte plausible, pas une vérité vérifiée.
L'IA est le domaine entier, et il contient quantité de systèmes qui classent, prédisent ou recommandent sans rien produire. L'IA générative en est une branche : elle fabrique du contenu nouveau, texte, image ou son. Un filtre antispam est de l'IA sans être génératif.
Le LLM est le moteur de prédiction ; ChatGPT est le produit commercial qui l'emballe. Un même moteur peut servir plusieurs produits, et un produit peut changer de moteur sans que rien ne le signale.
L'unité que le modèle manipule, un fragment de mot plutôt qu'un mot entier. En français, un token vaut environ 0,6 mot contre 0,75 en anglais : nos accents et notre morphologie consomment 20 à 40 % de tokens en plus. C'est sur cette unité que tout est facturé.
Parce qu'elle optimise la plausibilité, pas la vérité. Quand l'information lui manque, rien dans son fonctionnement ne l'arrête : elle produit la suite la plus probable, qui ressemble à une réponse juste. On appelle cela une hallucination, et aucun modèle n'en est exempt.
Les quatre outils du quartet ont une version gratuite, limitée en volume et adossée à des modèles moins puissants. Chaque réponse coûte pourtant un calcul réel à l'éditeur : la gratuité est financée par les abonnements payants et l'usage professionnel, pas par une absence de coût.
Aucune interdiction générale ne s'y oppose dans l'Union européenne, même si votre employeur peut avoir sa propre règle. La vraie question n'est pas la performance, où ces modèles rivalisent avec le quartet, mais la juridiction : leur service en ligne traite vos données hors de l'espace européen, sous droit chinois. Hébergés par vos soins en poids ouverts, ils ne posent plus ce problème.