Optimiser sur la « puissance »
Sortir Opus 5 ou GPT-5.6 Sol pour reformuler un email, c'est mettre un GPU de 700 watts sur une tâche qu'un modèle léger règle en deux secondes. Pure inflation.
Une grille à quatre critères pour décider sans suivre le top du jour LinkedIn.
Chaque éditeur propose plusieurs modèles. Le marketing pousse en permanence le plus puissant, alors qu'un modèle léger règle 70 % des tâches courantes. Cette leçon vous redonne le contrôle.
Promesse
Vous saurez choisir un modèle IA en raisonnant sur quatre critères : juridiction, capacité de raisonnement, capacité agentique, coût Wh par requête.
Pourquoi maintenant
Chaque éditeur en propose plusieurs au sein de son offre : ChatGPT décline GPT-5.6 Sol, Terra et Luna, Anthropic empile Fable, Opus, Sonnet et Haiku, Google maintient Gemini Pro et Flash, Mistral aligne Large, Medium et Small. Hors du quartet, des challengers montent, Grok (xAI) côté américain, DeepSeek côté chinois, et la même grille s'applique à eux, juridiction en tête. Le marketing IA pousse en permanence le modèle le plus puissant, alors qu'un modèle léger suffit pour 70 % des tâches courantes.
Depuis juillet 2026, une difficulté s'ajoute : le haut de gamme n'est plus compris dans tous les plans. Claude Fable 5, qu'Anthropic présente comme son modèle le plus capable, n'est inclus que dans Max et Team Premium, plafonné à 50 % des limites hebdomadaires, il se paie au crédit sur le plan Pro, et il est absent du plan gratuit. Le meilleur modèle sur le papier n'est pas forcément celui auquel votre abonnement donne accès.
Choisir « par défaut » est devenu un risque : risque de surcoût, risque énergétique, risque juridictionnel quand vous envoyez machinalement vos données vers un modèle américain. La grille de décision que voici vous redonne le contrôle.
Le concept central
Quatre questions à poser, dans cet ordre. La séquence compte : la juridiction se vérifie avant la performance, le coût Wh se calcule à la fin.
Où vivent vos données pendant et après la requête ? Critique pour RH, juridique, santé, stratégique.
Chaîne logique, calcul, analyse étape par étape ? Ou simple reformulation ?
Exécuter une suite d'actions de bout en bout ? Ou répondre une fois ?
Un Thinking consomme 3 à 10 fois plus qu'un modèle léger. Vraiment besoin du max ?
Panorama 2026
Les modèles flagship 2026 ont chacun un profil dominant sur la grille. Lire de gauche à droite pour cadrer votre choix selon l'usage.
OpenAI · ChatGPT · USA
Anthropic · USA · opt-out API
Google · USA · EU activable
Mistral AI · Vibe · France
Hors du quartet
Le quartet n'est pas le marché. Sur OpenRouter, la plateforme qui répartit les requêtes entre fournisseurs, les modèles chinois sont passés de moins de 2 % du trafic fin 2024 à environ 51 % en avril 2026, pendant que la part des modèles américains tombait de 70 % à 30 % en un an. DeepSeek, Qwen et Kimi ne sont plus des curiosités, et Grok occupe une place comparable côté américain.
La bonne nouvelle est que la grille ne change pas. Elle se contente de donner des réponses différentes.
Juridiction. C'est le critère qui tranche le plus vite. Passer par le service en ligne d'un éditeur chinois place vos données hors de l'espace européen, sous un droit qui n'est pas le vôtre. Pour une note RH ou un contrat, la question est réglée avant même de regarder les performances.
Raisonnement et agentique. C'est là que ces modèles se sont rapprochés le plus vite, en particulier sur le code et les tâches à étapes. Sur un usage sans données sensibles, un brainstorming ou un exercice de style, l'écart avec le quartet ne justifie plus grand-chose.
Coût. C'est leur argument principal, et il est réel. À qualité comparable sur des tâches courantes, la facture est souvent divisée par plusieurs.
Une différence structurelle mérite d'être connue : la plupart de ces modèles sont publiés en poids ouverts. Vous pouvez les héberger vous-même, sur votre infrastructure ou celle d'un prestataire européen. La juridiction redevient alors la vôtre, et le premier critère de la grille cesse d'être bloquant. Dans le quartet, seul Mistral le permet : Mistral Large 3 et la gamme Small sont publiés en poids ouverts sous licence Apache 2.0, et Mistral Medium 3.5 sous une licence MIT modifiée. OpenAI, Anthropic et Google ne proposent pas leurs modèles phares en auto-hébergement.
C'est l'arbitrage à retenir : en service hébergé, la juridiction les écarte des usages sensibles. En auto-hébergement, ils deviennent la seule option qui combine coût bas et maîtrise complète, au prix d'une compétence technique que peu d'organisations ont en interne.
Méthode appliquée
Cas 1. Note interne confidentielle (RH). Vous préparez un mémo sur une réorganisation. Données très sensibles. Juridiction : France ou USA sans training. Choix : Vibe (souveraineté, en plan payant) ou Claude (politique opt-out training documentée sur l'API). ChatGPT et Gemini passent en seconde ligne sauf à activer les modes entreprise dédiés.
Cas 2. Recherche fact-checkée pour un article. Vous devez vérifier des chiffres récents et croiser des sources web. Choix : Gemini 3.1 Pro avec recherche live native, ou ChatGPT en mode recherche. Le critère est ici la fraîcheur des données, pas la souveraineté.
Cas 3. Brainstorm créatif sans enjeu factuel. Vous cherchez 10 idées de titres pour un atelier. Données triviales. Optimisez sur le coût Wh : Haiku (Anthropic), Mistral Small ou Gemini Flash suffisent largement. Sortir Opus 5 pour ça serait du gâchis énergétique et budgétaire.
Exemple concret
Un cadre RH prépare un mémo confidentiel sur une réorganisation impliquant 40 postes. Données ultra-sensibles. Application de la grille :
1. Tâche. Rédaction structurée + relecture juridique. Pas d'agentique.
2. Juridiction. France ou USA sans training. Vibe ou Claude.
3. Capacités. Pas de besoin de fenêtre 1M ni de recherche live. Une fenêtre modeste suffit.
4. Coût Wh. Modèle moyen suffit. Mistral Medium ou Claude Sonnet, pas Opus.
Choix final : Vibe (Mistral Medium 3.5) en plan payant, juridiction française, fenêtre 256k, opt-out d'entraînement par défaut, coût Wh raisonnable. Pas ChatGPT par défaut. La décision tient en deux minutes une fois la grille intégrée.
À éviter
Sortir Opus 5 ou GPT-5.6 Sol pour reformuler un email, c'est mettre un GPU de 700 watts sur une tâche qu'un modèle léger règle en deux secondes. Pure inflation.
Envoyer une note RH à ChatGPT par habitude, alors que Vibe ou Claude couvriraient le cas, c'est créer une exposition juridique inutile.
Un modèle qui raisonne longuement (Thinking) n'est pas forcément agentique. Un modèle agentique exécute des actions externes (clic, scraping, posting). Deux capacités différentes.
8 questions. 60 % de bonnes réponses pour valider la leçon.
Synthèse
Mise en pratique
Reprenez vos trois dernières requêtes IA professionnelles. Pour chacune, appliquez la grille à 4 critères. Notez si votre choix de modèle de l'époque tient toujours, ou si vous auriez fait mieux avec un autre.
Critère de réussite : vous identifiez au moins une requête où vous avez sur-dimensionné le modèle, et une où vous auriez dû changer de juridiction.
La question n'a pas de réponse absolue, seulement une réponse par cas d'usage. Quatre critères la tranchent, dans cet ordre : où vivent vos données, la tâche demande-t-elle du raisonnement, faut-il exécuter des actions, et quel est le coût énergétique acceptable. Un classement général change tous les mois, cette grille non.
Non, et c'est l'erreur la plus coûteuse. Un modèle léger comme Haiku, Gemini Flash ou Mistral Small couvre l'essentiel des tâches quotidiennes. Sortir un modèle de raisonnement pour reformuler un email consomme jusqu'à dix fois plus pour un résultat équivalent.
Non, ce sont deux capacités distinctes. Un modèle de raisonnement décompose un problème avant de répondre, mais il répond. Un modèle agentique exécute des actions à l'extérieur : naviguer, cliquer, écrire dans un outil. Un modèle peut avoir l'une sans l'autre.
Reprenez vos dernières requêtes et demandez-vous, pour chacune, si un modèle léger aurait donné un résultat équivalent. Reformulation, traduction, résumé court et brainstorming n'ont besoin ni de raisonnement étendu ni de grande fenêtre de contexte. Si la réponse vous convenait du premier coup, le modèle était probablement trop gros.
Pas par réflexe. Un nouveau modèle ne déplace votre grille que s'il change une des quatre réponses : juridiction, capacité de raisonnement, capacité agentique, coût. Sur la majorité des tâches courantes, un modèle léger d'il y a six mois fait le même travail que le dernier annoncé. Testez sur vos propres cas avant de basculer.