Confondre OPRO et self-refine
Self-refine = passe rapide sur la réponse. OPRO = méta-optim multi-itérations sur le prompt. Les deux ont leur place, ce ne sont pas les mêmes outils.
Méta-optimisation par prompt, formalisée par Yang et al. 2023. Cinq étapes, pas de boucle infinie.
Sans baseline ni métrique, vous tournez en rond. Sans limite d'itérations, vous tombez dans la circularité. OPRO bien appliqué fait gagner 2 à 3 itérations manuelles.
Promesse
Vous saurez appliquer OPRO pour faire itérer l'IA sur la qualité d'un prompt, et reconnaître ses limites avant de partir en boucle infinie.
Pourquoi maintenant
OPRO (Optimization by PROmpting) a été formalisé par Yang et al. en 2023, dans le cadre des travaux Google DeepMind sur l'optimisation des grands modèles. Le pattern utilise l'IA elle-même comme optimiseur de prompts.
En 2026, OPRO connaît une seconde vie. Les modèles Thinking (GPT-5.6 Sol Pro, Claude Opus 5 adaptive thinking) facilitent l'auto-critique structurée. Mais le pattern attire aussi un usage flou : « demande à l'IA de te faire un meilleur prompt ». Cette version simpliste produit des résultats inégaux. La méthode rigoureuse, en cinq étapes, est ce qui transforme OPRO en outil reproductible.
Le concept central
OPRO repose sur trois principes.
Baseline et métrique. Vous ne pouvez pas optimiser sans savoir ce que vous mesurez. Précision factuelle, longueur cible, format respecté, ton calibré : choisissez la métrique avant de lancer l'optimisation.
Exploration multi-variantes. L'IA propose plusieurs versions du prompt, pas une seule. Cinq variations donnent une exploration utile. Une seule, c'est juste une réécriture.
Validation empirique. Vous testez chaque variante sur des cas représentatifs. Vous comparez les sorties à la métrique. Vous gardez le prompt qui maximise la métrique, pas celui qui « semble mieux écrit ».
OPRO se distingue du self-refine. Self-refine est en une passe (« critique ta réponse et refais-la »). OPRO est une méta-optimisation multi-itérations sur le prompt, pas sur la réponse. Les deux se combinent, mais ce ne sont pas les mêmes patterns.
Méthode
Prompt actuel + ce que vous voulez maximiser. Format, ton, longueur, précision factuelle.
L'IA propose 5 variantes fondamentalement différentes + 1 phrase qui explique ce que chacune modifie.
Cas typique + tendu + marginal. L'étape la plus chronophage, celle qui distingue OPRO d'une réécriture aveugle.
Celle qui maximise objectivement la métrique sur les 3 cas. Pas celle qui « sonne le mieux ».
Boucle OPRO sur le gagnant pour affiner. Pas plus de 2 itérations pour éviter la circularité.
Multi-IA
Qui exécute bien OPRO
Limites
Circularité. L'IA optimise pour SES propres préférences (lisibilité, complétude, structure). Si votre métrique ne correspond pas à ces préférences, OPRO peut diverger de votre objectif réel.
Métrique floue. « Meilleure réponse » n'est pas une métrique. Sans critère explicite, OPRO produit une optimisation aveugle. C'est l'erreur la plus fréquente.
Prompts à fort contexte humain. Pour un prompt qui mobilise une nuance culturelle, un humour fin, une voix éditoriale spécifique, OPRO atteint vite ses limites. L'IA optimise pour la moyenne, pas pour votre voix.
Coût en tokens. Cinq variations testées sur trois cas représentatifs = quinze inférences. Sur un modèle premium, le coût devient sensible. Réservez OPRO aux prompts critiques, pas à chaque tâche du jour.
Exemple chiffré
Baseline : « Rédige un email de relance commerciale pour un prospect silencieux depuis 10 jours. »
Métrique : objet ≤50 caractères, corps ≤100 mots, ton direct, pas de formule creuse en ouverture, mention d'une question de relance ouverte.
Étape 2 : 5 variations à Claude Opus 5. V1 ajoute un rôle. V2 ajoute few-shot. V3 explicite l'audience. V4 impose le format. V5 combine 1+3+4.
Étape 3 : test sur 3 cas (prospect tiède, froid, intermédiaire). Notation selon métrique.
Étape 4 : la V5 gagne sur les 3 cas, score moyen 4,3 / 5 contre 2,8 pour le baseline.
Étape 5 : boucle OPRO sur V5. V5b gagne 0,2 point. Arrêt.
Gain mesuré : prompt de 2,8 → 4,5 sur 5 en deux itérations. Coût total : ~20 inférences sur Claude Opus 5.
À éviter
Self-refine = passe rapide sur la réponse. OPRO = méta-optim multi-itérations sur le prompt. Les deux ont leur place, ce ne sont pas les mêmes outils.
Si vous ne savez pas où vous partez, vous ne savez pas si vous progressez.
« Mieux écrit » n'est pas une métrique. Précisez 2 ou 3 critères mesurables.
Au-delà de 2-3 boucles, vous optimisez pour les préférences de l'IA, pas pour votre cas. Stoppez tôt.
8 questions. 60 % de bonnes réponses pour valider la leçon.
Synthèse
Mise en pratique
Identifiez un prompt critique que vous utilisez régulièrement (relance commerciale, brief créatif, synthèse récurrente). Définissez une métrique mesurable. Lancez une boucle OPRO complète sur Claude Opus 5 ou GPT-5.6 Sol Pro : 5 variations, test sur 3 cas, sélection objective, 1 itération supplémentaire si pertinent.
Critère de réussite : vous avez un prompt v2 qui surpasse mesurablement le baseline sur votre métrique, et vous savez chiffrer le gain. Vous savez aussi reconnaître si OPRO ne s'applique pas à votre cas (voix éditoriale forte, métrique impossible à formuler).
Une méta-optimisation décrite par Yang et al. en 2023 : produire cinq variations d'un prompt, les tester empiriquement sur trois cas, puis garder objectivement la meilleure.
OPRO travaille sur le prompt, en plusieurs itérations ; l'auto-affinage travaille sur la réponse, en une seule passe. Une à deux itérations OPRO suffisent, au-delà le coût en tokens dépasse le gain.
Cinq variations, une sélection, puis une ou deux itérations de plus au maximum. Au-delà, vous optimisez le bruit : les gains deviennent invisibles et vous risquez d'ajuster le prompt aux préférences du modèle plutôt qu'à votre besoin.
Oui, et elle doit être vérifiable. « Mieux écrit » ne permet aucun arbitrage. « Tient en 150 mots, cite deux chiffres sourcés, ne contient aucune formule d'atténuation » se contrôle en dix secondes.
La circularité. Vous demandez à un modèle d'optimiser un prompt qui sera jugé par lui-même : il converge vers ce qu'il aime produire. Le garde-fou est de valider la version retenue sur une autre plateforme.