Connexion
Mis à jour le
Sur cette page
Prompting avancé

OPRO en 5 étapes.

Méta-optimisation par prompt, formalisée par Yang et al. 2023. Cinq étapes, pas de boucle infinie.

⏱ 6 min de lecture🔁 5 étapes disciplinées⚠️ 4 limites à connaître
ChatGPTClaude

Sans baseline ni métrique, vous tournez en rond. Sans limite d'itérations, vous tombez dans la circularité. OPRO bien appliqué fait gagner 2 à 3 itérations manuelles.

Promesse

À la fin de cette leçon

Vous saurez appliquer OPRO pour faire itérer l'IA sur la qualité d'un prompt, et reconnaître ses limites avant de partir en boucle infinie.

Pourquoi maintenant

Une seconde vie

OPRO (Optimization by PROmpting) a été formalisé par Yang et al. en 2023, dans le cadre des travaux Google DeepMind sur l'optimisation des grands modèles. Le pattern utilise l'IA elle-même comme optimiseur de prompts.

En 2026, OPRO connaît une seconde vie. Les modèles Thinking (GPT-5.6 Sol Pro, Claude Opus 5 adaptive thinking) facilitent l'auto-critique structurée. Mais le pattern attire aussi un usage flou : « demande à l'IA de te faire un meilleur prompt ». Cette version simpliste produit des résultats inégaux. La méthode rigoureuse, en cinq étapes, est ce qui transforme OPRO en outil reproductible.

Le concept central

Méta-optimisation par prompt

OPRO repose sur trois principes.

Baseline et métrique. Vous ne pouvez pas optimiser sans savoir ce que vous mesurez. Précision factuelle, longueur cible, format respecté, ton calibré : choisissez la métrique avant de lancer l'optimisation.

Exploration multi-variantes. L'IA propose plusieurs versions du prompt, pas une seule. Cinq variations donnent une exploration utile. Une seule, c'est juste une réécriture.

Validation empirique. Vous testez chaque variante sur des cas représentatifs. Vous comparez les sorties à la métrique. Vous gardez le prompt qui maximise la métrique, pas celui qui « semble mieux écrit ».

💡

OPRO se distingue du self-refine. Self-refine est en une passe (« critique ta réponse et refais-la »). OPRO est une méta-optimisation multi-itérations sur le prompt, pas sur la réponse. Les deux se combinent, mais ce ne sont pas les mêmes patterns.

Méthode

Cinq étapes

  1. Baseline + métrique

    Prompt actuel + ce que vous voulez maximiser. Format, ton, longueur, précision factuelle.

  2. 5 variations + justification

    L'IA propose 5 variantes fondamentalement différentes + 1 phrase qui explique ce que chacune modifie.

  3. Tester sur 3 cas

    Cas typique + tendu + marginal. L'étape la plus chronophage, celle qui distingue OPRO d'une réécriture aveugle.

  4. Garder la variante max

    Celle qui maximise objectivement la métrique sur les 3 cas. Pas celle qui « sonne le mieux ».

  5. 1-2 itérations max

    Boucle OPRO sur le gagnant pour affiner. Pas plus de 2 itérations pour éviter la circularité.

Multi-IA

Qui exécute bien OPRO

  • Claude Opus 5 : la meilleure IA pour OPRO en 2026. Auto-critique sincère, nuance, 5 variations vraiment distinctes. Recommandé pour les prompts à fort enjeu.
  • GPT-5.6 Sol Pro : très bon en mode Thinking. Légèrement plus tendance à valider sa propre proposition.
  • Gemini 3.1 Pro : correct, et meilleur encore en mode Deep Think. Sous-optimal sur les paliers Flash. Auto-critique parfois flatteuse.
  • Mistral Medium 3.5 (29 avril 2026) : correct, surtout pour 3 ou 4 variations. Au-delà, les variations se rapprochent.

Limites

Quatre angles morts

Circularité. L'IA optimise pour SES propres préférences (lisibilité, complétude, structure). Si votre métrique ne correspond pas à ces préférences, OPRO peut diverger de votre objectif réel.

Métrique floue. « Meilleure réponse » n'est pas une métrique. Sans critère explicite, OPRO produit une optimisation aveugle. C'est l'erreur la plus fréquente.

Prompts à fort contexte humain. Pour un prompt qui mobilise une nuance culturelle, un humour fin, une voix éditoriale spécifique, OPRO atteint vite ses limites. L'IA optimise pour la moyenne, pas pour votre voix.

Coût en tokens. Cinq variations testées sur trois cas représentatifs = quinze inférences. Sur un modèle premium, le coût devient sensible. Réservez OPRO aux prompts critiques, pas à chaque tâche du jour.

Exemple chiffré

Optimiser une relance commerciale

Baseline : « Rédige un email de relance commerciale pour un prospect silencieux depuis 10 jours. »

Métrique : objet ≤50 caractères, corps ≤100 mots, ton direct, pas de formule creuse en ouverture, mention d'une question de relance ouverte.

Étape 2 : 5 variations à Claude Opus 5. V1 ajoute un rôle. V2 ajoute few-shot. V3 explicite l'audience. V4 impose le format. V5 combine 1+3+4.

Étape 3 : test sur 3 cas (prospect tiède, froid, intermédiaire). Notation selon métrique.

Étape 4 : la V5 gagne sur les 3 cas, score moyen 4,3 / 5 contre 2,8 pour le baseline.

Étape 5 : boucle OPRO sur V5. V5b gagne 0,2 point. Arrêt.

💡

Gain mesuré : prompt de 2,8 → 4,5 sur 5 en deux itérations. Coût total : ~20 inférences sur Claude Opus 5.

À éviter

Les pièges courants

Confondre OPRO et self-refine

Self-refine = passe rapide sur la réponse. OPRO = méta-optim multi-itérations sur le prompt. Les deux ont leur place, ce ne sont pas les mêmes outils.

Itérer sans baseline

Si vous ne savez pas où vous partez, vous ne savez pas si vous progressez.

Métrique floue

« Mieux écrit » n'est pas une métrique. Précisez 2 ou 3 critères mesurables.

Trop d'itérations

Au-delà de 2-3 boucles, vous optimisez pour les préférences de l'IA, pas pour votre cas. Stoppez tôt.

Quiz de validation

Quiz de validation

8 questions. 60 % de bonnes réponses pour valider la leçon.

1Que signifie OPRO et qui l'a formalisé ?
2Quelle est la différence entre OPRO et self-refine ?
3Combien de variations sont demandées à l'IA dans l'étape 2 d'une boucle OPRO disciplinée ?
4Sur quelle IA OPRO donne-t-il les meilleurs résultats en 2026 selon la leçon ?
5Cochez les 4 limites d'OPRO mentionnées dans la leçon.(plusieurs réponses)
6Cochez les pièges courants quand on utilise OPRO.(plusieurs réponses)
7Une boucle OPRO disciplinée prévoit 1 ou 2 itérations supplémentaires maximum après la sélection initiale.
8« Mieux écrit » est une métrique de succès suffisante pour lancer une boucle OPRO.

Synthèse

À retenir

Cinq points pour ancrer la leçon

OPRO (Yang et al. 2023) = méta-optim par prompt. Cinq variations, test empirique, sélection objective.
Cinq étapes disciplinées. Baseline + métrique, 5 variations, test 3 cas, garder la meilleure, 1 à 2 itérations max.
Claude Opus 5 = meilleure IA pour OPRO. Auto-critique sincère, vraies variations distinctes.
OPRO ≠ self-refine. Méta-optim multi-itérations sur le prompt vs single-pass sur la réponse.
Quatre limites à connaître. Circularité, métrique floue, prompts à voix éditoriale, coût en tokens.

Mise en pratique

20 minutes pour itérer

Identifiez un prompt critique que vous utilisez régulièrement (relance commerciale, brief créatif, synthèse récurrente). Définissez une métrique mesurable. Lancez une boucle OPRO complète sur Claude Opus 5 ou GPT-5.6 Sol Pro : 5 variations, test sur 3 cas, sélection objective, 1 itération supplémentaire si pertinent.

Critère de réussite : vous avez un prompt v2 qui surpasse mesurablement le baseline sur votre métrique, et vous savez chiffrer le gain. Vous savez aussi reconnaître si OPRO ne s'applique pas à votre cas (voix éditoriale forte, métrique impossible à formuler).

Questions fréquentes

Qu'est-ce que la méthode OPRO ?

Une méta-optimisation décrite par Yang et al. en 2023 : produire cinq variations d'un prompt, les tester empiriquement sur trois cas, puis garder objectivement la meilleure.

Quelle différence entre OPRO et l'auto-affinage ?

OPRO travaille sur le prompt, en plusieurs itérations ; l'auto-affinage travaille sur la réponse, en une seule passe. Une à deux itérations OPRO suffisent, au-delà le coût en tokens dépasse le gain.

Combien d'itérations dans une boucle OPRO ?

Cinq variations, une sélection, puis une ou deux itérations de plus au maximum. Au-delà, vous optimisez le bruit : les gains deviennent invisibles et vous risquez d'ajuster le prompt aux préférences du modèle plutôt qu'à votre besoin.

Faut-il une métrique avant de lancer OPRO ?

Oui, et elle doit être vérifiable. « Mieux écrit » ne permet aucun arbitrage. « Tient en 150 mots, cite deux chiffres sourcés, ne contient aucune formule d'atténuation » se contrôle en dix secondes.

Quel est le principal risque de la méthode ?

La circularité. Vous demandez à un modèle d'optimiser un prompt qui sera jugé par lui-même : il converge vers ce qu'il aime produire. Le garde-fou est de valider la version retenue sur une autre plateforme.