On entend "l'IA fait l'analyse heuristique". Laquelle. Sur une capture de page entière, avec la mise en page, la hiérarchie, la position des blocs, tous les modèles ne se valent pas. Le prompt compte, le modèle aussi. Voici le prompt que j'utilise, une démo sur ma propre page, et le protocole pour comparer deux modèles toi-même au lieu de me croire sur parole.

D'abord, de quoi on parle

L'analyse heuristique n'est pas une invention de l'IA. Jakob Nielsen a posé en 1994 une liste de principes d'utilisabilité, visibilité de l'état du système, correspondance avec le monde réel, contrôle utilisateur, cohérence, prévention des erreurs, et quelques autres. Auditer une page à l'heuristique, c'est la confronter à cette grille établie, principe par principe. L'IA ne réinvente rien, elle applique une méthode qui a trente ans, plus vite qu'un humain sur une capture.

C'est important de le dire, parce que ça déplace la question. Le sujet n'est pas "l'IA sait-elle faire de l'analyse heuristique", la réponse est oui, la grille est publique. Le sujet est "ce modèle-là, sur cette capture-là, ancre-t-il ses remarques ou récite-t-il la grille dans le vide". Et là, les modèles divergent nettement.

Et le prompt fait au moins la moitié du travail. Le même modèle, avec un prompt qui interdit explicitement le générique, ancre bien mieux qu'avec un "analyse cette page" nu qui le laisse filer vers les banalités. Modèle et prompt ne sont pas deux questions séparées, ce sont deux réglages du même appareil, et tant que tu n'as pas fixé les deux, tu ne juges rien, tu tires au hasard.

Pourquoi le modèle change le résultat sur cette tâche

Une analyse heuristique sur capture, c'est une tâche à long contexte et visuelle en même temps. Le modèle doit tenir toute la page en tête, croiser hiérarchie, libellés, position des éléments, et raisonner sans perdre le fil. Ce n'est pas lire un paragraphe, c'est garder une carte mentale de l'écran entier pendant qu'il note.

Les modèles diffèrent nettement sur ce raisonnement long et multimodal, et le symptôme est toujours le même. Un modèle qui perd le fil régresse vers la sécurité, il produit des remarques vraies mais vagues, applicables à n'importe quelle page, parce qu'une généralité ne prend aucun risque. "Améliorez la clarté de votre proposition de valeur" ne peut pas être faux, donc un modèle qui ne tient plus le contexte s'y réfugie. Un modèle qui tient le contexte fait l'inverse, il pointe l'élément précis, à cet endroit, sur cette page, et prend le risque d'avoir tort. C'est toute la différence entre un rapport utile et une liste de conseils qu'on a déjà lus mille fois. D'où l'erreur de prendre le premier modèle venu par habitude.

Le test de qualité tient donc en une question, la remarque cite-t-elle un élément visible de la page, ou pourrait-elle s'appliquer partout. L'ancrage est le signal, la généralité est le bruit.

Pourquoi la capture entière, précisément. Parce qu'une remarque de position, "ton prix arrive après le livrable", exige de situer un bloc par rapport à tous les autres. Le modèle ne peut la produire que s'il tient l'ordre de la page en mémoire, du haut jusqu'au bas. Passe-lui une zone isolée, il te parlera de cette zone, jamais de l'endroit où elle tombe dans le parcours. C'est là que la capacité à tenir un long contexte visuel se paie cash, les meilleures remarques d'un audit sont des remarques de position, et une remarque de position est impossible sans la vue d'ensemble.

Comparaison en deux colonnes, une remarque ancrée qui pointe un élément précis de la page, une généralité applicable à n'importe quelle page.
Une remarque ancrée contre une généralité applicable partout.

Le prompt

Rôle : analyste CRO, évaluation heuristique sur capture de page.
Entrée : une capture de la page entière.
Consigne : pour chaque zone, hero, preuve, formulaire, CTA, pied de page,
1. décris ce que la zone communique en une phrase,
2. note la friction principale en pointant l'élément visuel précis,
3. propose la correction.
Termine par les 3 frictions au meilleur rapport gain sur effort.
Interdit : aucune remarque qui pourrait s'appliquer à n'importe quelle
page. Chaque point cite un élément visible de la capture.

L'interdit final est le coeur du prompt. Sans lui, le modèle glisse vers le générique dès qu'il fatigue. Avec lui, tu le forces à ancrer ou à se taire.

Un exemple de la différence, sur le même défaut. Version générique, "améliore la visibilité de ta proposition de valeur". Version ancrée, "ta promesse 2 jours ouvrés est dans la section prix en bas, pas dans le hero, remonte-la". Les deux parlent du même problème. La première, tu l'as lue cent fois et tu ne sais pas quoi en faire, la seconde, tu peux l'appliquer cet après-midi. Même sujet, deux mondes, et seul un modèle qui a réellement vu ta page peut écrire la seconde.

La démo, sur ma propre page

J'ai passé ce prompt sur ma page Radiographie CRO. Il a pointé deux choses justes, ancrées, vérifiables.

La première, la section prix arrive tard, après la méthode et le livrable, alors qu'un acheteur pressé la cherche plus tôt. Ce n'est pas une remarque de principe, c'est une observation de position, le bloc prix est physiquement bas dans la page, et l'oeil qui le cherche doit scroller longtemps. La seconde, la promesse "2 jours ouvrés", qui est un de mes arguments les plus forts, n'apparaît pas dans le hero, elle est enterrée dans la section prix. Un délai court rassure et différencie, le cacher en bas de page, c'est gâcher un atout.

Précis, actionnable, ancré sur des éléments réels de ma page. C'est le genre de sortie qu'un bon modèle donne sur cette tâche. Un modèle qui aurait décroché aurait écrit "clarifiez votre proposition de valeur" ou "renforcez vos preuves", vrai pour n'importe quelle page, utile pour aucune. Je ne te montre pas un transcript, tu ne saurais pas s'il est réel, je te montre ce que la bonne sortie a changé pour moi, remonter la promesse 2 jours dans le hero et rapprocher le prix.

Note un point sur ces deux remarques, ce sont des remarques de position, pas de contenu. Le modèle ne dit pas "ta promesse est mauvaise", il dit "ta bonne promesse est au mauvais endroit". C'est exactement ce qu'un modèle qui ne tient pas la page entière est incapable de produire, il faudrait qu'il compare le hero et la section prix, donc qu'il tienne les deux en tête au même moment. Un modèle faible aurait loué le hero, puis loué le prix, séparément, sans jamais voir que l'un devrait nourrir l'autre.

Page Radiographie, la section prix repérée bas dans la page avec une flèche, et la promesse deux jours à remonter dans le hero.
Vue schématique, le prix arrive tard et la promesse deux jours est enterrée.

L'artefact, le protocole de comparaison

Tu veux savoir quel modèle sert ton oeil. Ne me crois pas sur parole, teste, avec cette grille.

Comparaison de deux modèles, sur une même capture de page

1. Prends une seule page, une capture entière.
2. Passe le MÊME prompt dans les deux modèles, sans rien changer.
3. Pour chaque remarque produite, coche une colonne :
   ANCRÉE    elle cite un élément précis et visible de la page
   GÉNÉRIQUE elle s'appliquerait telle quelle à n'importe quelle page
4. Compte.
   Modèle A : nb ancrées / nb génériques
   Modèle B : nb ancrées / nb génériques
5. Le meilleur pour cette tâche, c'est celui qui a le plus d'ancrées
   et le moins de génériques. Pas celui qui écrit le plus.

C'est tout. Pas de benchmark abstrait, pas de classement général, un test sur ta page, avec ton oeil. Le ratio ancrées sur génériques est un juge honnête, parce qu'il mesure exactement ce dont tu as besoin, du spécifique sur ta page, pas de la prose confortable.

Deux garde-fous pour décider. Un, ne tranche pas sur trois remarques, passe au moins une page dense avec une dizaine de points, l'écart entre les deux modèles devient net. Deux, refais le test sur deux ou trois pages différentes, un modèle peut ancrer sur une landing simple et décrocher sur un tunnel chargé. Le bon modèle pour toi, c'est celui qui garde son taux d'ancrage quand la page se complique, pas celui qui brille sur le cas facile.

Pourquoi ne pas juste prendre le meilleur modèle du moment

Objection naturelle, il existe des classements, prends le numéro un et arrête de tester. Le piège, c'est qu'un classement général mesure une moyenne de tâches, pas la tienne. Un modèle peut exceller au raisonnement pur et se disperser sur une capture chargée, ou l'inverse. La performance sur cette tâche précise, tenir une page entière en tête et ancrer chaque remarque, ne se lit pas dans un score global. Ton test sur ta page vaut mieux que n'importe quel palmarès, parce qu'il évalue le seul cas qui t'intéresse, le tien. En pratique, sur les captures de page entière, je constate qu'un modèle à fort raisonnement long contexte ancre mieux ses remarques, mais je te donne le protocole justement pour que tu n'aies pas à me faire confiance là-dessus.

Où le protocole ne suffit pas

Compter les remarques ancrées trie les modèles, ça ne fait pas l'audit à ta place. Une remarque peut être parfaitement ancrée et pointer une friction qui n'a aucune importance pour ton business. Le modèle voit que ton prix arrive tard, il ne sait pas si c'est un problème ou un choix, peut-être que tu retardes le prix exprès pour installer la valeur d'abord. L'ancrage garantit que la remarque parle de ta page, pas qu'elle mérite ton temps. Ce dernier tri, ce qui compte contre ce qui est juste vrai, reste humain, et c'est lui qui sépare un rapport propre d'un audit utile.

Et il y a l'inverse, la remarque qu'aucun modèle ne fera, parce qu'elle demande de connaître ton marché. Aucun modèle ne te dira que ton prix bas trahit un positionnement premium, ou que ta promesse 2 jours crée une attente que ton process ne tiendra pas à dix clients par semaine. Ça ne se voit pas sur une capture, ça se sait. Le protocole choisit le meilleur lecteur de ta page, il ne remplace jamais celui qui connaît ton business.

Ce que tu retiens

"L'IA fait l'analyse heuristique" ne veut rien dire tant que tu n'as pas choisi le modèle et cadré le prompt. Le prompt ci-dessus force l'ancrage, le protocole te dit quel modèle ancre le mieux sur ta page, et ton jugement tranche ce qui compte. Une analyse heuristique ancrée, c'est la première brique de ma Radiographie CRO. Si tu veux la version complète sur ta page, c'est là.

Dans la même série

Ce prompt s'inscrit dans mon pilier sur l'IA et l'audit CRO. Il prend son sens dans le système d'audit que je fais tourner avec Claude Code, et il existe en version encodée dans les trois skills d'audit, fichiers fournis.