Deux boutons. Le premier dit « Commencer ». Le second dit « Démarrer ». Je les ai mis côte à côte sur une page d'accueil, et je vous jure que je pensais connaître la réponse. Le mot « Commencer » gagnerait, forcément — il est plus doux, plus engageant. Trois semaines plus tard, le verdict est tombé. « Démarrer » a généré 11 % de clics en plus. Je n'y croyais pas. J'ai relancé le test. Même résultat.
Voilà ce que fait un AB test : il vous colle le nez dans vos propres certitudes et vous prouve que vous aviez tort. Pas tout le temps, mais assez souvent pour que ça devienne une habitude de travail. Et si la plupart des articles expliquent le principe (comparer deux variantes d'une même page, d'un même bouton, d'une même pub), presque aucun ne vous dit comment on monte un test qui tient debout.
Points clés à retenir
- Un AB test compare deux versions d'un même élément où un seul critère change — sinon vous ne saurez jamais ce qui a fait bouger les chiffres.
- Un test qui tourne deux jours ne vaut rien : il faut souvent une à trois semaines pour avoir assez de conversions pour trancher.
- Le seuil de signification à viser, c'est p < 0,05 et une puissance statistique d'environ 80 % — sinon vous lisez du hasard.
- Le RGPD s'applique dès que vous scindez vos visiteurs en groupes : consentement des cookies et base légale à prévoir.
- Arrêter un test dès qu'un résultat vous plaît est le meilleur moyen de se tromper.
Ab testing : la vraie définition, celle qu'on oublie trop souvent
La définition scolaire circule partout : on teste deux versions d'un objet pour voir laquelle performe le mieux. C'est exact, et c'est incomplet. La partie qu'on oublie, c'est le un seul critère. Si votre variante B change à la fois le titre, la couleur du bouton et la photo, vous obtenez un gagnant — mais vous ne saurez jamais pourquoi il a gagné. Le test vous a coûté du temps et ne vous a rien appris de réutilisable.
Pourquoi une variante ne doit changer qu'un élément
Je l'ai appris de la mauvaise façon. Sur un formulaire d'inscription, j'avais refait la variante B de fond en comble : raccourci de quatre champs, nouveau texte d'intro, CTA différent. La B a gagné de 23 %. Super. Sauf que mon client m'a demandé quel changement avait produit l'effet. Silence gêné. On a dû retester chacun des trois éléments un par un — six semaines de travail supplémentaires pour isoler ce que trois jours de test mal conçu auraient dû nous dire.
Un AB test propre, c'est une hypothèse précise et un seul levier. Par exemple : « raccourcir le formulaire de quatre champs à deux augmentera le taux d'inscription ». Vous, vous avez une hypothèse. Le test, lui, a une seule variable à manipuler.
AB test ou test multivarié : ne confondez pas
Un AB test compare deux versions qui diffèrent sur un point. Un test multivarié combine plusieurs changements et mesure leurs interactions. Le second demande beaucoup plus de trafic pour être fiable. Si vous avez moins de quelques milliers de visiteurs par mois sur la page concernée, restez à l'AB test. Vraiment.
Combien de temps faut-il tester ? Le calcul que personne ne vous montre
Question qu'on me pose à chaque audit : « On lance le test demain, on regarde vendredi ? ». Non. Trois jours, ce n'est pas un test, c'est un pari avec des graphiques.
Pour trancher honnêtement, il vous faut deux paramètres :
- Un niveau de signification à p < 0,05 — classiquement, la probabilité que le résultat soit dû au hasard reste sous les 5 %.
- Une puissance statistique d'environ 80 % — la capacité du test à détecter un effet réel s'il existe.
Concrètement, plus l'effet que vous espérez est petit, plus il vous faut de trafic. Détecter une amélioration de 2 % demande énormément de monde. Détecter un bond de 40 % se fait avec beaucoup moins. Et surtout : arrêtez de regarder les résultats tous les matins. C'est ce qu'on appelle le peeking — vous jetez un œil, la B est devant, vous voulez arrêter. Le problème, c'est que les écarts sont énormes au début puis se tassent. Arrêter trop tôt, c'est graver dans le marbre une différence qui n'existait que dans le bruit.
L'effet de nouveauté qui fausse tout
Vos habitués réagissent à ce qui est nouveau. Le changement attire l'œil simplement parce qu'il est différent, pas parce qu'il est meilleur. Sur des audiences fidèles, cet effet peut durer plusieurs jours. Une façon de le neutraliser : ne testez jamais une variante pendant moins d'une semaine complète, et vérifiez que les résultats de la première moitié du test ressemblent à ceux de la seconde. S'ils divergent, méfiance.
| Situation | Durée minimale décente | Ce qu'il faut surveiller |
|---|---|---|
| Page avec beaucoup de trafic (plusieurs milliers de visites/semaine) | 1 à 2 semaines | Stabilité des résultats semaine après semaine |
| Trafic moyen | 3 à 4 semaines | Effet de nouveauté, cycles hebdomadaires |
| Trafic faible ou conversion rare | 1 mois ou plus | Patience — ou renoncer au test et décider autrement |
Ce tableau est une règle de pouce, pas une loi. Le vrai critère reste le nombre de conversions atteint, pas le nombre de jours écoulés.
AB test et RGPD : le point que tout le monde zappe
Dès que vous répartissez vos visiteurs en groupes, vous les traitez différemment sur la base d'une donnée. Et ça, en Europe, ça déclenche des obligations.
- Le consentement des cookies : si votre outil de test s'appuie sur des cookies ou du tracking (c'est presque toujours le cas), il doit s'intégrer à votre bandeau de consentement.
- La base légale : sur quel fondement traitez-vous cette donnée ? Consentement, intérêt légitime — à vous de savoir, et l'intérêt légitime ne se proclame pas, il se justifie.
- L'information : vos visiteurs doivent pouvoir comprendre qu'ils participent à un test. Ça peut rester discret dans la politique de confidentialité, mais ça doit exister.
Franchement, l'erreur que je vois le plus souvent n'est même pas juridique, elle est pratique : l'outil de test charge avant que l'utilisateur ait dit « oui » aux cookies. Résultat, vous répartissez en groupes des gens que vous n'avez pas le droit de pister. À l'inverse, un test qui ne cible que les visiteurs ayant accepté peut avoir un échantillon biaisé — les gens qui acceptent les cookies ne sont pas représentatifs de tout le monde. C'est un compromis, et il faut le décider consciemment.
AB testing gratuit ou payant : quel outil choisir ?
Il n'y a pas de réponse universelle. Ça dépend de votre trafic, de votre stack, et de votre appétit pour les lignes de code.
| Type d'outil | Pour qui | Points forts | Limites |
|---|---|---|---|
| Solution gratuite intégrée (ex. dans une plateforme d'emailing ou d'analytics) | Débutants, petits volumes | Coût nul, prise en main rapide | Peu flexible, périmètre limité |
| Outil dédié payant | Sites avec trafic régulier | Statistiques solides, gestion multi-tests | Facturation au volume de visiteurs |
| Solution maison | Équipes techniques | Contrôle total, intégration RGPD maîtrisée | Coût de développement et de maintenance |
Pour une newsletter, la question est plus simple : votre plateforme d'emailing propose presque toujours un AB test sur l'objet, parfois sur le contenu. Testez l'objet en priorité, c'est lui qui décide de l'ouverture. Un écart de 5 points de taux d'ouverture sur un objet bien trouvé, sur une liste de quelques milliers d'abonnés, ça se voit tout de suite dans les statistiques d'ouverture.
L'AB test sur YouTube, une exception à part
YouTube fournit un outil qui teste plusieurs miniatures pour une même vidéo, et vous donne ensuite la vignette la plus performante. C'est pratique, mais ça ne teste que la miniature — pas le titre, pas l'intro, pas la description. Et le résultat dépend fortement du moment et de l'audience exposée. Ne prenez pas le gagnant d'un test de miniatures YouTube comme une vérité définitive sur votre chaîne entière : c'est utile, c'est gratuit, c'est limité.
Lire un résultat : la carte de test, et comment on l'interprète
Beaucoup d'outils affichent ce qu'on appelle une « carte » de résultat — une vue qui récapitule, pour chaque variante, le taux observé, l'écart avec la référence, et une indication de confiance. Le piège, c'est de ne regarder que la ligne du haut en se disant « la B a le meilleur taux, on garde la B ».
La bonne lecture tient en trois vérifications :
- L'écart est-il statistiquement significatif, ou est-il dans la marge d'erreur ? Si la carte affiche un intervalle de confiance qui chevauche celui de la variante A, vous n'avez rien prouvé.
- Le test a-t-il tourné assez longtemps et sur assez de monde ? Un résultat significatif sur 200 visiteurs reste fragile.
- L'écart est-il utile ? Gagner 3 % sur un taux de clic minuscule ne changera peut-être rien à vos revenus. Un petit gain sur une étape à fort enjeu, à l'inverse, peut valoir de l'or.
Une carte de résultat n'est pas une réponse. C'est un faisceau d'indices. Si trois tests successifs pointent dans la même direction, là vous tenez quelque chose.
Les erreurs que je continue de voir (et que j'ai commises)
Un récapitulatif qui vous fera gagner des semaines :
- Tester sans hypothèse. Changer une couleur « pour voir » ne vous apprend rien. Partez d'une raison : « ce bouton est trop pâle, il se perd dans le fond ».
- Tout changer d'un coup, comme je l'ai fait — et ne jamais savoir ce qui a marché.
- Arrêter dès que ça plaît. Le peeking est un tueur silencieux de fiabilité.
- Ignorer la signification statistique et célébrer un écart de 0,4 point qui n'existe pas.
- Négliger le RGPD et se demander, six mois plus tard, pourquoi la répartition des groupes ne colle pas.
- Conclure sur un segment et généraliser. Ce qui marche sur mobile peut échouer sur desktop. Parfois, il faut tester par segment.
Et une erreur plus insidieuse : croire qu'un AB test tranche définitivement. Non. Une variante qui gagne aujourd'hui peut perdre dans six mois quand votre audience aura changé. Un test, c'est une photo à un instant donné.
Ce que je retiens après tout ça
L'AB test n'est pas un bouton magique. C'est une discipline. Il vous force à formuler des hypothèses claires, à attendre, à accepter que votre intuition soit fausse — et parfois, comme mon « Commencer » contre « Démarrer », il vous surprend.
Ce qui m'a le plus servi n'a pas été un gain de conversion spectaculaire. C'est la manière dont je regarde maintenant mes propres pages : je vois des hypothèses partout, des choses à vérifier, des endroits où je me raconte des histoires. La prochaine fois que vous hésitez entre deux formulations, ne tranchez pas à l'instinct. Testez. Et prévoyez de tenir le test assez longtemps pour que le résultat ait le droit de vous contredire — parce que c'est précisément là que ça devient intéressant.