Experiment och utvärdering

Tolka konfidensintervall för annonser i ChatGPT

Bedöm förbättring, risk och praktisk betydelse i ChatGPT-annonstester med ett korrekt tolkat konfidensintervall för skillnaden mellan alternativen.

Börja läsa
Bildillustration: Ett avlångt grönt glasblock möter en mörk och en korallfärgad skiva på en ljus yta.
BildillustrationGlasets utsträckning och de två skivorna gestaltar att osäkerhet behöver bedömas mot både nollskillnad och affärens krav.
Arbetsguiden

Det här får du hjälp med.

Experiment och utvärdering
  • Läs intervallet för skillnaden, inte bara varje alternativs separata intervall.
  • Jämför både med noll och med den förbättring som behövs i verksamheten.
  • Ett smalt intervall rättar inte fel i tilldelning, mätning eller datamognad.

En rapport visar att den nya bokningssidan ger 6,5 procents konvertering och den gamla 5 procent efter klick från annonser i ChatGPT. Det ser lovande ut. Men skillnaden på 1,5 procentenheter är en skattning från ett begränsat underlag, inte ett säkert löfte om nästa månads utfall. Ett konfidensintervall hjälper er förstå hur precist skillnaden har skattats under en bestämd statistisk modell.

Den viktigaste läsfrågan är vilka effektstorlekar som fortfarande är förenliga med data och modellen. Det är mer användbart än att bara sätta en grön markering på ordet signifikant. Vår rekommendation är att skriva både skattningen och intervallet i beslutsunderlaget, tillsammans med en tydlig definition av vad som har jämförts.

Börja med vilket intervall ni har framför er

Ett intervall kring konverteringsgraden för sida B besvarar en fråga om B:s nivå. Ett intervall kring skillnaden B minus A besvarar frågan om jämförelsen. De är inte utbytbara. Två separata intervall som överlappar är inte i sig ett korrekt test av skillnaden, och deras ändpunkter ska inte bara subtraheras för att skapa ett nytt intervall.

Skriv därför ut parametern: exempelvis skillnaden i andelen tilldelade besökare som bokar inom det bestämda observationsfönstret. Definiera om effekten uttrycks i procentenheter, relativ procent eller ett annat mått. Från 5 till 6,5 procent är ökningen 1,5 procentenheter eller 30 procent relativt utgångsnivån. De båda talen beskriver samma punktestimat men kräver olika intervallberäkningar.

OpenAI:s rapportering använder konverteringar delat med klick för post-click CVR. Den kvoten ska inte automatiskt behandlas som oberoende personers binära bokningsutfall. Om rapporten saknar den information som analysmetoden kräver behöver ni ändra metoden eller begränsa slutsatsen, inte bara mata kvoten i en kalkylator.

Räkna ett exempel och skriv antagandena bredvid

Följande är ett hypotetiskt webbplatstest som annonsören genomför med egen giltig randomisering efter annonsklick. Anta 2 000 oberoende, unika tilldelade besökare per sida, högst en bokning per person och ett lika långt, avslutat observationsfönster. Sida A har 100 bokande besökare och B har 130. Andelarna blir 100/2 000 = 0,05 och 130/2 000 = 0,065.

För en pedagogisk normalapproximation beräknas standardfelet för skillnaden som kvadratroten ur 0,05 × 0,95 / 2 000 + 0,065 × 0,935 / 2 000. Resultatet är cirka 0,00736, alltså 0,736 procentenheter. Ett ungefärligt tvåsidigt 95-procentigt intervall blir 1,5 ± 1,96 × 0,736 procentenheter, vilket ger cirka 0,06 till 2,94 procentenheter.

Beräkningen illustrerar storleksordningen och förutsätter en enda planerad analys med en lämplig modell. NIST:s genomgång av två andelar ger statistisk bakgrund. Vid få utfall, extrema andelar eller annan observationsstruktur ska en lämpligare metod väljas i förväg. För en enskild binomial andel beskriver NIST även Wilsonintervall. Ett sådant intervall är inte automatiskt metoden för skillnaden mellan två andelar.

Vad 95 procent faktiskt betyder

Konfidensnivån avser beräkningsmetodens täckning vid upprepade urval under modellens antaganden. Ett 95-procentigt intervall ska inte läsas som 95 procents sannolikhet att den fasta, okända effekten ligger i just detta redan beräknade intervall. NIST:s förklaring av konfidensnivå skiljer uttryckligen dessa tolkningar åt.

Intervallet är inte heller en prognos för nästa kampanjvecka. Framtida besökare, konkurrens, erbjudanden och leverans kan förändras. Siffrorna uttrycker urvalsosäkerhet enligt modellen; de omfattar inte automatiskt spårningsfel, felaktig tilldelning eller alla förändringar i marknaden. Den skillnaden behöver följa med när resultatet sammanfattas för någon som inte ser analysbilagan.

Jämför med två gränser

Den första gränsen är noll skillnad. I exemplet ligger det ungefärliga intervallet precis över noll, vilket under motsvarande test och antaganden ger stöd för en positiv skillnad på den valda nivån. Avrundningen till 0,06 visar samtidigt hur nära gränsen resultatet ligger. Rapportera därför inte att varje rimligt framtida utfall säkert är positivt.

Den andra gränsen är verksamhetens behov. Anta hypotetiskt att ett införande kräver minst 1 procentenhets förbättring för att motivera merkostnaden. Intervallet 0,06 till 2,94 omfattar både förbättringar under och över den gränsen. Underlaget stödjer då inte ett säkert påstående om att den nödvändiga förbättringen har uppnåtts, även om noll ligger utanför intervallet.

Om intervallet i ett annat scenario går från minus 0,4 till plus 0,6 procentenheter är stora lyft mindre förenliga med modellen och data än om intervallet går från minus 5 till plus 8. Båda innehåller noll, men de ger mycket olika beslutsunderlag. Se hantering av osäkra testresultat för hur en sådan skillnad påverkar nästa steg.

Beslutsunderlag

Jämför intervallet med två gränser

  1. Skattning

    6,5 % minus 5 % = 1,5 procentenheter.

  2. Osäkerhet

    Ungefärligt 95 % intervall: 0,06 till 2,94 procentenheter.

  3. Nollgräns

    Noll ligger strax utanför intervallet under exemplets modell.

  4. Affärsgräns

    Kravet +1 procentenhet ligger inuti: tillräcklig nytta är fortfarande osäker.

Hypotetisk normalapproximation: 100/2 000 mot 130/2 000, oberoende besökare.

Kontrollera vad som kan göra intervallet missvisande

Återkommande personer, gemensamma företagskonton eller tilldelning per region skapar beroenden som en enkel modell för oberoende besökare inte fångar. Då kan standardfelet bli för litet. Samma problem uppstår om teamet provar många varianter eller upprepar analyser tills ett önskat intervall visar sig, men redovisar resultatet som en enda planerad jämförelse.

Använd därför definitionen och analysplanen från det förhandsbestämda framgångsmåttet. Kontrollera tilldelning, observationsfönster och vilka enheter som faktiskt är oberoende. Ett välberäknat intervall kan beskriva en observerad skillnad utan att bevisa att annonseringen orsakade den. Skriv avslutningsvis vilken effekt som skattades, hur precist den skattades och vilket beslut osäkerheten tillåter. Då blir intervallet ett stöd för bedömningen, inte en dekorativ siffra.

Källor och avgränsning

Tolka ett beräknat intervall för ett konverteringsutfall och avgöra vilka slutsatser osäkerheten faktiskt tillåter.

Arbetsmetoder och exempel är redaktionella förslag. Kontrollera aktuella plattformsvillkor och funktioner inför genomförandet.

Ditt nästa kapitel

Se hur kampanjen följs upp.

Utforska rapporteringen i AthillyAds och hur den passar ihop med din egen mätning av förfrågningar, köp och andra affärsresultat.