Experiment och utvärdering

Planera tester när ChatGPT-annonser ger få konverteringar

Avgör om ett test av ChatGPT-annonser ryms i er trafik och tid. Skilj stickprovsstorlek, minsta upptäckbara effekt och statistisk styrka åt.

Börja läsa
Bildillustration: Enstaka droppar faller i ett nästan tomt keramikfat på en terrass med långa skuggor.
BildillustrationDe få dropparna och den långa skuggan gestaltar frågan om tillräckligt underlag hinner samlas före beslutet.
Arbetsguiden

Det här får du hjälp med.

Experiment och utvärdering
  • Planera på oberoende analysenheter och förväntade utfall, inte på visningar ensamma.
  • Styrka gäller en specificerad effekt och modell före testet.
  • En alltför lång insamlingsperiod kan göra frågan inaktuell även om stickprovet till slut räcker.

Fyra köp under en vecka kan vara värdefulla affärer men ett tunt underlag för att skilja två liknande kampanjupplägg åt. När annonser i ChatGPT ger få konverteringar är den första testfrågan därför om den önskade jämförelsen alls ryms i den tillgängliga trafiken. Ett genomtänkt nej kan spara både budget och veckor av uppföljning som ändå inte kan avgöra beslutet.

Vi rekommenderar att göra en genomförbarhetskalkyl innan testet startar. Kalkylen nedan är intern metodik och beskriver ingen experimentfunktion i annonsplattformen. Den förutsätter att teamet kan skapa en giltig jämförelse med en lämplig tilldelningsmetod. Om det inte går behöver undersökningen beskrivas som observationsbaserad, med motsvarande begränsningar för orsakssamband.

Fem uppgifter som inte får blandas ihop

Stickprovsstorlek är antalet relevanta analysenheter. Det kan vara unika tilldelade besökare i ett eget webbplatstest, men också regioner eller tidsblock i en annan design. Antal konverteringar är antalet positiva utfall, inte automatiskt stickprovsstorleken. Visningar och klick kan dessutom innehålla upprepade exponeringar från samma personer.

Basnivån är den konverteringssannolikhet ni använder för planering. Minsta upptäckbara effekt, MDE, är den effektstorlek som den valda planen dimensioneras för att upptäcka med önskad styrka. Alfa anger testets tillåtna risk för ett falskt positivt utfall under nollhypotesen och modellens villkor. Statistisk styrka är sannolikheten att förkasta nollhypotesen vid en specificerad verklig effekt och dessa villkor.

En styrka på 80 procent är alltså inte 80 procents sannolikhet att hypotesen är sann. Den är inte heller ett kvalitetsbetyg för kampanjen. NIST:s planering av stickprov visar sambandet mellan vald effekt, alfa och styrka. Kontrollera att den faktiska beräkningen avser er design, eftersom ett test av en andel mot en fast referens skiljer sig från två samtidiga grupper.

Översätt en önskad förbättring till besökare

Anta hypotetiskt att ni vill testa två bokningssidor efter klick från annonser i ChatGPT och själva kan slumpa unika besökare korrekt. Planerad basnivå är 2 procent. Ni vill kunna upptäcka en ökning till 3 procent: 1 procentenhet i absolut förändring och 50 procent i relativ förändring. Välj för exemplet tvåsidigt alfa 0,05, styrka 80 procent och lika stora grupper.

En vanlig normalapproximation för två oberoende andelar ger ungefär 3 826 besökare per grupp, totalt 7 652. Beräkningen använder 1,96 för alfa, cirka 0,842 för styrkan och medelandelen 0,025. Uttrycket per grupp är kvadraten av summan 1,96 × √(2 × 0,025 × 0,975) och 0,842 × √(0,02 × 0,98 + 0,03 × 0,97), delat med 0,01².

Detta är en avrundad planeringsapproximation utan kontinuitetskorrektion, inte ett universellt krav från OpenAI. Exakt metod, beroenden, bortfall och osäker basnivå kan ändra behovet. Låt analysansvarig verifiera beräkningen med den metod som faktiskt ska användas. Förbered underlaget med rätt indata till stickprovsberäkningen innan ni accepterar ett resultat från en kalkylator.

Gör kalendern lika tydlig som statistiken

Med 80 behöriga nya besökare per dag totalt tar 7 652 besökare minst cirka 96 insamlingsdagar vid oförändrat inflöde. Det är 40 per grupp och dag, inte 80 i vardera gruppen. Om observationsfönstret är sju dygn behöver de sista besökarna dessutom få sju dygn på sig. Exemplet bortser från helger, bortfall och tekniska avbrott.

Om affärsbeslutet måste fattas efter 28 dagar finns bara cirka 2 240 tilldelningar, alltså 1 120 per grupp, före eventuell förlust av mätbara utfall. Under exemplets planerade sannolikheter motsvarar det i genomsnitt 22,4 respektive 33,6 bokande personer. Det är väntevärden för planering, inte utlovade bokningar. Att fylla ett kalkylblad med fler decimaler gör inte tidshorisonten mer realistisk.

Kontrollera sedan om erbjudande, bemanning och kundbehov kan hållas tillräckligt jämförbara under hela perioden. En lång insamling kan passera ett produktbyte eller en säsong där den ursprungliga frågan inte längre är relevant. Fler dagar är därför ett designbeslut, inte en automatisk lösning på få konverteringar.

Jämför alternativen

Räcker trafik och kalender?

  1. Behov

    Cirka 3 826 unika besökare per grupp = 7 652 totalt.

  2. Tillgängligt på 28 dagar

    80 per dag × 28 = 2 240 totalt, bara 1 120 per grupp.

  3. Insamlingstid

    7 652 / 80 avrundat uppåt = 96 dagar, plus utfallens väntetid.

  4. Beslut

    Pröva om frågan håller i 96 dagar eller välj en tydligt avgränsad mätpilot.

Hypotetiskt: 2 % till 3 %, två grupper, alfa 0,05 och styrka 80 %. Normalapproximation.

Välj ett alternativ som fortfarande besvarar något användbart

Ett alternativ är att testa en större, affärsmässigt relevant förändring. Det innebär inte att ni får bestämma att effekten kommer vara större. Formulera i stället vilken skillnad testet behöver kunna skilja från noll och bedöm om just den skillnaden skulle påverka beslutet. Guiden om minsta upptäckbara effekt hjälper till att hålla planeringsmålet skilt från en prognos.

Ett annat alternativ är en mätpilot. Kontrollera om rätt besökare inkluderas, om bokningar registreras och hur snabbt utfallen mognar. En sådan pilot kan förbättra framtida indata utan att ge ett svar på vilken sida som ökar försäljningen. Var explicit med att uppgiften har ändrats så att en lyckad teknisk kontroll inte presenteras som bevis för affärseffekt.

Ett tidigare steg i kundresan, exempelvis påbörjad bokning, ger ibland fler utfall. Det kan användas för en separat fråga om beteendet vid det steget. Men en förbättring där bevisar inte fler genomförda bokningar. Byt därför inte primärt mått i efterhand bara för att köpvolymen blev lägre än väntat.

Låt resultatet visa osäkerheten

Efter testet rekommenderar vi effektens skattning och ett korrekt konfidensintervall, inte en beräkning av observerad styrka utifrån samma uppmätta effekt. Ett brett intervall visar redan att flera affärsmässigt olika effekter återstår. Om ytterligare ett test övervägs, planera det framåt med en relevant effekt och uppdaterade antaganden.

Dokumentera till sist beslutet som genomförbart test, avgränsad pilot eller uppskjuten jämförelse. Varje alternativ kan vara rationellt. Det viktiga är att teamet vet vilken kunskap budgeten köper och vilken fråga som fortfarande förblir obesvarad.

Källor och avgränsning

Bedöma om ett planerat konverteringstest är genomförbart vid låg volym och välja en rimlig alternativ kunskapsfråga om det inte är det.

Arbetsmetoder och exempel är redaktionella förslag. Kontrollera aktuella plattformsvillkor och funktioner inför genomförandet.

Ditt nästa kapitel

Se hur kampanjen följs upp.

Utforska rapporteringen i AthillyAds och hur den passar ihop med din egen mätning av förfrågningar, köp och andra affärsresultat.