Experiment och utvärdering

Förbered rätt indata till annonstestets stickprovsberäkning

Förbered indata till stickprovsberäkning för ett ChatGPT-annonstest. Samordna enheter, basdata, effektstorlek, felrisk och tiden till mogna utfall.

Börja läsa
Bildillustration: Linneband i en träram, med ett band som delas i tunnare trådar och sedan förenas igen.
BildillustrationTrådarna gestaltar varför flera registrerade händelser kan höra till samma enhet och inte alltid ska räknas som oberoende observationer.
Arbetsguiden

Det här får du hjälp med.

Experiment och utvärdering
  • Anpassa beräkningen till tilldelnings- och analysenhet.
  • Bevara basantal, variation och utfallens mognad.
  • Dokumentera effekt, vald felrisk och metod före tidsprognosen.

En stickprovskalkylator kan inte rädda ett experiment vars indata beskriver fel population. Innan trafikbehovet för ett test med ChatGPT-annonser uppskattas bör ni skapa ett kort underlag som en analytiker kan granska. Det ska förklara utfall, tilldelningsenhet, basdata och designantaganden bakom beräkningen.

Resultatet är en planeringsuppskattning som gäller under dessa antaganden. Det är inte ett universellt antal klick som garanterar en tydlig slutsats. Kampanjtrafik, mätbortfall och fördröjda utfall kan göra att det genomförda experimentet skiljer sig från den ursprungliga planen.

Ange enheten som räknas

Identifiera vad som tilldelas ett villkor: besökare, kund, geografiskt område eller tidsblock. Ange sedan vilken enhet analysen använder. Gruppering kan kräva en särskild design i stället för att varje registrerat event behandlas som en oberoende observation i beräkningen.

I ett hypotetiskt test av en målsida kan samma tilldelade besökare återvända tre gånger och lägga en order. Om tre sessioner räknas som tre oberoende personer överskattas informationsmängden. Beskriv hur återbesök hanteras och vilken identifierare eller aggregeringsregel som gör hanteringen möjlig.

Om förändringen tillämpas på hela regioner innebär många klick inte automatiskt många oberoende regioner. Stickprovsmetoden behöver spegla den designen. Lägg inte totala klick i en enkel kalkylator för besökare och presentera resultatet som en färdig plan för ett geografiskt experiment.

Definiera utfallet matematiskt

För ett binärt köputfall uppfyller varje giltig enhet antingen köpdefinitionen inom observationsfönstret eller inte. För intäkt per enhet spelar beloppens variation roll. För kvalificerade leads bestämmer CRM-regeln och mognadsfönstret när utfallet kan bedömas med den avsedda betydelsen.

Anteckna täljare, nämnare, undantag och observationsperiod. Kampanjens rapporterade konverteringar delat med klick behöver inte vara samma utfall som köpsannolikhet bland slumpmässigt tilldelade besökare. OpenAI:s rapportering definierar plattformsmåtten. Experimentanalysen måste ange om och hur dessa passar designen.

Bestäm hanteringen av saknade data före beräkningen. Om en variant kan påverka samtycke, slutförd spårning eller sannolikheten att hamna i datamängden kan ett urval av enbart observerade konverterare eller fullständigt spårade användare ändra populationen som jämförs mellan grupperna.

Använd basnivå från jämförbart underlag

Välj en historisk period vars erbjudande, destination, population och mognad liknar det planerade testet. Spara antal tillsammans med andelen. En basnivå på 5 procent från två köp bland fyrtio besökare är betydligt mer osäker än samma andel från en mycket större jämförbar population.

Visa flera rimliga basnivåer om underlaget är svagt. En andel från en annan kanal kan fungera som scenario men ska inte beskrivas som observerad nivå för en ChatGPT-kampanj. Ett genomsnitt för hela webbplatsen kan också blanda trafik med helt annan avsikt än den planerade kampanjens besökare.

För utfall i pengar, exempelvis intäkt per besökare, behöver fördelningen och ovanligt stora order granskas. Ett medelvärde beskriver inte ensamt variationen. Analysansvarig kan behöva historiska värden per enhet eller en lämplig simulering i stället för en kalkylator som bara hanterar en binär konverteringsandel.

Lämna effekt och antaganden om felrisk

Ange måleffekten både absolut och relativt när det är relevant. Använd guiden för effektstorlek för att motivera varför skillnaden spelar roll. Låt inte kalkylatorns förvalda förbättring bli det enda affärsskälet för att genomföra försöket.

Bestäm planerad signifikansnivå, statistisk styrka, fördelning mellan grupper och om analysen är ensidig eller tvåsidig. Det är val med konsekvenser och inte dekorationer i formuläret. Att verksamheten hoppas på förbättring motiverar inte i sig att en försämring får ignoreras i analysen.

NIST:s vägledning för stickprovsstorlek vid andelar visar hur basandel, effekt och vald felrisk ingår i planeringen. Exemplet gäller en andel jämförd med ett referensvärde, så formeln ska inte utan vidare användas för två slumpmässigt tilldelade besökargrupper. Använd en metod som passar jämförelsen och dokumentera versionen av verktyg eller kod.

Arbetsunderlag

En beräkning behöver mer än trafik

  1. Enhet

    Tilldelad besökare; återbesök ska hanteras konsekvent.

  2. Basdata

    Köpandel från jämförbar trafik med samma mognad.

  3. Effekt

    Absolut skillnad och relativ skillnad anges separat.

  4. Design

    Tilldelning, felrisk, styrka och eventuell gruppering.

Illustrativa indata för ett test med köp som binärt utfall.

Översätt observationer till en genomförbar kalender

När informationsbehovet beräknats kan inflödet av giltiga enheter uppskattas under avsedd fördelning. Ta hänsyn till undantag, återbesök och tiden tills utfallet mognat. Trafikprognosen är osäker. Visa ett intervall i stället för ett exakt slutdatum utan stöd i faktisk leverans.

Ta med hela affärscykler där de behövs för tolkningen. Ett numeriskt mål som nås under en ovanlig kampanjhelg kanske inte svarar på frågan om normal drift. Guiden för stoppregler kopplar informationsmålet till kalender och operativa begränsningar.

Om beräknad längd är opraktisk används planering vid låg volym för att ompröva fråga eller design. Sänk inte antagen variation eller höj förväntad konverteringsgrad i tysthet tills beräkningen råkar passa tillgänglig tid och budget.

Det färdiga underlaget ska låta en annan analytiker återskapa beräkningen och ifrågasätta varje antagande. Håll källperiod, enhetsdefinition, effekt, vald felrisk, tilldelning, analysmetod och väntad utfallsfördröjning samlade. Då blir stickprovsstorleken ett transparent planeringsbeslut som hör ihop med kampanjen i stället för en auktoritativ siffra utan tydlig grund.

Källor och avgränsning

Samla granskningsbara design- och basdata till en giltig stickprovsberäkning utan att hitta på ett universellt trafikmål.

Arbetsmetoder och exempel är redaktionella förslag. Kontrollera aktuella plattformsvillkor och funktioner inför genomförandet.

Ditt nästa kapitel

Se hur kampanjen följs upp.

Utforska rapporteringen i AthillyAds och hur den passar ihop med din egen mätning av förfrågningar, köp och andra affärsresultat.