Experiment och utvärdering

Planera ett geografiskt test av ChatGPT-annonser

Bedöm om ett geografiskt test kan mäta effekten av ChatGPT-annonser. Planera områden, jämförelse, affärsutfall och osäkerhet innan kampanjen ändras.

Börja läsa
Bildillustration: Ett sytt landskap med färgade regioner, små hus, floder och broar mellan områdena.
BildillustrationDe avgränsade områdena och broarna illustrerar både regional jämförbarhet och möjliga vägar för påverkan över gränser.
Arbetsguiden

Det här får du hjälp med.

Experiment och utvärdering
  • Regionerna är experimentets enheter, inte annonsvisningarna.
  • Kontrollera geografisk styrning och mätning innan områden väljs.
  • En beräknad skillnad behöver en trovärdig jämförelse och ett osäkerhetsmått.

Ett geografiskt test börjar med en karta över vad företaget faktiskt kan styra och mäta. För annonser i ChatGPT räcker det inte att dela försäljningsrapporten i två regioner och kalla den ena kontrollgrupp. Annonsinsatsen måste kunna skilja sig enligt en bestämd plan, och försäljningen måste kunna följas på ett jämförbart sätt även där insatsen inte ändras.

Det här är en rekommenderad intern planeringsmetod. Den beskriver inte en inbyggd experimentfunktion i ChatGPT Ads och lovar inte att önskad geografisk avgränsning finns i ett visst konto. Beslutet kan mycket väl bli att ett geografiskt test inte går att genomföra trovärdigt med tillgängliga förutsättningar.

Börja med den effekt som ska uppskattas

Skriv en mening som anger förändringen och affärsutfallet. Exempelvis: vilken förändring i genomförda köp ger en avgränsad ökning av annonsinsatsen under testperioden? Formuleringen skiljer testet från frågan om hur många köp som rapporten tillskriver en annons. Attribuering beskriver en tilldelningsregel; en effektstudie försöker uppskatta vad som skulle ha hänt utan förändringen.

Välj om utfallet är order, nya betalande kunder eller täckningsbidrag efter returer. Använd företagets samlade utfall i respektive område när det är den totala affärseffekten som efterfrågas. Om endast klickande besökare ingår försvinner personer som kan påverkas utan att klicka, och urvalet formas dessutom av annonsen.

Ange också vilken insats som jämförs. Att lägga till annonser är en annan fråga än att öka en redan pågående investering. Ett positivt resultat för den senare förändringen säger inte automatiskt vad hela kanalen bidrar med. Denna skillnad bör stå i testbeställningen, inte läggas till som en fotnot efteråt.

Kontrollera att kartan går att använda

OpenAI beskriver kampanjinställningar, men dokumenterade inställningar utgör inte ett färdigt geografiskt experiment. Kontrollera i den tillgängliga lösningen vilka områden som faktiskt kan avgränsas och hur överlappande kampanjer hanteras. Utgå inte från att städer, postnummer eller egna regionlistor kan användas.

Bestäm separat hur ett köp tillhör ett område. Leveransadress kan vara lämplig för varor, medan en avtalad verksamhetsadress kan vara mer relevant för företagskunder. Blanda inte dessa regler mellan perioder. Behåll köp med okänd region i en egen kategori och följ om andelen förändras.

Kartlägg pendling, resor, rikstäckande erbjudanden och andra vägar för påverkan mellan områden. En person kan möta annonser i ett område och handla i ett annat. Om sådant spill är stort kan skillnaden mellan grupperna bli för svag eller få en annan innebörd än planerat. Använd genomgången av testkontaminering för att skriva konkreta kontrollfrågor.

Välj områden utifrån historik, inte önskat resultat

Bygg ett underlag med lika långa historiska perioder, stabila affärsdefinitioner och kända lokala händelser. Titta på nivå, trend, veckomönster och variation. Två lika stora regioner kan reagera helt olika på en lönehelg eller en förändrad leveranstid. En mycket stor region kan dominera hela analysen trots att kartan ser balanserad ut.

Vår rekommendation är att låsa reglerna för urval och eventuell matchning innan testutfallen syns. När oberoende, avgränsade områden verkligen finns kan en separat experimentplan ange slumpmässig tilldelning, eventuellt inom jämförbara par. Det är en metod som annonsören måste kunna genomföra och dokumentera, inte en förmodad plattformsfunktion.

Google Research beskriver geografiska experiment där områden tilldelas olika villkor. NIST:s beskrivning av blockdesign förklarar principen att hantera kända störfaktorer i designen. Källorna ger metodstöd, inte belägg för att ett visst ChatGPT-konto kan genomföra upplägget.

Räkneexempel: två aggregat ger ingen säkerhet

Anta hypotetiskt att testområdena har 1 000 order före testet och 1 150 under testet. Jämförelseområdena går samtidigt från 800 till 880 order. Perioderna är lika långa. Om den historiska relationen motiverar en proportionell jämförelse innebär kontrollens ökning på 10 procent ett beräknat jämförelseutfall på 1 100 order för testområdena.

Skillnaden blir då 1 150 minus 1 100, alltså 50 order. Relativt jämförelseutfallet är det cirka 4,5 procent. Det är inte samma sak som testområdenas observerade ökning på 15 procent. Det är heller inte ett verifierat kampanjresultat: talen är påhittade för att visa beräkningen.

Beräkningen bygger på att kontrollens förändring är en relevant beskrivning av testområdenas alternativa utveckling. En lokal butiksexpansion eller olika prishöjningar kan bryta det antagandet. Med endast dessa fyra totalsiffror går det inte att bedöma osäkerheten ordentligt. Spara därför data per faktisk region och period, tillsammans med urvals- och tilldelningsreglerna.

Dimensionera efter regioner och variation

Tusentals annonsvisningar ersätter inte flera oberoende testområden. När insatsen tilldelas på regionnivå måste analysen respektera den nivån och beroenden över tid. Be den analysansvarige bedöma vilken minsta upptäckbar effekt, MDE, upplägget har vid vald statistisk styrka. Jämför sedan denna med den effekt verksamheten tycker är värd att agera på. Använd historisk variation och den planerade insatsskillnaden, inte ett godtyckligt antal klick.

Ett osäkert intervall som omfattar både meningsfull vinst och förlust ger ett oavgjort resultat. Det bevisar varken effekt eller avsaknad av effekt. Om rimliga testperioder och tillgängliga regioner inte kan ge tillräcklig precision bör frågan avgränsas innan företaget förbrukar en större testbudget.

Beslutsunderlag

Tre grindar före ett geografiskt test

  1. Kan behandlingen avgränsas?

    Verifiera tillgängliga geografier och hur spill till kontrollområden ska upptäckas.

  2. Kan utfallet mätas lika?

    Samma orderdefinition, regionregel och tidsperiod för samtliga områden.

  3. Räcker oberoende områden?

    Bedöm variation mellan regioner och önskad effektstorlek före budgetbeslutet.

Intern bedömningsmodell. Ett nej kräver en annan design eller en snävare slutsats.

Lås drift och beslutsunderlag

Spara planerad tilldelning, faktiskt genomförda ändringar och avvikelser separat. OpenAI Reporting ger leverans- och attribueringsdata; komplettera med företagets regionala affärsutfall. En planerad budgetskillnad är inte bevis för motsvarande skillnad i faktisk exponering.

Bestäm före start hur lokala kampanjer, lagerbrist och utebliven leverans ska hanteras. Kontrollera om en kontrollgrupp alls är genomförbar innan områden reserveras. Avsluta planeringen med ett beslut: kör den specificerade designen, ändra frågan eller avstå. En tydligt dokumenterad begränsning är mer användbar än en exakt siffra från en jämförelse som aldrig kunde bära slutsatsen.

Källor och avgränsning

Utforma eller avvisa ett geografiskt effekttest utifrån verklig styrbarhet, jämförbara regioner och mätbar förändring i affärsutfall.

Arbetsmetoder och exempel är redaktionella förslag. Kontrollera aktuella plattformsvillkor och funktioner inför genomförandet.

Ditt nästa kapitel

Se hur kampanjen följs upp.

Utforska rapporteringen i AthillyAds och hur den passar ihop med din egen mätning av förfrågningar, köp och andra affärsresultat.