AI Measurement Governance: Cara Mencegah Tim Memilih Data yang Hanya Mendukung Narasi
Rapat bulanan dimulai dengan slide yang terlihat sangat meyakinkan.
“AI visibility naik 38 persen.”
CEO mengangguk.
Marketing senang.
Agency terlihat berhasil.
Lalu finance bertanya, “Naik dibanding apa?”
Ternyata bulan sebelumnya tim menguji 100 query. Bulan ini hanya 55 query. Sebagian query yang hasilnya jelek dikeluarkan karena dianggap “kurang relevan”. Model yang digunakan juga berubah. Dua platform tidak lagi diuji karena aksesnya sulit. Tetapi angka 38 persen tetap dipresentasikan seolah kita sedang membandingkan dua periode dengan metode yang sama.
Di sinilah AI Measurement Governance dibutuhkan.
Masalahnya bukan tim pasti berniat memanipulasi.
Sering kali bias muncul karena manusia memang suka data yang mendukung cerita yang ingin dibawa.
Performance marketing punya bias optimasi.
PR punya bias reputasi.
Agency punya bias success story.
Product punya bias adoption.
Leadership punya bias simplifikasi.
Kalau sistem measurement tidak punya governance, semua bias tersebut masuk ke angka.
AI measurement akhirnya terlihat ilmiah, tetapi metode di belakangnya terus bergeser.
Measurement governance bukan soal membuat dashboard lebih rumit
Tujuannya sederhana: membuat angka tetap bisa dibandingkan dan dipertanggungjawabkan.
OpenAI dalam materi tentang evals menekankan pentingnya evaluasi yang sistematis untuk mengukur apakah sistem AI memenuhi expectation yang kita tetapkan. OpenAI juga memiliki framework evals yang memungkinkan organisasi membuat evaluasi khusus untuk use case sendiri.
Prinsipnya relevan untuk AI search measurement.
Sebelum mengukur, kita harus tahu apa yang dimaksud “berhasil”.
Mention?
Citation?
Owned-source citation?
Shortlist?
Answer accuracy?
Organic product result?
Paid impression?
Conversion?
Kalau definisi berubah di tengah jalan, trend menjadi sulit dipercaya.
Governance dimulai dari metric dictionary.
Definisikan metric sebelum melihat hasil
Contoh:
Mention rate:
persentase query dalam panel tetap yang menyebut brand minimal satu kali.
Citation rate:
persentase answer yang menampilkan source milik brand ketika platform menyediakan citation.
Accuracy rate:
persentase factual claim yang dinilai benar terhadap source of truth yang sudah ditetapkan.
Shortlist presence:
persentase query comparison atau recommendation di mana brand masuk daftar pilihan yang relevan.
Hallucination incidence:
persentase answer yang memiliki minimal satu factual error menurut taxonomy yang telah ditetapkan.
Jangan menggunakan kata seperti “visibility”, “trust”, atau “authority” tanpa operational definition.
“AI visibility naik” terdengar sederhana.
Tetapi visibility bisa berarti lima hal berbeda di lima tim.
Metric dictionary memaksa semua orang memakai bahasa yang sama.
Query panel harus punya governance
Inilah tempat cherry-picking paling mudah terjadi.
Bulan pertama brand lemah pada query:
“software payroll terbaik untuk enterprise Indonesia”
Bulan kedua query itu dihapus karena dianggap “terlalu luas”.
Kemudian diganti:
“apakah Brand X software payroll?”
Tentu angka brand mention naik.
Apakah AI visibility membaik?
Tidak bisa disimpulkan.
Query set berubah.
Buat tiga panel.
Core panel:
query yang dibekukan untuk trend jangka panjang.
Experimental panel:
query baru untuk eksplorasi.
Event panel:
query terkait launch, regulation, campaign, atau incident sementara.
Core panel jangan diubah hanya karena hasilnya jelek.
Kalau query memang sudah tidak relevan karena bisnis berubah, retire dengan reason dan version.
Jangan diam-diam dihapus.
Query retirement adalah measurement event.
Sampling juga perlu merepresentasikan buyer journey
Jangan semua query branded.
Kalau semua pertanyaan mengandung nama brand, mention rate akan tinggi.
Gunakan cluster.
Problem discovery.
Category.
Comparison.
Buyer intent.
Brand verification.
Price.
Location.
Product capability.
Trust.
Policy.
Industry-specific.
Weight berdasarkan business relevance.
Misalnya perusahaan B2B mungkin tidak perlu 40 query lifestyle.
Klinik perlu lebih banyak factual and service accuracy.
Marketplace perlu price, availability, seller, dan policy.
Governance memastikan panel mengikuti real decision environment, bukan hanya area yang sudah kuat.
Repeated run harus konsisten
Generative system bisa memberi output berbeda.
Satu query satu run terlalu rapuh.
Tentukan:
Berapa run per query?
Fresh session atau continuing context?
Locale?
Logged-in atau logged-out?
Mode search?
Date window?
Platform?
Kalau model/version diketahui, catat.
Kalau tidak diketahui, tulis unknown.
Jangan menebak.
Metode harus cukup stabil supaya perubahan yang terlihat tidak hanya berasal dari perubahan cara testing.
Kalau bulan ini tiga run dan bulan depan sepuluh run, trend perlu qualification.
Tidak salah mengubah metode.
Yang salah adalah mengubah metode tanpa version note.
Model update harus masuk measurement log
Ini penting.
OpenAI API menyediakan model snapshots untuk sejumlah model agar developer dapat mengunci versi tertentu dan menjaga behavior lebih konsisten. Dokumentasi API juga memiliki changelog dan deprecation notices.
Prinsip yang bisa diambil:
Model adalah dependency yang berubah.
Kalau experiment memakai model alias yang bisa berubah, result before dan after tidak selalu comparable secara langsung.
Untuk external consumer surfaces seperti ChatGPT atau AI search lain, kita mungkin tidak bisa memilih snapshot.
Tetapi kita tetap bisa mencatat tanggal testing dan known product change.
Jangan menyimpulkan:
“Konten kita membaik sehingga answer berubah.”
Bisa jadi model berubah.
Index berubah.
Retrieval berubah.
Source berubah.
Measurement governance selalu memisahkan observation dan causality.
Paid dan organic harus punya ledger terpisah
Jika paid impression masuk denominator organic visibility, angka rusak.
OpenAI pada Ads di ChatGPT menegaskan pemisahan ads dari organic answer.
Internal reporting harus mengikuti prinsip yang sama.
Paid:
Spend.
Impression.
Click.
Conversion.
Campaign.
Organic:
Mention.
Citation.
Shortlist.
Answer accuracy.
Source coverage.
Kalau placement type tidak diketahui, label unknown.
Unknown lebih baik daripada memaksa klasifikasi.
Metric yang tidak punya provenance gampang dipakai untuk narasi.
Reviewer juga perlu governance
Siapa yang menentukan answer benar atau salah?
Agency yang performanya sedang dievaluasi?
Marketing yang ingin menunjukkan progress?
Idealnya ada rule.
Untuk factual claim:
Compare ke canonical source.
Untuk high-risk claim:
Domain owner review.
Untuk subjective recommendation:
Jangan label “correct/incorrect” secara sederhana.
Nilai fit dengan criteria.
Gunakan adjudication untuk disagreement.
Misalnya analyst menilai “wrong”, product owner menilai “partially correct”.
Status:
Correct.
Partially correct.
Incorrect.
Stale.
Conflicted.
Unverifiable.
Dengan taxonomy ini, reviewer tidak dipaksa membuat dunia hitam-putih.
Blind review bisa dipakai pada sample tertentu
Kalau ingin mengurangi bias, hilangkan informasi yang tidak perlu dari reviewer.
Contoh reviewer menilai factual accuracy tanpa tahu apakah answer berasal dari pre-optimization atau post-optimization period.
Atau reviewer tidak tahu variant campaign.
Ini tidak selalu practical.
Tetapi untuk experiment penting, blind review bisa mengurangi expectation bias.
Jangan membuat analyst mencari “bukti program berhasil”.
Minta mereka menilai output sesuai rubric.
Setelah scoring selesai, baru bandingkan cohort.
Narrative dibangun setelah data, bukan sebelum.
Change log wajib
Setiap perubahan measurement:
Query ditambah.
Query dihapus.
Weight berubah.
Platform berubah.
Number of runs berubah.
Reviewer berubah.
Taxonomy berubah.
Model berubah.
Prompt berubah.
Session condition berubah.
Source of truth berubah.
Catat.
Version:
AI Visibility Measurement v1.2.
Effective date.
Change summary.
Expected impact.
Sekarang trend bisa dibaca.
Kalau jump besar terjadi bersamaan dengan methodology change, dashboard memberi note.
Tanpa log, management bisa mengira perubahan operational padahal measurement system yang berubah.
Pre-register experiment untuk project besar
Untuk eksperimen penting, tulis dulu:
Hypothesis.
Query panel.
Metric.
Primary outcome.
Secondary outcome.
Test period.
Sample.
Exclusion rule.
Stop condition.
Sebelum result diketahui.
Kenapa?
Karena setelah melihat data, manusia sangat mudah memilih metric yang menang.
Contoh:
Target awal citation.
Citation tidak berubah.
Mention naik.
Deck akhirnya menulis project sukses karena mention.
Itu outcome switching.
Tidak selalu jahat.
Tetapi kalau dilakukan diam-diam, evidence lemah.
Pre-registration sederhana mengurangi temptation.
Satu halaman cukup.
NIST AI RMF berguna untuk mindset measurement
NIST AI RMF menggunakan fungsi Govern, Map, Measure, dan Manage untuk membantu organisasi mengelola risiko AI. Playbook NIST juga menekankan bahwa suggested actions bukan checklist universal yang harus dilakukan semua organisasi.
Ini cocok dengan measurement governance.
Govern:
siapa owner methodology.
Map:
use case dan context.
Measure:
metric dan test.
Manage:
action dari hasil.
Jangan berhenti di Measure.
Dashboard yang tidak mengubah keputusan hanyalah reporting artifact.
Metric harus punya action threshold
Contoh:
High-severity factual error > 0:
immediate review.
Persistent wrong price:
commerce correction.
Entity confusion meningkat:
identity audit.
Source conflict tinggi:
evidence reconciliation.
Organic mention turun tetapi accuracy naik:
jangan otomatis panic.
Paid impression naik:
review commercial outcome.
Metric bukan sekadar headline.
Ia trigger keputusan.
Audit raw evidence, bukan hanya dashboard
Leadership mungkin hanya lihat summary.
Tetapi raw evidence harus tersedia.
Query.
Answer.
Date.
Source.
Screenshot atau record.
Classification.
Reviewer.
Correction.
Jangan hanya menyimpan chart.
Kalau tiga bulan kemudian auditor atau client bertanya kenapa angka 72 persen muncul, analyst harus bisa trace.
Measurement tanpa evidence ledger mudah berubah menjadi folklore.
“Kemarin katanya 72.”
Tidak cukup.
Tanda measurement governance sedang gagal
Query yang jelek hilang tanpa note.
Metode berubah tiap bulan.
Score punya dua angka desimal tetapi sample kecil.
Agency menilai keberhasilan sendiri tanpa rubric.
Paid dan organic dicampur.
Citation dan mention dicampur.
Satu screenshot dipakai sebagai proof universal.
Model update diabaikan.
High-severity error ditutupi oleh average score.
Dashboard tidak menyimpan raw evidence.
Limitation tidak ditulis.
Kalau tiga atau empat tanda ini muncul, jangan menambah dashboard dulu.
Perbaiki governance.
Cara paling sehat mencegah tim memilih data yang mendukung narasi adalah membuat pilihan penting sebelum melihat hasil.
Definisi dulu.
Panel dulu.
Rubric dulu.
Exclusion rule dulu.
Primary metric dulu.
Version dulu.
Baru testing.
Setelah itu data boleh memberi cerita yang tidak kita suka.
Kalau hasilnya flat, bilang flat.
Kalau turun, bilang turun.
Kalau methodology berubah, tulis.
Kalau tidak comparable, jangan dipaksa.
AI measurement akan selalu punya uncertainty.
Platform berubah.
Model berubah.
Source berubah.
User behavior berubah.
Tujuan governance bukan membuat measurement sempurna.
Tujuannya membuat perubahan dan keterbatasan tersebut terlihat.
Perusahaan yang serius tentang AI visibility tidak membutuhkan angka paling spektakuler.
Mereka membutuhkan angka yang tetap masuk akal ketika orang lain bertanya:
“Metodenya apa?”
Kalau jawabannya jelas, narasi mengikuti data.
Kalau jawabannya tidak jelas, data hanya mengikuti narasi.
Bacaan terkait di GEO.or.id
- Cluster: AI Governance & Regulation
- Kerangka terkait: Pemanfaatan AI dalam PMSE: Catatan Riset Permendag 19 Tahun 2026
- Kerangka terkait: Knowledge Consistency
- Artikel terkait: Checklist Governance untuk Organisasi yang Mulai Serius di AI Search
- Artikel terkait: Paid vs Organic AI Answer: Kenapa Harus Ada Kebijakan Pemisahan
- Artikel terkait: Model Update dan Change Log: Kenapa Eksperimen Harus Punya Versi
- Artikel terkait: AI Search Governance: Siapa yang Bertanggung Jawab atas Klaim Brand di Mesin Jawaban
