Tutorial Sinkronisasi robots.txt dengan Bot Preference Sync di Cloudflare
AW
Axel W

Dipublikasikan 25 Agustus 2026

Tutorial Sinkronisasi robots.txt dengan Bot Preference Sync di Cloudflare

Cloudflare meluncurkan Bot Preference Sync, fitur yang menyelaraskan preferensi AI bot di dashboard Cloudflare dengan file robots.txt secara otomatis. Fitur ini tersedia untuk semua pelanggan, mulai dari tier Free hingga Enterprise. Artikel ini membahas cara mengkonfigurasi Bot Preference Sync untuk mengontrol bagaimana AI crawler berinteraksi dengan websitemu.

Menurut Cloudflare Blog, Bot Preference Sync menghilangkan kerumitan memelihara file robots.txt secara manual. Saat kamu mengatur kebijakan untuk Search, Agent, dan Training di dashboard, Cloudflare akan secara otomatis memperbarui robots.txt agar mencerminkan preferensi tersebut.

Latar Belakang dan Masalah yang Dipecahkan

Selama bertahun-tahun, pemilik situs menghadapi dilema kompleks mengenai bot traffic. Di satu sisi, mereka ingin kontennya dapat ditemukan melalui mesin pencari. Di sisi lain, banyak yang tidak ingin kontennya digunakan untuk melatih model AI tanpa izin. Masalahnya semakin rumit ketika mixed-use crawler menggunakan satu user agent untuk search, agent, dan training sekaligus.

Sebelumnya, Cloudflare menyediakan robots.txt yang dikelola secara manual untuk melarang crawler training. Namun, ketika preferensi di robots.txt tidak selaras dengan aturan enforcement di edge, beberapa crawler menganggapnya sebagai alasan untuk mengabaikan preferensi atau mencoba bypass aturan. Bot Preference Sync hadir untuk menutup celah ini.

Langkah 1: Memahami Kategori AI Bot

Cloudflare membagi AI bot ke dalam tiga kategori utama yang dapat dikonfigurasi secara terpisah:

  • Search: Bot yang mengindeks konten untuk mesin pencari. Pilihan: Allow, Block on pages with ads, atau Block everywhere.

  • Agent: Bot yang mengakses konten atas nama pengguna, seperti AI assistant. Pilihan sama dengan Search.

  • Training: Bot yang mengumpulkan data untuk melatih model AI. Pilihan: Allow atau Disallow.

Kategori ini memungkinkan strategi yang nuansa. Misalnya, sebuah situs e-commerce mungkin ingin semua produknya di-crawl dan dilatih agar muncul saat pengguna bertanya kepada chatbot. Sebaliknya, penerbit yang memonetisasi dengan iklan mungkin ingin tetap terindeks di mesin pencari namun melarang training.

Langkah 2: Mengkonfigurasi AI Bot Policy di Dashboard

Masuk ke dashboard Cloudflare, pilih domain yang ingin dikonfigurasi, lalu navigasi ke menu Bot Management atau AI bot settings. Di sana kamu akan menemukan pengaturan untuk masing-masing kategori: Search, Agent, dan Training.

Contoh konfigurasi untuk penerbit yang memonetisasi dengan iklan:

  • Search: Allow

  • Agent: Allow

  • Training: Disallow

Dengan konfigurasi ini, situs tetap terindeks dan dapat diakses oleh AI agent, namun konten tidak boleh digunakan untuk melatih model AI. Pilihan Disallow menulis preferensi no training ke robots.txt sehingga crawler yang kooperatif dapat mematuhi kebijakan tersebut.

Langkah 3: Mengaktifkan Bot Preference Sync

Setelah kebijakan AI bot ditentukan, aktifkan Bot Preference Sync di dashboard. Fitur ini akan menambahkan blok robots.txt yang dihasilkan Cloudflare di awal file robots.txt yang sudah ada. Blok tersebut mencakup daftar user agent yang teridentifikasi dalam kategori yang kamu blokir atau disallow.

Contoh output robots.txt ketika Training diatur ke Disallow:

# BEGIN Cloudflare Bot Preference Sync

User-agent: TrainingBot1
User-agent: TrainingBot2
User-agent: TrainingBot3
User-agent: MixedUseBot-Extended
Disallow: /

...

# END Cloudflare Bot Preference Sync

Daftar bot ini diperbarui secara berkala berdasarkan data BotBase Cloudflare. Bot yang diverifikasi dan diklasifikasikan sebagai Search, Agent, atau Training dapat dilihat di public bots directory.

Langkah 4: Memahami Transparansi dan Verified Bots

Cloudflare mempromosikan transparansi sebagai syarat utama bagi operator bot. Crawler yang melakukan search dan training secara bersamaan harus memenuhi persyaratan tambahan agar tidak diblokir saat Training diatur ke Disallow:

  • Bot harus menghormati preferensi no training di robots.txt.

  • Memberikan cara bagi pemilik situs untuk memilih keluar dari AI summaries.

  • Menyediakan visibilitas URL-level tentang halaman mana yang tersedia untuk training.

  • Menunjukkan secara publik bahwa melarang training tidak merusak hasil pencarian tradisional.

Bot yang memenuhi kriteria ini dilacak di AI bot transparency section di Cloudflare Radar. Crawler yang tidak transparan tidak akan mendapatkan keuntungan dari keraguan dan tetap diblokir.

Langkah 5: Menyesuaikan untuk Kasus Khusus

Bot Preference Sync dirancang untuk kebijakan kategori luas, bukan pengecualian per kasus. Jika organisasimu memiliki perjanjian khusus dengan penyedia AI tertentu dan ingin memberikan pengecualian, kamu dapat mematikan Bot Preference Sync dan mengelola robots.txt secara manual.

Untuk pelanggan baru, Bot Preference Sync aktif secara default agar kebijakan yang kamu tetapkan selalu selaras dengan apa yang dipublikasikan. Pelanggan yang menggunakan fitur managed robots.txt lama akan diminta untuk meninjau dan mengonfirmasi preferensi saat transisi ke Bot Preference Sync.

Penerbit yang mengandalkan iklan dapat memilih opsi khusus saat onboarding: I monetize from pages with ads on this domain. Opsi ini secara default mengatur Training ke Disallow, menjaga konten tetap terindeks sambil mencegah penggunaan data untuk model training.

Monitoring dan Verifikasi

Setelah mengaktifkan Bot Preference Sync, verifikasi bahwa robots.txt sudah diperbarui dengan mengakses https://domainmu.com/robots.txt. Pastikan blok Cloudflare muncul di awal file dan berisi user agent yang sesuai dengan kebijakan yang kamu pilih.

Gunakan Cloudflare Analytics untuk memantau volume traffic dari kategori bot yang berbeda. Jika kamu melihat peningkatan traffic dari bot yang seharusnya diblokir, periksa apakah kebijakan enforcement di edge sudah sesuai dengan preferensi robots.txt. Ketidakselarasan antara keduanya dapat memberikan sinyal yang membingungkan kepada crawler.

Kesimpulan

Bot Preference Sync menyederhanakan manajemen robots.txt dengan menghubungkan preferensi di dashboard Cloudflare langsung ke file yang dilihat oleh crawler. Fitur ini mengurangi risiko ketidakselarasan antara preferensi yang dinyatakan dan aturan yang diberlakukan, sekaligus mendorong transparansi di kalangan operator AI bot.

Pantau Cloudflare Radar untuk melihat daftar bot yang memenuhi praktik terbaik transparansi dan yang tidak.