Langsung ke konten utama
← Semua panduan

robots.txt dan sitemap

Kedua berkas ini menyampaikan sesuatu tentang URL Anda kepada perayap, dan tidak satu pun bekerja seperti yang biasa diasumsikan. Yang satu menahan izin mengambil. Yang lain menawarkan daftar untuk dipertimbangkan.

Izin bukanlah hal yang sama dengan pengecualian

robots.txt menahan izin untuk mengambil sebuah URL, dan tidak lebih dari itu. Google menyatakan terus terang bahwa berkas ini bukan mekanisme untuk menjauhkan halaman dari Penelusuran. Dua gagasan itu terus-menerus dicampuradukkan, dan pencampuran itu melahirkan satu kegagalan yang khas dan sangat kasatmata.

URL yang diblokir tetapi ditautkan situs lain tetap bisa terindeks. Google tahu alamat itu ada karena seseorang menautkannya; ia hanya tidak bisa melihat isinya. Maka URL itu bisa muncul tanpa deskripsi sama sekali — yang terburuk dari kedua sisi, karena halaman tampil publik di hasil sementara Anda tidak punya kendali atas penampilannya.

Membaca dan menulis berkasnya

Berkas ini berada di akar sebuah host dan hanya berlaku untuk host serta protokol itu. Aturan dikelompokkan menurut user-agent, dan sebuah perayap mematuhi satu kelompok paling spesifik yang cocok dengannya — bukan setiap kelompok yang mungkin cocok. Di dalam satu kelompok, Google menyelesaikan konflik lewat aturan yang lebih spesifik, bukan lewat urutan.

robots.txt
User-agent: *
Disallow: /admin/
Disallow: /*.pdf$
Allow: /admin/public/

User-agent: Googlebot
Disallow: /drafts/

Sitemap: https://example.com/sitemap.xml

Dua detail dalam contoh itu menyimpan hampir seluruh kebingungan. Baris Allow lebih spesifik daripada Disallow di atasnya, jadi /admin/public/ tetap bisa diambil. Dan begitu kelompok Googlebot ada, Googlebot hanya mematuhi kelompok itu — kelompok tanda bintang tidak lagi berlaku baginya, sehingga di sini /admin/ justru bisa diambil Googlebot. Hampir tidak pernah itu yang dimaksud penulisnya.

  • Memblokir sebuah jalur tidak menghapus URL yang sudah terindeks; ia hanya menghentikan pengambilan berikutnya.
  • Direktif Sitemap berdiri lepas dari kelompok user-agent mana pun dan boleh ditaruh di bagian mana saja.
  • Galat 5xx pada robots.txt sendiri bisa membuat perayap menjauhi seluruh host, jadi sajikan dari sesuatu yang andal.

Ketika aturan robots merusak jauh dari dirinya sendiri

Kesalahan robots.txt yang paling mahal bukanlah halaman yang memang ingin Anda blokir. Yang mahal adalah sumber daya yang dibutuhkan halaman untuk dirender. Mesin pencari merender halaman sebelum mengindeksnya, dan proses render menarik skrip, gaya, serta respons API.

Blokir jalur skrip atau rute API, dan perayap tetap mengambil HTML dengan sempurna. Setelah itu ia merender halaman yang nyaris kosong dan mengindeks halaman yang nyaris kosong. Tidak ada laporan yang akan menyebut halaman itu diblokir, karena halamannya memang tidak — hanya yang dibutuhkannya.

Sitemap adalah usulan, bukan antrean

Sitemap membantu penemuan justru di tempat penautan paling lemah: situs besar, situs yang benar-benar baru dengan sedikit tautan masuk, dan situs padat media yang tidak punya teks tautan alami. Google menyatakan terus terang bahwa mencantumkan URL tidak menjamin perayapan maupun pengindeksan.

Panduan Google sendiri menyebut situs yang lebih kecil dan tertaut rapi mungkin tidak membutuhkannya sama sekali, karena perayap menemukan semuanya lewat tautan. Itu layak ditimbang serius sebelum membangun infrastruktur sitemap demi masalah yang lebih baik diselesaikan tautan internal.

BatasNilai
URL per berkas sitemap50.000
Ukuran tanpa kompresi per berkas50 MB
Melewati salah satu batasPecah dan rujuk bagiannya dari indeks sitemap

Tag mana yang dibaca, diabaikan, atau diragukan

Di sinilah sebagian besar usaha pada sitemap terbuang. Dua dari empat tag yang lazim sama sekali tidak berbuat apa-apa, dan yang ketiga bisa berbalik merugikan Anda.

TagYang dilakukan Google terhadapnya
locDibaca — URL itu sendiri
lastmodDipakai hanya bila konsisten dan dapat diverifikasi
changefreqDiabaikan
priorityDiabaikan

Syarat pada lastmod itulah yang menggigit. Jika proses build Anda mencap setiap URL dengan waktu penerapan, setiap nilai sekaligus keliru dan mudah dibantah: halaman tidak berubah, dan mesin pencari bisa melihatnya. Begitu ia berhenti memercayai kolom itu, ia berhenti memakainya, dan Anda jadi lebih buruk daripada tidak mengirim lastmod sama sekali. Keluarkan hanya untuk perubahan nyata pada konten utama, dan lebih baik hilangkan daripada mengarangnya.

sitemap.xml
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://example.com/guides/indexing/</loc>
    <lastmod>2026-06-14</lastmod>
  </url>
</urlset>

Memilih alat yang tepat

Hampir setiap pertanyaan di ranah ini selesai begitu Anda memisahkan tiga pekerjaan yang terasa mirip padahal bukan.

TujuanAlatAlasan
Berhenti memboroskan perayapan pada URL sampahrobots.txtMencegah pengambilan sepenuhnya
Menjauhkan halaman dari hasilnoindex, atau autentikasiMenuntut pengambilan agar direktifnya terbaca
Membantu halaman ditemukanTautan internal, lalu sitemapTautan membawa konteks, entri sitemap tidak

Pertanyaan dan jawaban

Bolehkah menggabungkan disallow dan noindex?

Tidak, dan itulah kesalahan klasiknya. Jika robots.txt memblokir URL, perayap tidak pernah mengambil halaman dan tidak pernah melihat noindex. Izinkan perayapan lalu sajikan noindex, atau taruh halaman di balik autentikasi.

Apakah saya butuh sitemap?

Tidak selalu. Panduan Google menyebut situs kecil dengan tautan internal yang rapi bisa ditemukan lewat tautan. Sitemap berguna pada situs besar, situs yang benar-benar baru dengan sedikit tautan masuk, dan media melimpah.

Mengapa halaman yang saya blokir masih muncul di Google?

Karena robots.txt menghentikan pengambilan, bukan pengindeksan. Situs lain menautkan URL itu, jadi Google tahu ia ada tetapi tidak melihat isinya — karena itulah muncul tanpa deskripsi. Izinkan perayapan lalu sajikan noindex untuk menghapusnya dengan benar.

Perlukah saya mengisi priority dan changefreq?

Tidak. Google mengabaikan keduanya. Usaha itu lebih berguna untuk membuat lastmod akurat, atau untuk tautan internal.

Apa yang terjadi bila robots.txt mengembalikan galat?

Galat 5xx bisa membuat perayap menjauhi host alih-alih menganggap semuanya diizinkan. Sajikan robots.txt dari infrastruktur yang setidaknya seandal situsnya sendiri.