Empat tahap, dan mengapa pembedaannya penting
Mesin pencari melakukan empat tahap terpisah pada sebuah halaman, dan satu tahap dapat berhasil sementara tahap berikutnya gagal. Pada tahap penemuan, URL mulai diketahui. Perayapan mengambil halaman. Pengindeksan memutuskan apakah halaman disimpan. Pemeringkatan menentukan, untuk setiap kueri, apakah halaman ditampilkan. Fitur AI Google merupakan bagian dari Penelusuran dan tetap bergantung pada dasar yang sama untuk perayapan, pengindeksan, dan kelayakan, meskipun pengambilan dapat melebar ke penelusuran terkait.
Hampir setiap pertanyaan yang diawali «mengapa halaman saya tidak muncul» sebenarnya pertanyaan tentang di tahap mana ia berhenti. Jawabannya mengubah sepenuhnya langkah berikutnya, dan tahap-tahap itu gagal dengan cara yang dari luar tampak serupa: halaman yang absen terlihat identik di hasil, entah ia tak pernah ditemukan, diblokir saat pengambilan, dinilai tak layak disimpan, atau disimpan lalu sekadar dilampaui.
| Tahap | Apa yang terjadi | Bagaimana ia gagal |
|---|---|---|
| Penemuan | URL menjadi dikenal, lewat tautan atau peta situs | Tak ada yang menaut ke halaman dan tak ada peta situs yang memuatnya |
| Perayapan | URL diambil dan dirender seperti di peramban | robots.txt menahan izin, atau server mengembalikan galat |
| Pengindeksan | Mesin memutuskan apakah menyimpan halaman | Konten dinilai duplikat, tipis, atau tak layak disimpan |
| Pemeringkatan | Halaman tersimpan dinilai terhadap maksud kueri | Halaman tersimpan tetapi ada jawaban yang lebih baik |
Penemuan: bagaimana sebuah URL menjadi dikenal
Google menyatakan bahwa sebagian besar halaman baru yang ditemukannya setiap hari datang lewat tautan. Perayap yang sudah mengambil salah satu halaman Anda menarik URL dari markup-nya lalu mengantrekannya. Itu menjadikan tautan internal sebagai mekanisme penemuan utama di situs mana pun, bukan optimalisasi yang ditempelkan belakangan.
Peta situs adalah jalur kedua. Ia paling berarti di tempat tautannya paling lemah: situs yang sangat besar, situs yang benar-benar baru dengan sedikit tautan masuk, dan situs padat media yang tak punya teks jangkar alami. Google menyatakan tegas bahwa mencantumkan URL tidak menjamin perayapan maupun pengindeksan — itu usulan yang diajukan untuk dipertimbangkan, bukan antrean yang akan dikerjakan.
Konsekuensi praktisnya, halaman yang tak ditaut apa pun bersandar pada mekanisme yang lebih lemah dari dua itu. Entri peta situs tidak membawa konteks: ia mengatakan sebuah URL ada, tetapi tidak apa pun tentang untuk apa halaman itu atau bagaimana ia terhubung dengan yang lain. Sebuah tautan membawa keduanya, lewat penempatannya dan lewat teks jangkarnya.
Perayapan: izin, kapasitas, dan permintaan
Perayapan dibatasi dua hal yang disebut Google secara terpisah. Batas kapasitas perayapan adalah berapa koneksi serentak yang dibuka tanpa membebani server Anda; ia menyesuaikan diri dengan waktu respons dan tingkat galat Anda. Permintaan perayapan adalah seberapa banyak yang benar-benar ingin diambil, digerakkan oleh ukuran situs, frekuensi pembaruan, dan penilaiannya atas kualitas.
Panduan Google sendiri menyebut sebagian besar situs tak perlu memikirkan ini sama sekali. Anggaran perayapan baru jadi persoalan nyata di atas kira-kira satu juta halaman yang diperbarui mingguan, di atas sepuluh ribu halaman yang berubah harian, atau pada situs mana pun dengan porsi besar URL tersangkut di «Ditemukan – saat ini tidak diindeks». Di bawah itu, perayapan yang lambat hampir selalu gejala dari hal lain.
Di tempat yang memang relevan, tuasnya tidak megah: satukan duplikat, kembalikan 404 atau 410 sungguhan untuk yang dihapus permanen alih-alih soft 404, pendekkan rantai pengalihan, perbaiki waktu respons server, dan dukung permintaan bersyarat agar halaman yang tak berubah bisa dijawab murah. Perhatikan apa yang hilang dari daftar itu: noindex bukan alat anggaran perayapan, karena perayap harus mengambil halaman untuk bisa membaca arahannya.
Perenderan: tahap yang terlupakan
Di antara pengambilan dan pengindeksan ada perenderan. Mesin menjalankan halaman kurang lebih seperti peramban, lalu mengindeks apa yang ada pada keluaran hasil render. Konten yang baru muncul setelah JavaScript berjalan karenanya bisa diindeks — tetapi itu bergantung pada berhasilnya eksekusi tersebut dan pada bisa-tidaknya sumber daya yang dibutuhkannya dirayapi.
Di sinilah satu aturan robots.txt menimbulkan kerusakan jauh dari tempat ia ditulis. Memblokir jalur skrip atau API menghalangi perayap mengambil justru berkas-berkas yang dipakai halaman untuk membangun kontennya. HTML terambil baik-baik saja, dirender nyaris kosong, dan diindeks nyaris kosong. Tak ada status yang akan berkata «diblokir» — halaman itu sendiri tak pernah diblokir.
Pengindeksan adalah penilaian, bukan antrean
Salah baca paling umum atas seluruh rangkaian ini adalah memperlakukan pengindeksan sebagai antre: dirayapi, menunggu giliran, diindeks. Bukan begitu cara kerjanya. Setelah perenderan, mesin memutuskan apakah halaman layak disimpan, dan keputusan itu bisa saja tidak.
Itulah persis yang dimaksud Search Console dengan «Sudah dirayapi – saat ini tidak diindeks». Tak ada yang rusak, tak ada yang memblokir, pengambilan berhasil. Halaman dinilai lalu disisihkan. Halaman nyaris identik yang dihasilkan dari satu templat — hanya berbeda pada nama atau angka yang disubstitusi — adalah alasan lazimnya, dan mengirim ulang tidak mengubah apa pun, karena masukan bagi keputusan itu tidak berubah.
Pemeringkatan dan fitur AI Google memiliki dasar yang sama
Untuk kueri tertentu, Pencarian mengambil dan memberi peringkat materi yang relevan. Ikhtisar AI Google dan Mode AI juga dapat menggunakan query fan-out, mengeluarkan beberapa penelusuran terkait di seluruh subtopik dan sumber data sebelum menghasilkan respons dengan tautan pendukung.
Konsekuensinya sederhana: visibilitas dalam fitur Penelusuran AI Google masih bergantung pada kelayakan Penelusuran biasa. Google mengatakan tidak ada persyaratan teknis tambahan atau markup AI khusus; perayapan harus diizinkan, konten penting harus dapat diindeks dan tersedia dalam teks, dan kontrol pratinjau seperti nosnippet dapat membatasi apa yang muncul di fitur AI.