Ana içeriğe geç
← Tüm rehberler

robots.txt ve site haritaları

İki dosya da bir tarayıcıya adresleriniz hakkında bir şey söyler ve hiçbiri genellikle sanıldığı işi yapmaz. Biri getirme iznini geri çeker. Diğeri değerlendirilmek üzere bir liste sunar.

İzin ile dışarıda tutmak aynı şey değildir

robots.txt bir adresi getirme iznini geri çeker, başka bir şey değil. Google açıkça belirtiyor: bu dosya bir sayfayı Arama'dan uzak tutma mekanizması değildir. İki fikir sürekli birbirine karıştırılıyor ve bu karışıklık çok belirli, gayet görünür bir arızaya yol açıyor.

Başka sitelerin bağlantı verdiği engellenmiş bir adres yine dizine girebilir. Google adresin var olduğunu bilir, çünkü biri ona bağlantı vermiştir; yalnızca üzerinde ne yazdığını göremez. Dolayısıyla adresi hiç açıklamasız listeleyebilir — iki dünyanın da en kötüsü, çünkü sayfa sonuçlarda herkese açıkken nasıl göründüğü üzerinde hiçbir denetiminiz yoktur.

Dosyayı okumak ve yazmak

Dosya bir ana makinenin kökünde durur ve yalnızca o ana makine ile o protokol için geçerlidir. Kurallar user-agent'a göre gruplanır ve bir tarayıcı, kendisine en özgül biçimde uyan tek gruba uyar — uyabileceği her gruba değil. Bir grup içinde Google çakışmaları sıraya göre değil, daha özgül kurala göre çözer.

robots.txt
User-agent: *
Disallow: /admin/
Disallow: /*.pdf$
Allow: /admin/public/

User-agent: Googlebot
Disallow: /drafts/

Sitemap: https://example.com/sitemap.xml

Bu örnekteki iki ayrıntı kafa karışıklığının neredeyse tamamını taşır. Allow satırı üstündeki Disallow'dan daha özgüldür, bu yüzden /admin/public/ getirilebilir kalır. Ve bir Googlebot grubu var olduğu anda Googlebot yalnızca o gruba uyar — joker grup artık onu bağlamaz, dolayısıyla burada /admin/ Googlebot için getirilebilirdir. Bu, yazarın kastettiği şey neredeyse hiçbir zaman değildir.

  • Bir yolu engellemek zaten dizindeki adresleri kaldırmaz; yalnızca sonraki getirmeleri durdurur.
  • Sitemap yönergesi her user-agent grubundan bağımsızdır ve dosyanın herhangi bir yerinde bulunabilir.
  • robots.txt'in kendisinde bir 5xx, tarayıcının tüm ana makineden geri çekilmesine yol açabilir; bu yüzden güvenilir bir yerden sunun.

Bir robots kuralının kendinden çok uzakta yaptığı hasar

En pahalı robots.txt hataları engellemek istediğiniz sayfalar değildir. Bir sayfanın işlenmek için ihtiyaç duyduğu kaynaklardır. Arama motorları sayfaları dizine eklemeden önce işler ve bu işleme betikleri, stilleri ve API yanıtlarını çeker.

Bir betik yolunu ya da API rotasını engelleyin: tarayıcı HTML'i yine kusursuzca getirir. Ardından neredeyse boş bir sayfa işler ve neredeyse boş bir sayfayı dizine ekler. Hiçbir rapor sayfanın engellendiğini söylemez, çünkü sayfa engellenmemiştir — yalnızca ihtiyaç duyduğu şeyler engellenmiştir.

Site haritası bir öneridir, sıra değil

Site haritaları keşfe tam da bağlantılamanın en zayıf olduğu yerde yardım eder: büyük siteler, az bağlantı alan yepyeni siteler ve doğal bağlantı metni bulunmayan medya ağırlıklı siteler. Google dolaysızca söylüyor: bir adresi listelemek ne taramayı ne de dizine eklemeyi garanti eder.

Google'ın kendi yönlendirmesi, küçük ve iyi bağlantılanmış bir sitenin hiç ihtiyaç duymayabileceği yönünde; çünkü tarayıcı bağlantıları izleyerek her şeyi bulur. Bunu, iç bağlantılamanın daha iyi çözeceği bir sorun için site haritası altyapısı kurmadan önce ciddiye almakta yarar var.

SınırDeğer
Dosya başına adres50.000
Dosya başına sıkıştırılmamış boyut50 MB
İkisinden birini aşıncaBölün ve parçaları bir site haritası dizininden gösterin

Hangi etiketler okunur, yok sayılır ya da kuşkuyla karşılanır

Site haritası emeğinin çoğu tam burada boşa gider. Yaygın dört etiketin ikisi hiçbir şey yapmaz, üçüncüsü ise size karşı çalışabilir.

EtiketGoogle onunla ne yapar
locOkunur — adresin kendisi
lastmodYalnızca tutarlı ve doğrulanabilir biçimde doğruysa kullanılır
changefreqYok sayılır
priorityYok sayılır

Isıran koşul lastmod'unkidir. Derlemeniz her adresi dağıtım zamanıyla damgalıyorsa her değer aynı anda hem yanlıştır hem de çürütülmesi kolaydır: sayfa değişmemiştir ve arama motoru bunu görebilir. Alana güvenmeyi bıraktığı anda onu kullanmayı da bırakır; bu da sizi hiç lastmod göndermemekten daha kötü duruma sokar. Yalnızca ana içerikteki gerçek değişikliklerde yayın ve uydurmaktansa hiç koymayın.

sitemap.xml
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://example.com/guides/indexing/</loc>
    <lastmod>2026-06-14</lastmod>
  </url>
</urlset>

Doğru aracı seçmek

Bu alandaki hemen her soru, birbirine benzeyen ama aynı olmayan üç işi ayırdığınız anda çözülür.

AmaçAraçNeden
Çöp adreslere tarama emeği harcamamakrobots.txtGetirmeyi tümüyle engeller
Bir sayfayı sonuçlardan uzak tutmaknoindex ya da kimlik doğrulamasıYönergenin okunabilmesi için getirmeyi gerektirir
Sayfaların bulunmasına yardım etmekİç bağlantılar, sonra site haritasıBağlantılar bağlam taşır, site haritası kayıtları taşımaz

Sorular ve yanıtlar

disallow ile noindex'i birleştirebilir miyim?

Hayır ve bu eşleşme klasik hatadır. robots.txt adresi engelliyorsa tarayıcı sayfayı hiç getirmez ve noindex'i hiç görmez. Taramaya izin verip noindex'i sunun ya da sayfayı kimlik doğrulaması arkasına alın.

Site haritasına gerçekten ihtiyacım var mı?

Her zaman değil. Google'ın yönlendirmesi şu: küçük ve iyi bağlantılanmış bir site bağlantılar izlenerek keşfedilir. Site haritaları büyük sitelerde, az bağlantı alan yepyeni sitelerde ve bol medyada yerini hak eder.

Engellediğim sayfa neden hâlâ Google'da görünüyor?

Çünkü robots.txt getirmeyi durdurdu, dizine eklemeyi değil. Başka siteler o adrese bağlantı veriyor; Google var olduğunu biliyor ama içeriği göremiyor — açıklamasız kayıt bundandır. Taramaya izin verip bir noindex sunarak düzgünce kaldırın.

priority ve changefreq değerlerini ayarlamalı mıyım?

Hayır. Google ikisini de yok sayar. Bu emek, lastmod'u doğru kılmakta ya da iç bağlantılamada daha iyi değerlenir.

robots.txt hata döndürürse ne olur?

Bir 5xx, tarayıcıyı her şeyin serbest olduğunu varsaymak yerine ana makineden geri çekilmeye yöneltebilir. robots.txt'i en az sitenin kendisi kadar güvenilir bir altyapıdan sunun.