Crawl-Budget
Das Crawl-Budget bezeichnet die Menge an URLs, die der Googlebot innerhalb eines bestimmten Zeitraums auf einer Website crawlen kann und will. Es ergibt sich aus dem Crawl-Kapazitätslimit (wie viel Zeit und wie viele parallele Verbindungen der Server für den Googlebot aufbringen kann, ohne überlastet zu werden) und der Crawl-Nachfrage (wie relevant und aktuell Google die Inhalte einschätzt).
In der Praxis
Für die meisten kleinen und mittleren Websites ist Crawl-Budget kein Problem, da Google sie ohnehin vollständig crawlt. Relevant wird es laut Google vor allem bei sehr großen Websites mit über einer Million eindeutiger Seiten und wöchentlich wechselndem Content, bei mittelgroßen Websites mit mehr als 10.000 eindeutigen Seiten und täglich wechselndem Content sowie bei Seiten mit vielen technisch unnötigen URLs, etwa durch Filterkombinationen oder Duplicate Content; diese Zahlen bezeichnet Google ausdrücklich als grobe Richtwerte, nicht als Grenzwerte. Wer Crawl-Budget verschwendet, riskiert, dass neue oder aktualisierte Seiten spät oder gar nicht indexiert werden. Gegenmaßnahmen: unnötige URLs per robots.txt vom Crawling ausschließen, doppelte Inhalte zusammenführen statt sie nur per Canonical zu bündeln (beide URLs werden weiterhin abgerufen), Serverantwortzeiten verbessern und Weiterleitungsketten vermeiden. Von noindex als Mittel zur Budgetsteuerung rät Google ausdrücklich ab: Die Seite wird trotzdem abgerufen, die Crawling-Zeit ist verloren.