Robots.txt
Eine Textdatei, die Suchmaschinen-Crawlern mitteilt, welche Seiten oder Bereiche einer Website sie crawlen dürfen oder nicht.
Robots.txt ist eine Textdatei, die im Stammverzeichnis einer Website platziert wird und Suchmaschinen-Crawlern mitteilt, welche Seiten oder Bereiche der Website sie crawlen dürfen. Sie ist Teil des Robots Exclusion Protocol, einem Standard, den Websites nutzen, um mit Web-Crawlern zu kommunizieren.
Die robots.txt-Datei kann verwendet werden, um Crawler von sensiblen Bereichen fernzuhalten, Crawl-Budget für unwichtige Seiten zu sparen, Probleme mit doppelten Inhalten zu vermeiden und zu steuern, wie Suchmaschinen Ihre Website crawlen. Allerdings verhindert sie nicht, dass Seiten indexiert werden, wenn sie von anderen Websites verlinkt sind.
Eine robots.txt-Datei verwendet eine einfache Syntax mit User-agent (legt fest, für welchen Crawler die Regeln gelten) und den Direktiven Disallow oder Allow (bestimmt, welche Pfade nicht oder doch gecrawlt werden sollen). Sie können auch eine Sitemap-Direktive einfügen, die auf Ihre XML-Sitemap verweist.
Häufige Fehler bei der robots.txt sind das versehentliche Blockieren wichtiger Seiten, das Sperren von CSS- oder JavaScript-Dateien, die Google zum korrekten Rendern von Seiten benötigt, oder das Vertrauen auf robots.txt, um die Indexierung zu verhindern (nutzen Sie stattdessen noindex-Tags). Sie können Ihre robots.txt-Datei mit dem robots.txt-Tester-Tool in der Google Search Console überprüfen.