Early Fokus
Digital-Marketing Guide: Ratgeber & Tutorials

GlossarTechnik

Robots.txt

Die robots.txt ist eine kleine Datei im Wurzelverzeichnis einer Website, die Suchmaschinen mitteilt, welche Bereiche sie abrufen sollen.

Die robots.txt liegt unter ihre-domain.de/robots.txt und ist die erste Datei, die viele Suchmaschinen beim Besuch einer Website abrufen. Sie enthält Hinweise darauf, welche Verzeichnisse abgerufen werden sollen und welche außen vor bleiben können – etwa interne Suchergebnisse oder Bereiche, die für die Öffentlichkeit ohne Belang sind.

Wie sie gelesen wird

Der Aufbau ist bewusst schlicht: User-agent benennt, für welchen Besucher eine Regel gilt, Disallow und Allow steuern den Zugriff auf einzelne Pfade. Üblich ist zudem ein Verweis auf die XML-Sitemap, damit der Googlebot und vergleichbare Programme den Bestand einer Website zügig erfassen.

Was gute Praxis ausmacht

Eine wichtige Unterscheidung

Die robots.txt steuert das Crawling, nicht die Indexierung. Soll eine Seite nicht in den Suchergebnissen erscheinen, ist die Angabe „noindex" im Seitenkopf das passende Mittel; die Seite muss dann abrufbar bleiben, damit dieser Hinweis überhaupt gelesen werden kann. Vertrauliche Inhalte gehören zusätzlich hinter einen Zugangsschutz, denn die Datei selbst ist öffentlich einsehbar.

← Zurück zum Glossar