Die robots.txt ist eine kleine Textdatei im Stammverzeichnis einer Website, die Suchmaschinen-Crawlern Anweisungen gibt: Welche Bereiche dürfen gecrawlt werden, welche nicht? Sie ist keine Sicherheitsmaßnahme, sondern ei
Die robots.txt ist eine kleine Textdatei im Stammverzeichnis einer Website, die Suchmaschinen-Crawlern Anweisungen gibt: Welche Bereiche dürfen gecrawlt werden, welche nicht? Sie ist keine Sicherheitsmaßnahme, sondern eine Steuerung für Crawler.
Die Syntax ist einfach: User-agent bezeichnet den Crawler, Disallow verbietet Pfade, Allow erlaubt sie explizit. Wichtig: Was in der robots.txt steht, ist eine Bitte – nicht alle Crawler halten sich strikt daran.
Die robots.txt wird oft genutzt, um Crawl-Budget zu schonen, Duplikate auszuschließen oder die Sitemap zu referenzieren. Eine fehlerhafte oder zu restriktive robots.txt kann dazu führen, dass wichtige Seiten nicht indexiert werden.
Wer seine Website für Suchmaschinen optimiert, prüft die robots.txt: Ist sie vorhanden, sind die richtigen Bereiche erlaubt oder ausgeschlossen?
Die robots.txt ist die Ampel für Crawler. Mit ihr steuern Sie, wo Suchmaschinen unterwegs sein dürfen – und wo nicht.