Zum Inhalt

Wissen

Crawling und Indexierung

Wie Bots HTML holen, Links folgen und entscheiden, was gespeichert wird. Mit Schema — ohne fremde Screenshots.

Sichtbarkeit beginnt nicht mit einem Keyword-Dokument. Sie beginnt damit, dass ein Crawler die URL findet, den Inhalt lesen darf und die Suchmaschine ihn im Index behält. Erst danach entscheidet die Ausspielung — bei Adult-Seiten oft strenger als bei einem Handwerksbetrieb.

Drei Dateien steuern den ersten Kontakt: robots.txt sagt, welche Pfade der Bot meiden soll. Die XML-Sitemap listet URLs, die Sie für wichtig halten. Meta-Robots und Canonicals an der einzelnen Seite korrigieren, was Sitemap und interne Links sonst doppelt anbieten.

Website robots · Sitemap Crawler Holt HTML, folgt Links Index Was gespeichert wird SERP Was ausgespielt wird Engstellen im Adult-Web noindex / robots-Block Crawl-Budget (Video, Parameter) SafeSearch in der Ausspielung
Crawler holt, Index speichert, SERP spielt aus. Ein Block in robots.txt stoppt schon vor dem Index.

Wo Adult-Sites typisch hängen

Parameter-URLs aus Filtern (Stadt, Haarfarbe, Preis) erzeugen Tausende Varianten mit gleichem Inhalt. Pagination ohne rel-logische Kette zieht den Bot in Archive, die kein eigenes Dokument verdienen. Video-Player und Infinite-Scroll halten den eigentlichen Text hinter Scripten, die der Bot nicht ausführt.

Member- und Tube-Sites verbrauchen Crawl-Budget auf Vorschaubildern und Session-IDs. Escort-Portale tun dasselbe mit leeren Stadtarchiven und Facetten. Beides sieht „lebendig“ aus und liefert dem Index wenig Neues.

Arbeitsfolge in einem technischen Audit

  1. Live-Header, HTTPS, Weiterleitungsketten, Soft-404.
  2. robots.txt und Sitemap gegen den tatsächlichen Bestand halten.
  3. Stichprobe: Title, H1, Canonical, noindex auf Filter, Dankesseiten, internen Suchen.
  4. Verwaiste URLs: im Index, aber von keiner internen Kante erreichbar.
  5. Logs oder Search-Console-Abdeckung: was geholt, was ausgeschlossen, was dupliziert wird.

Index und Ausspielung trennen

Viele Marken-URLs sind indexiert und erscheinen bei Namenssuchen. Dieselbe Domain kann bei expliziten Generics unsichtbar bleiben, weil SafeSearch und Richtlinien die Ausspielung begrenzen. Wer beides in einen Topf wirft, priorisiert falsch: erst crawlbar und indexierbar machen, dann Inhalte und Marke stärken.

Mehr zur Lesart der Kurven steht im Artikel zur Search Console. Die Onpage-Checkliste folgt, sobald der Bot die richtigen URLs sieht.