• Navigation überspringen
  • Zur Navigation
  • Zum Seitenende
Organisationsmenü öffnen Organisationsmenü schließen
Friedrich-Alexander-Universität Dokumentation der WordPress-Themes und -Plugins
  • FAUZur zentralen FAU Website
  1. Friedrich-Alexander-Universität
  2. Regionales Rechenzentrum Erlangen
Suche öffnen
  • FAU.tv
  • RRZE
  1. Friedrich-Alexander-Universität
  2. Regionales Rechenzentrum Erlangen
Friedrich-Alexander-Universität Dokumentation der WordPress-Themes und -Plugins
Menu Menu schließen
  • Grundlagen
    • Häufig gestellte Fragen
    • Allgemeines
      • Grundsätzliches zum Webpublishing
      • Rahmenbedingungen für Webauftritte
      • Eine CMS-Instanz beantragen
      • Konzeption einer Website
    • WordPress Grundlagen
      • Über WordPress
      • Login und Navigation im Backend
      • Das eigene Profil bearbeiten
      • Benutzer anlegen und bearbeiten
      • Seiten und Beiträge
      • Menüs
    • Inhalte bearbeiten
      • Seiten erstellen
      • Beiträge erstellen
      • Mediathek
      • Bilder und Videos einbinden
      • PDFs
      • Zitate
    • SEO – Search engine optimization
      • Suchmaschinenoptimierung in 5 Minuten
      • SEO Inhalte gestalten
      • SEO Grundlagen
      • SEO und Barrierefreiheit
      • SEO und KI
    • Tutorials
      • WordPress Tipps & Tricks
    Portal Grundlagen
  • Block-Editor
    • Umstellung auf den Block-Editor
    • FAQ Block-Editor
    • Was ist der Block-Editor?
    • Hauptelemente des Editors
      • Die obere Editorleiste
      • Das Inserter Fenster
      • Der Inhaltsbereich
      • Das Einstellungsfenster
    • Was ist ein Block?
      • Block-Typen
      • Die Block-Werkzeugleiste
      • Einen Block hinzufügen
      • Die Listenansicht
    • Block-Funktionen
      • Text und Bild verlinken
      • Blöcke gruppieren
      • Anker-Links (Sprungmarken)
      • Block-Vorlagen erstellen
      • Bild in Tabellenblock einfügen
      • Spalten einfügen
    Portal Der Block-Editor
  • Plugins
    • Plugins aktivieren
    • Plugins für FAU Portale
      • CRIS
      • Jobs
      • Lehrveranstaltungen (Lectures)
      • Studiengangsverwaltung (MeinStudium)
    • Inhaltliche Erweiterung
      • Elements (Gestaltung)
      • Elements Blocks
      • Multilang (mehrsprachige Seiten)
      • Person (Kontakte)
      • RRZE Answers
      • RRZE Bluesky
      • RRZE FAUdir
      • RRZE Research Data
      • Remoter
      • RRZE FAUbox
      • FAU oEmbed
      • Typesettings (Code Highlighter)
      • Video
    • Funktionale Erweiterung
      • Contact Form 7
      • Calendar
      • RRZE Downloads
      • Expo
      • Post-Expiration (Verfallsdatum Beiträge)
      • RRZE Appointment
      • RRZE Events
      • RRZE Formular
      • RSVP (Buchungssystem)
      • WS Form (Formulare erstellen)
    • SEO & Marketing
      • Autoshare
      • QR-Code Generator
      • RSS Feed
      • RRZE Newsletter
      • Siteimprove
      • Statistik
      • The SEO Framework
    • Benutzer- und Zugriffsverwaltung
      • Access Control
      • RRZE Private Site
      • RRZE Block Control
      • WMP (Domain Information)
      • Workflow (Rollen & Module verwalten)
    • Sicherheit & Datenschutz
      • Legal (Rechtl. Pflichttexte)
    Portal Plugins
  • Themes
    • Was ist ein Theme?
    • Ein Theme auswählen
    • FAU Elemental
      • FAU Elemental FAQ
      • Erste Schritte
      • Theme Vorschau und Aktivierung
      • Customizer-Einstellungen
      • Menüs anpassen
      • Die Startseite anpassen
      • Übersichtsseiten und Portalmenüs
      • Bilder und Grafiken
      • Galerie
      • FAU Elemental Blöcke
        • Teaser Grid
      • Vorlagen erstellen
      • Rechtliche Pflichtangaben ergänzen
    • FAU Einrichtungen
      • FAU Einrichtungen FAQ
      • Templates
      • Seitenlogo und Seiteninformationen ergänzen
      • Bühnenbild erstellen
      • Abmessungen für Bilder und Grafiken
      • Galerie
      • Widgetbereiche und Widgets
      • Dynamische Sidebar
      • Portalseiten und -menüs
      • Seitennavigation
      • Slider und Blogroll
      • Shortcodes
    • FAU Events
    • Francesca – Ein Theme für Kooperationen
    Portal Themes
  • Barrierefreiheit
    • Vorwort und Überblick
    • Einführung und Hintergründe
    • Bereitstellung und Pflege von Inhalten
    • Entwicklung und Design
    • Organisatorische und rechtliche Anforderungen
    • Satzungen
    • Tests der Barrierefreiheit
    • Weitere Leitfäden und relevante Informationsangebote
    • Kurzanleitung zur Verbesserung der digitalen Barrierefreiheit in Dokumenten aus Büroanwendungen
    Portal Barrierefreiheit
  • Entwicklung
    • Farben
    • Schriften
    • Einsatzkontext (Statistik)
    • Versionsverwaltung Git
    • Einheitliche Vergabe von Versionsnummern
    • Themes
    • Plugins
    • Eigene Testinstanz
    • Serverkonfiguration
    Portal Entwicklung
  1. Startseite
  2. Entwicklung
  3. Spezifikationen und Vorgaben
  4. Crawler, Bots und Webscraper

Crawler, Bots und Webscraper

Bereichsnavigation: Entwicklung
  • Spezifikationen und Vorgaben
    • Betriebsbedingungen
    • Plugins
    • Themes
    • Corporate Design
    • Crawler, Bots und Webscraper
  • Programmierhilfen
  • Auftragsentwicklung
  • Wartung

Crawler, Bots und Webscraper

Automatisierte Crawler, Bots und Webscraper, die im Verantwortungsbereich einer FAU-Einrichtung, eines FAU-Projekts oder eines entsprechenden Dienstes betrieben werden, um Webauftritte auf FAU-Webservern abzurufen, sollten sich eindeutig zu erkennen geben und Websites performanceschonend abrufen.
Diese Kurzbeschreibung fasst die wichtigsten Regeln und Empfehlungen zusammen.

Die vollständigen und jeweils maßgeblichen Vorgaben stehen im GitHub-Repository:

  • RRZE-Crawler-Rules.md
  • RRZE-Crawler-Rules-LLM-Shortcut.md

Anforderungen an FAU-Crawler

  1. Jeder Crawler muss einen eindeutigen HTTP-User-Agent verwenden, der die verantwortliche FAU-Einrichtung, den Bot, die Version, eine Informationsseite und eine betreute Kontaktadresse nennt.
  2. Das vorgesehene Schema lautet: FAU-<ORG>-<BOT>/<VERSION> (+<INFO-URL>;mailto:<CONTACT>)
  3. Neue Implementierungen sollen die kanonische Schreibweise ;mailto: ohne Leerzeichen verwenden. Parser und Validatoren sollen die ältere Schreibweise ; mailto: weiterhin akzeptieren.
  4. Der Name des Bots muss den Dienst erkennbar machen. Reine Techniknamen wie Python, curl, wget, Guzzle oder python-requests sind als Botname nicht geeignet.
  5. Der User-Agent muss bei allen crawler-originated HTTP-Requests gesetzt werden, also auch bei HTML-Seiten, WordPress-REST-API-Anfragen, XML-Sitemaps, Feeds, Dateien, Medien und Requests nach Redirects.
  6. Ein Crawler darf sich nicht als normaler Browser tarnen, etwa durch einen generischen Mozilla/5.0-User-Agent.
  7. Vor einem systematischen Crawl muss die jeweilige robots.txt abgerufen und beachtet werden. FAU-Zugehörigkeit ist keine Ausnahme von robots.txt.
  8. In robots.txt deklarierte Sitemaps sollen bevorzugt für die URL-Ermittlung verwendet werden. Sitemap-Indexdateien sollen unterstützt werden, wenn Sitemap-Discovery implementiert ist.
  9. Für Discovery und Abruf gilt grundsätzlich diese Reihenfolge: robots.txt, dort deklarierte Sitemaps, llms.txt bzw. llms-full.txt, geeignete APIs oder strukturierte Repräsentationen, danach regulärer HTML-Crawl.
  10. Maschinenlesbare Alternativen, die im HTML über Metadaten oder rel-Links beworben werden, sollen genutzt werden, wenn sie die benötigten Inhalte vollständiger oder effizienter liefern als HTML.
  11. Ressourcen unter /.well-known/ dürfen nur gezielt abgerufen werden, wenn der Crawler die jeweilige Spezifikation unterstützt oder die Ressource ausdrücklich referenziert wurde. Eine pauschale Enumeration ist nicht zulässig.
  12. Pro Origin oder Host dürfen standardmäßig höchstens drei Requests pro Sekunde gestartet werden. Das Limit gilt für den gesamten Crawler, also auch über parallele Worker, Prozesse oder Threads hinweg.
  13. Strengere Zielsystem-Vorgaben, Retry-After, HTTP 429 und HTTP 503 müssen berücksichtigt werden. Bei Überlastung oder Rate-Limits muss der Crawler die Abrufrate reduzieren oder Backoff verwenden.
  14. Crawler sollen grundsätzlich zustandslos arbeiten. Cookies und Sessions dürfen nur verwendet werden, wenn sie für den ausdrücklich definierten Zweck technisch erforderlich sind.
  15. Tracking-, Analytics-, Werbe-, Personalisierungs- und Consent-Cookies sollen nicht gespeichert oder zurückgesendet werden. Cookie-Consent-Dialoge für Menschen dürfen nicht automatisiert genutzt werden, um optionale Verarbeitung zu aktivieren.
  16. Cookies, Sessions oder Browserzustand dürfen nicht genutzt werden, um Authentisierung, Zugriffsschutz, Paywalls, Crawler-Beschränkungen oder Anti-Bot-Maßnahmen zu umgehen.
  17. Der User-Agent ist keine Authentisierung. Die Angabe des UserAgent-Strings allein darf niemals als Vertrauensnachweis dienen oder besondere Zugriffsrechte auslösen.
  18. Wenn die Identität eines Crawlers technisch verifiziert werden muss, ist ein zusätzliches überprüfbares Verfahren erforderlich, zum Beispiel Authentisierung oder kontrollierte Quell-IP-Adressen bzw. Netze.

Beispiel

FAU-RRZE-Legalcheck/1.0 (+https://www.wp.rrze.fau.de/;mailto:webmaster@fau.de)

Hintergrund der Regelung

Die Webserver der FAU werden zunehmend von Crawler, Bots und Webscraper besucht. Viele Zugriffe gehen zurück auf das Webscraping von KI-Projekten, die Inhalte der Websites als Grundlage für neue Sprachmodelle oder als RAG nutzen wollen. Leider sind viele Crawler nur sehr rudimentär und fehlerhaft programmiert und berücksichtigen keine oder nur wenige Standards zum ressourcenschonenden Abruf von Websites. Sie sind daher oftmals kaum unterscheidbar von Angriffen auf die IT-Infrastruktur.
Aus diesem Grund werden Schutzmaßnahmen eingeführt, die Crawler, Bots und Webscraper, die sich nicht an die gängigen Standards halten und nicht einem Betreiber zuordbar sind, (automatisiert) gesperrt.
Die Berücksichtigung obiger Regeln sorgt dafür, dass wissenschaftliche Projekte an der FAU, bei denen entsprechende Werkzeuge eingesetzt werden, entsprechend erkannt und nicht als unerwünschten Zugriff gewertet werden.

Weitere Hinweise zum Webauftritt

Noch Fragen?

Schreiben Sie uns eine E-Mail an webmaster@fau.de.
Wir beantworten Ihnen alle offenen Fragen rund um unser Content Management System (CMS), WordPress, Webhosting und Co.

Regionales Rechenzentrum Erlangen
(RRZE)

Martensstraße 1
91058 Erlangen
  • Kontakt
  • Blog
  • Impressum
  • Datenschutz
  • Barrierefreiheit
  • RSS Feed
  • GitHub
Nach oben