Website (neue Oberfläche)
Der Website-Konnektor crawlt die Seiten, die Sie angeben, und indexiert deren Text – so antwortet ein Assistent aus einer öffentlichen Website, einem Dokumentationsportal oder einer Intranetseite.
Sowohl serverseitig als auch clientseitig gerenderte Seiten werden unterstützt: Der Crawler steuert einen echten Browser, sodass auch Text indexiert wird, der erst nach der Ausführung von JavaScript erscheint.
Einen Website-Konnektor hinzufügen
Wählen Sie im Menü „Konnektor hinzufügen“ den Eintrag „Website“, benennen Sie ihn und fügen Sie eine URL in das Feld Type your URL here ein. Zwei Schaltflächen bestimmen den Umfang:
- Add page – indexiert genau diese eine URL.
- Add page and subpages – folgt den Links unterhalb dieser URL und übernimmt die gefundenen Seiten.
Das Eingabefeld nimmt mehrere URLs auf einmal an — fügen Sie eine pro Zeile ein. Mit Enter werden sie gecrawlt, mit Strg/Cmd + Enter als einzelne Seiten hinzugefügt. Bereits vorhandene URLs werden ignoriert, und eine Warnung nennt die Anzahl der übersprungenen URLs.
Die Tabelle unter dem Eingabefeld listet auf, was indexiert wird – mit Hierarchie und Pfad jeder Seite. So entfernen Sie vor dem Speichern alles, was Sie nicht möchten.
Crawling-Einstellungen
Das Zahnradsymbol im URL-Feld öffnet die Einstellungen zur Linkerkennung. Sie steuern nur, wie Unterseiten gefunden werden — wie eine Seite gelesen wird, legen Sie in den erweiterten Einstellungen.
- Maximale Tiefe — wie viele Linkebenen unterhalb der URL der Crawler verfolgt. Eine Website ist ein Baum aus Seiten, und dies bestimmt, wie tief er in diesen Baum vordringt. Zwischen 1 und 3, standardmäßig 2.
- Timeout — wie lange die Linkerkennung laufen darf, standardmäßig 20 Sekunden. Wird das Limit erreicht, stoppt der Crawler und behält die bereits gefundenen Links; der Rest wird als übersprungen aufgeführt.
- Klick-Tags — Elemente, die der Crawler anklickt, bevor er Links sammelt — für Navigationsmenüs oder "Mehr laden"-Schaltflächen, die Links erst beim Öffnen anzeigen. Tag eingeben und mit Enter als Chip hinzufügen.
- robots.txt beachten — standardmäßig aktiv. Von der Website untersagte Seiten werden ausgelassen und separat aufgeführt, sodass Sie sie bewusst wieder hinzufügen können.
Arbeiten mit der Seitenliste
Jede hinzugefügte URL erscheint in der Tabelle unter dem Eingabefeld, wobei Unterseiten unter der Seite gruppiert sind, von der sie stammen. Dort können Sie:
- Auf eine URL klicken, um sie in einem Vorschaufenster zu öffnen und ohne Verlassen des Dialogs zu prüfen, ob es die richtige Seite ist.
- Mit dem Pfeil einer übergeordneten Zeile deren Unterseiten ein- oder ausklappen. Die Gruppen bleiben so, wie Sie sie hinterlassen haben, während Sie weitere URLs hinzufügen.
- Zeilen anhaken, um genau festzulegen, was indexiert wird — mit einer übergeordneten Seite werden auch ihre Unterseiten ausgewählt. Ohne Auswahl wird alles in der Tabelle hinzugefügt.
- Eine Unterseite mit der Verschieben-Schaltfläche in der Spalte Aktionen aus ihrer Gruppe herausnehmen. Sie wird ein eigenständiger Eintrag und bleibt erhalten, wenn Sie die Gruppe später löschen.
- Eine einzelne Zeile mit der Löschen-Schaltfläche entfernen oder mehrere gleichzeitig, indem Sie sie auswählen und in der Symbolleiste Ausgewählte Zeilen löschen verwenden.
Übersprungene Links
Während der Linkerkennung werden manche URLs beiseitegelegt statt hinzugefügt — ein Timeout wurde erreicht, robots.txt hat sie untersagt, oder sie verweisen außerhalb der Ausgangs-URL. Das Fenster Übersprungene Links listet sie auf, damit Sie entscheiden können, welche in den Connector gehören.
Zwei Filter helfen bei langen Listen:
- Enthält — wählt jede URL aus, die den eingegebenen Text enthält. Ein Filter auf "/blog/" wählt alle übersprungenen Links unter einem /blog/-Pfad.
- Endet mit — wählt jede URL aus, die auf diesen Text endet. Ein Filter auf ".pdf" wählt alle Links zu PDF-Dateien.
Klicken Sie auf Filter anwenden, und die passenden Zeilen werden angehakt. Die Auswahl ist additiv: Jeder Filter ergänzt die bestehende Auswahl, und kein Filter entfernt jemals manuell ausgewählte Zeilen. Wählen Sie also eine URL manuell und wenden dann einen Filter an, der zwei weitere trifft, bleiben alle drei ausgewählt.
Hinzufügen übernimmt die ausgewählten URLs als Unterseiten der Seite, von der sie übersprungen wurden, und sie verschwinden aus der Liste.
Erweiterte Einstellungen
Die Schaltfläche Einstellungen öffnet die erweiterten Einstellungen, die steuern, wie jede Seite geladen wird und was davon behalten wird. Die Standardwerte passen für die meisten Websites; ändern Sie sie, wenn eine Website eine Anmeldung erfordert, langsam lädt oder ihre Inhalte in viel Navigation einbettet.
Identifikation
- Cookies — für Websites, die eine Sitzung benötigen. Als Schlüssel=Wert-Paare angeben, eines pro Zeile oder durch Semikolons getrennt.
- Token — für Websites hinter einem Token. Name und Wert werden in den Local Storage der Seite geschrieben und die Seite wird vor dem Auslesen neu geladen.
Zusätzliche Parameter
- Nach Iframes suchen — standardmäßig aus; Iframes werden dann nur untersucht, wenn die Seite es zu erfordern scheint. Aktivieren Sie es, um Iframe-Inhalte immer zu lesen.
- Scroll-Strategie — wie die Seite gescrollt wird, um nachgeladene Inhalte auszulösen. Full springt nach unten, Step scrollt schrittweise, was bei endlosen Listen besser funktioniert.
- 404 überspringen — standardmäßig aktiv: Defekte Links werden ignoriert, statt den Crawl abzubrechen.
- Explizite Wartezeit — zusätzliche Sekunden, die nach dem Laden einer Seite gewartet wird, bevor der Text gelesen wird. Erhöhen Sie sie bei Seiten, die langsam rendern.
Treiber-Einstellungen
- Implizites Timeout — wie lange der Browser in Sekunden auf ein Element wartet, bevor er aufgibt.
- Seitenlade-Timeout — wie lange in Millisekunden auf das vollständige Laden der Seite inklusive Bilder und Skripte gewartet wird. Standardmäßig 30000.
- Skript-Timeout — wie lange in Millisekunden gewartet wird, bis das JavaScript der Seite fertig ist. Standardmäßig 30000.
Filter hinzufügen
Filter bestimmen, welche Teile einer Seite behalten werden. Fügen Sie einen Filter nach Tag, Klasse oder ID hinzu oder schreiben Sie selbst einen CSS-Selektor:
- Einschließen — wenn gesetzt, werden nur die passenden Teile der Seite indexiert. Nützlich, wenn der Inhalt in einem einzigen Container liegt, etwa .content oder #app.
- Ausschließen — die passenden Teile werden verworfen. Verwenden Sie es für Navigation, Kopf- und Fußzeilen sowie Cookie-Banner, die sich sonst auf jeder Seite wiederholen.
Ein sinnvoller Filtersatz ist bereits gesetzt — üblicherweise der Container mit dem Hauptinhalt unter Einschließen sowie nav, footer, script und style unter Ausschließen. Passen Sie ihn an, statt bei Null anzufangen.
Connector erstellen
Fertigstellen schließt den Dialog und startet den Crawl unmittelbar. Der Connector erscheint mit seinem Fortschritt in der Liste, und Sie können währenddessen weiterarbeiten.
Eine Website aktuell halten
Eine gecrawlte Website veraltet. In der Konnektorzeile stehen drei website-spezifische Aktionen bereit:
- Settings – dieselben Crawling-Optionen für die bereits hinzugefügten Seiten.
- Add Links – ergänzt weitere URLs im bestehenden Konnektor.
- Update Websites – crawlt die Seiten erneut und aktualisiert Änderungen.
Websites aktualisieren legt außerdem fest, wie oft der Crawl automatisch wiederholt wird — Now startet ihn sofort, Never, Daily, Weekly oder Monthly bestimmen den Zeitplan. Im selben Menü finden Sie Retry Failed, das nur die nicht erfolgreich verarbeiteten Seiten erneut crawlt.
Indexierte Seiten
Klappen Sie den Konnektor auf, um alle enthaltenen Seiten zu sehen:
- Die Statusspalte zeigt, welche Seiten indexiert wurden und welche fehlgeschlagen sind.
- „Rohtext ansehen“ zeigt, was von einer Seite extrahiert wurde – hilfreich bei stark skriptbasierten Websites.
- Über das Menü ⋮ löschen Sie eine einzelne Seite oder ändern ihren Namen in Quellenangaben.










