Site web (nouvelle interface)

Le connecteur Site web explore les pages que vous lui indiquez et indexe leur texte : un assistant peut ainsi répondre à partir d'un site public, d'un portail de documentation ou d'une page d'intranet.

Les pages rendues côté serveur comme côté client sont prises en charge : le crawler pilote un vrai navigateur, si bien que le texte qui n'apparaît qu'après l'exécution du JavaScript est également indexé.

Ajouter un connecteur Site web

Choisissez « Website » dans le menu « Ajouter un connecteur », nommez-le, puis collez une URL dans Type your URL here . Deux boutons déterminent l'étendue :

  • Add page — indexe exactement cette URL.
  • Add page and subpages — suit les liens sous cette URL et ajoute les pages trouvées.

Le champ accepte plusieurs URL à la fois — collez-en une par ligne. Entrée lance le crawl, Ctrl/Cmd + Entrée les ajoute comme pages seules. Les URL déjà présentes sont ignorées et un avertissement indique combien ont été écartées.

Le tableau sous le champ liste ce qui sera indexé, avec la hiérarchie et le chemin de chaque page : vous pouvez retirer ce que vous ne voulez pas avant d'enregistrer.

Website connector form
Info
Seules les pages accessibles et autorisées à l'exploration peuvent être indexées. Les pages derrière une authentification, ou bloquées par les règles robots, ne renvoient rien.

Paramètres de crawl

L'icône d'engrenage dans le champ URL ouvre les paramètres de détection des liens. Ils ne contrôlent que la façon dont les sous-pages sont découvertes — la façon dont une page est lue se règle dans les paramètres avancés.

  • Profondeur maximale — le nombre de niveaux de liens sous l'URL que le crawler suit. Un site web est un arbre de pages, et ce réglage décide jusqu'où il descend dans cet arbre. Entre 1 et 3, 2 par défaut.
  • Délai d'attente — la durée maximale de la détection des liens, 20 secondes par défaut. Une fois la limite atteinte, le crawler s'arrête et conserve les liens déjà trouvés ; les autres sont listés comme ignorés.
  • Balises à cliquer — les éléments que le crawler clique avant de collecter les liens, pour les menus de navigation ou les boutons « charger plus » qui ne révèlent les liens qu'une fois ouverts. Saisissez une balise et appuyez sur Entrée pour l'ajouter en étiquette.
  • Respecter robots.txt — activé par défaut. Les pages interdites par le site sont écartées et listées à part, ce qui vous permet de les rajouter délibérément.
Link detection settings

Utiliser la liste des pages

Chaque URL ajoutée apparaît dans le tableau sous le champ de saisie, les sous-pages étant regroupées sous la page dont elles proviennent. Vous pouvez alors :

  • Cliquer sur une URL pour l'ouvrir dans une fenêtre d'aperçu et vérifier qu'il s'agit de la bonne page sans quitter la boîte de dialogue.
  • Utiliser la flèche d'une ligne parente pour déplier ou replier ses sous-pages. Les groupes restent dans l'état où vous les avez laissés pendant que vous ajoutez d'autres URL.
  • Cocher des lignes pour choisir précisément ce qui sera indexé — sélectionner une page parente sélectionne aussi ses sous-pages. Sans sélection, tout le tableau est ajouté.
  • Sortir une sous-page de son groupe avec le bouton de déplacement dans la colonne Actions. Elle devient une entrée de premier niveau et subsiste si vous supprimez ensuite le groupe.
  • Supprimer une ligne avec le bouton de suppression, ou plusieurs d'un coup en les sélectionnant puis en utilisant Supprimer les lignes sélectionnées dans la barre d'outils.
Subpages grouped under their parent page
Note
Deux icônes d'avertissement peuvent apparaître à côté d'une URL : une icône d'information orange signifie que des liens ont été ignorés, généralement parce que le délai a été atteint ; une icône de robot barré signifie que robots.txt les interdit. Les deux ouvrent la fenêtre Liens ignorés.

Liens ignorés

Pendant la détection des liens, certaines URL sont mises de côté au lieu d'être ajoutées — délai atteint, interdiction par robots.txt, ou lien pointant en dehors de l'URL de départ. La fenêtre Liens ignorés les liste afin que vous décidiez lesquelles ont leur place dans le connecteur.

Deux filtres aident à gérer les longues listes :

  • Contient — sélectionne toutes les URL contenant le texte saisi. Filtrer sur « /blog/ » sélectionne tous les liens ignorés sous un chemin /blog/.
  • Se termine par — sélectionne toutes les URL qui se terminent par ce texte. Filtrer sur « .pdf » sélectionne tous les liens vers des fichiers PDF.

Cliquez sur Appliquer les filtres et les lignes correspondantes sont cochées. La sélection est cumulative : chaque filtre s'ajoute à la sélection existante et aucun filtre ne décoche les lignes choisies manuellement. Ainsi, si vous sélectionnez une URL à la main puis appliquez un filtre correspondant à deux autres, les trois restent sélectionnées.

Ajouter place les URL sélectionnées dans le connecteur comme sous-pages de la page dont elles ont été écartées, et elles disparaissent de la liste.

Skipped links window

Paramètres avancés

Le bouton Paramètres ouvre les paramètres avancés, qui contrôlent la façon dont chaque page est chargée et ce qui en est conservé. Les valeurs par défaut conviennent à la plupart des sites ; modifiez-les lorsqu'un site exige une connexion, se charge lentement ou entoure son contenu de beaucoup de navigation.

Identification

  • Cookies — pour les sites nécessitant une session. Indiquez-les sous forme de paires clé=valeur, une par ligne ou séparées par des points-virgules.
  • Jeton — pour les sites protégés par un jeton. Le nom et la valeur sont écrits dans le stockage local de la page, puis la page est rechargée avant d'être lue.

Paramètres supplémentaires

  • Rechercher les iframes — désactivé par défaut : les iframes ne sont alors inspectées que lorsque la page semble le nécessiter. Activez-le pour toujours lire le contenu des iframes.
  • Stratégie de défilement — la façon dont la page est défilée pour déclencher le contenu chargé à la demande. Full saute jusqu'en bas, Step défile progressivement, ce qui fonctionne mieux sur les listes infinies.
  • Ignorer les 404 — activé par défaut : les liens morts sont ignorés au lieu de faire échouer le crawl.
  • Attente explicite — secondes d'attente supplémentaires après le chargement d'une page, avant la lecture du texte. Augmentez-la pour les pages qui s'affichent lentement.

Paramètres du pilote

  • Délai implicite — la durée, en secondes, pendant laquelle le navigateur attend l'apparition d'un élément avant d'abandonner.
  • Délai de chargement de page — la durée, en millisecondes, d'attente du chargement complet de la page, images et scripts compris. 30000 par défaut.
  • Délai des scripts — la durée, en millisecondes, d'attente de la fin d'exécution du JavaScript de la page. 30000 par défaut.

Ajouter des filtres

Les filtres décident des parties de la page qui sont conservées. Ajoutez un filtre par balise, classe ou identifiant, ou écrivez vous-même un sélecteur CSS :

  • Inclure — lorsqu'il est défini, seules les parties correspondantes de la page sont indexées. Utile quand le contenu se trouve dans un seul conteneur, par exemple .content ou #app.
  • Exclure — les parties correspondantes sont écartées. À utiliser pour la navigation, les en-têtes, les pieds de page et les bandeaux de cookies qui se répéteraient sinon sur chaque page.

Un jeu de filtres pertinent est déjà en place — en général le conteneur du contenu principal sous Inclure, et nav, footer, script et style sous Exclure. Ajustez-le plutôt que de partir de zéro.

Website crawling settings
Conseil
Définissez les filtres avant de crawler un grand site. Indexer les menus et les pieds de page de centaines de pages remplit l'index d'un texte identique partout, ce qui dégrade les réponses.

Créer le connecteur

Terminer ferme la boîte de dialogue et démarre le crawl immédiatement. Le connecteur apparaît dans la liste avec sa progression, et vous pouvez continuer à travailler pendant ce temps.

Garder un site à jour

Un site exploré vieillit. La ligne du connecteur propose trois actions propres aux sites web :

  • Settings — les mêmes options d'exploration, pour les pages déjà ajoutées.
  • Add Links — ajoute d'autres URL au connecteur existant.
  • Update Websites — explore à nouveau les pages et rafraîchit ce qui a changé.

Mettre à jour les sites web définit aussi la fréquence de répétition automatique du crawl — Now le lance immédiatement, Never, Daily, Weekly ou Monthly fixent la planification. Le même menu contient Retry Failed, qui ne recrawle que les pages qui n'ont pas abouti.

Update frequency menu of a website connector
Note
Une nouvelle exploration remplace le texte indexé d'une page. Si une page a disparu, retirez-la de la liste : sans cela elle reste dans l'index.

Pages indexées

Dépliez le connecteur pour voir toutes les pages qu'il contient :

  • La colonne d'état indique les pages indexées et celles en échec.
  • « Voir le texte brut » montre ce qui a été extrait d'une page — utile pour un site très dépendant des scripts.
  • Le menu ⋮ supprime une page ou change son nom dans les citations.
Actions of a single indexed page
Conseil
Les pages explorées comptent dans votre quota de ressources externes. Pour des réponses issues du web en direct plutôt que d'un instantané, utilisez la recherche web.