Document - Source de données

Utilisez un ou plusieurs documents comme source de données. Cette section explique comment téléverser des documents.

Cliquez sur Document pour ajouter des documents comme source de données :

Add data source menu

Téléverser

Téléversez vos fichiers (cliquez ou faites glisser-déposer dans la zone dédiée) :

Info
Les formats de fichiers actuellement pris en charge sont : .txt, .html, .md, .ods, .docx, .xlsx, .doc, .rtf, .odt, .csv, .pdf, .pptx, ainsi que les fichiers image (.png, .jpg, .jpeg, .gif, .bmp, .webp, .tiff).
document empty

Extraire le texte des images et des numérisations

Vous pouvez téléverser des fichiers image (.png, .jpg, .gif, .bmp, .webp, .tiff) et des PDF numérisés comme source de données, au même titre que n'importe quel autre document. Par défaut, seul le texte déjà présent dans le fichier est indexé — le texte situé à l'intérieur d'une image n'est pas lu. Pour rendre ce texte consultable, activez l'un des deux modes d'extraction ci-dessous pour le fichier avant l'indexation.

Chaque ligne de la liste des fichiers comporte un interrupteur sur sa droite. OCR et LLM s'excluent mutuellement : activer l'un désactive automatiquement l'autre.

Reconnaissance optique de caractères (OCR)

L'OCR convertit une image de texte en texte lisible par machine. Par exemple, la numérisation d'un document produit un fichier image qui ne peut pas être modifié, recherché ou compté directement.

L'OCR convertit cette image en un document texte dont le contenu est stocké sous forme de données textuelles.

Avertissement
Les résultats de l'OCR peuvent ne pas être précis à 100 %. Vérifiez le texte extrait pour détecter d'éventuelles erreurs, en particulier pour les écritures manuscrites ou les numérisations de mauvaise qualité.

Analyse par LLM

L'analyse par LLM envoie l'image (ou la page numérisée) à un modèle de langage doté de capacités visuelles, qui la lit comme le ferait un humain. Elle gère généralement mieux que l'OCR les mises en page complexes, les tableaux et l'écriture manuscrite, et peut également décrire des contenus visuels non textuels.

Info
L'analyse par LLM est réservée aux administrateurs et aux utilisateurs disposant de l'autorisation « LLM File Parsing ». Son utilisation consomme une partie de votre quota LLM.

Pour activer un mode, cliquez sur l'interrupteur OCR ou LLM situé à droite du fichier sur lequel vous souhaitez l'appliquer :

documents list OCR

Une fois tous les documents spécifiés, cliquez sur « Terminer ». La page de source de données s'ouvre :

documents list
Info
Les images téléversées sont converties en un PDF d'une page, afin de pouvoir être prévisualisées et téléchargées depuis la source de données comme n'importe quel autre document.

Actions groupées sur les fichiers sélectionnés

Vous pouvez sélectionner plusieurs fichiers à la fois en utilisant les cases à cocher sur le côté gauche de chaque ligne.

Une fois un ou plusieurs fichiers sélectionnés, une barre d'actions groupées apparaît au-dessus du tableau avec les actions suivantes :

  • Téléchargertélécharge tous les fichiers PDF sélectionnés en une seule fois. Le bouton est actif uniquement lorsqu'au moins un fichier sélectionné est un PDF ou un fichier audio avec le statut Indexé.
  • Supprimersupprime définitivement tous les fichiers sélectionnés du connecteur.
Document table with batch download and delete toolbar
Conseil

Pour tester cette source de données, utilisez cette collection de PDF sur les Simpsons :

Ces documents proviennent de le wiki des Simpsons

Accédez à une interface de recherche en direct basée sur cette collection de PDF :