Dokument - Datenquelle

Verwenden Sie ein oder mehrere Dokumente als Datenquelle. Dieser Abschnitt beschreibt das Hochladen von Dokumenten.

Klicken Sie auf Dokument um Dokumente als Datenquelle hinzuzufügen:

Add data source menu

Hochladen

Laden Sie Ihre Dateien hoch (klicken oder per Drag & Drop in den vorgesehenen Bereich):

Info
Folgende Dateiformate werden derzeit unterstützt: .txt, .html, .md, .ods, .docx, .xlsx, .doc, .rtf, .odt, .csv, .pdf, .pptx sowie Bilddateien (.png, .jpg, .jpeg, .gif, .bmp, .webp, .tiff).
document empty

Text aus Bildern und Scans extrahieren

Sie können Bilddateien (.png, .jpg, .gif, .bmp, .webp, .tiff) und gescannte PDFs wie jedes andere Dokument als Datenquelle hochladen. Standardmäßig wird nur der bereits in der Datei vorhandene Text indexiert — Text innerhalb eines Bildes wird nicht gelesen. Um diesen Text durchsuchbar zu machen, aktivieren Sie vor der Indexierung einen der beiden folgenden Extraktionsmodi für die Datei.

Jede Zeile in der Dateiliste hat auf der rechten Seite einen Schalter. OCR und LLM schließen sich gegenseitig aus: Wenn Sie einen aktivieren, wird der andere automatisch deaktiviert.

Optische Zeichenerkennung (OCR)

OCR wandelt ein Textbild in maschinenlesbaren Text um. Zum Beispiel erzeugt das Scannen eines Dokuments eine Bilddatei, die nicht direkt bearbeitet, durchsucht oder auf Wortanzahl geprüft werden kann.

OCR wandelt dieses Bild in ein Textdokument um, dessen Inhalt als Textdaten gespeichert wird.

Warnung
OCR-Ergebnisse sind möglicherweise nicht zu 100 % korrekt. Überprüfen Sie den extrahierten Text auf Fehler, insbesondere bei Handschrift oder Scans von geringer Qualität.

LLM-Verarbeitung

Bei der LLM-Verarbeitung wird das Bild (oder die gescannte Seite) an ein bildfähiges Sprachmodell gesendet, das es wie ein Mensch liest. In der Regel kommt es mit komplexen Layouts, Tabellen und Handschrift besser zurecht als OCR und kann auch nicht-textuelle visuelle Inhalte beschreiben.

Info
Die LLM-Verarbeitung steht nur Administratoren sowie Benutzern mit aktivierter Berechtigung "LLM File Parsing" zur Verfügung. Ihre Nutzung verbraucht einen Teil Ihres LLM-Kontingents.

Um einen Modus zu aktivieren, klicken Sie auf den OCR- oder LLM-Schalter auf der rechten Seite der Datei, auf die Sie ihn anwenden möchten:

documents list OCR

Sobald alle Dokumente angegeben sind, klicken Sie auf "Fertig". Die Datenquellenseite wird geöffnet:

documents list
Info
Hochgeladene Bilder werden in ein einseitiges PDF umgewandelt, sodass sie wie jedes andere Dokument in der Datenquelle angezeigt und heruntergeladen werden können.

Stapelaktionen für ausgewählte Dateien

Sie können mehrere Dateien gleichzeitig über die Kontrollkästchen auf der linken Seite jeder Zeile auswählen.

Sobald eine oder mehrere Dateien ausgewählt sind, erscheint eine Stapelaktions-Leiste über der Tabelle mit folgenden Aktionen:

  • Herunterladenlädt alle ausgewählten PDF-Dateien auf einmal herunter. Die Schaltfläche ist nur aktiv, wenn mindestens eine ausgewählte Datei eine PDF- oder Audiodatei mit dem Status Indiziert ist.
  • Löschenentfernt alle ausgewählten Dateien dauerhaft aus dem Connector.
Document table with batch download and delete toolbar
Tipp

Um diese Datenquelle auszuprobieren, verwenden Sie diese PDF-Sammlung über die Simpsons:

Diese Dokumente stammen von dem Simpsons-Wiki

Zugriff auf eine Live-Suchoberfläche, die auf dieser PDF-Sammlung basiert: