KI-Chatbot mit Wissensquellen trainieren

Wissensquellen

Wissensquellen liefern die Informationen, die dein Chatbot für fundierte Antworten nutzt. Öffne Dashboard → dein Assistent → Wissen, um Website-URLs hinzuzufügen, Dateien hochzuladen, Text direkt einzugeben oder externe Plattformen wie Confluence, Notion, SharePoint, Google Drive, Nextcloud oder SFTP/FTPS anzubinden.

Der Reiter Wissen zeigt außerdem den kontoweiten Zeichenverbrauch an. Die Quellentabelle kann nach Typ oder Kategorie durchsucht und gefiltert werden und zeigt den Indexierungsstatus sowie die letzte Aktualisierung jeder Quelle an. Über Zeilenaktionen kannst du eine Quelle neu importieren, bearbeiten, prüfen, herunterladen, stoppen oder löschen, sofern unterstützt. Wähle mehrere Zeilen für eine gebündelte Neuindexierung oder Löschung aus.

Du kannst auch einen Ordner verbinden, sei es SharePoint, Google Drive, Nextcloud oder ein SFTP-Server. Alles darin wird automatisch indiziert, und jede Änderung wird bei der nächsten Synchronisierung erfasst, ohne dass jemand eine Datei erneut hochladen muss. Siehe Verbundene Ordner.

Website-URLs

Gib URLs zum Crawlen und Indizieren ein. WebChatAgent crawlt die Seiten automatisch und extrahiert Inhalte für die Wissensdatenbank deines Chatbots.

Website hinzufügen

  1. Klicke im Reiter Wissen auf Datenquelle hinzufügen und wähle Website
  2. Gib die Website-URL ein (z. B. example.com, https:// wird automatisch hinzugefügt)
  3. Konfiguriere optionale erweiterte Einstellungen (siehe unten)
  4. Klicke auf Hinzufügen, um das Crawling zu starten

Erweiterte Einstellungen

FeldBeschreibungStandard
Crawl-TiefeWie viele Link-Ebenen tief gecrawlt werden soll. 0 = nur diese Seite, leer = unbegrenzte Tiefe.Leer (unbegrenzt)
CSS-SelektorenKommagetrennte CSS-Selektoren, um gezielt bestimmte Inhaltsbereiche anzusprechen (z. B. article, .content, #main-body). Wenn gesetzt, wird nur Inhalt innerhalb dieser Selektoren extrahiert.Leer (gesamte Seite)
URL-Muster ausschließenKommagetrennte URL-Muster, die beim Crawlen übersprungen werden sollen (z. B. /login, /impressum, */amp/*).Leer
Automatisches Re-Indexing-IntervallWie oft der Inhalt automatisch neu gecrawlt und aktualisiert werden soll. Optionen: Alle 3 Tage, Alle 7 Tage, Alle 30 Tage (Premium- und Enterprise-Pläne erhalten zusätzlich Täglich).Deaktiviert
Automatisches Re-Indexing ist ab einem Standard-Plan oder höher verfügbar. Free- und Basic-Pläne müssen manuell neu indizieren. Das tägliche Intervall ist exklusiv für Premium und Enterprise.

Wann CSS-Selektoren verwendet werden sollten

CSS-Selektoren helfen dir, nur den relevanten Inhalt einer Seite zu extrahieren. Das ist nützlich, wenn:

  • Deine Seiten Navigationsmenüs, Fußzeilen oder Seitenleisten enthalten, die du ausschließen möchtest
  • Du dich nur auf den Hauptinhalt von Artikeln konzentrieren möchtest
  • Die Seite Werbung oder unpassende Widgets enthält

Beispiel: Um nur den Hauptinhaltsbereich zu extrahieren und die Navigation zu überspringen:

article, .main-content, #post-body

Wann URL-Ausschlussmuster verwendet werden sollten

Ausschlussmuster verhindern, dass bestimmte Seiten indiziert (zur Wissensdatenbank deines Chatbots hinzugefügt) werden. Häufige Anwendungsfälle:

  • Login-/Admin-Seiten: /login, /admin, /wp-admin
  • Rechtliche Seiten: /impressum, /privacy-policy, /terms
  • Doppelter Inhalt: */amp/*, */print/*
  • Kategorie-/Tag-Archive: /category/*, /tag/* (oft duplizierter Inhalt)
  • Abfrageparameter: ?hitsPerPage schließt alle URLs aus, die diesen Parameter enthalten (z. B. Suchergebnisseiten mit Paginierung)

Wichtige Details:

  • Muster unterscheiden zwischen Groß- und Kleinschreibung. /About und /about werden als unterschiedliche Muster behandelt. Stelle sicher, dass deine Muster exakt der Schreibweise in deinen URLs entsprechen.
  • Ausgeschlossene Seiten werden nicht indiziert, aber ihren Links wird trotzdem gefolgt. Der Crawler entdeckt und crawlt weiterhin Seiten, die von ausgeschlossenen URLs verlinkt sind, lediglich die ausgeschlossene Seite selbst wird bei der Indexierung übersprungen. Wenn du beispielsweise eine Kategorieseite wie /blog/category/news ausschließt, wird diese Übersichtsseite nicht indiziert, die verlinkten einzelnen Blogbeiträge werden jedoch trotzdem gecrawlt und indiziert (es sei denn, sie passen ebenfalls auf ein Ausschlussmuster).

Überlegungen zur Sprache

Wenn deine Website mehrsprachige Inhalte hat (z. B. /en/about und /de/about), wird dringend empfohlen, nur eine Sprache zu indizieren. Das Indizieren desselben Inhalts in mehreren Sprachen führt zu:

  • Doppelten Informationen, die dein Inhaltskontingent (gemessen in Zeichen) unnötig verbrauchen
  • Geringerer Trefferqualität, da die KI Antworten möglicherweise aus der falschen Sprache bezieht
  • Verschwendetem Token-Budget für redundante Inhalte

Der Chatbot antwortet in der Sprache des Besuchers, unabhängig davon, welche Sprache du indizierst, daher bringt es keinen Vorteil, dieselbe Seite doppelt zu indizieren. Nutze das Feld Exclude URL Patterns, um die anderen Sprachordner zu überspringen (z. B. /de/*, /fr/*).

Wähle die Sprache, die deine Kunden am häufigsten verwenden, oder die Sprache, die der primären Zielgruppe deines Chatbots entspricht.

Text-Datenquellen

Du kannst Textinhalte manuell als Datenquelle eingeben. Dies ist ideal für FAQs, internes Wissen oder Inhalte, die auf keiner Website existieren.

Textdokument hinzufügen

  1. Klicke im Reiter Wissen auf Datenquelle hinzufügen und wähle Texteingabe
  2. Fülle die Felder aus:
FeldBeschreibungEinschränkungen
DokumentnameEin aussagekräftiger Name für dieses Dokument. Leer lassen für einen KI-generierten Namen.Optional
KategorieDokumente nach Kategorie organisieren. Wähle eine bestehende Kategorie oder gib eine neue ein. Leer lassen für automatische Erkennung.Optional
InhaltDer eigentliche Textinhalt, den der Chatbot verwenden wird.Pflichtfeld, max. 50.000 Zeichen

Datei-Upload

Lade Dokumente direkt in die Wissensdatenbank deines Chatbots hoch.

Unterstützte Formate

FormatBeschreibung
PDFHandbücher, Berichte, Broschüren, Whitepaper
DOCXWord-Dokumente
TXTReine Textdateien
MDMarkdown-Dokumente
XLSXTabellenkalkulationen

Dateigrößenbeschränkungen

PlanMaximale Dateigröße
Kostenlos1 MB
Basic5 MB
Standard10 MB
Premium50 MB
EnterpriseUnbegrenzt

Automatische KI-Dateinamen

Wenn du in kostenpflichtigen Plänen eine Datei mit einem generischen Namen hochlädst (z. B. document.txt oder untitled.pdf), generiert das System automatisch einen aussagekräftigen Dateinamen basierend auf dem Dateiinhalt.

Confluence Cloud

Verbinde deine Confluence Cloud-Instanz, um Wiki-Seiten direkt in die Wissensdatenbank deines Chatbots zu importieren.

Confluence ist nur in den Plänen Premium und Enterprise verfügbar.

Confluence-Quelle hinzufügen

  1. Klicke auf Datenquelle hinzufügen und wähle Confluence Cloud
  2. Gib deine Confluence-URL ein (z. B. https://yourcompany.atlassian.net)
  3. Gib die E-Mail-Adresse ein, die mit deinem Atlassian-Konto verknüpft ist
  4. Gib ein API-Token von Atlassian API Tokens ein
  5. Klicke auf Verbindung testen, verfügbare Spaces werden geladen
  6. Wähle die zu indizierenden Spaces aus (leer lassen, um alle zugänglichen Spaces zu importieren)
  7. Konfiguriere das Synchronisierungsintervall und klicke auf Erstellen & Indizieren

Confluence-Quelle bearbeiten

Klicke nach dem Hinzufügen einer Confluence-Quelle auf das Bearbeiten-Symbol, um Folgendes zu ändern:

  • Space-Auswahl, Spaces zum Indizieren hinzufügen oder entfernen
  • Unterseiten einbeziehen, ob verschachtelte Seiten einbezogen werden sollen
  • Re-Indexing-Intervall, wie oft automatisch synchronisiert werden soll

Änderungen werden bei der nächsten Neuindexierung wirksam.

Inkrementelle Synchronisierung

Confluence-Quellen unterstützen inkrementelle Synchronisierung. Nur Seiten, die sich seit der letzten Synchronisierung geändert haben, werden neu indiziert, was Aktualisierungen schnell und effizient macht.

Notion

Verbinden Sie Notion, um Seiten und Datenbanken in die Wissensdatenbank Ihres Chatbots zu importieren.

Notion ist nur in den Tarifen Premium und Enterprise verfügbar.

Eine Notion-Quelle hinzufügen

  1. Klicken Sie auf Datenquelle hinzufügen und wählen Sie Notion
  2. Erstellen Sie eine Interne Integration unter Notion-Integrationen
  3. Teilen Sie die gewünschten Seiten oder Datenbanken in Notion mit Ihrer Integration
  4. Geben Sie das Integrations-Token ein (beginnt mit ntn_ oder secret_)
  5. Klicken Sie auf Verbindung testen, verfügbare Datenbanken werden geladen
  6. Wählen Sie die zu indizierenden Datenbanken aus (leer lassen, um alle zugänglichen Seiten zu importieren)
  7. Konfigurieren Sie das Synchronisierungsintervall und klicken Sie auf Erstellen & Indizieren

Eine Notion-Quelle bearbeiten

Klicken Sie nach dem Hinzufügen einer Notion-Quelle auf das Bearbeiten-Symbol, um Folgendes zu ändern:

  • Datenbankauswahl, zu indizierende Datenbanken hinzufügen oder entfernen
  • Unterseiten einbeziehen, ob verschachtelte Seiten einbezogen werden sollen
  • Neuindizierungsintervall, wie oft automatisch synchronisiert wird

Inkrementelle Synchronisierung

Notion-Quellen unterstützen die inkrementelle Synchronisierung. Nur Seiten, die seit der letzten Synchronisierung geändert wurden, werden erneut verarbeitet.

Verbundene Ordner

Ein verbundener Ordner ist ein Ordner, der dauerhaft verbunden bleibt. Sie verknüpfen den Chatbot einmal mit einem Ordner in SharePoint, Google Drive, Nextcloud oder auf einem SFTP-Server. Von da an liest er jede indizierbare Datei darin und prüft den Inhalt nach einem von Ihnen gewählten Zeitplan. Ändern Sie ein PDF in diesem Ordner, kennt der Chatbot nach der nächsten Synchronisierung die neue Version. Löschen Sie eine Datei, verschwindet sie aus der Wissensdatenbank. Niemand muss manuell Dateien neu hochladen.

Verbundene Ordner sind in den Tarifen Premium und Enterprise verfügbar.

Was indiziert wird

EnthaltenÜbersprungen
PDF, DOCX, XLSX, XLS, CSV, TXT, MDAlles andere, Bilder, Videos, ZIP-Archive, PPTX
Dateien in Unterordnern (optional, standardmäßig aktiviert)Dateien, die das Upload-Limit Ihres Tarifs überschreiten
Google Docs, Sheets und Slides (nur Drive, automatisch umgewandelt)Dateien, die Ihren Ausschlussregeln entsprechen

Übersprungene Dateien werden im Dialog Indizierte Dateien mit dem Grund aufgeführt, sodass Sie auf einen Blick sehen, warum etwas fehlt.

Wie die Synchronisierung funktioniert

Jede Datei enthält ein Versionskennzeichen des Speichersystems. SharePoint und Google Drive liefern einen Inhalts-Fingerprint, SFTP und Nextcloud nutzen Größe und Änderungszeitpunkt. Bei jeder Synchronisierung vergleicht der Chatbot die Kennzeichen und lädt nur herunter, was sich tatsächlich geändert hat. Eine unveränderte Datei verursacht keine Kosten: kein Download, keine Verarbeitung, kein Kontingentverbrauch.

Ihr Zeichenkontingent zählt, was gespeichert ist, nicht wie oft es gelesen wird. Ein Ordner mit 500 Dateien, die sich nie ändern, verbraucht genau so viel wie am ersten Tag, egal wie oft er synchronisiert wird.

Wählen Sie das Synchronisierungsintervall beim Verbinden des Ordners: Täglich, Alle 3 Tage, Wöchentlich oder Alle 30 Tage. Sie können eine Synchronisierung auch jederzeit manuell über das Aktualisieren-Symbol anstoßen.

Benutzern den Speicherort einer Datei anzeigen

Standardmäßig deaktiviert, ein Schalter pro Ordner: Speicherort gegenüber Benutzern benennen. Ist er aktiviert, kann der Chatbot den Ordnerpfad in einer Antwort erwähnen, und jede Antwort zeigt eine Karte pro verwendeter Datei: Dateiname, Pfad, Speichersystem und einen direkten Link zu SharePoint, Drive oder Nextcloud, sofern vorhanden.

Lassen Sie die Option für ein öffentliches Website-Widget aus. Andernfalls kann jeder Besucher Ihre interne Ordnerstruktur einsehen. Ist der Schalter deaktiviert, werden weder Dateiname noch Pfad an das KI-Modell gesendet, sodass diese auch nicht im Text auftauchen können.

Dateien ausschließen

Fügen Sie unter Bestimmte Dateien überspringen eine Regel pro Zeile ein:

RegelWas übersprungen wird
/Archive/**Der gesamte Archivordner samt Inhalt
*_internal*Jede Datei mit _internal im Namen
*.csvJede CSV-Datei
/HR/Salaries/**Ein bestimmter Unterordner

* steht für beliebige Zeichen innerhalb eines Pfadsegments, ** für eine beliebige Anzahl von Unterordnern. Ausgeschlossene Dateien werden bei der nächsten Synchronisierung aus der Wissensdatenbank entfernt.

Sie können eine einzelne Datei auch nachträglich ausschließen: Öffnen Sie Indizierte Dateien, suchen Sie die Zeile und klicken Sie auf Aus Index entfernen. Sie bleibt auch bei künftigen Synchronisierungen ausgeschlossen.


SharePoint / OneDrive

Liest eine Dokumentbibliothek aus Microsoft 365. Ihr Microsoft-Administrator registriert einmalig eine Anwendung und stellt Ihnen drei Werte bereit.

Zugangsdaten abrufen

  1. Melden Sie sich im Microsoft Entra Admin Center mit einem Konto an, das Anwendungen registrieren darf
  2. Gehen Sie zu Identität → Anwendungen → App-Registrierungen und klicken Sie auf Neue Registrierung
  3. Vergeben Sie einen Namen (z. B. WebChatAgent Knowledge), übernehmen Sie die Standardeinstellungen und klicken Sie auf Registrieren
  4. Kopieren Sie auf der Übersichtsseite zwei Werte:
    • Verzeichnis-ID (Mandant)
    • Anwendungs-ID (Client)
  5. Gehen Sie zu Zertifikate & Geheimnisse → Neuer geheimer Clientschlüssel, wählen Sie eine Gültigkeitsdauer, klicken Sie auf Hinzufügen und kopieren Sie den Eintrag in der Spalte Wert sofort, da Microsoft ihn nur ein einziges Mal anzeigt
  6. Gehen Sie zu API-Berechtigungen → Berechtigung hinzufügen → Microsoft Graph → Anwendungsberechtigungen und fügen Sie Folgendes hinzu:
    • Sites.Selected, empfohlen: zunächst kein Zugriff, bis ein Administrator explizit eine Website freigibt, oder
    • Sites.Read.All, Lesezugriff auf alle SharePoint-Websites; einfacher, aber deutlich weitreichender
  7. Klicken Sie auf Administratorzustimmung erteilen, ohne diesen Schritt hat die Anwendung keinerlei Zugriff
  8. Bei Sites.Selected muss ein Administrator der Anwendung zusätzlich Lesezugriff auf die jeweilige Website gewähren (über PowerShell oder den Graph Explorer, Sites.Selected-Berechtigung für diese Website)
Das Client-Geheimnis läuft ab, Microsoft erlaubt maximal 24 Monate. Nach Ablauf stoppt die Synchronisierung des Ordners und das Dashboard zeigt Zugangsdaten nicht mehr gültig an. Erstellen Sie eine Kalendererinnerung und tragen Sie rechtzeitig vor Ablauf ein neues Geheimnis im Bearbeiten-Dialog ein.

Verbindung herstellen

  1. Datenquelle hinzufügen → SharePoint / OneDrive
  2. Mandanten-ID, Client-ID und Client-Geheimnis eingeben
  3. Optional die Website-URL eingeben (z. B. https://contoso.sharepoint.com/sites/marketing), um direkt zu einer bestimmten Website zu springen
  4. Verbindung testen, die Dokumentbibliotheken, auf die Sie Zugriff haben, werden geladen
  5. Wählen Sie die Bibliothek aus und navigieren Sie zum gewünschten Ordner
  6. Wählen Sie das Synchronisierungsintervall und klicken Sie auf Verbinden und einlesen

Google Drive

Liest einen Drive-Ordner über ein Google-Dienstkonto aus, ein technisches Konto, das Ihrer Organisation gehört und nicht einer einzelnen Person. So bricht nichts ab, wenn ein Mitarbeiter das Unternehmen verlässt.

Zugangsdaten beschaffen

  1. Öffnen Sie die Google Cloud Console und wählen Sie ein Projekt aus (oder erstellen Sie eines, es ist kostenlos)
  2. Gehen Sie zu APIs & Services → Library, suchen Sie nach Google Drive API und klicken Sie auf Enable
  3. Gehen Sie zu APIs & Services → Credentials → Create credentials → Service account
  4. Vergeben Sie einen Namen, klicken Sie auf Create and continue, überspringen Sie die optionalen Rollenschritte und klicken Sie auf Done
  5. Klicken Sie auf das neue Dienstkonto, öffnen Sie den Reiter Keys und wählen Sie Add key → Create new key → JSON. Eine .json-Datei wird heruntergeladen, diese Datei enthält die Zugangsdaten
  6. Kopieren Sie die E-Mail-Adresse des Dienstkontos, sie sieht etwa so aus: name@project-id.iam.gserviceaccount.com

Geben Sie dieser Adresse nun auf einem von zwei Wegen Zugriff auf Ihre Dateien:

  • Ordner freigeben (am einfachsten): In Google Drive mit der rechten Maustaste auf den Ordner klicken → Share → Adresse des Dienstkontos einfügen → Rolle ViewerShare
  • Domainweite Delegation (nur Google Workspace): Ein Workspace-Administrator autorisiert die Client-ID des Dienstkontos für den Bereich https://www.googleapis.com/auth/drive.readonly unter Admin console → Security → API controls → Domain-wide delegation. Tragen Sie danach die E-Mail-Adresse des Nutzers, dessen Dateien gelesen werden sollen, in das Feld Act as user ein. Wählen Sie diesen Weg, wenn Ihr Workspace externe Freigaben blockiert, denn ein Dienstkonto gilt als extern.
Ein Dienstkonto besitzt keinen eigenen Drive-Speicherplatz. Es kann nur lesen, was für das Konto freigegeben wurde, was hier genau das gewünschte Verhalten ist.

Verbindung einrichten

  1. Datenquelle hinzufügen → Google Drive
  2. Fügen Sie den Inhalt der JSON-Schlüsseldatei ein
  3. Optional Act as user ausfüllen (nur bei domainweiter Delegation)
  4. Ordner-Link oder dessen ID einfügen: Öffnen Sie den Ordner in Drive und kopieren Sie die URL; die ID ist der Teil nach /folders/
  5. Verbindung testen, Intervall wählen, auf Verbinden und einlesen klicken

Google Docs, Sheets und Slides enthalten keine Dateibytes und werden daher während des Einlesens umgewandelt: Docs in Markdown, Sheets in Excel (nur das erste Tabellenblatt), Slides in reinen Text. Google begrenzt diese Umwandlung auf 10 MB pro Datei; größere Dateien werden als übersprungen aufgelistet.


Nextcloud / WebDAV

Funktioniert mit Nextcloud, ownCloud und jedem anderen WebDAV-Server, einschließlich der WebDAV-Schnittstelle vieler NAS-Geräte.

Zugangsdaten beschaffen

Verwenden Sie für Nextcloud und ownCloud ein App-Passwort, niemals Ihr normales Kontopasswort:

  1. Melden Sie sich in Ihrer Nextcloud an
  2. Klicken Sie auf Ihren Avatar → Settings → Security
  3. Scrollen Sie zu Devices & sessions, tragen Sie einen Namen ein (z. B. WebChatAgent) und klicken Sie auf Create new app password
  4. Kopieren Sie das generierte Passwort, es wird nur einmal angezeigt

Ein App-Passwort kann einzeln widerrufen werden und funktioniert nicht für den Web-Login, sodass ein Datenleck begrenzt bleibt. Für andere WebDAV-Server verwenden Sie den Benutzernamen und das Passwort, die Sie von Ihrem Administrator erhalten haben.

Verbindung einrichten

  1. Datenquelle hinzufügen → Nextcloud / WebDAV
  2. Server URL: Nur die Adresse ohne Pfad, z. B. https://cloud.example.com
  3. Benutzername und App-Passwort
  4. WebDAV path: Bei Nextcloud und ownCloud leer lassen, da diese den Standardpfad nutzen. Nur bei anderen WebDAV-Servern ausfüllen (Ihr Administrator kennt den Pfad, oft etwa /dav oder /webdav)
  5. Verbindung testen, zum Ordner navigieren, Intervall wählen, auf Verbinden und einlesen klicken
Der Server muss über HTTPS erreichbar sein. Unverschlüsseltes HTTP wird abgelehnt, ebenso Adressen in privaten Netzwerken, da ein Chatbot in der Cloud Adressen wie 192.168.x.x ohnehin nicht erreichen kann.

SFTP / FTPS

Für eigene Server, ein Hosting-Paket oder ein NAS mit SSH-Zugang.

Was Sie benötigen

Erfragen Sie beim Serverbetreiber folgende Angaben:

  • Serveradresse und Port (SFTP meist 22, FTPS meist 21 oder 990)
  • Benutzername
  • Passwort oder, noch besser, einen SSH-Schlüssel

Ein SSH-Schlüssel ist einem Passwort vorzuziehen: Er kann nicht erraten werden und lässt sich widerrufen, ohne die Zugangsdaten anderer Nutzer zu ändern. Wenn Sie selbst einen Schlüssel erstellen müssen, führen Sie auf dem Mac oder unter Linux folgenden Befehl aus:

ssh-keygen -t ed25519 -f ~/wca-key -C "webchatagent"

Dadurch entstehen zwei Dateien. Fügen Sie den Inhalt von wca-key (dem privaten Schlüssel) in den Dialog ein und übergeben Sie wca-key.pub (den öffentlichen Schlüssel) an Ihren Administrator, der ihn für das jeweilige Konto an die Datei ~/.ssh/authorized_keys anhängt. Wenn Sie eine Passphrase vergeben haben, tragen Sie diese in das Passphrase-Feld ein.

Verbindung einrichten

  1. Datenquelle hinzufügen → SFTP / FTPS
  2. Protokoll wählen, Serveradresse, Port und Benutzername eingeben
  3. Entweder das Passwort eingeben oder Use SSH key instead of password aktivieren und den privaten Schlüssel einfügen
  4. Verbindung testen: Bei SFTP wird ein Server-Fingerprint angezeigt
  5. Vergleichen Sie diesen Fingerprint mit dem Wert Ihres Administrators und bestätigen Sie ihn. Er wird gespeichert und bei jeder späteren Synchronisierung überprüft. Sollte er sich jemals ändern, stoppt die Synchronisierung, anstatt sich stillschweigend mit einem anderen Rechner zu verbinden
  6. Zum Ordner navigieren, Intervall wählen, auf Verbinden und einlesen klicken
Unverschlüsseltes FTP wird nicht unterstützt, da das Passwort im Klartext übertragen würde. FTPS (AUTH TLS) und SFTP werden beide unterstützt.

Wann „Dateien immer neu einlesen“ hilft

SFTP bietet keinen Fingerprint für den Inhalt; der Chatbot vergleicht Dateigröße und Änderungszeitpunkt. Manche Sync-Tools (rsync -t, bestimmte Backup-Jobs) behalten beides bei, selbst wenn sich der Inhalt geändert hat, wodurch eine solche Änderung unbemerkt bliebe. Für diese Fälle gibt es im Bearbeitungsdialog die Option Dateien immer neu einlesen. Dadurch wird jede Datei bei jeder Synchronisierung komplett neu eingelesen. Das dauert länger, stellt aber sicher, dass nichts übersehen wird. Lassen Sie die Option deaktiviert, es sei denn, das Problem tritt bei Ihnen tatsächlich auf.


Wenn etwas schiefgeht

Was Sie sehenBedeutungWas zu tun ist
Zugangsdaten nicht mehr gültigPasswort, Secret oder Schlüssel wurden abgewiesen. Die automatische Synchronisierung wird pausiert, damit ein falsches Passwort nicht stündlich erneut getestet wird.Geben Sie die Zugangsdaten im Bearbeitungsdialog erneut ein. SharePoint-Client-Secrets laufen nach einer gewissen Zeit ab, was meistens die Ursache ist.
Ordner nicht erreichbarDer Ordner wurde umbenannt, verschoben oder gelöscht, oder der Zugriff wurde entzogen.Überprüfen Sie den Ordner im Speichersystem. Ihr indexierter Inhalt bleibt bewusst erhalten, bis Sie den Fehler behoben haben.
Server-Fingerprint hat sich geändert (SFTP)Der Server meldet einen anderen SSH-Schlüssel als bei der Einrichtung.Fragen Sie Ihren Administrator. Das ist nach einer Neuinstallation des Servers normal, sieht aber genauso aus, wenn jemand den Server imitiert. Bestätigen Sie die Änderung erst, wenn die Ursache feststeht.
Einzelne Datei zeigt FehlgeschlagenDiese eine Datei konnte nicht gelesen werden, z. B. durch ein beschädigtes PDF, ein passwortgeschütztes Dokument oder ein unerwartetes Format.Alle anderen Dateien wurden indiziert. Öffnen Sie Indizierte Dateien, um den Grund einzusehen.
Einzelne Datei zeigt Zu großDie Datei überschreitet das Dateigrößenlimit Ihres Tarifs.Teilen Sie die Datei auf oder führen Sie ein Upgrade durch.

Kategorien

Kategorien helfen Ihnen, Ihre Datenquellen zu organisieren. Sie können:

  • Eine Kategorie beim Hinzufügen oder Bearbeiten jeder Datenquelle zuweisen
  • Die Liste der Datenquellen nach Kategorie filtern
  • Kategorien verwenden, um zusammengehörige Inhalte zu gruppieren (z. B. „Produkte“, „Support“, „Rechtliches“)

Kategorien werden in Kleinbuchstaben gespeichert und über alle Datenquellentypen hinweg gemeinsam genutzt.

Data Source List

Die Datenquellenliste zeigt jede Quelle mit ihrem aktuellen Status:

StatusBeschreibung
IndiziertErfolgreich verarbeitet und für den Chatbot verfügbar
AusstehendWird gerade verarbeitet oder befindet sich in der Warteschlange für die Indizierung
Aktualisierung erforderlichWird als oranges Badge angezeigt. Die indexierten Daten der Quelle sind nicht mehr nutzbar, meist nach einem Wechsel des KI-Anbieters des Chatbots, und müssen neu aufgebaut werden, bevor der Chatbot daraus antworten kann. Siehe Neu indizieren.
FehlerVerarbeitung fehlgeschlagen, prüfen Sie die Quell-URL oder Datei und versuchen Sie es erneut

Sie können die Liste filtern nach:

  • Suche — Quellen nach Name oder URL finden. Verbundene Ordner werden anhand ihres Anzeigenamens und des Ordnerpfads abgeglichen, sodass die Eingabe von sharepoint oder eines Teils des Pfads diese findet
  • Typ — Filtern nach Website, Datei, Confluence, Notion, SharePoint, Google Drive, Nextcloud / WebDAV oder SFTP / FTPS
  • Kategorie — Filtern nach zugewiesener Kategorie

Inhalte durchsuchen (die Schaltfläche über der Liste) durchsucht den indexierten Text anstelle der Quellennamen und deckt auch verbundene Ordner ab, nützlich, um herauszufinden, aus welcher Datei ein bestimmter Satz stammt.

Editing Data Sources

  • Website-URLs: Klicken Sie auf das Bearbeiten-Symbol, um URL, Crawl-Tiefe, CSS-Selektoren, Ausschlussmuster und das Intervall für die Neuindizierung zu ändern
  • Textdokumente: Klicken Sie auf das Bearbeiten-Symbol, um Name, Kategorie und Inhalt zu ändern
  • Dateidokumente: Klicken Sie auf das Bearbeiten-Symbol, um Name und Kategorie zu ändern (der Inhalt kann nicht geändert werden, laden Sie stattdessen die Datei erneut hoch)
  • Confluence-Quellen: Klicken Sie auf das Bearbeiten-Symbol, um Space-Auswahl, Einbindung von Unterseiten und Synchronisierungsintervall zu ändern
  • Notion-Quellen: Klicken Sie auf das Bearbeiten-Symbol, um Datenbankauswahl, Einbindung von Unterseiten und Synchronisierungsintervall zu ändern
  • Verbundene Ordner: Klicken Sie auf das Bearbeiten-Symbol, um Anzeigenamen, Synchronisierungsintervall, Einbindung von Unterordnern, den Speicherort-Schalter, Ausschlussregeln, Suchpriorität zu ändern und Zugangsdaten erneut einzugeben. Die Dateiinhalte selbst können hier nicht bearbeitet werden, das Speichersystem bleibt die einzige verlässliche Quelle und jede Bearbeitung würde bei der nächsten Synchronisierung überschrieben

Re-indexing

Sie können einzelne Datenquellen manuell neu indizieren, um deren Inhalt zu aktualisieren. Dies ist nützlich, wenn:

  • Sich Website-Inhalte geändert haben
  • Sie nach dem Anpassen von CSS-Selektoren oder Ausschlussmustern aktualisieren möchten
  • Eine zuvor fehlerhafte Quelle korrigiert wurde

Aktualisierung erforderlich (oranges Badge)

Wenn eine Datenquelle ein oranges Badge "Aktualisierung erforderlich" anzeigt, können ihre indexierten Inhalte vom Chatbot nicht mehr verwendet werden und müssen neu aufgebaut werden.

Dies geschieht automatisch, wenn Sie in den Chatbot-Einstellungen den KI-Anbieter des Chatbots ändern (zum Beispiel von OpenAI zu Google Gemini). Jeder Anbieter speichert Ihre Inhalte in seinem eigenen Embedding-Format, und diese Formate sind nicht austauschbar. Wenn sich der Anbieter ändert, werden die alten indexierten Daten gelöscht und jede Datenquelle wird mit Aktualisierung erforderlich markiert.

Bis zur Neuindizierung verfügt der Chatbot über kein nutzbares Wissen aus den betroffenen Quellen. Er greift auf allgemeine Antworten oder "Ich weiß es nicht" zurück, anstatt aus Ihren Inhalten zu antworten. Führen Sie die Neuindizierung durch, sobald Sie das orange Badge sehen.

Wenn mindestens eine Quelle neu indiziert werden muss, wird oben im Tab Wissen die Option Alle neu einlesen verfügbar. Klicken Sie darauf, um alle betroffenen Quellen in einem Durchgang neu aufzubauen, oder nutzen Sie die Aktualisierungsaktion bei einer einzelnen Quelle, um nur diese neu zu indizieren.

Sie müssen nichts erneut hinzufügen, die Neuindizierung verwendet Ihre vorhandenen URLs, Dateien, Texte, Confluence, Notion und verbundenen Ordner wieder. Websites werden neu gecrawlt und externe Quellen neu synchronisiert, daher kann eine große Wissensdatenbank einige Minuten dauern. Sobald der Vorgang abgeschlossen ist, verschwindet das Badge und der Chatbot antwortet wieder aus Ihren Inhalten.

Bei verbundenen Ordnern ist dies der einzige Fall, in dem jede Datei erneut heruntergeladen und verarbeitet wird, unabhängig davon, ob sie sich geändert hat, da die gespeicherten Daten verworfen wurden und kein Vergleichswert mehr vorhanden ist.

Content Limits

Trainingsinhalte werden in Zeichen des indexierten Textes über alle Ihre Datenquellen (Webseiten, Dateien, Fragen-und-Antworten-Einträge) hinweg gemessen. Dies ersetzt das frühere Limit pro Seite, sodass wenige lange Seiten und viele kurze Seiten gleich gewertet werden. Ihr Zeichenkontingent wächst mit Ihrem Plan; die aktuellen Limits pro Plan finden Sie auf der Preisseite.

Wenn das Limit erreicht ist, pausiert die Indizierung, bis Sie Inhalte entfernen oder ein Upgrade durchführen.

Best Practices

  • Inhalte klar und gut strukturiert halten — Die KI liefert mit organisierten, lesbaren Inhalten bessere Ergebnisse
  • Nur relevante Seiten indizieren — Schließen Sie Login-Seiten, Administrationsbereiche und doppelte Inhalte aus
  • CSS-Selektoren verwenden, um sich auf den Hauptinhalt zu konzentrieren und Navigation, Fußzeilen sowie Werbung auszuschließen
  • Das Fragen-Dashboard überwachen, um Wissenslücken zu identifizieren und fehlende Inhalte hinzuzufügen
  • Datenquellen regelmäßig aktualisieren, um genaue und aktuelle Antworten zu gewährleisten
  • Kategorien nutzen, um große Mengen an Datenquellen zu organisieren
  • Auf eine Sprache beschränken, wenn Ihre Website identische Inhalte in mehreren Sprachen bereitstellt
  • Verbundene Ordner auf einen gepflegten Ordner ausrichten, nicht auf das gesamte Laufwerk, ein verwalteter Ordner "Chatbot-Wissen" ist deutlich besser, als jeden herumliegenden Entwurf und alten Vertrag zu indizieren
  • Den Speicherort-Schalter für öffentliche Widgets deaktiviert lassen, für interne Assistenten und Team-Wikis aktivieren