KI-Chatbot mit Wissensquellen trainieren
Wissensquellen
Wissensquellen liefern die Informationen, die dein Chatbot für fundierte Antworten nutzt. Öffne Dashboard → dein Assistent → Wissen, um Website-URLs hinzuzufügen, Dateien hochzuladen, Text direkt einzugeben oder externe Plattformen wie Confluence, Notion, SharePoint, Google Drive, Nextcloud oder SFTP/FTPS anzubinden.
Der Reiter Wissen zeigt außerdem den kontoweiten Zeichenverbrauch an. Die Quellentabelle kann nach Typ oder Kategorie durchsucht und gefiltert werden und zeigt den Indexierungsstatus sowie die letzte Aktualisierung jeder Quelle an. Über Zeilenaktionen kannst du eine Quelle neu importieren, bearbeiten, prüfen, herunterladen, stoppen oder löschen, sofern unterstützt. Wähle mehrere Zeilen für eine gebündelte Neuindexierung oder Löschung aus.
Du kannst auch einen Ordner verbinden, sei es SharePoint, Google Drive, Nextcloud oder ein SFTP-Server. Alles darin wird automatisch indiziert, und jede Änderung wird bei der nächsten Synchronisierung erfasst, ohne dass jemand eine Datei erneut hochladen muss. Siehe Verbundene Ordner.
Website-URLs
Gib URLs zum Crawlen und Indizieren ein. WebChatAgent crawlt die Seiten automatisch und extrahiert Inhalte für die Wissensdatenbank deines Chatbots.
Website hinzufügen
- Klicke im Reiter Wissen auf Datenquelle hinzufügen und wähle Website
- Gib die Website-URL ein (z. B.
example.com,https://wird automatisch hinzugefügt) - Konfiguriere optionale erweiterte Einstellungen (siehe unten)
- Klicke auf Hinzufügen, um das Crawling zu starten
Erweiterte Einstellungen
| Feld | Beschreibung | Standard |
|---|---|---|
| Crawl-Tiefe | Wie viele Link-Ebenen tief gecrawlt werden soll. 0 = nur diese Seite, leer = unbegrenzte Tiefe. | Leer (unbegrenzt) |
| CSS-Selektoren | Kommagetrennte CSS-Selektoren, um gezielt bestimmte Inhaltsbereiche anzusprechen (z. B. article, .content, #main-body). Wenn gesetzt, wird nur Inhalt innerhalb dieser Selektoren extrahiert. | Leer (gesamte Seite) |
| URL-Muster ausschließen | Kommagetrennte URL-Muster, die beim Crawlen übersprungen werden sollen (z. B. /login, /impressum, */amp/*). | Leer |
| Automatisches Re-Indexing-Intervall | Wie oft der Inhalt automatisch neu gecrawlt und aktualisiert werden soll. Optionen: Alle 3 Tage, Alle 7 Tage, Alle 30 Tage (Premium- und Enterprise-Pläne erhalten zusätzlich Täglich). | Deaktiviert |
Wann CSS-Selektoren verwendet werden sollten
CSS-Selektoren helfen dir, nur den relevanten Inhalt einer Seite zu extrahieren. Das ist nützlich, wenn:
- Deine Seiten Navigationsmenüs, Fußzeilen oder Seitenleisten enthalten, die du ausschließen möchtest
- Du dich nur auf den Hauptinhalt von Artikeln konzentrieren möchtest
- Die Seite Werbung oder unpassende Widgets enthält
Beispiel: Um nur den Hauptinhaltsbereich zu extrahieren und die Navigation zu überspringen:
article, .main-content, #post-body
Wann URL-Ausschlussmuster verwendet werden sollten
Ausschlussmuster verhindern, dass bestimmte Seiten indiziert (zur Wissensdatenbank deines Chatbots hinzugefügt) werden. Häufige Anwendungsfälle:
- Login-/Admin-Seiten:
/login, /admin, /wp-admin - Rechtliche Seiten:
/impressum, /privacy-policy, /terms - Doppelter Inhalt:
*/amp/*, */print/* - Kategorie-/Tag-Archive:
/category/*, /tag/*(oft duplizierter Inhalt) - Abfrageparameter:
?hitsPerPageschließt alle URLs aus, die diesen Parameter enthalten (z. B. Suchergebnisseiten mit Paginierung)
Wichtige Details:
- Muster unterscheiden zwischen Groß- und Kleinschreibung.
/Aboutund/aboutwerden als unterschiedliche Muster behandelt. Stelle sicher, dass deine Muster exakt der Schreibweise in deinen URLs entsprechen. - Ausgeschlossene Seiten werden nicht indiziert, aber ihren Links wird trotzdem gefolgt. Der Crawler entdeckt und crawlt weiterhin Seiten, die von ausgeschlossenen URLs verlinkt sind, lediglich die ausgeschlossene Seite selbst wird bei der Indexierung übersprungen. Wenn du beispielsweise eine Kategorieseite wie
/blog/category/newsausschließt, wird diese Übersichtsseite nicht indiziert, die verlinkten einzelnen Blogbeiträge werden jedoch trotzdem gecrawlt und indiziert (es sei denn, sie passen ebenfalls auf ein Ausschlussmuster).
Überlegungen zur Sprache
Wenn deine Website mehrsprachige Inhalte hat (z. B. /en/about und /de/about), wird dringend empfohlen, nur eine Sprache zu indizieren. Das Indizieren desselben Inhalts in mehreren Sprachen führt zu:
- Doppelten Informationen, die dein Inhaltskontingent (gemessen in Zeichen) unnötig verbrauchen
- Geringerer Trefferqualität, da die KI Antworten möglicherweise aus der falschen Sprache bezieht
- Verschwendetem Token-Budget für redundante Inhalte
Der Chatbot antwortet in der Sprache des Besuchers, unabhängig davon, welche Sprache du indizierst, daher bringt es keinen Vorteil, dieselbe Seite doppelt zu indizieren. Nutze das Feld Exclude URL Patterns, um die anderen Sprachordner zu überspringen (z. B. /de/*, /fr/*).
Wähle die Sprache, die deine Kunden am häufigsten verwenden, oder die Sprache, die der primären Zielgruppe deines Chatbots entspricht.
Text-Datenquellen
Du kannst Textinhalte manuell als Datenquelle eingeben. Dies ist ideal für FAQs, internes Wissen oder Inhalte, die auf keiner Website existieren.
Textdokument hinzufügen
- Klicke im Reiter Wissen auf Datenquelle hinzufügen und wähle Texteingabe
- Fülle die Felder aus:
| Feld | Beschreibung | Einschränkungen |
|---|---|---|
| Dokumentname | Ein aussagekräftiger Name für dieses Dokument. Leer lassen für einen KI-generierten Namen. | Optional |
| Kategorie | Dokumente nach Kategorie organisieren. Wähle eine bestehende Kategorie oder gib eine neue ein. Leer lassen für automatische Erkennung. | Optional |
| Inhalt | Der eigentliche Textinhalt, den der Chatbot verwenden wird. | Pflichtfeld, max. 50.000 Zeichen |
Datei-Upload
Lade Dokumente direkt in die Wissensdatenbank deines Chatbots hoch.
Unterstützte Formate
| Format | Beschreibung |
|---|---|
| Handbücher, Berichte, Broschüren, Whitepaper | |
| DOCX | Word-Dokumente |
| TXT | Reine Textdateien |
| MD | Markdown-Dokumente |
| XLSX | Tabellenkalkulationen |
Dateigrößenbeschränkungen
| Plan | Maximale Dateigröße |
|---|---|
| Kostenlos | 1 MB |
| Basic | 5 MB |
| Standard | 10 MB |
| Premium | 50 MB |
| Enterprise | Unbegrenzt |
Automatische KI-Dateinamen
Wenn du in kostenpflichtigen Plänen eine Datei mit einem generischen Namen hochlädst (z. B. document.txt oder untitled.pdf), generiert das System automatisch einen aussagekräftigen Dateinamen basierend auf dem Dateiinhalt.
Confluence Cloud
Verbinde deine Confluence Cloud-Instanz, um Wiki-Seiten direkt in die Wissensdatenbank deines Chatbots zu importieren.
Confluence-Quelle hinzufügen
- Klicke auf Datenquelle hinzufügen und wähle Confluence Cloud
- Gib deine Confluence-URL ein (z. B.
https://yourcompany.atlassian.net) - Gib die E-Mail-Adresse ein, die mit deinem Atlassian-Konto verknüpft ist
- Gib ein API-Token von Atlassian API Tokens ein
- Klicke auf Verbindung testen, verfügbare Spaces werden geladen
- Wähle die zu indizierenden Spaces aus (leer lassen, um alle zugänglichen Spaces zu importieren)
- Konfiguriere das Synchronisierungsintervall und klicke auf Erstellen & Indizieren
Confluence-Quelle bearbeiten
Klicke nach dem Hinzufügen einer Confluence-Quelle auf das Bearbeiten-Symbol, um Folgendes zu ändern:
- Space-Auswahl, Spaces zum Indizieren hinzufügen oder entfernen
- Unterseiten einbeziehen, ob verschachtelte Seiten einbezogen werden sollen
- Re-Indexing-Intervall, wie oft automatisch synchronisiert werden soll
Änderungen werden bei der nächsten Neuindexierung wirksam.
Inkrementelle Synchronisierung
Confluence-Quellen unterstützen inkrementelle Synchronisierung. Nur Seiten, die sich seit der letzten Synchronisierung geändert haben, werden neu indiziert, was Aktualisierungen schnell und effizient macht.
Notion
Verbinden Sie Notion, um Seiten und Datenbanken in die Wissensdatenbank Ihres Chatbots zu importieren.
Eine Notion-Quelle hinzufügen
- Klicken Sie auf Datenquelle hinzufügen und wählen Sie Notion
- Erstellen Sie eine Interne Integration unter Notion-Integrationen
- Teilen Sie die gewünschten Seiten oder Datenbanken in Notion mit Ihrer Integration
- Geben Sie das Integrations-Token ein (beginnt mit
ntn_odersecret_) - Klicken Sie auf Verbindung testen, verfügbare Datenbanken werden geladen
- Wählen Sie die zu indizierenden Datenbanken aus (leer lassen, um alle zugänglichen Seiten zu importieren)
- Konfigurieren Sie das Synchronisierungsintervall und klicken Sie auf Erstellen & Indizieren
Eine Notion-Quelle bearbeiten
Klicken Sie nach dem Hinzufügen einer Notion-Quelle auf das Bearbeiten-Symbol, um Folgendes zu ändern:
- Datenbankauswahl, zu indizierende Datenbanken hinzufügen oder entfernen
- Unterseiten einbeziehen, ob verschachtelte Seiten einbezogen werden sollen
- Neuindizierungsintervall, wie oft automatisch synchronisiert wird
Inkrementelle Synchronisierung
Notion-Quellen unterstützen die inkrementelle Synchronisierung. Nur Seiten, die seit der letzten Synchronisierung geändert wurden, werden erneut verarbeitet.
Verbundene Ordner
Ein verbundener Ordner ist ein Ordner, der dauerhaft verbunden bleibt. Sie verknüpfen den Chatbot einmal mit einem Ordner in SharePoint, Google Drive, Nextcloud oder auf einem SFTP-Server. Von da an liest er jede indizierbare Datei darin und prüft den Inhalt nach einem von Ihnen gewählten Zeitplan. Ändern Sie ein PDF in diesem Ordner, kennt der Chatbot nach der nächsten Synchronisierung die neue Version. Löschen Sie eine Datei, verschwindet sie aus der Wissensdatenbank. Niemand muss manuell Dateien neu hochladen.
Was indiziert wird
| Enthalten | Übersprungen |
|---|---|
| PDF, DOCX, XLSX, XLS, CSV, TXT, MD | Alles andere, Bilder, Videos, ZIP-Archive, PPTX |
| Dateien in Unterordnern (optional, standardmäßig aktiviert) | Dateien, die das Upload-Limit Ihres Tarifs überschreiten |
| Google Docs, Sheets und Slides (nur Drive, automatisch umgewandelt) | Dateien, die Ihren Ausschlussregeln entsprechen |
Übersprungene Dateien werden im Dialog Indizierte Dateien mit dem Grund aufgeführt, sodass Sie auf einen Blick sehen, warum etwas fehlt.
Wie die Synchronisierung funktioniert
Jede Datei enthält ein Versionskennzeichen des Speichersystems. SharePoint und Google Drive liefern einen Inhalts-Fingerprint, SFTP und Nextcloud nutzen Größe und Änderungszeitpunkt. Bei jeder Synchronisierung vergleicht der Chatbot die Kennzeichen und lädt nur herunter, was sich tatsächlich geändert hat. Eine unveränderte Datei verursacht keine Kosten: kein Download, keine Verarbeitung, kein Kontingentverbrauch.
Wählen Sie das Synchronisierungsintervall beim Verbinden des Ordners: Täglich, Alle 3 Tage, Wöchentlich oder Alle 30 Tage. Sie können eine Synchronisierung auch jederzeit manuell über das Aktualisieren-Symbol anstoßen.
Benutzern den Speicherort einer Datei anzeigen
Standardmäßig deaktiviert, ein Schalter pro Ordner: Speicherort gegenüber Benutzern benennen. Ist er aktiviert, kann der Chatbot den Ordnerpfad in einer Antwort erwähnen, und jede Antwort zeigt eine Karte pro verwendeter Datei: Dateiname, Pfad, Speichersystem und einen direkten Link zu SharePoint, Drive oder Nextcloud, sofern vorhanden.
Lassen Sie die Option für ein öffentliches Website-Widget aus. Andernfalls kann jeder Besucher Ihre interne Ordnerstruktur einsehen. Ist der Schalter deaktiviert, werden weder Dateiname noch Pfad an das KI-Modell gesendet, sodass diese auch nicht im Text auftauchen können.
Dateien ausschließen
Fügen Sie unter Bestimmte Dateien überspringen eine Regel pro Zeile ein:
| Regel | Was übersprungen wird |
|---|---|
/Archive/** | Der gesamte Archivordner samt Inhalt |
*_internal* | Jede Datei mit _internal im Namen |
*.csv | Jede CSV-Datei |
/HR/Salaries/** | Ein bestimmter Unterordner |
* steht für beliebige Zeichen innerhalb eines Pfadsegments, ** für eine beliebige Anzahl von Unterordnern. Ausgeschlossene Dateien werden bei der nächsten Synchronisierung aus der Wissensdatenbank entfernt.
Sie können eine einzelne Datei auch nachträglich ausschließen: Öffnen Sie Indizierte Dateien, suchen Sie die Zeile und klicken Sie auf Aus Index entfernen. Sie bleibt auch bei künftigen Synchronisierungen ausgeschlossen.
SharePoint / OneDrive
Liest eine Dokumentbibliothek aus Microsoft 365. Ihr Microsoft-Administrator registriert einmalig eine Anwendung und stellt Ihnen drei Werte bereit.
Zugangsdaten abrufen
- Melden Sie sich im Microsoft Entra Admin Center mit einem Konto an, das Anwendungen registrieren darf
- Gehen Sie zu Identität → Anwendungen → App-Registrierungen und klicken Sie auf Neue Registrierung
- Vergeben Sie einen Namen (z. B.
WebChatAgent Knowledge), übernehmen Sie die Standardeinstellungen und klicken Sie auf Registrieren - Kopieren Sie auf der Übersichtsseite zwei Werte:
- Verzeichnis-ID (Mandant)
- Anwendungs-ID (Client)
- Gehen Sie zu Zertifikate & Geheimnisse → Neuer geheimer Clientschlüssel, wählen Sie eine Gültigkeitsdauer, klicken Sie auf Hinzufügen und kopieren Sie den Eintrag in der Spalte Wert sofort, da Microsoft ihn nur ein einziges Mal anzeigt
- Gehen Sie zu API-Berechtigungen → Berechtigung hinzufügen → Microsoft Graph → Anwendungsberechtigungen und fügen Sie Folgendes hinzu:
Sites.Selected, empfohlen: zunächst kein Zugriff, bis ein Administrator explizit eine Website freigibt, oderSites.Read.All, Lesezugriff auf alle SharePoint-Websites; einfacher, aber deutlich weitreichender
- Klicken Sie auf Administratorzustimmung erteilen, ohne diesen Schritt hat die Anwendung keinerlei Zugriff
- Bei
Sites.Selectedmuss ein Administrator der Anwendung zusätzlich Lesezugriff auf die jeweilige Website gewähren (über PowerShell oder den Graph Explorer,Sites.Selected-Berechtigung für diese Website)
Verbindung herstellen
- Datenquelle hinzufügen → SharePoint / OneDrive
- Mandanten-ID, Client-ID und Client-Geheimnis eingeben
- Optional die Website-URL eingeben (z. B.
https://contoso.sharepoint.com/sites/marketing), um direkt zu einer bestimmten Website zu springen - Verbindung testen, die Dokumentbibliotheken, auf die Sie Zugriff haben, werden geladen
- Wählen Sie die Bibliothek aus und navigieren Sie zum gewünschten Ordner
- Wählen Sie das Synchronisierungsintervall und klicken Sie auf Verbinden und einlesen
Google Drive
Liest einen Drive-Ordner über ein Google-Dienstkonto aus, ein technisches Konto, das Ihrer Organisation gehört und nicht einer einzelnen Person. So bricht nichts ab, wenn ein Mitarbeiter das Unternehmen verlässt.
Zugangsdaten beschaffen
- Öffnen Sie die Google Cloud Console und wählen Sie ein Projekt aus (oder erstellen Sie eines, es ist kostenlos)
- Gehen Sie zu APIs & Services → Library, suchen Sie nach Google Drive API und klicken Sie auf Enable
- Gehen Sie zu APIs & Services → Credentials → Create credentials → Service account
- Vergeben Sie einen Namen, klicken Sie auf Create and continue, überspringen Sie die optionalen Rollenschritte und klicken Sie auf Done
- Klicken Sie auf das neue Dienstkonto, öffnen Sie den Reiter Keys und wählen Sie Add key → Create new key → JSON. Eine
.json-Datei wird heruntergeladen, diese Datei enthält die Zugangsdaten - Kopieren Sie die E-Mail-Adresse des Dienstkontos, sie sieht etwa so aus:
name@project-id.iam.gserviceaccount.com
Geben Sie dieser Adresse nun auf einem von zwei Wegen Zugriff auf Ihre Dateien:
- Ordner freigeben (am einfachsten): In Google Drive mit der rechten Maustaste auf den Ordner klicken → Share → Adresse des Dienstkontos einfügen → Rolle Viewer → Share
- Domainweite Delegation (nur Google Workspace): Ein Workspace-Administrator autorisiert die Client-ID des Dienstkontos für den Bereich
https://www.googleapis.com/auth/drive.readonlyunter Admin console → Security → API controls → Domain-wide delegation. Tragen Sie danach die E-Mail-Adresse des Nutzers, dessen Dateien gelesen werden sollen, in das Feld Act as user ein. Wählen Sie diesen Weg, wenn Ihr Workspace externe Freigaben blockiert, denn ein Dienstkonto gilt als extern.
Verbindung einrichten
- Datenquelle hinzufügen → Google Drive
- Fügen Sie den Inhalt der JSON-Schlüsseldatei ein
- Optional Act as user ausfüllen (nur bei domainweiter Delegation)
- Ordner-Link oder dessen ID einfügen: Öffnen Sie den Ordner in Drive und kopieren Sie die URL; die ID ist der Teil nach
/folders/ - Verbindung testen, Intervall wählen, auf Verbinden und einlesen klicken
Google Docs, Sheets und Slides enthalten keine Dateibytes und werden daher während des Einlesens umgewandelt: Docs in Markdown, Sheets in Excel (nur das erste Tabellenblatt), Slides in reinen Text. Google begrenzt diese Umwandlung auf 10 MB pro Datei; größere Dateien werden als übersprungen aufgelistet.
Nextcloud / WebDAV
Funktioniert mit Nextcloud, ownCloud und jedem anderen WebDAV-Server, einschließlich der WebDAV-Schnittstelle vieler NAS-Geräte.
Zugangsdaten beschaffen
Verwenden Sie für Nextcloud und ownCloud ein App-Passwort, niemals Ihr normales Kontopasswort:
- Melden Sie sich in Ihrer Nextcloud an
- Klicken Sie auf Ihren Avatar → Settings → Security
- Scrollen Sie zu Devices & sessions, tragen Sie einen Namen ein (z. B.
WebChatAgent) und klicken Sie auf Create new app password - Kopieren Sie das generierte Passwort, es wird nur einmal angezeigt
Ein App-Passwort kann einzeln widerrufen werden und funktioniert nicht für den Web-Login, sodass ein Datenleck begrenzt bleibt. Für andere WebDAV-Server verwenden Sie den Benutzernamen und das Passwort, die Sie von Ihrem Administrator erhalten haben.
Verbindung einrichten
- Datenquelle hinzufügen → Nextcloud / WebDAV
- Server URL: Nur die Adresse ohne Pfad, z. B.
https://cloud.example.com - Benutzername und App-Passwort
- WebDAV path: Bei Nextcloud und ownCloud leer lassen, da diese den Standardpfad nutzen. Nur bei anderen WebDAV-Servern ausfüllen (Ihr Administrator kennt den Pfad, oft etwa
/davoder/webdav) - Verbindung testen, zum Ordner navigieren, Intervall wählen, auf Verbinden und einlesen klicken
192.168.x.x ohnehin nicht erreichen kann.SFTP / FTPS
Für eigene Server, ein Hosting-Paket oder ein NAS mit SSH-Zugang.
Was Sie benötigen
Erfragen Sie beim Serverbetreiber folgende Angaben:
- Serveradresse und Port (SFTP meist 22, FTPS meist 21 oder 990)
- Benutzername
- Passwort oder, noch besser, einen SSH-Schlüssel
Ein SSH-Schlüssel ist einem Passwort vorzuziehen: Er kann nicht erraten werden und lässt sich widerrufen, ohne die Zugangsdaten anderer Nutzer zu ändern. Wenn Sie selbst einen Schlüssel erstellen müssen, führen Sie auf dem Mac oder unter Linux folgenden Befehl aus:
ssh-keygen -t ed25519 -f ~/wca-key -C "webchatagent"
Dadurch entstehen zwei Dateien. Fügen Sie den Inhalt von wca-key (dem privaten Schlüssel) in den Dialog ein und übergeben Sie wca-key.pub (den öffentlichen Schlüssel) an Ihren Administrator, der ihn für das jeweilige Konto an die Datei ~/.ssh/authorized_keys anhängt. Wenn Sie eine Passphrase vergeben haben, tragen Sie diese in das Passphrase-Feld ein.
Verbindung einrichten
- Datenquelle hinzufügen → SFTP / FTPS
- Protokoll wählen, Serveradresse, Port und Benutzername eingeben
- Entweder das Passwort eingeben oder Use SSH key instead of password aktivieren und den privaten Schlüssel einfügen
- Verbindung testen: Bei SFTP wird ein Server-Fingerprint angezeigt
- Vergleichen Sie diesen Fingerprint mit dem Wert Ihres Administrators und bestätigen Sie ihn. Er wird gespeichert und bei jeder späteren Synchronisierung überprüft. Sollte er sich jemals ändern, stoppt die Synchronisierung, anstatt sich stillschweigend mit einem anderen Rechner zu verbinden
- Zum Ordner navigieren, Intervall wählen, auf Verbinden und einlesen klicken
AUTH TLS) und SFTP werden beide unterstützt.Wann „Dateien immer neu einlesen“ hilft
SFTP bietet keinen Fingerprint für den Inhalt; der Chatbot vergleicht Dateigröße und Änderungszeitpunkt. Manche Sync-Tools (rsync -t, bestimmte Backup-Jobs) behalten beides bei, selbst wenn sich der Inhalt geändert hat, wodurch eine solche Änderung unbemerkt bliebe. Für diese Fälle gibt es im Bearbeitungsdialog die Option Dateien immer neu einlesen. Dadurch wird jede Datei bei jeder Synchronisierung komplett neu eingelesen. Das dauert länger, stellt aber sicher, dass nichts übersehen wird. Lassen Sie die Option deaktiviert, es sei denn, das Problem tritt bei Ihnen tatsächlich auf.
Wenn etwas schiefgeht
| Was Sie sehen | Bedeutung | Was zu tun ist |
|---|---|---|
| Zugangsdaten nicht mehr gültig | Passwort, Secret oder Schlüssel wurden abgewiesen. Die automatische Synchronisierung wird pausiert, damit ein falsches Passwort nicht stündlich erneut getestet wird. | Geben Sie die Zugangsdaten im Bearbeitungsdialog erneut ein. SharePoint-Client-Secrets laufen nach einer gewissen Zeit ab, was meistens die Ursache ist. |
| Ordner nicht erreichbar | Der Ordner wurde umbenannt, verschoben oder gelöscht, oder der Zugriff wurde entzogen. | Überprüfen Sie den Ordner im Speichersystem. Ihr indexierter Inhalt bleibt bewusst erhalten, bis Sie den Fehler behoben haben. |
| Server-Fingerprint hat sich geändert (SFTP) | Der Server meldet einen anderen SSH-Schlüssel als bei der Einrichtung. | Fragen Sie Ihren Administrator. Das ist nach einer Neuinstallation des Servers normal, sieht aber genauso aus, wenn jemand den Server imitiert. Bestätigen Sie die Änderung erst, wenn die Ursache feststeht. |
| Einzelne Datei zeigt Fehlgeschlagen | Diese eine Datei konnte nicht gelesen werden, z. B. durch ein beschädigtes PDF, ein passwortgeschütztes Dokument oder ein unerwartetes Format. | Alle anderen Dateien wurden indiziert. Öffnen Sie Indizierte Dateien, um den Grund einzusehen. |
| Einzelne Datei zeigt Zu groß | Die Datei überschreitet das Dateigrößenlimit Ihres Tarifs. | Teilen Sie die Datei auf oder führen Sie ein Upgrade durch. |
Kategorien
Kategorien helfen Ihnen, Ihre Datenquellen zu organisieren. Sie können:
- Eine Kategorie beim Hinzufügen oder Bearbeiten jeder Datenquelle zuweisen
- Die Liste der Datenquellen nach Kategorie filtern
- Kategorien verwenden, um zusammengehörige Inhalte zu gruppieren (z. B. „Produkte“, „Support“, „Rechtliches“)
Kategorien werden in Kleinbuchstaben gespeichert und über alle Datenquellentypen hinweg gemeinsam genutzt.
Data Source List
Die Datenquellenliste zeigt jede Quelle mit ihrem aktuellen Status:
| Status | Beschreibung |
|---|---|
| Indiziert | Erfolgreich verarbeitet und für den Chatbot verfügbar |
| Ausstehend | Wird gerade verarbeitet oder befindet sich in der Warteschlange für die Indizierung |
| Aktualisierung erforderlich | Wird als oranges Badge angezeigt. Die indexierten Daten der Quelle sind nicht mehr nutzbar, meist nach einem Wechsel des KI-Anbieters des Chatbots, und müssen neu aufgebaut werden, bevor der Chatbot daraus antworten kann. Siehe Neu indizieren. |
| Fehler | Verarbeitung fehlgeschlagen, prüfen Sie die Quell-URL oder Datei und versuchen Sie es erneut |
Sie können die Liste filtern nach:
- Suche — Quellen nach Name oder URL finden. Verbundene Ordner werden anhand ihres Anzeigenamens und des Ordnerpfads abgeglichen, sodass die Eingabe von
sharepointoder eines Teils des Pfads diese findet - Typ — Filtern nach Website, Datei, Confluence, Notion, SharePoint, Google Drive, Nextcloud / WebDAV oder SFTP / FTPS
- Kategorie — Filtern nach zugewiesener Kategorie
Inhalte durchsuchen (die Schaltfläche über der Liste) durchsucht den indexierten Text anstelle der Quellennamen und deckt auch verbundene Ordner ab, nützlich, um herauszufinden, aus welcher Datei ein bestimmter Satz stammt.
Editing Data Sources
- Website-URLs: Klicken Sie auf das Bearbeiten-Symbol, um URL, Crawl-Tiefe, CSS-Selektoren, Ausschlussmuster und das Intervall für die Neuindizierung zu ändern
- Textdokumente: Klicken Sie auf das Bearbeiten-Symbol, um Name, Kategorie und Inhalt zu ändern
- Dateidokumente: Klicken Sie auf das Bearbeiten-Symbol, um Name und Kategorie zu ändern (der Inhalt kann nicht geändert werden, laden Sie stattdessen die Datei erneut hoch)
- Confluence-Quellen: Klicken Sie auf das Bearbeiten-Symbol, um Space-Auswahl, Einbindung von Unterseiten und Synchronisierungsintervall zu ändern
- Notion-Quellen: Klicken Sie auf das Bearbeiten-Symbol, um Datenbankauswahl, Einbindung von Unterseiten und Synchronisierungsintervall zu ändern
- Verbundene Ordner: Klicken Sie auf das Bearbeiten-Symbol, um Anzeigenamen, Synchronisierungsintervall, Einbindung von Unterordnern, den Speicherort-Schalter, Ausschlussregeln, Suchpriorität zu ändern und Zugangsdaten erneut einzugeben. Die Dateiinhalte selbst können hier nicht bearbeitet werden, das Speichersystem bleibt die einzige verlässliche Quelle und jede Bearbeitung würde bei der nächsten Synchronisierung überschrieben
Re-indexing
Sie können einzelne Datenquellen manuell neu indizieren, um deren Inhalt zu aktualisieren. Dies ist nützlich, wenn:
- Sich Website-Inhalte geändert haben
- Sie nach dem Anpassen von CSS-Selektoren oder Ausschlussmustern aktualisieren möchten
- Eine zuvor fehlerhafte Quelle korrigiert wurde
Aktualisierung erforderlich (oranges Badge)
Wenn eine Datenquelle ein oranges Badge "Aktualisierung erforderlich" anzeigt, können ihre indexierten Inhalte vom Chatbot nicht mehr verwendet werden und müssen neu aufgebaut werden.
Dies geschieht automatisch, wenn Sie in den Chatbot-Einstellungen den KI-Anbieter des Chatbots ändern (zum Beispiel von OpenAI zu Google Gemini). Jeder Anbieter speichert Ihre Inhalte in seinem eigenen Embedding-Format, und diese Formate sind nicht austauschbar. Wenn sich der Anbieter ändert, werden die alten indexierten Daten gelöscht und jede Datenquelle wird mit Aktualisierung erforderlich markiert.
Wenn mindestens eine Quelle neu indiziert werden muss, wird oben im Tab Wissen die Option Alle neu einlesen verfügbar. Klicken Sie darauf, um alle betroffenen Quellen in einem Durchgang neu aufzubauen, oder nutzen Sie die Aktualisierungsaktion bei einer einzelnen Quelle, um nur diese neu zu indizieren.
Sie müssen nichts erneut hinzufügen, die Neuindizierung verwendet Ihre vorhandenen URLs, Dateien, Texte, Confluence, Notion und verbundenen Ordner wieder. Websites werden neu gecrawlt und externe Quellen neu synchronisiert, daher kann eine große Wissensdatenbank einige Minuten dauern. Sobald der Vorgang abgeschlossen ist, verschwindet das Badge und der Chatbot antwortet wieder aus Ihren Inhalten.
Content Limits
Trainingsinhalte werden in Zeichen des indexierten Textes über alle Ihre Datenquellen (Webseiten, Dateien, Fragen-und-Antworten-Einträge) hinweg gemessen. Dies ersetzt das frühere Limit pro Seite, sodass wenige lange Seiten und viele kurze Seiten gleich gewertet werden. Ihr Zeichenkontingent wächst mit Ihrem Plan; die aktuellen Limits pro Plan finden Sie auf der Preisseite.
Wenn das Limit erreicht ist, pausiert die Indizierung, bis Sie Inhalte entfernen oder ein Upgrade durchführen.
Best Practices
- Inhalte klar und gut strukturiert halten — Die KI liefert mit organisierten, lesbaren Inhalten bessere Ergebnisse
- Nur relevante Seiten indizieren — Schließen Sie Login-Seiten, Administrationsbereiche und doppelte Inhalte aus
- CSS-Selektoren verwenden, um sich auf den Hauptinhalt zu konzentrieren und Navigation, Fußzeilen sowie Werbung auszuschließen
- Das Fragen-Dashboard überwachen, um Wissenslücken zu identifizieren und fehlende Inhalte hinzuzufügen
- Datenquellen regelmäßig aktualisieren, um genaue und aktuelle Antworten zu gewährleisten
- Kategorien nutzen, um große Mengen an Datenquellen zu organisieren
- Auf eine Sprache beschränken, wenn Ihre Website identische Inhalte in mehreren Sprachen bereitstellt
- Verbundene Ordner auf einen gepflegten Ordner ausrichten, nicht auf das gesamte Laufwerk, ein verwalteter Ordner "Chatbot-Wissen" ist deutlich besser, als jeden herumliegenden Entwurf und alten Vertrag zu indizieren
- Den Speicherort-Schalter für öffentliche Widgets deaktiviert lassen, für interne Assistenten und Team-Wikis aktivieren
