Entraînez votre Chatbot IA avec des sources de Connaissances

Sources de données

Les sources de données fournissent les informations que votre chatbot utilise pour apporter des réponses fondées. Ouvrez Tableau de bord → votre assistant → Connaissances pour ajouter des URL de sites web, importer des fichiers, saisir du texte directement ou connecter des plateformes externes comme Confluence, Notion, SharePoint, Google Drive, Nextcloud ou SFTP/FTPS.

L'onglet Connaissances affiche également l'utilisation des caractères à l'échelle du compte. Son tableau des sources permet la recherche et le filtrage par type ou catégorie, et indique l'état d'indexation ainsi que la dernière mise à jour de chaque source. Les actions de ligne vous permettent de réimporter, modifier, inspecter, télécharger, arrêter ou supprimer une source lorsque cette option est prise en charge. Sélectionnez plusieurs lignes pour réindexer ou supprimer en masse.

Vous pouvez aussi connecter un dossier, qu'il s'agisse de SharePoint, Google Drive, Nextcloud ou d'un serveur SFTP. Tout son contenu est indexé automatiquement, et chaque modification est prise en compte lors de la synchronisation suivante sans que personne n'ait besoin de réimporter un fichier. Consultez Dossiers connectés.

URL de sites web

Saisissez des URL à explorer et à indexer. WebChatAgent explore automatiquement les pages et extrait le contenu pour la base de connaissances de votre chatbot.

Ajouter un site web

  1. Cliquez sur Ajouter une source de données dans l'onglet Connaissances et choisissez Site web
  2. Saisissez l'URL du site web (par exemple example.com, le préfixe https:// est ajouté automatiquement)
  3. Configurez les paramètres avancés facultatifs (voir ci-dessous)
  4. Cliquez sur Ajouter pour lancer l'exploration

Paramètres avancés

ChampDescriptionPar défaut
Profondeur d'explorationNombre de niveaux de liens à explorer. 0 = cette page uniquement, vide = profondeur illimitée.Vide (illimité)
Sélecteurs CSSSélecteurs CSS séparés par des virgules pour cibler des zones de contenu spécifiques (par exemple article, .content, #main-body). Lorsqu'ils sont définis, seul le contenu situé dans ces sélecteurs est extrait.Vide (page entière)
Modèles d'URL à exclureModèles d'URL séparés par des virgules à ignorer lors de l'exploration (par exemple /login, /impressum, */amp/*).Vide
Intervalle de ré-indexation automatiqueFréquence de réexploration et de mise à jour automatique du contenu. Options : Tous les 3 jours, Tous les 7 jours, Tous les 30 jours (les forfaits Premium et Enterprise bénéficient également de l'option Quotidien).Désactivé
La réindexation automatique est disponible à partir du forfait Standard. Les forfaits Gratuit et Basique doivent effectuer la réindexation manuellement. L'intervalle Quotidien est réservé aux forfaits Premium et Enterprise.

Quand utiliser les sélecteurs CSS

Les sélecteurs CSS vous aident à extraire uniquement le contenu pertinent d'une page. Cela est utile lorsque :

  • Vos pages comportent des menus de navigation, des pieds de page ou des barres latérales que vous souhaitez exclure
  • Vous souhaitez vous concentrer uniquement sur le contenu de l'article principal
  • La page contient des publicités ou des widgets sans rapport

Exemple : pour extraire uniquement la zone de contenu principal et ignorer la navigation :

article, .main-content, #post-body

Quand utiliser les modèles d'URL à exclure

Les modèles d'exclusion empêchent des pages spécifiques d'être indexées (ajoutées à la base de connaissances de votre chatbot). Cas d'utilisation courants :

  • Pages de connexion/administration : /login, /admin, /wp-admin
  • Pages juridiques : /impressum, /privacy-policy, /terms
  • Contenu en double : */amp/*, */print/*
  • Archives de catégories/étiquettes : /category/*, /tag/* (souvent du contenu en double)
  • Paramètres de requête : ?hitsPerPage : exclut toutes les URL contenant ce paramètre (par exemple les pages de résultats de recherche avec pagination)

Détails importants :

  • Les modèles sont sensibles à la casse. /About et /about sont traités comme deux modèles différents. Assurez-vous que vos modèles respectent exactement la casse utilisée dans vos URL.
  • Les pages exclues ne sont pas indexées, mais leurs liens sont tout de même suivis. Le robot d'exploration découvrira et explorera tout de même les pages liées à partir des URL exclues, seule la page exclue elle-même n'est pas indexée. Cela signifie qu'exclure une page de catégorie comme /blog/category/news empêchera cette page de liste d'être indexée, mais les articles de blog individuels vers lesquels elle renvoie seront tout de même explorés et indexés (sauf s'ils correspondent également à un modèle d'exclusion).

Considérations linguistiques

Si votre site web comporte du contenu multilingue (par exemple /en/about et /de/about), il est fortement recommandé d'indexer une seule langue. Indexer le même contenu dans plusieurs langues entraîne :

  • Des informations en double consommant inutilement votre quota de contenu (mesuré en caractères)
  • Une qualité de récupération inférieure, car l'IA peut extraire des réponses dans la mauvaise langue
  • Un budget de jetons gaspillé sur du contenu redondant

Le chatbot répond dans la langue du visiteur, quelle que soit la langue indexée, il n'y a donc aucun intérêt à indexer deux fois la même page. Utilisez le champ Modèles d'URL à exclure pour ignorer les dossiers des autres langues (par exemple /de/*, /fr/*).

Choisissez la langue que vos clients utilisent le plus fréquemment, ou la langue qui correspond au public principal de votre chatbot.

Sources de données textuelles

Vous pouvez saisir manuellement du contenu textuel en tant que source de données. Cela est idéal pour les FAQ, les connaissances internes ou le contenu qui n'existe pas sur un site web.

Ajouter un document texte

  1. Cliquez sur Ajouter une source de données dans l'onglet Connaissances et choisissez Saisie de texte
  2. Remplissez les champs :
ChampDescriptionContraintes
Nom du documentUn nom descriptif pour ce document. Laissez vide pour un nom généré par l'IA.Facultatif
CatégorieOrganisez les documents par catégorie. Sélectionnez une catégorie existante ou saisissez-en une nouvelle. Laissez vide pour une détection automatique.Facultatif
ContenuLe contenu textuel réel que le chatbot utilisera.Obligatoire, 50 000 caractères au maximum

Téléchargement de fichiers

Importez des documents directement dans la base de connaissances de votre chatbot.

Formats pris en charge

FormatDescription
PDFManuels, rapports, brochures, livres blancs
DOCXDocuments Word
TXTFichiers texte brut
MDDocuments Markdown
XLSXFeuilles de calcul

Limites de taille de fichier

ForfaitTaille de fichier maximale
Gratuit1 Mo
Basique5 Mo
Standard10 Mo
Premium50 Mo
EnterpriseIllimité

Nom de fichier automatique par l'IA

Sur les forfaits payants, si vous importez un fichier avec un nom générique (par exemple document.txt ou untitled.pdf), le système génère automatiquement un nom de fichier descriptif basé sur le contenu du fichier.

Confluence Cloud

Connectez votre instance Confluence Cloud pour importer des pages wiki directement dans la base de connaissances de votre chatbot.

Confluence est disponible uniquement sur les forfaits Premium et Enterprise.

Ajouter une source Confluence

  1. Cliquez sur Ajouter une source de données et sélectionnez Confluence Cloud
  2. Saisissez votre URL Confluence (par exemple https://yourcompany.atlassian.net)
  3. Saisissez l'adresse e-mail associée à votre compte Atlassian
  4. Saisissez un jeton API provenant de Jetons API Atlassian
  5. Cliquez sur Tester la connexion, les espaces disponibles seront chargés
  6. Sélectionnez les espaces à indexer (laissez vide pour importer tous les espaces accessibles)
  7. Configurez l'intervalle de synchronisation et cliquez sur Créer et indexer

Modifier une source Confluence

Après avoir ajouté une source Confluence, cliquez sur l'icône de modification pour changer :

  • Sélection des espaces : ajouter ou supprimer des espaces à indexer
  • Inclure les sous-pages : inclure ou non les pages imbriquées
  • Intervalle de réindexation : fréquence de synchronisation automatique

Les modifications prennent effet lors de la réindexation suivante.

Synchronisation incrémentielle

Les sources Confluence prennent en charge la synchronisation incrémentielle. Seules les pages ayant été modifiées depuis la dernière synchronisation sont réindexées, ce qui rend les mises à jour rapides et efficaces.

Notion

Connectez Notion pour importer des pages et des bases de données dans la base de connaissances de votre chatbot.

Notion est disponible uniquement sur les forfaits Premium et Enterprise.

Ajouter une source Notion

  1. Cliquez sur Ajouter une source de données et sélectionnez Notion
  2. Créez une Internal Integration sur Notion Integrations
  3. Partagez les pages ou bases de données souhaitées avec votre intégration dans Notion
  4. Saisissez le jeton d'intégration (commence par ntn_ ou secret_)
  5. Cliquez sur Tester la connexion, les bases de données disponibles seront chargées
  6. Sélectionnez les bases de données à indexer (laissez vide pour importer toutes les pages accessibles)
  7. Configurez l'intervalle de synchronisation et cliquez sur Create & Index

Modifier une source Notion

Après avoir ajouté une source Notion, cliquez sur l'icône de modification pour changer :

  • Sélection des bases de données, pour ajouter ou supprimer des bases de données à indexer
  • Inclure les sous-pages, pour inclure ou non les pages imbriquées
  • Intervalle de réindexation, pour définir la fréquence de synchronisation automatique

Synchronisation incrémentielle

Les sources Notion prennent en charge la synchronisation incrémentielle. Seules les pages modifiées depuis la dernière synchronisation sont traitées à nouveau.

Dossiers connectés

Un dossier connecté est un dossier qui reste connecté. Vous pointez le chatbot vers un dossier dans SharePoint, Google Drive, Nextcloud ou sur un serveur SFTP une seule fois ; à partir de là, il lit chaque fichier indexable qu'il contient et vérifie selon la planification de votre choix. Modifiez un PDF dans ce dossier et le chatbot prend connaissance de la nouvelle version après la synchronisation suivante. Supprimez un fichier et il disparaît de la base de connaissances. Personne n'a besoin de réimporter quoi que ce soit.

Les dossiers connectés sont disponibles sur les forfaits Premium et Enterprise.

Ce qui est indexé

InclusIgnoré
PDF, DOCX, XLSX, XLS, CSV, TXT, MDTout le reste, images, vidéos, archives ZIP, PPTX
Fichiers dans les sous-dossiers (facultatif, activé par défaut)Fichiers dépassant la limite de téléversement de votre forfait
Google Docs, Sheets et Slides (Drive uniquement, convertis automatiquement)Fichiers correspondant à vos règles d'exclusion

Les fichiers ignorés sont répertoriés dans la boîte de dialogue Fichiers indexés avec le motif, ce qui vous permet de voir d'un coup d'œil pourquoi un élément est manquant.

Comment la synchronisation est maintenue

Chaque fichier porte un marqueur de version issu du système de stockage, SharePoint et Google Drive fournissent une empreinte de contenu, SFTP et Nextcloud utilisent la taille et la date de modification. À chaque synchronisation, le chatbot compare les marqueurs et télécharge uniquement ce qui a réellement changé. Un fichier inchangé ne coûte rien : pas de téléchargement, pas de traitement, pas de quota.

Votre quota de caractères prend en compte ce qui est stocké, et non la fréquence de lecture. Un dossier de 500 fichiers qui ne changent jamais consomme exactement la même chose qu'au premier jour, quelle que soit la fréquence de synchronisation.

Choisissez l'intervalle de synchronisation lors de la connexion du dossier : quotidien, tous les 3 jours, hebdomadaire ou tous les 30 jours. Vous pouvez également déclencher une synchronisation manuelle à tout moment avec l'icône d'actualisation.

Indiquer aux utilisateurs l'emplacement d'un fichier

Désactivée par défaut, une option par dossier : Indiquer l'emplacement de stockage aux utilisateurs. Lorsqu'elle est activée, le chatbot peut mentionner le chemin du dossier dans une réponse, et chaque réponse affiche une carte par fichier utilisé, nom de fichier, chemin, système de stockage et un lien direct vers SharePoint, Drive ou Nextcloud lorsqu'il existe.

Laissez-la désactivée pour un widget de site web public. Sinon, chaque visiteur peut voir la structure interne de vos dossiers. Lorsque l'option est désactivée, ni le nom de fichier ni le chemin ne sont jamais envoyés au modèle IA, qui ne peut donc pas les divulguer dans le texte.

Exclure des fichiers

Ajoutez une règle par ligne sous Ignorer certains fichiers :

RègleCe qu'elle ignore
/Archive/**L'ensemble du dossier Archive avec tout son contenu
*_internal*Chaque fichier contenant _internal dans son nom
*.csvChaque fichier CSV
/HR/Salaries/**Un sous-dossier spécifique

* représente tous les caractères au sein d'un même segment de chemin, ** représente un nombre quelconque de sous-dossiers. Les fichiers exclus sont supprimés de la base de connaissances lors de la synchronisation suivante.

Vous pouvez également exclure un fichier spécifique a posteriori : ouvrez Fichiers indexés, repérez la ligne correspondante et cliquez sur Supprimer de l'index. Il restera exclu lors des synchronisations ultérieures.


SharePoint / OneDrive

Lit une bibliothèque de documents depuis Microsoft 365. Votre administrateur Microsoft enregistre une application une seule fois et vous fournit trois valeurs.

Obtenir les identifiants

  1. Connectez-vous au centre d'administration Microsoft Entra avec un compte autorisé à enregistrer des applications
  2. Allez dans Identité → Applications → Inscriptions d'applications et cliquez sur Nouvelle inscription
  3. Donnez-lui un nom (par exemple WebChatAgent Knowledge), laissez les valeurs par défaut, cliquez sur Inscrire
  4. Sur la page d'aperçu, copiez deux valeurs :
    • ID de l'annuaire (locataire)
    • ID d'application (client)
  5. Allez dans Certificats & secrets → Nouveau secret client, choisissez une date d'expiration, cliquez sur Ajouter, et copiez immédiatement la colonne Valeur, Microsoft ne l'affiche qu'une seule fois
  6. Allez dans Autorisations d'API → Ajouter une autorisation → Microsoft Graph → Autorisations d'application et ajoutez :
    • Sites.Selected, recommandé : aucun accès tant qu'un administrateur n'a pas accordé explicitement un site, ou
    • Sites.Read.All, accès en lecture à tous les sites SharePoint ; plus simple, mais nettement plus étendu
  7. Cliquez sur Accorder le consentement de l'administrateur, sans cela l'application n'a aucun accès
  8. Pour Sites.Selected, un administrateur doit en outre accorder à l'application l'accès en lecture au site concerné (via PowerShell ou Graph Explorer, autorisation Sites.Selected sur ce site)
Le secret client expire, Microsoft autorise 24 mois au maximum. À l'expiration, le dossier cesse de se synchroniser et le tableau de bord indique Identifiants non valides. Définissez un rappel dans votre calendrier et collez un nouveau secret dans la boîte de dialogue de modification avant cette date.

Connexion

  1. Ajouter une source de données → SharePoint / OneDrive
  2. Saisissez l'ID de locataire, l'ID client et le secret client
  3. Vous pouvez éventuellement saisir l'URL du site (par exemple https://contoso.sharepoint.com/sites/marketing) pour accéder directement à un site
  4. Tester la connexion, les bibliothèques de documents auxquelles vous avez accès sont chargées
  5. Choisissez la bibliothèque, parcourez jusqu'au dossier souhaité
  6. Choisissez l'intervalle de synchronisation et cliquez sur Connecter et lire

Google Drive

Lit un dossier Drive à l'aide d'un compte de service Google, un compte technique qui appartient à votre organisation et non à une personne physique, évitant ainsi toute rupture de service lors du départ d'un employé.

Obtenir les identifiants

  1. Ouvrez la Google Cloud Console et sélectionnez un projet (ou créez-en un, c'est gratuit)
  2. Allez dans APIs & Services → Library, recherchez Google Drive API, puis cliquez sur Enable
  3. Allez dans APIs & Services → Credentials → Create credentials → Service account
  4. Donnez-lui un nom, cliquez sur Create and continue, ignorez les étapes facultatives d'attribution de rôle, cliquez sur Done
  5. Cliquez sur le nouveau compte de service, ouvrez l'onglet Keys, choisissez Add key → Create new key → JSON. Un fichier .json est téléchargé, ce fichier constitue votre identifiant
  6. Copiez l'adresse e-mail du compte de service, elle ressemble à name@project-id.iam.gserviceaccount.com

Accordez maintenant à cette adresse l'accès à vos fichiers, selon l'une des deux méthodes suivantes :

  • Partager le dossier (le plus simple) : dans Google Drive, faites un clic droit sur le dossier → Partager → collez l'adresse du compte de service → rôle LecteurPartager
  • Délégation à l'échelle du domaine (Google Workspace uniquement) : un administrateur Workspace autorise l'ID client du compte de service pour le scope https://www.googleapis.com/auth/drive.readonly sous Console d'administration → Sécurité → Contrôle des API → Délégation à l'échelle du domaine. Saisissez ensuite l'e-mail de l'utilisateur dont les fichiers doivent être lus dans le champ Act as user. Utilisez cette option lorsque votre Workspace bloque le partage externe, car un compte de service est considéré comme externe.
Un compte de service ne dispose d'aucun espace de stockage Drive propre. Il peut uniquement lire ce qui a été partagé avec lui, ce qui correspond exactement au comportement recherché ici.

Connexion

  1. Ajouter une source de données → Google Drive
  2. Collez le contenu du fichier de clé JSON
  3. Renseignez le champ Act as user si nécessaire (délégation à l'échelle du domaine uniquement)
  4. Collez le lien du dossier ou son identifiant : ouvrez le dossier dans Drive et copiez l'URL ; l'identifiant correspond à la partie située après /folders/
  5. Tester la connexion, choisissez l'intervalle, cliquez sur Connecter et lire

Les fichiers Google Docs, Sheets et Slides ne contiennent pas de données binaires brutes, ils sont donc convertis à la volée : Docs en Markdown, Sheets en Excel (première feuille uniquement), Slides en texte brut. Google limite cette conversion à 10 Mo par fichier ; tout élément plus volumineux est indiqué comme ignoré.


Nextcloud / WebDAV

Fonctionne avec Nextcloud, ownCloud et tout autre serveur WebDAV, y compris l'interface WebDAV intégrée à de nombreux NAS.

Obtenir les identifiants

Pour Nextcloud et ownCloud, utilisez un mot de passe d'application, jamais le mot de passe de votre compte :

  1. Connectez-vous à votre Nextcloud
  2. Cliquez sur votre avatar → Paramètres → Sécurité
  3. Faites défiler jusqu'à Appareils & sessions, saisissez un nom (par exemple WebChatAgent), cliquez sur Créer un nouveau mot de passe d'application
  4. Copiez le mot de passe généré, il ne sera affiché qu'une seule fois

Un mot de passe d'application peut être révoqué individuellement et ne permet pas de se connecter à l'interface web, ce qui limite les risques en cas de fuite. Pour les autres serveurs WebDAV, utilisez le nom d'utilisateur et le mot de passe fournis par votre administrateur.

Connexion

  1. Ajouter une source de données → Nextcloud / WebDAV
  2. Server URL : uniquement l'adresse, sans chemin : https://cloud.example.com
  3. Nom d'utilisateur et mot de passe d'application
  4. WebDAV path : laissez vide pour Nextcloud et ownCloud, ils utilisent le chemin standard. Renseignez ce champ uniquement pour les autres serveurs WebDAV (votre administrateur le connaît, souvent sous la forme /dav ou /webdav)
  5. Tester la connexion, naviguez jusqu'au dossier souhaité, choisissez l'intervalle, cliquez sur Connecter et lire
Le serveur doit être accessible via HTTPS. Le protocole HTTP non chiffré est rejeté, tout comme les adresses situées sur des réseaux privés, un chatbot hébergé dans le cloud ne pouvant pas joindre une adresse du type 192.168.x.x.

SFTP / FTPS

Pour votre propre serveur, une offre d'hébergement ou un NAS avec accès SSH.

Prérequis

Demandez au gestionnaire du serveur :

  • L'adresse du serveur et le port (SFTP utilise généralement le 22, FTPS le 21 ou le 990)
  • Le nom d'utilisateur
  • Le mot de passe ou, idéalement, une clé SSH

Une clé SSH est préférable à un mot de passe : elle ne peut pas être devinée et vous pouvez la révoquer sans impacter les identifiants des autres utilisateurs. Si vous devez en créer une vous-même, exécutez la commande suivante sur Mac ou Linux :

ssh-keygen -t ed25519 -f ~/wca-key -C "webchatagent"

Cette commande génère deux fichiers. Collez le contenu de wca-key (la clé privée) dans la boîte de dialogue, et transmettez wca-key.pub (la clé publique) à votre administrateur, qui l'ajoutera au fichier ~/.ssh/authorized_keys du compte concerné. Si vous avez défini une phrase secrète, saisissez-la dans le champ dédié.

Connexion

  1. Ajouter une source de données → SFTP / FTPS
  2. Choisissez le protocole, saisissez l'adresse du serveur, le port et le nom d'utilisateur
  3. Saisissez le mot de passe, ou activez l'option Use SSH key instead of password et collez la clé privée
  4. Tester la connexion : avec SFTP, une empreinte numérique du serveur s'affiche
  5. Comparez cette empreinte avec celle fournie par votre administrateur et confirmez-la. Elle est enregistrée et vérifiée à chaque synchronisation ultérieure ; si elle change, la synchronisation s'interrompt au lieu de se connecter silencieusement à une autre machine
  6. Naviguez jusqu'au dossier souhaité, choisissez l'intervalle, cliquez sur Connecter et lire
Le protocole FTP non chiffré n'est pas pris en charge, car le mot de passe circulerait en clair. FTPS (AUTH TLS) et SFTP sont tous deux acceptés.

Utilité de l'option « toujours relire »

Le protocole SFTP ne fournit pas d'empreinte de contenu ; le chatbot compare la taille et l'heure de modification. Certains outils de synchronisation (rsync -t, certaines tâches de sauvegarde) conservent ces deux métadonnées même lorsque le contenu a changé, ce qui rendrait la modification indétectable. Pour ces situations, l'option Always read files in again est disponible dans la boîte de dialogue de modification. Elle relit l'intégralité des fichiers à chaque synchronisation : le processus est plus lent, mais aucune modification n'est omise. Laissez cette option désactivée sauf si vous rencontrez précisément ce cas de figure.


En cas de problème

Ce que vous voyezSignificationAction à mener
Credentials no longer validLe mot de passe, le secret ou la clé a été rejeté. La synchronisation automatique est suspendue pour éviter de tester un mot de passe erroné toutes les heures.Saisissez à nouveau les identifiants dans la boîte de dialogue de modification. Les secrets clients SharePoint arrivent à expiration, c'est la cause la plus fréquente.
Folder not reachableLe dossier a été renommé, déplacé ou supprimé, ou l'accès a été révoqué.Vérifiez l'état du dossier sur le système de stockage. Votre contenu indexé est délibérément conservé en l'état jusqu'à la résolution du problème.
Server fingerprint changed (SFTP)Le serveur présente une clé SSH différente de celle configurée initialement.Consultez votre administrateur. Ce comportement est normal après la réinstallation d'un serveur, mais correspond également à une tentative d'usurpation du serveur. Ne confirmez à nouveau qu'après en avoir identifié la cause exacte.
Un fichier unique affiche failedCe fichier précis n'a pas pu être lu : PDF corrompu, document protégé par mot de passe ou format inattendu.Le reste des éléments a été indexé. Ouvrez Indexed files pour afficher le motif de l'échec.
Un fichier unique affiche too largeLa taille du fichier dépasse la limite autorisée par votre forfait.Fractionnez le fichier ou mettez à niveau votre forfait.

Catégories

Les catégories vous permettent d'organiser vos sources de données. Vous pouvez :

  • Attribuer une catégorie lors de l'ajout ou de la modification d'une source de données
  • Filtrer la liste des sources de données par catégorie
  • Utiliser les catégories pour regrouper des contenus similaires (par exemple « Produits », « Support », « Juridique »)

Les catégories sont enregistrées en minuscules et sont partagées entre tous les types de sources de données.

Liste des sources de données

La liste des sources de données affiche chaque source avec son statut actuel :

StatutDescription
IndexéTraité avec succès et disponible pour le Chatbot
En attenteEn cours de traitement ou en file d'attente pour l'indexation
Réindexation requiseAffiché sous la forme d'un badge orange. Les données indexées de la source ne sont plus utilisables, le plus souvent après avoir changé le fournisseur d'IA du Chatbot, et doivent être reconstruites avant que le Chatbot puisse y puiser ses réponses. Voir Réindexation.
ErreurLe traitement a échoué, vérifiez l'URL source ou le fichier puis réessayez

Vous pouvez filtrer la liste par :

  • Recherche : trouvez des sources par nom ou par URL. Les dossiers connectés correspondent à leur nom d'affichage et au chemin du dossier, donc saisir sharepoint ou une partie du chemin permet de les trouver
  • Type : filtrez par Site web, Fichier, Confluence, Notion, SharePoint, Google Drive, Nextcloud / WebDAV ou SFTP / FTPS
  • Catégorie : filtrez par catégorie attribuée

Rechercher dans le contenu (le bouton situé au-dessus de la liste) recherche dans le texte indexé plutôt que dans les noms des sources, et couvre également les dossiers connectés, ce qui est pratique pour trouver de quel fichier provient une phrase précise.

Modifier les sources de données

  • URL de sites web : cliquez sur l'icône de modification pour changer l'URL, la profondeur de crawl, les sélecteurs CSS, les règles d'exclusion et l'intervalle de réindexation
  • Documents texte : cliquez sur l'icône de modification pour changer le nom, la catégorie et le contenu
  • Fichiers : cliquez sur l'icône de modification pour changer le nom et la catégorie (le contenu ne peut pas être modifié directement, réimportez le fichier à la place)
  • Sources Confluence : cliquez sur l'icône de modification pour changer la sélection de l'espace, l'inclusion des pages enfants et l'intervalle de synchronisation
  • Sources Notion : cliquez sur l'icône de modification pour changer la sélection de la base de données, l'inclusion des pages enfants et l'intervalle de synchronisation
  • Dossiers connectés : cliquez sur l'icône de modification pour changer le nom d'affichage, l'intervalle de synchronisation, l'inclusion des sous-dossiers, l'option de localisation du stockage, les règles d'exclusion, la priorité de recherche et pour saisir à nouveau les identifiants. Le contenu des fichiers eux-mêmes ne peut pas être modifié ici, le système de stockage restant la source unique de vérité et toute modification étant écrasée lors de la synchronisation suivante

Réindexation

Vous pouvez réindexer manuellement des sources de données individuelles pour mettre à jour leur contenu. Cela est utile lorsque :

  • Le contenu du site web a changé
  • Vous souhaitez actualiser après avoir corrigé des sélecteurs CSS ou des règles d'exclusion
  • Une source qui était en erreur a été corrigée

Réindexation requise (badge orange)

Lorsqu'une source de données affiche un badge orange "Réindexation requise", son contenu indexé ne peut plus être utilisé par le Chatbot et doit être reconstruit.

Cela se produit automatiquement lorsque vous changez le fournisseur d'IA du Chatbot (par exemple en passant d'OpenAI à Google Gemini) dans les paramètres du Chatbot. Chaque fournisseur stocke votre contenu dans son propre format d'embedding, et ces formats ne sont pas interchangeables. Dès que le fournisseur change, les anciennes données indexées sont effacées et chaque source de données est marquée Réindexation requise.

Tant que vous n'avez pas réindexé, le Chatbot n'a aucune connaissance exploitable issue des sources concernées. Il se rabattra sur des réponses génériques ou des messages de type "Je ne sais pas" au lieu de répondre à partir de votre contenu. Réindexez dès que vous voyez le badge orange.

Lorsqu'au moins une source nécessite une réindexation, le bouton Tout réimporter devient disponible en haut de l'onglet Connaissances. Cliquez dessus pour reconstruire toutes les sources affectées en une seule fois, ou utilisez l'action d'actualisation sur une source individuelle pour ne réindexer que celle-ci.

Vous n'avez rien à ajouter de nouveau : la réindexation réutilise vos URL, fichiers, textes, Confluence, Notion et dossiers connectés existants. Les sites web sont analysés à nouveau et les sources externes resynchronisées, donc une base de connaissances volumineuse peut prendre quelques minutes. Une fois l'opération terminée, le badge disparaît et le Chatbot répond à nouveau à partir de votre contenu.

Pour les dossiers connectés, c'est le seul cas où chaque fichier est téléchargé et traité à nouveau, qu'il ait été modifié ou non, car les données stockées ont été supprimées et il ne reste rien pour établir une comparaison.

Limites de contenu

Le volume de contenu d'entraînement est mesuré en caractères de texte indexé sur l'ensemble de vos sources de données (pages web, fichiers, entrées Q&A). Ce système remplace l'ancienne limite par page : quelques pages longues et de nombreuses pages courtes sont donc comptabilisées de la même manière. Votre quota de caractères augmente avec votre forfait. Pour consulter les limites actuelles par forfait, rendez-vous sur la page des tarifs.

Lorsque la limite est atteinte, l'indexation est suspendue jusqu'à ce que vous supprimiez du contenu ou mettiez à niveau votre forfait.

Bonnes pratiques

  • Gardez un contenu clair et bien structuré : l'IA fonctionne mieux avec un contenu organisé et lisible
  • Indexez uniquement les pages pertinentes : excluez les pages de connexion, les espaces d'administration et les contenus en double
  • Utilisez des sélecteurs CSS pour cibler le contenu principal et exclure la navigation, les pieds de page et les publicités
  • Consultez le tableau de bord des questions pour identifier les lacunes de connaissances et ajouter le contenu manquant
  • Mettez à jour vos sources de données régulièrement pour garantir des réponses exactes et à jour
  • Utilisez des catégories pour organiser un grand nombre de sources de données
  • Limitez-vous à une seule langue lorsque votre site propose un contenu identique dans plusieurs langues
  • Pointez les dossiers connectés vers un dossier ciblé, et non vers l'intégralité du disque : un dossier "Connaissances Chatbot" géré par une personne est bien plus efficace que l'indexation de chaque brouillon ou ancien contrat qui traîne
  • Laissez l'option de localisation de stockage désactivée pour les widgets publics, et activez-la pour les assistants internes et les wikis d'équipe