Addestra il tuo Chatbot AI con le Origini delle Conoscenze

Fonti di Dati

Le fonti di dati forniscono le informazioni utilizzate dal chatbot per elaborare risposte fondate. Apri Bacheca → il tuo assistente → Conoscenze per aggiungere URL di siti web, caricare file, inserire testo direttamente o connettere piattaforme esterne come Confluence, Notion, SharePoint, Google Drive, Nextcloud o SFTP/FTPS.

La scheda Conoscenze mostra anche l'utilizzo dei caratteri a livello di account. La tabella delle origini consente di eseguire ricerche e applicare filtri per tipo o categoria, mostrando lo stato di indicizzazione e l'ultimo aggiornamento di ogni fonte. Le azioni di riga permettono di reimportare, modificare, ispezionare, scaricare, interrompere o eliminare una fonte, ove supportato. Seleziona più righe per la reindicizzazione o l'eliminazione in blocco.

Puoi anche connettere una cartella da SharePoint, Google Drive, Nextcloud o un server SFTP. Tutto il contenuto viene indicizzato automaticamente e qualsiasi modifica viene acquisita alla sincronizzazione successiva senza dover ricaricare i file manualmente. Consulta Cartelle collegate.

URL del Sito Web

Inserisci gli URL da sottoporre a scansione e indicizzare. WebChatAgent esegue automaticamente la scansione delle pagine ed estrae i contenuti per la Base di conoscenza del chatbot.

Aggiungere un Sito Web

  1. Fai clic su Aggiungi Fonte di Dati nella scheda Conoscenze e seleziona Sito Web
  2. Inserisci l'URL del sito web (ad es. example.com, il prefisso https:// viene aggiunto automaticamente)
  3. Configura le impostazioni avanzate opzionali (vedi sotto)
  4. Fai clic su Aggiungi per avviare la scansione

Impostazioni Avanzate

CampoDescrizionePredefinito
Crawl DepthQuanti livelli di link approfondire durante la scansione. 0 = solo questa pagina, vuoto = profondità illimitata.Vuoto (illimitato)
CSS SelectorsSelettori CSS separati da virgola per mirare ad aree di contenuto specifiche (ad es. article, .content, #main-body). Se impostati, viene estratto solo il contenuto interno a questi selettori.Vuoto (pagina intera)
Exclude URL PatternsPattern di URL separati da virgola da saltare durante la scansione (ad es. /login, /impressum, */amp/*).Vuoto
Intervallo di reindicizzazione automaticaFrequenza con cui ripetere automaticamente la scansione e aggiornare i contenuti. Opzioni: Ogni 3 giorni, Ogni 7 giorni, Ogni 30 giorni (i piani Premium ed Enterprise includono anche Giornaliero).Disattivato
La Reindicizzazione automatica è disponibile con il piano Standard o superiore. I piani Gratuito e Basic richiedono la reindicizzazione manuale. L'intervallo Giornaliero è riservato ai piani Premium ed Enterprise.

Quando utilizzare i selettori CSS

I selettori CSS consentono di estrarre solo i contenuti rilevanti da una pagina. Questa opzione è utile quando:

  • Le pagine contengono menu di navigazione, piè di pagina o barre laterali da escludere
  • Vuoi concentrarti solo sul contenuto principale dell'articolo
  • La pagina contiene annunci pubblicitari o widget non pertinenti

Esempio: Per estrarre solo l'area del contenuto principale ed escludere la navigazione:

article, .main-content, #post-body

Quando utilizzare i pattern di esclusione URL

I pattern di esclusione impediscono che pagine specifiche vengano indicizzate (ovvero aggiunte alla Base di conoscenza del chatbot). Casi d'uso comuni:

  • Pagine di login/amministrazione: /login, /admin, /wp-admin
  • Pagine legali: /impressum, /privacy-policy, /terms
  • Contenuti duplicati: */amp/*, */print/*
  • Archivi di categorie/tag: /category/*, /tag/* (spesso contenuti duplicati)
  • Parametri di query: ?hitsPerPage esclude tutti gli URL contenenti questo parametro (ad es. pagine dei risultati di ricerca con paginazione)

Dettagli importanti:

  • I pattern fanno distinzione tra maiuscole e minuscole. /About e /about vengono trattati come pattern diversi. Assicurati che i pattern corrispondano esattamente all'uso di maiuscole e minuscole presente negli URL.
  • Le pagine escluse non vengono indicizzate, ma i relativi link continuano a essere seguiti. Il crawler rileverà ed eseguirà comunque la scansione delle pagine collegate dagli URL esclusi; solo la pagina esclusa in sé viene ignorata durante l'indicizzazione. Di conseguenza, escludendo una pagina di categoria come /blog/category/news si impedirà l'indicizzazione dell'elenco, ma i singoli post del blog collegati verranno comunque scansionati e indicizzati (a meno che non corrispondano anch'essi a un pattern di esclusione).

Considerazioni sulla lingua

Se il tuo sito web presenta contenuti multilingue (ad es. /en/about e /it/about), è fortemente consigliato indicizzare una sola lingua. L'indicizzazione dello stesso contenuto in più lingue comporta:

  • Informazioni duplicate che consumano inutilmente la quota di contenuti disponibile (misurata in caratteri)
  • Minore qualità di recupero poiché l'IA potrebbe estrarre risposte dalla lingua errata
  • Budget di token sprecato per contenuti ridondanti

Il chatbot risponde nella lingua del visitatore a prescindere dalla lingua indicizzata, pertanto non vi è alcun vantaggio nell'indicizzare la stessa pagina due volte. Utilizza il campo Exclude URL Patterns per saltare le cartelle delle altre lingue (ad es. /de/*, /fr/*).

Scegli la lingua utilizzata più di frequente dai tuoi clienti, oppure la lingua che corrisponde al pubblico principale del tuo chatbot.

Fonti di dati testuali

È possibile inserire manualmente contenuti testuali come fonte di dati. Questa soluzione è ideale per FAQ, documentazione interna o contenuti non presenti su un sito web.

Aggiungere un documento di testo

  1. Fai clic su Aggiungi Fonte di Dati nella scheda Conoscenze e seleziona Input di Testo
  2. Compila i campi:
CampoDescrizioneVincoli
Document NameUn nome descrittivo per questo documento. Lascia vuoto per generare il nome tramite IA.Opzionale
CategoriaOrganizza i documenti per categoria. Seleziona una categoria esistente o inseriscine una nuova. Lascia vuoto per il rilevamento automatico.Opzionale
ContentIl contenuto testuale effettivo che verrà utilizzato dal chatbot.Obbligatorio, massimo 50.000 caratteri

Caricamento file

Carica i documenti direttamente nella Base di conoscenza del chatbot.

Formati supportati

FormatoDescrizione
PDFManuali, report, brochure, whitepaper
DOCXDocumenti Word
TXTFile di testo semplice
MDDocumenti Markdown
XLSXFogli di calcolo

Limiti sulle dimensioni dei file

PianoDimensione massima del file
Gratuito1 MB
Basic5 MB
Standard10 MB
Premium50 MB
EnterpriseIllimitato

Denominazione automatica dei file con IA

Nei piani a pagamento, se carichi un file con un nome generico (ad es. document.txt o untitled.pdf), il sistema genera automaticamente un nome descrittivo basato sul contenuto del file.

Confluence Cloud

Connetti la tua istanza di Confluence Cloud per importare le pagine wiki direttamente nella Base di conoscenza del chatbot.

Confluence è disponibile solo nei piani Premium ed Enterprise.

Aggiungere una fonte Confluence

  1. Fai clic su Aggiungi Fonte di Dati e seleziona Confluence Cloud
  2. Inserisci l'URL di Confluence (ad es. https://yourcompany.atlassian.net)
  3. Inserisci l'indirizzo email associato al tuo account Atlassian
  4. Inserisci un token API generato in Token API Atlassian
  5. Fai clic su Prova Connessione, verranno caricati gli spazi disponibili
  6. Seleziona gli spazi da indicizzare (lascia vuoto per importare tutti gli spazi accessibili)
  7. Configura l'intervallo di sincronizzazione e fai clic su Crea e indicizza

Modificare una fonte Confluence

Dopo aver aggiunto una fonte Confluence, fai clic sull'icona di modifica per cambiare:

  • Selezione degli spazi per aggiungere o rimuovere gli spazi da indicizzare
  • Includi sottopagine per stabilire se includere le pagine nidificate
  • Intervallo di reindicizzazione per definire la frequenza di sincronizzazione automatica

Le modifiche diventano effettive alla reindicizzazione successiva.

Sincronizzazione incrementale

Le fonti Confluence supportano la sincronizzazione incrementale. Vengono reindicizzate solo le pagine modificate rispetto all'ultima sincronizzazione, garantendo aggiornamenti rapidi ed efficienti.

Notion

Collega Notion per importare pagine e database nella base di conoscenza del tuo chatbot.

Notion è disponibile solo sui piani Premium ed Enterprise.

Aggiungere una fonte Notion

  1. Fai clic su Aggiungi Fonte di Dati e seleziona Notion
  2. Crea un'Integrazione interna su Notion Integrations
  3. Condividi le pagine o i database desiderati con la tua integrazione in Notion
  4. Inserisci il token di integrazione (inizia con ntn_ o secret_)
  5. Fai clic su Prova Connessione, i database disponibili verranno caricati
  6. Seleziona i database da indicizzare (lascia vuoto per importare tutte le pagine accessibili)
  7. Configura l'intervallo di sincronizzazione e fai clic su Crea e indicizza

Modificare una fonte Notion

Dopo aver aggiunto una fonte Notion, fai clic sull'icona di modifica per cambiare:

  • Selezione del database, aggiungi o rimuovi database da indicizzare
  • Includi sottopagine, specifica se includere le pagine nidificate
  • Intervallo di reindicizzazione, frequenza di sincronizzazione automatica

Sincronizzazione incrementale

Le fonti Notion supportano la sincronizzazione incrementale. Vengono rielaborate solo le pagine modificate dopo l'ultima sincronizzazione.

Cartelle collegate

Una cartella collegata è una cartella che rimane connessa nel tempo. Indichi al chatbot una cartella in SharePoint, Google Drive, Nextcloud o su un server SFTP una sola volta; da quel momento legge ogni file indicizzabile al suo interno e controlla periodicamente in base alla pianificazione scelta. Modifica un PDF in quella cartella e il chatbot conoscerà la nuova versione dopo la sincronizzazione successiva. Elimina un file e scomparirà dalla base di conoscenza. Nessuno deve ricaricare nulla manualmente.

Le cartelle collegate sono disponibili sui piani Premium ed Enterprise.

Cosa viene indicizzato

InclusoSaltato
PDF, DOCX, XLSX, XLS, CSV, TXT, MDTutto il resto, immagini, video, archivi ZIP, PPTX
File all'interno delle sottocartelle (opzionale, attivo per impostazione predefinita)File che superano il limite di caricamento del tuo piano
Google Documenti, Fogli e Presentazioni (solo Drive, convertiti automaticamente)File che corrispondono alle tue regole di esclusione

I file saltati sono elencati nella finestra di dialogo File indicizzati con il relativo motivo, così puoi vedere a colpo d'occhio perché manca qualcosa.

Come rimane sincronizzato

Ogni file include un indicatore di versione fornito dal sistema di archiviazione: SharePoint e Google Drive forniscono un'impronta digitale del contenuto, SFTP e Nextcloud usano dimensione e data di modifica. A ogni sincronizzazione il chatbot confronta gli indicatori e scarica solo ciò che è effettivamente cambiato. Un file non modificato non comporta costi: nessun download, nessuna elaborazione, nessun consumo di quota.

La tua quota di caratteri calcola ciò che è archiviato, non la frequenza di lettura. Una cartella con 500 file immutati consuma esattamente quanto consumava il primo giorno, indipendentemente dalla frequenza di sincronizzazione.

Scegli l'intervallo di sincronizzazione quando colleghi la cartella: giornaliero, ogni 3 giorni, settimanale o ogni 30 giorni. Puoi anche avviare una sincronizzazione manuale in qualsiasi momento tramite l'icona di aggiornamento.

Mostrare agli utenti la posizione di un file

Disattivata per impostazione predefinita, è presente un'opzione per ciascuna cartella: Indica il percorso di archiviazione agli utenti. Se attivata, il chatbot può menzionare il percorso della cartella in una risposta, e ogni risposta mostra una scheda per ciascun file utilizzato, con nome file, percorso, sistema di archiviazione e un link diretto a SharePoint, Drive o Nextcloud, se disponibile.

Lasciala disattivata per un widget su un sito web pubblico. In caso contrario, ogni visitatore potrà leggere la struttura interna delle tue cartelle. Con l'opzione disattivata, né il nome del file né il percorso vengono mai inviati al modello IA, impedendo che trapelino nel testo generato.

Escludere file

Aggiungi una regola per riga in Salta determinati file:

RegolaCosa viene saltato
/Archivio/**L'intera cartella Archivio, compreso tutto il suo contenuto
*_interno*Ogni file con _interno nel nome
*.csvOgni file CSV
/HR/Stipendi/**Una specifica sottocartella

* rappresenta qualsiasi carattere all'interno di un singolo segmento di percorso, ** rappresenta qualsiasi numero di sottocartelle. I file esclusi vengono rimossi dalla base di conoscenza alla sincronizzazione successiva.

Puoi escludere un singolo file anche a posteriori: apri File indicizzati, trova la riga e fai clic su Rimuovi dall'indice. Il file rimarrà escluso nelle sincronizzazioni successive.


SharePoint / OneDrive

Legge una raccolta documenti da Microsoft 365. L'amministratore Microsoft registra un'applicazione una sola volta e ti fornisce tre valori.

Ottenere le credenziali

  1. Accedi a Microsoft Entra admin center con un account autorizzato a registrare applicazioni
  2. Vai su Identità → Applicazioni → Registrazioni app e fai clic su Nuova registrazione
  3. Assegna un nome (ad es. WebChatAgent Conoscenze), mantieni i valori predefiniti, fai clic su Registra
  4. Nella pagina della panoramica, copia due valori:
    • ID directory (tenant)
    • ID applicazione (client)
  5. Vai su Certificati e segreti → Nuovo segreto client, scegli una scadenza, fai clic su Aggiungi e copia subito la colonna Valore, Microsoft la mostra una sola volta
  6. Vai su Autorizzazioni API → Aggiungi un'autorizzazione → Microsoft Graph → Autorizzazioni applicazione e aggiungi:
    • Sites.Selected, consigliato: nessun accesso finché un amministratore non concede esplicitamente un sito, oppure
    • Sites.Read.All, accesso in lettura a tutti i siti SharePoint; più semplice, notevolmente più esteso
  7. Fai clic su Concedi consenso amministratore, senza questo passaggio l'app non avrà alcun accesso
  8. Per Sites.Selected, un amministratore deve inoltre concedere all'app l'accesso in lettura al sito specifico (tramite PowerShell o Graph Explorer, autorizzazione Sites.Selected su quel sito)
Il segreto client scade, Microsoft consente un massimo di 24 mesi. Alla scadenza, la cartella smette di sincronizzarsi e la dashboard mostra Credenziali non più valide. Imposta un promemoria nel calendario e incolla un nuovo segreto nella finestra di modifica prima di tale data.

Collegamento

  1. Aggiungi fonte di dati → SharePoint / OneDrive
  2. Inserisci ID tenant, ID client e segreto client
  3. Facoltativamente, inserisci l'URL del sito (ad es. https://contoso.sharepoint.com/sites/marketing) per passare direttamente a un sito specifico
  4. Prova connessione, le raccolte documenti a cui hai accesso verranno caricate
  5. Seleziona la raccolta documenti desiderata e individua la cartella specifica
  6. Scegli l'intervallo di sincronizzazione e fai clic su Collega e leggi

Google Drive

Legge una cartella di Drive tramite un account di servizio Google, un account tecnico appartenente alla tua organizzazione anziche a una persona, evitando interruzioni quando un dipendente lascia l'azienda.

Ottenere le credenziali

  1. Apri la Google Cloud Console e seleziona un progetto (oppure creane uno, e gratuito)
  2. Vai su APIs & Services → Library, cerca Google Drive API e fai clic su Riattiva
  3. Vai su APIs & Services → Credentials → Create credentials → Service account
  4. Assegna un nome, fai clic su Create and continue, salta i passaggi facoltativi sui ruoli e fai clic su Done
  5. Fai clic sul nuovo account di servizio, apri la scheda Keys, scegli Add key → Create new key → JSON. Viene scaricato un file .json, che corrisponde alla credenziale
  6. Copia l'indirizzo e-mail dell'account di servizio, simile a name@project-id.iam.gserviceaccount.com

Ora concedi a tale indirizzo l'accesso ai tuoi file, scegliendo una delle due modalita:

  • Condividi la cartella (piu semplice): in Google Drive, fai clic con il tasto destro sulla cartella → Condividi → incolla l'indirizzo dell'account di servizio → ruolo VisualizzatoreCondividi
  • Delega a livello di dominio (solo Google Workspace): un amministratore di Workspace autorizza l'ID client dell'account di servizio per l'ambito https://www.googleapis.com/auth/drive.readonly in Admin console → Security → API controls → Domain-wide delegation. Inserisci poi l'e-mail dell'utente di cui leggere i file nel campo Act as user. Scegli questa opzione se il tuo Workspace blocca la condivisione esterna, poiche un account di servizio viene considerato esterno.
Un account di servizio non dispone di spazio di archiviazione Drive proprio. Puo leggere solo cio che e stato condiviso con esso, che e esattamente cio che serve in questo caso.

Connessione

  1. Aggiungi fonte di dati → Google Drive
  2. Incolla il contenuto del file di chiave JSON
  3. Facoltativamente, compila Act as user (solo per delega a livello di dominio)
  4. Incolla il link della cartella o il suo ID: apri la cartella in Drive e copia l'URL; l'ID e la parte successiva a /folders/
  5. Prova connessione, scegli l'intervallo, fai clic su Collega e leggi

Google Documenti, Fogli e Presentazioni non contengono byte di file diretti, quindi vengono convertiti al volo: Documenti in Markdown, Fogli in Excel (solo il primo foglio di lavoro), Presentazioni in testo semplice. Google limita questa conversione a 10 MB per file; qualsiasi file piu grande viene contrassegnato come saltato.


Nextcloud / WebDAV

Funziona con Nextcloud, ownCloud e qualsiasi altro server WebDAV, inclusa l'interfaccia WebDAV offerta da molti dispositivi NAS.

Ottenere le credenziali

Per Nextcloud e ownCloud, utilizza una password per l'applicazione, mai la password dell'account:

  1. Accedi a Nextcloud
  2. Fai clic sul tuo avatar → Impostazioni → Sicurezza
  3. Scorri fino a Dispositivi e sessioni, inserisci un nome (es. WebChatAgent), fai clic su Crea nuova password per l'applicazione
  4. Copia la password generata, mostrata solo una volta

Una password per l'applicazione puo essere revocata singolarmente e non funziona per l'accesso web, limitando i rischi di compromissione. Per altri server WebDAV, usa il nome utente e la password forniti dall'amministratore.

Connessione

  1. Aggiungi fonte di dati → Nextcloud / WebDAV
  2. Server URL: solo l'indirizzo, senza percorso: https://cloud.example.com
  3. Nome utente e password per l'applicazione
  4. WebDAV path: lascia vuoto per Nextcloud e ownCloud, che usano il percorso predefinito. Compila questo campo solo per altri server WebDAV (l'amministratore conoscera il percorso, spesso simile a /dav o /webdav)
  5. Prova connessione, naviga fino alla cartella, scegli l'intervallo, fai clic su Collega e leggi
Il server deve essere raggiungibile tramite HTTPS. Le connessioni HTTP non cifrate vengono rifiutate, cosi come gli indirizzi all'interno di reti private, un Chatbot nel cloud non puo comunque raggiungere 192.168.x.x.

SFTP / FTPS

Per il tuo server, un pacchetto hosting o un NAS con accesso SSH.

Cosa serve

Richiedi a chi gestisce il server:

  • Indirizzo del server e porta (SFTP di solito 22, FTPS di solito 21 o 990)
  • Nome utente
  • Password o, preferibilmente, una chiave SSH

Una chiave SSH e preferibile a una password: non puo essere indovinata e puo essere revocata senza modificare l'accesso di altri. Se devi crearne una autonomamente, su Mac o Linux esegui:

ssh-keygen -t ed25519 -f ~/wca-key -C "webchatagent"

Verranno generati due file. Incolla il contenuto di wca-key (la chiave privata) nella finestra di dialogo e invia wca-key.pub (la chiave pubblica) all'amministratore, che la aggiungera al file ~/.ssh/authorized_keys dell'account. Se hai impostato una passphrase, inseriscila nel campo dedicato.

Connessione

  1. Aggiungi fonte di dati → SFTP / FTPS
  2. Scegli il protocollo, inserisci indirizzo del server, porta e nome utente
  3. Inserisci la password oppure attiva l'opzione per usare una chiave SSH al posto della password e incolla la chiave privata
  4. Prova connessione: con SFTP viene mostrata l'impronta digitale del server
  5. Confronta l'impronta digitale con quella fornita dall'amministratore e confermala. Viene memorizzata e verificata a ogni sincronizzazione successiva; in caso di modifica, la sincronizzazione si blocca invece di connettersi senza avviso a una macchina diversa
  6. Naviga fino alla cartella, scegli l'intervallo, fai clic su Collega e leggi
Il protocollo FTP non cifrato non e supportato, poiche la password verrebbe trasmessa in chiaro. FTPS (AUTH TLS) e SFTP sono entrambi supportati.

Quando e utile "rileggi sempre i file"

SFTP non genera un'impronta digitale dei contenuti; il Chatbot confronta dimensione e data di modifica. Alcuni strumenti di sincronizzazione (rsync -t, determinate procedure di backup) mantengono invariati entrambi i valori anche se il contenuto cambia, rendendo la modifica invisibile. In questi casi e disponibile l'opzione per rileggere sempre i file nella finestra di modifica. Questa opzione legge di nuovo ogni file a ogni sincronizzazione, risultando piu lenta ma assicurando la lettura di tutte le modifiche. Lasciala disattivata a meno che non si riscontri questo problema.


In caso di problemi

Cosa visualizziCosa significaCosa fare
Credenziali non piu validePassword, segreto o chiave sono stati rifiutati. La sincronizzazione automatica viene messa in pausa per non tentare la password errata ogni ora.Reinserisci le credenziali nella finestra di modifica. La causa abituale e la scadenza dei segreti client di SharePoint.
Cartella non raggiungibileLa cartella e stata rinominata, spostata o eliminata, oppure l'accesso e stato revocato.Controlla la cartella nel sistema di archiviazione. Il Contenuto indicizzato viene mantenuto fino alla correzione.
Impronta digitale del server modificata (SFTP)Il server presenta una chiave SSH diversa rispetto alla configurazione iniziale.Rivolgiti all'amministratore. Questo accade normalmente dopo la riconfigurazione di un server, ma corrisponde anche a un tentativo di impersonificazione del server. Dai nuova conferma solo dopo aver chiarito l'origine del cambiamento.
Singolo file mostra lo stato non riuscitoImpossibile leggere quel file: PDF corrotto, documento protetto da password o formato imprevisto.Tutti gli altri contenuti sono stati indicizzati. Apri l'elenco dei file indicizzati per verificare il Motivo.
Singolo file mostra lo stato troppo grandeDimensione superiore al limite previsto dal Piano.Suddividi il file oppure esegui l'upgrade.

Categorie

Le categorie consentono di organizzare le fonti di dati. Puoi:

  • Assegnare una Categoria durante l'aggiunta o la modifica di qualsiasi fonte di dati
  • Filtrare l'elenco delle fonti di dati per Categoria
  • Usare le categorie per raggruppare contenuti correlati (es. "Prodotti", "Supporto", "Legale")

Le categorie vengono salvate in minuscolo e sono condivise tra tutte le tipologie di fonti di dati.

Elenco delle Fonti di Dati

L'elenco delle fonti di dati mostra ciascuna origine con il suo stato attuale:

StatoDescrizione
IndicizzatoElaborato con successo e disponibile per il chatbot
In attesaAttualmente in elaborazione o in coda per l'indicizzazione
Reindicizzazione necessariaMostrato come un badge arancione. I dati indicizzati dell'origine non sono più utilizzabili, nella maggior parte dei casi dopo aver cambiato il provider IA del chatbot, e devono essere rigenerati prima che il chatbot possa rispondere utilizzandoli. Consulta Reindicizzazione.
ErroreElaborazione non riuscita, controlla l'URL di origine o il file e riprova

Puoi filtrare l'elenco per:

  • Cerca: trova le fonti per nome o URL. Le cartelle collegate corrispondono in base al loro nome visualizzato e al percorso della cartella, quindi digitando sharepoint o parte del percorso verranno trovate
  • Tipo: filtra per Sito Web, File, Confluence, Notion, SharePoint, Google Drive, Nextcloud / WebDAV o SFTP / FTPS
  • Categoria: filtra in base alla categoria assegnata

Cerca nei contenuti (il pulsante sopra l'elenco) cerca nel testo indicizzato anziché nei nomi delle fonti, e include anche le cartelle collegate, utile per trovare da quale file proviene una frase specifica.

Modifica delle Fonti di Dati

  • URL del Sito Web: fai clic sull'icona di modifica per modificare URL, profondità di crawl, selettori CSS, pattern di esclusione e intervallo di reindicizzazione
  • Documenti di testo: fai clic sull'icona di modifica per modificare nome, categoria e contenuto
  • Documenti file: fai clic sull'icona di modifica per modificare nome e categoria (il contenuto non può essere modificato, carica nuovamente il file)
  • Fonti Confluence: fai clic sull'icona di modifica per modificare la selezione dello spazio, l'inclusione delle pagine secondarie e l'intervallo di sincronizzazione
  • Fonti Notion: fai clic sull'icona di modifica per modificare la selezione del database, l'inclusione delle pagine secondarie e l'intervallo di sincronizzazione
  • Cartelle collegate: fai clic sull'icona di modifica per modificare il nome visualizzato, l'intervallo di sincronizzazione, l'inclusione delle sottocartelle, l'opzione per la posizione di archiviazione, le regole di esclusione, la priorità di ricerca e per reinserire le credenziali. I contenuti dei file non possono essere modificati qui, il sistema di archiviazione rimane l'unica fonte di verità e qualsiasi modifica verrebbe sovrascritta alla sincronizzazione successiva

Reindicizzazione

Puoi reindicizzare manualmente le singole fonti di dati per aggiornare il loro contenuto. Questo è utile quando:

  • Il contenuto del sito web è cambiato
  • Desideri aggiornare dopo aver corretto i selettori CSS o i pattern di esclusione
  • Un'origine precedentemente in errore è stata corretta

Reindicizzazione necessaria (badge arancione)

Quando una fonte di dati mostra un badge arancione "Reindicizzazione necessaria", il suo contenuto indicizzato non può più essere utilizzato dal chatbot e deve essere rigenerato.

Questo avviene automaticamente quando modifichi il provider IA del chatbot (ad esempio da OpenAI a Google Gemini) nelle impostazioni del chatbot. Ogni provider archivia i tuoi contenuti nel proprio formato di embedding, e questi formati non sono intercambiabili. Pertanto, quando il provider cambia, i vecchi dati indicizzati vengono cancellati e ogni fonte di dati viene contrassegnata come Reindicizzazione necessaria.

Fino a quando non reindicizzi, il chatbot non ha alcuna conoscenza utilizzabile proveniente dalle fonti interessate. Ricorrerà a risposte generiche o a messaggi del tipo "Non lo so" invece di rispondere basandosi sui tuoi contenuti. Reindicizza non appena vedi il badge arancione.

Quando almeno un'origine richiede la reindicizzazione, l'opzione Reimporta tutto diventa disponibile nella parte superiore della scheda Conoscenze. Fai clic su di essa per rigenerare tutte le fonti interessate in una sola operazione, oppure usa l'azione di aggiornamento su una singola origine per reindicizzare solo quella.

Non devi aggiungere nuovamente nulla: la reindicizzazione riutilizza i tuoi URL, file, testi, Confluence, Notion e cartelle collegate esistenti. I siti web vengono sottoposti a una nuova scansione e le fonti esterne vengono risincronizzate, pertanto una base di conoscenza di grandi dimensioni può richiedere alcuni minuti. Una volta terminato, il badge scompare e il chatbot risponde di nuovo utilizzando i tuoi contenuti.

Per le cartelle collegate, questo è l'unico caso in cui ogni file viene scaricato ed elaborato nuovamente, indipendentemente dal fatto che sia stato modificato o meno: i dati archiviati sono stati scartati, quindi non è rimasto nulla con cui effettuare il confronto.

Limiti di Contenuto

I contenuti di addestramento sono misurati in caratteri di testo indicizzato su tutte le tue fonti di dati (pagine web, file, voci di domande e risposte); questo ha sostituito il precedente limite per pagina, quindi alcune pagine lunghe e molte pagine brevi vengono conteggiate allo stesso modo. La tua quota di caratteri aumenta con il tuo piano; per i limiti attuali per ciascun piano, consulta la pagina dei prezzi.

Quando il limite viene raggiunto, l'indicizzazione viene messa in pausa fino a quando non rimuovi contenuti o effettui un aggiornamento del piano.

Buone Pratiche

  • Mantieni i contenuti chiari e ben strutturati: l'IA offre prestazioni migliori con contenuti organizzati e leggibili
  • Indicizza solo le pagine pertinenti: escludi pagine di accesso, aree di amministrazione e contenuti duplicati
  • Usa i selettori CSS per concentrarti sul contenuto principale ed escludere navigazione, piè di pagina e annunci pubblicitari
  • Monitora la bacheca Domande per identificare le lacune di conoscenza e aggiungere i contenuti mancanti
  • Aggiorna regolarmente le fonti di dati per garantire risposte accurate e aggiornate
  • Usa le categorie per organizzare un numero elevato di fonti di dati
  • Limita a una sola lingua quando il tuo sito presenta contenuti identici in più lingue
  • Punta le cartelle collegate a una cartella curata, non all'intero drive: una cartella "Conoscenza chatbot" gestita attivamente è preferibile all'indicizzazione di ogni bozza e vecchio contratto presente
  • Mantieni l'opzione per la posizione di archiviazione disattivata per i widget pubblici, e attiva per gli assistenti interni e i wiki del team