Entrena tu Chatbot de IA con fuentes de Conocimiento
Fuentes de conocimiento
Las fuentes de conocimiento proporcionan la información que utiliza tu chatbot para ofrecer respuestas fundamentadas. Abre Panel → tu asistente → Conocimiento para añadir URL de sitios web, subir archivos, introducir texto directamente o conectar plataformas externas como Confluence, Notion, SharePoint, Google Drive, Nextcloud o SFTP/FTPS.
La pestaña Conocimiento también muestra el uso de caracteres a nivel de cuenta. Su tabla de fuentes permite buscar y filtrar por tipo o categoría, y muestra el estado de indexación de cada fuente y su última actualización. Las acciones de fila te permiten volver a importar, editar, inspeccionar, descargar, detener o eliminar una fuente cuando sea compatible. Selecciona varias filas para reindexar o eliminar por lotes.
También puedes conectar una carpeta, ya sea de SharePoint, Google Drive, Nextcloud o un servidor SFTP. Todo su contenido se indexa automáticamente, y cualquier cambio se detecta en la siguiente sincronización sin necesidad de volver a subir ningún archivo. Consulta Carpetas conectadas.
URL de sitios web
Introduce URL para rastrear e indexar. WebChatAgent rastrea automáticamente las páginas y extrae el contenido para la base de conocimiento de tu chatbot.
Añadir un sitio web
- Haz clic en Añadir fuente de datos en la pestaña Conocimiento y selecciona Sitio web
- Introduce la URL del sitio web (por ejemplo,
example.com,https://se añade automáticamente) - Configura los ajustes avanzados opcionales (ver más abajo)
- Haz clic en Añadir para iniciar el rastreo
Configuración avanzada
| Campo | Descripción | Predeterminado |
|---|---|---|
| Profundidad de rastreo | Cuántos niveles de enlaces rastrear en profundidad. 0 = solo esta página, vacío = profundidad ilimitada. | Vacío (ilimitado) |
| Selectores CSS | Selectores CSS separados por comas para apuntar a áreas de contenido específicas (por ejemplo, article, .content, #main-body). Si se configuran, solo se extraerá el contenido dentro de estos selectores. | Vacío (página completa) |
| Patrones de exclusión de URL | Patrones de URL separados por comas para omitir durante el rastreo (por ejemplo, /login, /impressum, */amp/*). | Vacío |
| Intervalo de reindexación automática | Con qué frecuencia volver a rastrear y actualizar el contenido automáticamente. Opciones: Cada 3 días, Cada 7 días, Cada 30 días (los planes Premium y Enterprise también disponen de Diario). | Desactivado |
Cuándo usar selectores CSS
Los selectores CSS te ayudan a extraer únicamente el contenido relevante de una página. Esto resulta útil cuando:
- Tus páginas tienen menús de navegación, pies de página o barras laterales que quieres excluir
- Quieres centrarte únicamente en el contenido del artículo principal
- La página contiene anuncios o widgets no relacionados
Ejemplo: Para extraer únicamente el área de contenido principal y omitir la navegación:
article, .main-content, #post-body
Cuándo usar patrones de exclusión de URL
Los patrones de exclusión evitan que ciertas páginas específicas se indexen (se añadan a la base de conocimiento de tu chatbot). Casos de uso comunes:
- Páginas de inicio de sesión o administración:
/login, /admin, /wp-admin - Páginas legales:
/impressum, /privacy-policy, /terms - Contenido duplicado:
*/amp/*, */print/* - Archivos de categorías o etiquetas:
/category/*, /tag/*(a menudo contenido duplicado) - Parámetros de consulta:
?hitsPerPage, excluye todas las URL que contengan este parámetro (por ejemplo, páginas de resultados de búsqueda con paginación)
Detalles importantes:
- Los patrones distinguen entre mayúsculas y minúsculas.
/Abouty/aboutse tratan como patrones diferentes. Asegúrate de que tus patrones coincidan exactamente con las mayúsculas y minúsculas de tus URL. - Las páginas excluidas no se indexan, pero se siguen sus enlaces. El rastreador seguirá descubriendo y rastreando las páginas enlazadas desde las URL excluidas, únicamente se omite la indexación de la página excluida en sí. Esto significa que excluir una página de categoría como
/blog/category/newsevitará que se indexe esa página de listado, pero las entradas individuales del blog enlazadas desde ella se seguirán rastreando e indexando (a menos que también coincidan con un patrón de exclusión).
Consideraciones sobre el idioma
Si tu sitio web tiene contenido multilingüe (por ejemplo, /en/about y /de/about), se recomienda encarecidamente indexar solo un idioma. Indexar el mismo contenido en varios idiomas genera:
- Información duplicada que consume innecesariamente tu cuota de contenido (medida en caracteres)
- Menor calidad de recuperación, ya que la IA puede obtener respuestas del idioma incorrecto
- Gasto innecesario del presupuesto de tokens en contenido redundante
El chatbot responde en el idioma del visitante independientemente del idioma que indexes, por lo que no aporta ninguna ventaja indexar la misma página dos veces. Utiliza el campo de patrones de exclusión de URL para omitir las carpetas de otros idiomas (por ejemplo, /de/*, /fr/*).
Elige el idioma que tus clientes utilicen con mayor frecuencia o el idioma que coincida con la audiencia principal de tu chatbot.
Fuentes de datos de texto
Puedes introducir contenido de texto manualmente como fuente de datos. Esto es ideal para preguntas frecuentes, conocimiento interno o contenido que no existe en un sitio web.
Añadir un documento de texto
- Haz clic en Añadir fuente de datos en la pestaña Conocimiento y selecciona Entrada de texto
- Rellena los campos:
| Campo | Descripción | Restricciones |
|---|---|---|
| Nombre del documento | Un nombre descriptivo para este documento. Déjalo vacío para que la IA genere un nombre automáticamente. | Opcional |
| Categoría | Organiza los documentos por categoría. Selecciona una categoría existente o escribe una nueva. Déjalo vacío para la detección automática. | Opcional |
| Contenido | El contenido de texto real que utilizará el chatbot. | Obligatorio, máx. 50 000 caracteres |
Carga de archivos
Sube documentos directamente a la base de conocimiento de tu chatbot.
Formatos compatibles
| Formato | Descripción |
|---|---|
| Manuales, informes, folletos, documentos técnicos | |
| DOCX | Documentos de Word |
| TXT | Archivos de texto sin formato |
| MD | Documentos Markdown |
| XLSX | Hojas de cálculo |
Límites de tamaño de archivo
| Plan | Tamaño máximo de archivo |
|---|---|
| Gratis | 1 MB |
| Básico | 5 MB |
| Estándar | 10 MB |
| Premium | 50 MB |
| Enterprise | Ilimitado |
Asignación automática de nombres de archivo mediante IA
En los planes de pago, si subes un archivo con un nombre genérico (por ejemplo, document.txt o untitled.pdf), el sistema genera automáticamente un nombre de archivo descriptivo basado en el contenido del archivo.
Confluence Cloud
Conecta tu instancia de Confluence Cloud para importar páginas wiki directamente a la base de conocimiento de tu chatbot.
Añadir una fuente de Confluence
- Haz clic en Añadir fuente de datos y selecciona Confluence Cloud
- Introduce la URL de tu Confluence (por ejemplo,
https://yourcompany.atlassian.net) - Introduce el correo asociado a tu cuenta de Atlassian
- Introduce un token de API obtenido en Tokens de API de Atlassian
- Haz clic en Probar conexión, se cargarán los espacios disponibles
- Selecciona los espacios que deseas indexar (déjalo vacío para importar todos los espacios accesibles)
- Configura el intervalo de sincronización y haz clic en Crear e indexar
Editar una fuente de Confluence
Tras añadir una fuente de Confluence, haz clic en el icono de edición para modificar:
- Selección de espacios: añade o elimina espacios para indexar
- Incluir subpáginas: indica si se deben incluir las páginas anidadas
- Intervalo de reindexación: con qué frecuencia sincronizar automáticamente
Los cambios surten efecto en la siguiente reindexación.
Sincronización incremental
Las fuentes de Confluence admiten sincronización incremental. Solo se reindexan las páginas que han cambiado desde la última sincronización, lo que hace que las actualizaciones sean rápidas y eficientes.
Notion
Conecte Notion para importar páginas y bases de datos en la base de conocimiento de su chatbot.
Añadir una fuente de Notion
- Haga clic en Añadir fuente de datos y seleccione Notion
- Cree una Internal Integration en Notion Integrations
- Comparta las páginas o bases de datos deseadas con su integración en Notion
- Introduzca el token de integración (empieza por
ntn_osecret_) - Haga clic en Probar conexión, se cargarán las bases de datos disponibles
- Seleccione las bases de datos que desea indexar (déjelo vacío para importar todas las páginas accesibles)
- Configure el intervalo de sincronización y haga clic en Create & Index
Editar una fuente de Notion
Tras añadir una fuente de Notion, haga clic en el icono de editar para modificar:
- Selección de bases de datos: añada o elimine bases de datos para indexar
- Incluir subpáginas: si se deben incluir las páginas anidadas
- Intervalo de reindexación: con qué frecuencia se sincroniza automáticamente
Sincronización incremental
Las fuentes de Notion admiten sincronización incremental. Solo se vuelven a procesar las páginas modificadas desde la última sincronización.
Carpetas conectadas
Una carpeta conectada es una carpeta que permanece vinculada. Apunta el chatbot una sola vez a una carpeta en SharePoint, Google Drive, Nextcloud o en un servidor SFTP; a partir de ese momento, lee todos los archivos indexables que contiene y vuelve a comprobarla según la programación que elija. Si modifica un PDF en esa carpeta, el chatbot conocerá la nueva versión tras la siguiente sincronización. Si elimina un archivo, desaparecerá de la base de conocimiento. Nadie tiene que volver a subir nada.
Qué se indexa
| Incluido | Omitido |
|---|---|
| PDF, DOCX, XLSX, XLS, CSV, TXT, MD | Todo lo demás: imágenes, vídeos, archivos ZIP, PPTX |
| Archivos dentro de subcarpetas (opcional, activado de forma predeterminada) | Archivos que superen el límite de subida de su plan |
| Google Docs, Sheets y Slides (solo Drive, convertidos automáticamente) | Archivos que coincidan con sus reglas de exclusión |
Los archivos omitidos se muestran en el cuadro de diálogo de Archivos indexados con el motivo, para que pueda ver de un vistazo por qué falta algo.
Cómo se mantiene sincronizado
Cada archivo lleva un marcador de versión del sistema de almacenamiento: SharePoint y Google Drive proporcionan una huella digital del contenido, mientras que SFTP y Nextcloud utilizan el tamaño más la fecha y hora de modificación. En cada sincronización, el chatbot compara los marcadores y solo descarga lo que realmente ha cambiado. Un archivo sin cambios no cuesta nada: sin descarga, sin procesamiento y sin consumo de cuota.
Elija el intervalo de sincronización al conectar la carpeta: a diario, cada 3 días, semanalmente o cada 30 días. También puede iniciar una sincronización manual en cualquier momento con el icono de actualizar.
Indicar a los usuarios la ubicación de un archivo
Desactivado de forma predeterminada, mediante un interruptor por carpeta: Indicar la ubicación de almacenamiento a los usuarios. Con esta opción activada, el chatbot puede mencionar la ruta de la carpeta en una respuesta, y cada respuesta muestra una tarjeta por cada archivo que ha usado: nombre del archivo, ruta, sistema de almacenamiento y un enlace directo a SharePoint, Drive o Nextcloud cuando exista.
Déjelo desactivado para un widget de sitio web público. De lo contrario, cualquier visitante podrá leer su estructura interna de carpetas. Con el interruptor desactivado, ni el nombre del archivo ni la ruta se envían nunca al modelo de IA, por lo que tampoco puede filtrarlos en el texto.
Excluir archivos
Añada una regla por línea en Omitir ciertos archivos:
| Regla | Qué omite |
|---|---|
/Archive/** | Toda la carpeta Archive, incluido todo su contenido |
*_internal* | Cualquier archivo con _internal en su nombre |
*.csv | Cualquier archivo CSV |
/HR/Salaries/** | Una subcarpeta específica |
* representa cualquier carácter dentro de un segmento de ruta, ** cualquier número de subcarpetas. Los archivos excluidos se eliminan de la base de conocimiento en la siguiente sincronización.
También puede excluir un archivo individual a posteriori: abra Archivos indexados, busque la fila y haga clic en Eliminar del índice. Permanecerá excluido en las sincronizaciones posteriores.
SharePoint / OneDrive
Lee una biblioteca de documentos de Microsoft 365. Su administrador de Microsoft registra una aplicación una sola vez y le proporciona tres valores.
Obtención de las credenciales
- Inicie sesión en el centro de administración de Microsoft Entra con una cuenta que tenga permisos para registrar aplicaciones
- Vaya a Identidad → Aplicaciones → Registros de aplicaciones y haga clic en Nuevo registro
- Asígnele un nombre (por ejemplo,
WebChatAgent Knowledge), mantenga los valores predeterminados y haga clic en Registrar - En la página de información general, copie dos valores:
- Id. de directorio (inquilino)
- Id. de aplicación (cliente)
- Vaya a Certificados y secretos → Nuevo secreto de cliente, elija una fecha de expiración, haga clic en Añadir y copie la columna Valor de inmediato, ya que Microsoft solo la muestra una vez
- Vaya a Permisos de API → Añadir un permiso → Microsoft Graph → Permisos de aplicación y añada:
Sites.Selected, recomendado: sin acceso a nada hasta que un administrador conceda explícitamente un sitio, oSites.Read.All: acceso de lectura a todos los sitios de SharePoint; más sencillo, pero considerablemente más amplio
- Haga clic en Conceder consentimiento de administrador, sin esto la aplicación no tendrá ningún tipo de acceso
- Para
Sites.Selected, un administrador debe conceder además a la aplicación acceso de lectura al sitio específico (a través de PowerShell o Graph Explorer, permisoSites.Selecteden ese sitio)
Conexión
- Añadir fuente de datos → SharePoint / OneDrive
- Introduzca el ID de inquilino, el ID de cliente y el secreto de cliente
- Si lo desea, introduzca la URL del sitio (por ejemplo,
https://contoso.sharepoint.com/sites/marketing) para ir directamente a un sitio concreto - Probar conexión, se cargarán las bibliotecas de documentos a las que tiene acceso
- Elija la biblioteca y navegue hasta la carpeta que desee
- Elija el intervalo de sincronización y haga clic en Conectar y leer
Google Drive
Lee una carpeta de Drive mediante una cuenta de servicio de Google, una cuenta técnica que pertenece a tu organización y no a una persona, por lo que nada deja de funcionar cuando un empleado se va.
Obtener las credenciales
- Abre la Google Cloud Console y selecciona un proyecto (o crea uno, es Gratis)
- Ve a APIs & Services → Library, busca Google Drive API y haz clic en Enable
- Ve a APIs & Services → Credentials → Create credentials → Service account
- Asígnale un nombre, haz clic en Create and continue, omite los pasos de roles opcionales y haz clic en Done
- Haz clic en la nueva cuenta de servicio, abre la pestaña Keys, selecciona Add key → Create new key → JSON. Se descargará un archivo
.json; ese archivo es la credencial - Copia la dirección de correo electrónico de la cuenta de servicio, tiene un formato como
name@project-id.iam.gserviceaccount.com
Ahora dale a esa dirección acceso a tus archivos de una de estas dos formas:
- Compartir la carpeta (lo más simple): en Google Drive, haz clic derecho en la carpeta → Compartir → pega la dirección de la cuenta de servicio → rol Lector → Compartir
- Delegación en todo el dominio (solo Google Workspace): un administrador de Workspace autoriza el ID de cliente de la cuenta de servicio para el ámbito
https://www.googleapis.com/auth/drive.readonlyen Consola de administración → Seguridad → Control de API → Delegación en todo el dominio. Luego introduce el correo del usuario cuyos archivos deben leerse en el campo Act as user. Utiliza esta vía cuando tu Workspace bloquee el uso compartido externo, ya que una cuenta de servicio cuenta como externa.
Conexión
- Añadir fuente de datos → Google Drive
- Pega el contenido del archivo de clave JSON
- Opcionalmente completa Act as user (solo para delegación en todo el dominio)
- Pega el enlace de la carpeta o su ID: abre la carpeta en Drive y copia la URL; el ID es la parte posterior a
/folders/ - Probar conexión, elige el intervalo y haz clic en Conectar y leer
Google Docs, Sheets y Slides no contienen bytes de archivo reales, por lo que se convierten al vuelo: Docs a Markdown, Sheets a Excel (solo la primera hoja de cálculo), Slides a texto plano. Google limita esta conversión a 10 MB por archivo; cualquier archivo que supere ese tamaño se marcará como omitido.
Nextcloud / WebDAV
Funciona con Nextcloud, ownCloud y cualquier otro servidor WebDAV, incluida la interfaz WebDAV que ofrecen muchos dispositivos NAS.
Obtener las credenciales
Para Nextcloud y ownCloud, utiliza una contraseña de aplicación, nunca la contraseña de tu cuenta:
- Inicia sesión en tu Nextcloud
- Haz clic en tu avatar → Ajustes → Seguridad
- Desplázate hasta Dispositivos y sesiones, introduce un nombre (p. ej.,
WebChatAgent) y haz clic en Crear nueva contraseña de aplicación - Copia la contraseña generada, se muestra solo una vez
Una contraseña de aplicación se puede revocar individualmente y no sirve para iniciar sesión en la web, por lo que una filtración queda contenida. Para otros servidores WebDAV, utiliza el usuario y la contraseña facilitados por tu administrador.
Conexión
- Añadir fuente de datos → Nextcloud / WebDAV
- Server URL: solo la dirección, sin ruta:
https://cloud.example.com - Usuario y contraseña de aplicación
- Ruta WebDAV: déjalo vacío para Nextcloud y ownCloud, ya que utilizan la ruta estándar. Completa esto solo para otros servidores WebDAV (tu administrador la conocerá, suele ser algo como
/davo/webdav) - Probar conexión, navega hasta la carpeta, elige el intervalo y haz clic en Conectar y leer
192.168.x.x.SFTP / FTPS
Para tu propio servidor, un paquete de alojamiento o un NAS con acceso SSH.
Qué necesitas
Pide a quien administre el servidor:
- Dirección del servidor y puerto (SFTP habitualmente 22, FTPS habitualmente 21 o 990)
- Usuario
- Contraseña o, mejor, una clave SSH
Una clave SSH es superior a una contraseña: no se puede adivinar y puedes revocarla sin alterar las credenciales de nadie más. Si necesitas crear una tú mismo, en Mac o Linux ejecuta:
ssh-keygen -t ed25519 -f ~/wca-key -C "webchatagent"
Esto genera dos archivos. Pega el contenido de wca-key (la clave privada) en el cuadro de diálogo y entrega wca-key.pub (la clave pública) a tu administrador, quien la añadirá a ~/.ssh/authorized_keys en la cuenta. Si defines una frase de contraseña, introdúcela en el campo correspondiente.
Conexión
- Añadir fuente de datos → SFTP / FTPS
- Selecciona el protocolo e introduce la dirección del servidor, el puerto y el usuario
- Introduce la contraseña o activa Usar clave SSH en lugar de contraseña y pega la clave privada
- Probar conexión: con SFTP aparecerá una huella digital del servidor
- Compara esa huella digital con la que te proporcionó tu administrador y confírmala. Se guarda y se comprueba en cada sincronización posterior; si cambia alguna vez, la sincronización se detiene en lugar de conectarse silenciosamente a una máquina distinta
- Navega hasta la carpeta, elige el intervalo y haz clic en Conectar y leer
AUTH TLS) como SFTP son válidos.Cuándo es útil "volver a leer siempre"
SFTP no dispone de huella de contenido; el chatbot compara el tamaño y la hora de modificación. Algunas herramientas de sincronización (rsync -t, ciertas tareas de copia de seguridad) conservan ambos valores cuando el contenido cambia, por lo que dicha modificación pasaría desapercibida. Para estos casos existe la opción Volver a leer siempre los archivos en el cuadro de edición. Vuelve a leer cada archivo en cada sincronización: es más lento, pero no se pasa nada por alto. Déjalo desactivado a menos que tengas este problema en concreto.
Si algo sale mal
| Lo que ves | Lo que significa | Qué hacer |
|---|---|---|
| Credenciales no válidas | Se rechazó la contraseña, el secreto o la clave. La sincronización automática se pausa para evitar reintentar una contraseña incorrecta cada hora. | Vuelve a introducir las credenciales en el cuadro de edición. Los secretos de cliente de SharePoint caducan, esa suele ser la causa habitual. |
| Carpeta no accesible | La carpeta se renombró, se movió, se eliminó o se retiró el acceso. | Revisa la carpeta en el sistema de almacenamiento. Tu contenido indexado se conserva deliberadamente hasta que lo soluciones. |
| La huella digital del servidor ha cambiado (SFTP) | El servidor presenta una clave SSH diferente a la configurada inicialmente. | Consulta con tu administrador. Esto es habitual tras reconstruir un servidor, y es idéntico a lo que ocurre si alguien suplanta al servidor. Confírmala de nuevo solo cuando sepas con certeza cuál de los dos casos es. |
| Un archivo individual muestra error | Ese archivo no se pudo leer: PDF dañado, documento protegido con contraseña o formato inesperado. | El resto del contenido se indexó correctamente. Abre Archivos indexados para ver el motivo. |
| Un archivo individual muestra demasiado grande | Supera el límite de tamaño de archivo de tu plan. | Divide el archivo o cambia a un plan superior. |
Categorías
Las categorías te ayudan a organizar tus fuentes de datos. Puedes:
- Asignar una categoría al añadir o editar cualquier fuente de datos
- Filtrar la lista de fuentes de datos por categoría
- Usar categorías para agrupar contenido relacionado (p. ej., "Productos", "Soporte", "Legal")
Las categorías se guardan en minúsculas y se comparten entre todos los tipos de fuentes de datos.
Lista de Fuentes de datos
La lista de fuentes de datos muestra cada origen con su estado actual:
| Estado | Descripción |
|---|---|
| Indexado | Procesado con éxito y disponible para el chatbot |
| Pendiente | En proceso de procesamiento o en cola para indexación |
| Reindexación necesaria | Se muestra como una insignia naranja. Los datos indexados del origen ya no se pueden usar, casi siempre tras cambiar el proveedor de IA del chatbot, y deben reconstruirse antes de que el chatbot pueda responder a partir de ellos. Consulta Reindexar. |
| Error | Falló el procesamiento; revisa la URL de origen o el archivo y vuelve a intentarlo |
Puedes filtrar la lista por:
- Buscar: Encuentra orígenes por nombre o URL. Las carpetas conectadas coinciden por su nombre visible y por la ruta de la carpeta, por lo que escribir
sharepointo parte de la ruta las encontrará - Tipo: Filtra por Sitio web, Archivo, Confluence, Notion, SharePoint, Google Drive, Nextcloud / WebDAV o SFTP / FTPS
- Categoría: Filtra por la categoría asignada
Buscar contenido (el botón situado encima de la lista) busca en el texto indexado en lugar de en los nombres de los orígenes, e incluye también las carpetas conectadas; resulta útil para encontrar de qué archivo procede una frase concreta.
Editar Fuentes de datos
- URL de Sitio web: Haz clic en el icono de editar para cambiar la URL, la profundidad de rastreo, los selectores CSS, los patrones de exclusión y el intervalo de reindexación
- Documentos de texto: Haz clic en el icono de editar para cambiar el nombre, la categoría y el contenido
- Documentos de archivo: Haz clic en el icono de editar para cambiar el nombre y la categoría (el contenido no se puede cambiar; sube de nuevo el archivo en su lugar)
- Orígenes de Confluence: Haz clic en el icono de editar para cambiar la selección de espacios, la inclusión de páginas secundarias y el intervalo de sincronización
- Orígenes de Notion: Haz clic en el icono de editar para cambiar la selección de bases de datos, la inclusión de páginas secundarias y el intervalo de sincronización
- Carpetas conectadas: Haz clic en el icono de editar para cambiar el nombre visible, el intervalo de sincronización, la inclusión de subcarpetas, el interruptor de ubicación de almacenamiento, las reglas de exclusión, la prioridad de búsqueda y para volver a introducir las credenciales. El contenido de los archivos en sí no se puede editar aquí; el sistema de almacenamiento se mantiene como la única fuente de información fiable y cualquier edición se sobrescribirá en la siguiente sincronización
Reindexar
Puedes reindexar manualmente fuentes de datos individuales para actualizar su contenido. Esto resulta útil cuando:
- El contenido del sitio web ha cambiado
- Quieres actualizar tras corregir selectores CSS o patrones de exclusión
- Se ha corregido un origen que anteriormente daba error
Reindexación necesaria (insignia naranja)
Cuando una fuente de datos muestra una insignia naranja de "Reindexación necesaria", el chatbot ya no puede usar su contenido indexado y debe reconstruirse.
Esto ocurre automáticamente al cambiar el proveedor de IA del chatbot (por ejemplo, de OpenAI a Google Gemini) en la configuración del chatbot. Cada proveedor almacena tu contenido en su propio formato de embedding, y estos formatos no son intercambiables. Por tanto, cuando el proveedor cambia, los datos indexados anteriores se borran y cada fuente de datos se marca con Reindexación necesaria.
Cuando al menos un origen necesita reindexación, la opción Reimportar todo pasa a estar disponible en la parte superior de la pestaña Conocimiento. Haz clic en ella para reconstruir todos los orígenes afectados a la vez, o usa la acción de actualizar en un solo origen para reindexar solo ese.
No necesitas volver a añadir nada; la reindexación reutiliza tus URL, archivos, texto, Confluence, Notion y carpetas conectadas existentes. Los sitios web se vuelven a rastrear y los orígenes externos se sincronizan de nuevo, por lo que una base de conocimiento grande puede tardar unos minutos. Una vez finalizado, la insignia desaparece y el chatbot vuelve a responder a partir de tu contenido.
Límites de Contenido
El contenido de entrenamiento se mide en caracteres de texto indexado en todas tus fuentes de datos (páginas web, archivos, entradas de preguntas y respuestas); esto sustituyó al antiguo límite por página, por lo que unas pocas páginas largas y muchas cortas cuentan de la misma manera. Tu asignación de caracteres aumenta con tu plan; para conocer los límites actuales por plan, consulta la página de precios.
Cuando se alcanza el límite, la indexación se pausa hasta que elimines contenido o mejores tu plan.
Prácticas Recomendadas
- Mantén el contenido claro y bien estructurado: La IA funciona mejor con contenido organizado y legible
- Indexa solo páginas relevantes: Excluye páginas de inicio de sesión, áreas de administración y contenido duplicado
- Usa selectores CSS para centrarte en el contenido principal y excluir la navegación, los pies de página y los anuncios
- Supervisa el panel de Preguntas para identificar lagunas de conocimiento y añadir el contenido que falte
- Actualiza las fuentes de datos con regularidad para garantizar respuestas precisas y actuales
- Usa categorías para organizar un gran número de fuentes de datos
- Limítate a un solo idioma cuando tu sitio web tenga contenido idéntico en varios idiomas
- Apunta las carpetas conectadas a una carpeta seleccionada, no a toda la unidad; una carpeta de "Conocimiento del chatbot" mantenida por alguien es mucho mejor que indexar cada borrador y contrato antiguo almacenado
- Mantén el interruptor de ubicación de almacenamiento desactivado para widgets públicos y activado para asistentes internos y wikis de equipo
