Обучение AI Chatbot с помощью источников знаний
Источники знаний
Источники знаний предоставляют информацию, которую ваш chatbot использует для формирования точных ответов. Откройте Панель управления → ваш ассистент → Знания, чтобы добавить URL-адреса сайтов, загрузить файлы, ввести текст напрямую или подключить внешние платформы, такие как Confluence, Notion, SharePoint, Google Drive, Nextcloud или SFTP/FTPS.
Во вкладке Знания также отображается использование символов в рамках всего аккаунта. Таблицу источников можно искать и фильтровать по типу или категории, в ней отображаются статус индексации каждого источника и дата последнего обновления. Действия со строками позволяют повторно импортировать, редактировать, проверять, скачивать, останавливать или удалять источник, если это поддерживается. Выберите несколько строк для массовой переиндексации или удаления.
Вы также можете подключить папку, например SharePoint, Google Drive, Nextcloud или SFTP-сервер. Все файлы в ней индексируются автоматически, а любые изменения подтягиваются при следующей синхронизации без необходимости повторной загрузки вручную. Подробнее в разделе Подключённые папки.
URL сайтов
Введите URL для сканирования и индексации. WebChatAgent автоматически обойдет страницы и извлечет контент для базы знаний вашего чат-бота.
Добавление сайта
- Нажмите Добавить источник данных во вкладке Знания и выберите Сайт
- Введите URL сайта (например,
example.com, протоколhttps://добавляется автоматически) - Настройте необязательные расширенные параметры (см. ниже)
- Нажмите Добавить, чтобы запустить сканирование
Расширенные настройки
| Поле | Описание | По умолчанию |
|---|---|---|
| Глубина сканирования | Количество уровней ссылок вглубь для сканирования. 0 = только эта страница, пусто = неограниченная глубина. | Пусто (без ограничений) |
| CSS-селекторы | Разделенные запятыми CSS-селекторы для точечного выбора областей контента (например, article, .content, #main-body). Если задано, извлекается только контент внутри этих селекторов. | Пусто (вся страница) |
| Шаблоны исключаемых URL | Разделенные запятыми шаблоны URL, которые следует пропустить при сканировании (например, /login, /impressum, */amp/*). | Пусто |
| Интервал автоматической переиндексации | Частота автоматического повторного сканирования и обновления контента. Варианты: Каждые 3 дня, Каждые 7 дней, Каждые 30 дней (на тарифах Премиум и Enterprise также доступен вариант Ежедневно). | Отключён |
Когда использовать CSS-селекторы
CSS-селекторы помогают извлекать со страницы только нужный контент. Это полезно в следующих случаях:
- На страницах есть меню навигации, футеры или боковые панели, которые нужно исключить
- Необходимо сосредоточиться только на основном тексте статьи
- Страница содержит рекламу или посторонние виджеты
Пример: чтобы извлечь только основную область контента и пропустить навигацию:
article, .main-content, #post-body
Когда использовать шаблоны исключения URL
Шаблоны исключения предотвращают индексацию определенных страниц (их добавление в базу знаний вашего чат-бота). Типичные примеры использования:
- Страницы входа и администрирования:
/login, /admin, /wp-admin - Юридическая информация:
/impressum, /privacy-policy, /terms - Дублирующийся контент:
*/amp/*, */print/* - Архивы категорий и тегов:
/category/*, /tag/*(часто содержат дубли) - Параметры запроса:
?hitsPerPage, исключает все URL с данным параметром (например, страницы результатов поиска с пагинацией)
Важные детали:
- Шаблоны чувствительны к регистру.
/Aboutи/aboutсчитаются разными шаблонами. Убедитесь, что регистр в шаблонах точно совпадает с регистром в ваших URL. - Исключенные страницы не индексируются, но ссылки с них обрабатываются. Краулер продолжит переходить по ссылкам, найденным на исключенных страницах, пропущена будет только индексация самой страницы. Это означает, что исключение страницы категории вроде
/blog/category/newsпредотвратит ее индексацию, но отдельные статьи блога, на которые она ссылается, будут просканированы и проиндексированы (если они сами не подпадают под шаблон исключения).
Особенности работы с языками
Если на вашем сайте представлен многоязычный контент (например, /en/about и /de/about), настоятельно рекомендуется индексировать только один язык. Индексация одного и того же контента на нескольких языках приводит к следующим проблемам:
- Дублирование информации, нерационально расходующее ваш лимит символов
- Снижение качества поиска ответов, так как ИИ может брать данные не из того языка
- Лишний расход токенов на избыточный контент
Chatbot отвечает на языке посетителя независимо от того, на каком языке проиндексирован контент, поэтому повторная индексация одних и тех же страниц не дает преимуществ. Используйте поле Шаблоны исключаемых URL, чтобы пропустить папки других языков (например, /de/*, /fr/*).
Выберите язык, который ваши клиенты используют чаще всего, либо язык, соответствующий основной аудитории вашего чат-бота.
Текстовые источники данных
Вы можете вручную добавить текстовый контент в качестве источника данных. Это оптимально подходит для ЧаВо, внутренних инструкций или материалов, которых нет на сайте.
Добавление текстового документа
- Нажмите Добавить источник данных во вкладке Знания и выберите Ввод текста
- Заполните поля:
| Поле | Описание | Ограничения |
|---|---|---|
| Название документа | Понятное имя для этого документа. Оставьте пустым для автогенерации через ИИ. | Необязательно |
| Категория | Группировка документов по категориям. Выберите существующую категорию или введите новую. Оставьте пустым для автоопределения. | Необязательно |
| Контент | Текстовое содержимое, которое будет использовать chatbot. | Обязательно, максимум 50 000 символов |
Загрузка файлов
Загружайте документы напрямую в базу знаний вашего чат-бота.
Поддерживаемые форматы
| Формат | Описание |
|---|---|
| Руководства, отчеты, брошюры, презентации | |
| DOCX | Документы Word |
| TXT | Простые текстовые файлы |
| MD | Документы Markdown |
| XLSX | Таблицы |
Лимиты на размер файлов
| Тариф | Максимальный размер файла |
|---|---|
| Бесплатный | 1 МБ |
| Базовый | 5 МБ |
| Стандартный | 10 МБ |
| Премиум | 50 МБ |
| Enterprise | Безлимитно |
Автоматическое имя файла с помощью ИИ
На платных тарифах при загрузке файла со стандартным неинформативным именем (например, document.txt или untitled.pdf) система автоматически формирует понятное имя на основе содержимого файла.
Confluence Cloud
Подключите свое пространство Confluence Cloud, чтобы импортировать страницы вики напрямую в базу знаний чат-бота.
Добавление источника Confluence
- Нажмите Добавить источник данных и выберите Confluence Cloud
- Введите URL вашего Confluence (например,
https://yourcompany.atlassian.net) - Введите адрес электронной почты, привязанный к вашему аккаунту Atlassian
- Введите токен API из раздела Atlassian API Tokens
- Нажмите Проверить подключение, после чего загрузится список доступных пространств
- Выберите пространства для индексации (оставьте пустым для импорта всех доступных пространств)
- Настройте интервал синхронизации и нажмите Создать и индексировать
Редактирование источника Confluence
После добавления источника Confluence нажмите иконку редактирования, чтобы изменить:
- Выбор пространств, добавление или удаление пространств для индексации
- Включить дочерние страницы, обработка вложенных страниц
- Интервал переиндексации, частота автоматической синхронизации
Изменения вступят в силу при следующей переиндексации.
Инкрементальная синхронизация
Источники Confluence поддерживают инкрементальную синхронизацию. Повторно индексируются только те страницы, которые изменились с момента прошлой синхронизации, что обеспечивает быстрое и экономное обновление данных.
Notion
Подключите Notion для импорта страниц и баз данных в базу знаний вашего чат-бота.
Добавление источника Notion
- Нажмите Добавить источник данных и выберите Notion
- Создайте Internal Integration на странице Notion Integrations
- Предоставьте доступ к нужным страницам или базам данных для вашей интеграции в Notion
- Введите токен интеграции (начинается с
ntn_илиsecret_) - Нажмите Проверить подключение, после чего загрузятся доступные базы данных
- Выберите базы данных для индексации (оставьте пустым, чтобы импортировать все доступные страницы)
- Настройте интервал синхронизации и нажмите Создать и индексировать
Редактирование источника Notion
После добавления источника Notion нажмите на иконку редактирования, чтобы изменить:
- Выбор баз данных — добавление или удаление баз данных для индексации
- Включить дочерние страницы — включать ли вложенные страницы
- Интервал переиндексации — периодичность автоматической синхронизации
Инкрементальная синхронизация
Источники Notion поддерживают инкрементальную синхронизацию. Повторно обрабатываются только те страницы, которые изменились с момента последней синхронизации.
Подключенные папки
Подключённая папка остается постоянно связанной с системой. Вы один раз указываете чат-боту на папку в SharePoint, Google Drive, Nextcloud или на SFTP сервере, после чего он считывает каждый подходящий для индексации файл и выполняет регулярную проверку по выбранному вами расписанию. При изменении PDF в этой папке чат-бот узнает новую версию после следующей синхронизации. При удалении файла он исчезает из базы знаний. Никому не требуется загружать файлы заново.
Что индексируется
| Включено | Пропущено |
|---|---|
| PDF, DOCX, XLSX, XLS, CSV, TXT, MD | Все остальное, включая изображения, видео, ZIP архивы, PPTX |
| Файлы во вложенных папках (необязательно, включено по умолчанию) | Файлы, превышающие лимит на загрузку для вашего тарифа |
| Google Документы, Таблицы и Презентации (только Drive, конвертируются автоматически) | Файлы, соответствующие вашим правилам исключения |
Пропущенные файлы перечисляются в диалоговом окне Индексированные файлы с указанием причины, поэтому всегда можно сразу увидеть, почему файл отсутствует.
Как поддерживается синхронизация
Каждый файл содержит маркер версии из системы хранения данных: SharePoint и Google Drive предоставляют цифровой отпечаток содержимого, а SFTP и Nextcloud используют размер вместе со временем изменения. При каждой синхронизации чат-бот сравнивает маркеры и скачивает только то, что действительно изменилось. Неизмененный файл не требует затрат: ни скачивания, ни обработки, ни расхода квоты.
Выберите интервал синхронизации при подключении папки: ежедневно, каждые 3 дня, еженедельно или каждые 30 дней. Также можно запустить синхронизацию вручную в любое время с помощью иконки обновления.
Отображение расположения файла пользователям
Опция отключена по умолчанию и настраивается отдельно для каждой папки: Сообщать пользователям место хранения. При ее включении чат-бот может упоминать путь к папке в ответе, а в каждом ответе отображается карточка для каждого использованного файла: имя файла, путь, система хранения и прямая ссылка на SharePoint, Drive или Nextcloud, если она доступна.
Оставьте опцию выкл. для виджета на публичном сайте. В противном случае любой посетитель сможет увидеть структуру ваших внутренних папок. При выключенном переключателе ни имя файла, ни путь никогда не отправляются в модель ИИ, что исключает их попадание в текст ответа.
Исключение файлов
Добавьте по одному правилу на строку в поле Пропускать определенные файлы:
| Правило | Что пропускается |
|---|---|
/Archive/** | Вся папка Archive со всем ее содержимым |
*_internal* | Каждый файл, содержащий _internal в имени |
*.csv | Каждый CSV файл |
/HR/Salaries/** | Одна конкретная вложенная папка |
Символ * заменяет любые символы внутри одного сегмента пути, ** обозначает любое количество вложенных папок. Исключенные файлы удаляются из базы знаний при следующей синхронизации.
Также можно исключить отдельный файл постфактум: откройте Индексированные файлы, найдите нужную строку и нажмите Удалить из индекса. Файл останется исключенным при последующих синхронизациях.
SharePoint / OneDrive
Считывает библиотеку документов из Microsoft 365. Администратор Microsoft выполняет разовую регистрацию приложения и предоставляет три значения.
Получение учетных данных
- Войдите в Microsoft Entra admin center, используя аккаунт с правом регистрации приложений
- Перейдите в Identity → Applications → App registrations и нажмите New registration
- Задайте имя (например,
WebChatAgent Knowledge), сохраните значения по умолчанию и нажмите Register - На странице обзора скопируйте два значения:
- Directory (tenant) ID
- Application (client) ID
- Перейдите в Certificates & secrets → New client secret, выберите срок действия, нажмите Add и сразу скопируйте столбец Значение, так как Microsoft показывает его только один раз
- Перейдите в API permissions → Add a permission → Microsoft Graph → Application permissions и добавьте:
Sites.Selected— рекомендуется: закрывает доступ ко всему, пока администратор явно не разрешит конкретный сайт, илиSites.Read.All— доступ на чтение ко всем сайтам SharePoint, более простой и значительно более широкий вариант
- Нажмите Grant admin consent, так как без этого у приложения не будет доступа
- Для варианта
Sites.Selectedадминистратор должен дополнительно предоставить приложению доступ на чтение к конкретному сайту (через PowerShell или Graph Explorer с разрешениемSites.Selectedдля этого сайта)
Подключение
- Добавить источник данных → SharePoint / OneDrive
- Введите tenant ID, client ID и client secret
- При необходимости укажите URL сайта (например,
https://contoso.sharepoint.com/sites/marketing), чтобы сразу перейти к нужному сайту - Проверить подключение, после чего загрузятся доступные вам библиотеки документов
- Выберите библиотеку и перейдите к нужной папке
- Выберите интервал синхронизации и нажмите Подключить и прочитать
Google Drive
Считывает папку Google Drive через сервисный аккаунт Google. Это технический аккаунт организации, а не отдельного сотрудника, поэтому при увольнении людей доступ не ломается.
Получение учетных данных
- Откройте Google Cloud Console и выберите проект (или создайте новый, это бесплатно)
- Перейдите в APIs & Services → Library, найдите Google Drive API и нажмите Enable
- Перейдите в APIs & Services → Credentials → Create credentials → Service account
- Укажите имя, нажмите Create and continue, пропустите необязательные шаги с ролями и нажмите Done
- Нажмите на созданный сервисный аккаунт, перейдите на вкладку Keys и выберите Add key → Create new key → JSON. Будет скачан файл
.json, это и есть файл ключа - Скопируйте адрес электронной почты сервисного аккаунта, он выглядит как
name@project-id.iam.gserviceaccount.com
Предоставьте этому адресу доступ к файлам одним из двух способов:
- Открыть доступ к папке (самый простой способ): в Google Drive нажмите правой кнопкой мыши на папку → Share → вставьте адрес сервисного аккаунта → роль Viewer → Share
- Делегирование на уровне домена (только для Google Workspace): администратор Workspace разрешает Client ID сервисного аккаунта область видимости
https://www.googleapis.com/auth/drive.readonlyв разделе Admin console → Security → API controls → Domain-wide delegation. Затем введите email пользователя, чьи файлы нужно читать, в поле Act as user. Используйте этот вариант, если в Workspace заблокирован внешний доступ, так как сервисный аккаунт считается внешним.
Подключение
- Добавить источник данных → Google Drive
- Вставьте содержимое файла JSON с ключом
- При необходимости заполните поле Act as user (только при делегировании на уровне домена)
- Вставьте ссылку на папку или ее ID: откройте папку в Drive и скопируйте URL, частью после
/folders/является ID - Нажмите Test connection, выберите интервал и нажмите Подключить и прочитать
Файлы Google Docs, Sheets и Slides не содержат исходных байтов файлов, поэтому они преобразуются на лету: Docs в Markdown, Sheets в Excel (только первый лист), Slides в обычный текст. Google ограничивает это преобразование 10 МБ на файл, всё, что больше, помечается как пропущенное.
Nextcloud / WebDAV
Работает с Nextcloud, ownCloud и любыми другими серверами WebDAV, включая интерфейс WebDAV, который предоставляют многие хранилища NAS.
Получение учетных данных
Для Nextcloud и ownCloud используйте пароль приложения, а не основной пароль аккаунта:
- Выполните вход в Nextcloud
- Нажмите на свой аватар → Settings → Security
- Прокрутите до Devices & sessions, введите имя (например,
WebChatAgent) и нажмите Create new app password - Скопируйте сгенерированный пароль, он показывается только один раз
Пароль приложения можно отозвать отдельно, и он не подходит для входа через веб-интерфейс, поэтому утечка остается изолированной. Для других серверов WebDAV используйте имя пользователя и пароль, выданные администратором.
Подключение
- Добавить источник данных → Nextcloud / WebDAV
- Server URL: только адрес, без пути:
https://cloud.example.com - Имя пользователя и пароль приложения
- WebDAV path: оставьте пустым для Nextcloud и ownCloud, они используют стандартный путь. Заполняйте только для других серверов WebDAV (администратор подскажет точный путь, часто это
/davили/webdav) - Нажмите Test connection, выберите нужную папку, задайте интервал и нажмите Подключить и прочитать
192.168.x.x.SFTP / FTPS
Подходит для собственного сервера, виртуального хостинга или NAS с доступом по SSH.
Что потребуется
Запросите у администратора сервера:
- Адрес сервера и порт (для SFTP обычно 22, для FTPS обычно 21 или 990)
- Имя пользователя
- Пароль или SSH-ключ (рекомендуется)
SSH-ключ надежнее пароля: его нельзя подобрать, и его можно отозвать без смены учетных данных других пользователей. Если ключ нужно создать самостоятельно, выполните на Mac или Linux:
ssh-keygen -t ed25519 -f ~/wca-key -C "webchatagent"
Команда создаст два файла. Вставьте содержимое wca-key (приватный ключ) в форму, а wca-key.pub (публичный ключ) передайте администратору для добавления в ~/.ssh/authorized_keys нужного аккаунта. Если для ключа задана парольная фраза, укажите ее в соответствующем поле.
Подключение
- Добавить источник данных → SFTP / FTPS
- Выберите протокол, укажите адрес сервера, порт и имя пользователя
- Введите пароль либо включите параметр Use SSH key instead of password и вставьте приватный ключ
- Нажмите Test connection: для SFTP отобразится отпечаток сервера
- Сверьте отпечаток с тем, который предоставил администратор, и подтвердите его. Он сохранится и будет проверяться при каждой синхронизации; если отпечаток изменится, синхронизация остановится вместо незаметного подключения к другому серверу
- Выберите нужную папку, задайте интервал и нажмите Подключить и прочитать
AUTH TLS) и SFTP полностью поддерживаются.Когда помогает повторное считывание файлов
В SFTP нет встроенного отпечатка содержимого, поэтому чат-бот сверяет размер и время изменения. Некоторые инструменты синхронизации (rsync -t, отдельные задачи резервного копирования) сохраняют эти параметры даже при изменении содержимого, из-за чего правки могут остаться незамеченными. В таких случаях в окне редактирования предусмотрен переключатель Always read files in again. Он повторно считывает каждый файл при каждой синхронизации: процесс идет медленнее, но изменения не теряются. Оставляйте его выключенным, если такой проблемы нет.
Решение проблем
| Что отображается | Что это значит | Что делать |
|---|---|---|
| Credentials no longer valid | Пароль, секрет или ключ были отклонены. Автоматическая синхронизация приостановлена, чтобы не повторять попытки с неверным паролем каждый час. | Введите учетные данные заново в окне редактирования. Срок действия клиентских секретов SharePoint периодически истекает, это частая причина. |
| Folder not reachable | Папка была переименована, перемещена, удалена, или к ней был закрыт доступ. | Проверьте папку в хранилище. Проиндексированный контент сохраняется до тех пор, пока вы не исправите проблему. |
| Server fingerprint changed (SFTP) | Сервер предоставил другой SSH-ключ по сравнению с моментом первоначальной настройки. | Обратитесь к администратору. Это обычная ситуация после переустановки сервера, но точно так же выглядит подмена сервера третьей стороной. Подтверждайте ключ повторно только после выяснения причины. |
| У отдельного файла статус failed | Не удалось прочитать конкретный файл: поврежденный PDF, документ под паролем, непредвиденный формат. | Остальные файлы проиндексированы. Откройте Indexed files, чтобы узнать причину. |
| У отдельного файла статус too large | Размер файла превышает лимит вашего тарифа. | Разделите файл на части или перейдите на более высокий тариф. |
Категории
Категории помогают структурировать источники данных. Вы можете:
- Назначать категорию при добавлении или редактировании любого источника данных
- Фильтровать список источников данных по категориям
- Группировать связанный контент с помощью категорий (например, «Продукты», «Поддержка», «Юридическая информация»)
Категории сохраняются в нижнем регистре и доступны для всех типов источников данных.
Список источников данных
В списке источников данных показан каждый источник с его текущим статусом:
| Статус | Описание |
|---|---|
| Проиндексировано | Успешно обработано и доступно для чат-бота |
| Pending | В процессе обработки или в очереди на индексацию |
| Требуется переиндексация | Отображается в виде оранжевого бейджа. Проиндексированные данные источника больше нельзя использовать, чаще всего после смены AI-провайдера чат-бота, и их необходимо создать заново, чтобы чат-бот мог отвечать на их основе. См. раздел Переиндексация. |
| Ошибка | Ошибка обработки, проверьте URL источника или файл и повторите попытку |
Вы можете фильтровать список по следующим параметрам:
- Поиск — поиск источников по имени или URL. Для подключенных папок поиск выполняется по отображаемому имени и по пути к папке, поэтому ввод
sharepointили части пути найдет их - Тип — фильтрация по типу: Сайт, Файл, Confluence, Notion, SharePoint, Google Drive, Nextcloud / WebDAV или SFTP / FTPS
- Категория — фильтрация по назначенной категории
Кнопка Поиск по содержимому над списком ищет по проиндексированному тексту, а не по названиям источников, и охватывает в том числе подключенные папки. Это удобно, когда нужно найти, из какого именно файла взята конкретная фраза.
Редактирование источников данных
- URL сайтов: нажмите на иконку редактирования, чтобы изменить URL, глубину сканирования, CSS-селекторы, шаблоны исключения и интервал переиндексации
- Текстовые документы: нажмите на иконку редактирования, чтобы изменить название, категорию и содержимое
- Файловые документы: нажмите на иконку редактирования, чтобы изменить название и категорию (содержимое изменить нельзя, вместо этого загрузите файл заново)
- Источники Confluence: нажмите на иконку редактирования, чтобы изменить выбор пространств, включение дочерних страниц и интервал синхронизации
- Источники Notion: нажмите на иконку редактирования, чтобы изменить выбор баз данных, включение дочерних страниц и интервал синхронизации
- Подключенные папки: нажмите на иконку редактирования, чтобы изменить отображаемое имя, интервал синхронизации, включение подпапок, переключатель места хранения, правила исключения, приоритет поиска, а также ввести учетные данные заново. Содержимое самих файлов здесь редактировать нельзя: система хранения остается единственным источником истины, и любые правки будут перезаписаны при следующей синхронизации
Переиндексация
Вы можете вручную переиндексировать отдельные источники данных, чтобы обновить их содержимое. Это полезно в следующих случаях:
- Содержимое сайта изменилось
- Требуется обновить данные после исправления CSS-селекторов или шаблонов исключения
- Источник, ранее выдававший ошибку, был исправлен
Требуется переиндексация (оранжевый бейдж)
Если у источника данных отображается оранжевый бейдж "Требуется переиндексация", его проиндексированный контент больше не может использоваться чат-ботом и должен быть сформирован заново.
Это происходит автоматически при смене AI-провайдера чат-бота (например, с OpenAI на Google Gemini) в настройках чат-бота. Каждый провайдер сохраняет контент в собственном формате эмбеддингов, и эти форматы несовместимы между собой. Поэтому при смене провайдера старые проиндексированные данные удаляются, а каждый источник данных получает статус Требуется переиндексация.
Когда хотя бы одному источнику требуется переиндексация, в верхней части вкладки Знания появляется кнопка Импортировать всё заново. Нажмите ее, чтобы пересоздать все затронутые источники за один раз, либо используйте действие обновления для отдельного источника, чтобы переиндексировать только его.
Добавлять заново ничего не нужно: переиндексация использует существующие URL, файлы, тексты, Confluence, Notion и подключенные папки. Сайты сканируются повторно, а внешние источники синхронизируются заново, поэтому для большой базы знаний процесс может занять несколько минут. После завершения бейдж пропадет, и чат-бот снова начнет отвечать на основе вашего контента.
Лимиты на объем контента
Объем обучающего контента измеряется в символах проиндексированного текста по всем источникам данных (веб-страницы, файлы, пары вопрос-ответ). Это заменило прежний лимит по количеству страниц, поэтому несколько длинных страниц и множество коротких учитываются одинаково. Доступный лимит символов увеличивается вместе с вашим тарифом. Актуальные лимиты для каждого тарифа приведены на странице с ценами.
При достижении лимита индексация приостанавливается до тех пор, пока вы не удалите часть контента или не перейдете на более высокий тариф.
Рекомендации
- Поддерживайте понятную и четкую структуру контента — искусственный интеллект работает эффективнее с упорядоченными, легко читаемыми материалами
- Индексируйте только нужные страницы — исключайте страницы входа, панели администратора и дублирующийся контент
- Используйте CSS-селекторы, чтобы сфокусироваться на основном контенте и исключить навигацию, футеры и рекламу
- Отслеживайте панель Вопросы, чтобы выявлять пробелы в знаниях и добавлять недостающую информацию
- Регулярно обновляйте источники данных, чтобы обеспечить точность и актуальность ответов
- Используйте категории для организации большого числа источников данных
- Ограничивайтесь одним языком, если на сайте представлен одинаковый контент на нескольких языках
- Указывайте для подключенных папок специально подготовленную папку, а не весь диск целиком: папка "База знаний для чат-бота", за которой следят, гораздо лучше индексации всех имеющихся черновиков и старых договоров
- Оставляйте переключатель места хранения выключенным для публичных виджетов и включайте его для внутренних ассистентов и корпоративных вики
