Данный инструмент расходует средства с вашего баланса. Подробнее с расценками вы можете ознакомиться в разделе тарифов.
По данному инструменту действуют квоты на количество баз знаний, источников и размеры файлов. Подробнее по квотам — в разделе квот.
1. Обзор интерфейса
Старт работы происходит в разделе "Базы знаний". Данный раздел находится в меню пользователя (вверху справа). Здесь вы видите список всех созданных баз и список доступных источников данных, которые могут быть подключены.

На этом экране вы можете:
- Управлять списками (создавать, удалять, редактировать базы).
- Видеть статус подключенных источников (сколько документов, сайтов и других источников подключено к базе).
- Переходить к настройкам конкретных баз через иконки действий.
2. Создание новой базы знаний
Чтобы создать базу, нажмите кнопку + Добавить базу знаний в блоке "Базы знаний".

В открывшемся окне необходимо настроить параметры алгоритма поиска и ранжирования.
2.1 Основные настройки
- Название: Введите понятное имя базы (например,
Корпоративный порталилиFAQ 2024). Это поможет ориентироваться в системе, особенно если у вас много баз. - Предобработка запроса: (Включено по умолчанию) Рекомендуется включать. Этот параметр позволяет системе лучше понимать намерения пользователя перед поиском.
- Включить ранжирование (Reranking): (Включено по умолчанию) Улучшает точность поиска, переупорядочивая найденные документы перед выдачей пользователю. Позволяет выбрать наиболее релевантный контент даже если он не был первым в списке.
2.2 Параметры поиска (Limits)
- Лимит документов в ответе: Максимальное количество кусков информации, которые бот добавит в свой ответ. Значение
3является оптимальным, чтобы не перегружать пользователя текстом. - Лимит извлечения: Количество кандидатов, которые система найдёт в базе для выбора лучших. Значение
16позволяет алгоритму выбрать топ-3 из множества найденных вариантов, не утяжеляя вычисления. - Порог score: Минимальная уверенность системы (от 0 до 1). Если соответствие документа запросу ниже этого порога, документ не будет использован. Значение
0.5— это стандартная настройка для баланса между охватом и точностью.
Нажмите кнопку "Создать", чтобы сохранить базу.
3. Добавление источников данных
Источники — это данные, которые база знаний использует для поиска ответов и расширения возможностей LLM. В разделе "Источники" нажмите кнопку + Добавить источник.

После нажатия кнопки откроется выпадающее меню с тремя вариантами:
- Документ
- Сайт
- XML фид
В текущем интерфейсе источники можно условно разделить на две группы:
- Неструктурированные источники: документы и сайты. Такие источники парсятся, разбиваются на чанки и попадают в поисковый индекс базы знаний.
- Провайдеры структурированных данных: источники, которые получают данные в структурированном виде, формируют индекс и дополнительно предоставляют набор инструментов (
tools) для LLM. Это позволяет модели не только искать фрагменты данных, но и обращаться к провайдеру как к инструменту. Сейчас в интерфейсе доступен первый такой тип источника — XML фид. В дальнейшем список таких провайдеров может расширяться.
3.1 Неструктурированные источники
3.1.1 Добавление документа (PDF, DOCX)
Для загрузки документа выберите пункт Документ.

В открывшемся окне "Добавить документ":
- В поле Способ добавления выберите вариант Загрузка файла.
- В поле Файл нажмите "Выберите файл". Поддерживаются форматы
.pdfи.docx.
Настройки обработки файла
- Включить LLM-обработку: Если в документе есть картинки, схемы или графики, рекомендуется оставить эту опцию включенной.
- Что делает: Система не просто разбивает текст на куски, но и распознает изображения, создаст для них текстовое описание (описание картинки) и добавит его в чанки. Без этого бот "не увидит" то, что изображено на графике.
- Размер чанка: Размер кусков текста, на которые разбивается документ. По умолчанию
1024токена.- Совет: Если документ сложный и состоит из длинных абзацев, можно увеличить этот параметр до 2000, чтобы сохранить контекст. Если абзацы короткие — уменьшите до 512.
- Исключить заголовки (не обязательно): Дополнительное поле, где можно указать заголовки, которые не нужно учитывать при разбиении документа.
Нажмите "Загрузить и индексировать файл".
3.1.2 Индексация сайтов
Для добавления внешнего сайта выберите пункт Сайт и укажите URI (адрес ресурса).

Настройки краулера (Crawler)
Эти параметры регулируют то, как робот собирает информацию с сайта:
- Исключить заголовки: Укажите слова (через пробел), которые не должны быть частью контента (например, "реклама" или "меню").
- Исключить селекторы: CSS-классы или ID страниц, которые нужно игнорировать.
- Макс. глубина: Насколько глубоко заходить по ссылкам внутри сайта (по умолчанию
5). Если сайт сложен, увеличьте это значение. - Макс. страниц: Ограничение на количество загружаемых страниц (по умолчанию
100). - Использовать браузер: Если сайт заблокирован обычным парсером, включите режим браузера. Это медленнее, но эффективнее для сложных скриптов.
Нажмите "Создать и индексировать сайт".
3.1.3 Пример использования базы знаний с неструктурированными источниками
Для документов и сайтов база знаний обычно используется как источник дополнительного текстового контекста. В этом случае сценарий сначала выполняет поиск по индексу, а затем передает найденные фрагменты в запрос к модели.

На схеме показан следующий поток:
- Пользователь отправляет сообщение.
- Сообщение добавляется в массив
messages, который используется как история диалога. - В блоке Поиск в базе знаний выполняется поиск по вопросу
@{$message.text}. - Вместе с вопросом в поиск передается и история сообщений:
@{$messages->take(3, -3)->values()}. Это помогает искать фрагменты не только по последней реплике, но и с учетом недавнего контекста диалога. - В качестве ключа параметра базы знаний используется
knowledge_base. Это параметр проекта с типом База знаний, в настройках проекта уже указывается, какую именно базу нужно использовать. - Результат поиска сохраняется в переменную
contextчерез@{ragResponse.context_str}. - Затем выполняется блок Запрос в OpenAI, где к
messagesдобавляется системное сообщение с дополнительным контекстом из@{$context}. В этом примере запрос к модели строится черезmessages=@{[{'role':'system','content':'Дополнительный контекст:\n@{$context}'}]->arrayMerge($messages)}. - Модель формирует ответ на основе истории диалога и найденных фрагментов из документов или страниц сайта.
- Финальный текст отправляется пользователю через блок Отправить текст.
Что важно в этом примере:
- Для неструктурированных источников основной механизм работы — поиск по индексу. Сначала система находит релевантные чанки, затем передает их в LLM как дополнительный контекст.
- Поиск может учитывать историю диалога. На схеме в блок
Поиск в базе знанийпередаются не только текст текущего сообщения, но и последние элементы истории. - Основной источник ответа здесь — найденный текстовый контекст. Именно поиск по индексу дает модели фрагменты документов и страниц сайта, на которых строится ответ.
- В этом примере ответ строится без вызова `tools`. Модель получает уже подготовленный текстовый контекст из результата поиска и использует его при генерации ответа.
- Один и тот же параметр `knowledge_base` можно использовать в разных сценариях. Для документов и сайтов он нужен для поиска по индексу и передачи найденного контекста, а для структурированных провайдеров может дополнительно давать доступ к
tools.
Такой сценарий подходит для FAQ, инструкций, регламентов, документации, статей и других источников, где информация хранится в виде обычного текста.
3.2 Провайдеры структурированных данных
Провайдеры структурированных данных отличаются от обычных документов и сайтов:
- они работают со структурированными сущностями и атрибутами, а не только с произвольным текстом;
- формируют индекс на основе подготовленных данных;
- могут предоставлять набор инструментов (
tools) для LLM, чтобы модель могла выполнять целевые обращения к источнику данных.
Первый доступный в интерфейсе провайдер такого типа — XML фид.
3.2.1 Добавление XML-фида
Для загрузки XML-фида выберите пункт XML фид.
В окне "Добавить XML фид" отображается подсказка, что XML-фид должен содержать элементы типа <offer>.

Заполните поля:
- Способ добавления: выберите Загрузка по ссылке.
- URI: укажите прямую ссылку на XML-фид.
- Включить синхронизацию: включите опцию, если система должна периодически обновлять данные из этого XML-фида.
После загрузки XML-фид будет обработан как провайдер структурированных данных: система разберет элементы фида, подготовит индекс и сможет использовать связанный с этим источником набор инструментов при работе LLM.
После этого нажмите "Добавить XML фид по ссылке".
3.2.2 Пример использования tools со структурированными данными
Ниже показан базовый сценарий, в котором LLM работает не только с историей сообщений, но и с инструментами, предоставленными базой знаний:

На схеме показан следующий поток:
- Пользователь отправляет сообщение.
- Сообщение добавляется в массив
messages, который используется как контекст диалога. - Выполняется блок Запрос в OpenAI, где в запрос передаются:
messages=@{$messages}— текущая история диалога;tools=@{$settings.knowledge_base.tools}— набор инструментов, который предоставляет подключенный провайдер структурированных данных (knowledge_base-- это параметр с типом База знаний, в настройках проекта уже потом указывается какая конкретно база знаний используется).
- Если модель возвращает
tool_call, сценарий переходит в цикл по вызовам функций. - Для каждого вызова проверяется, можно ли выполнить инструмент через
@{$settings.knowledge_base->canExecuteTool($call)}. - Если инструмент доступен, он вызывается через
@{$settings.knowledge_base->executeTool($call)}. - Результат выполнения инструмента добавляется в
messages, после чего модель можно вызвать повторно уже с учетом полученных данных. - Если вызовов инструментов нет, пользователю отправляется обычный текстовый ответ из
@$openai.choices.0.message.content.
Что важно в этом примере:
- Структурированный источник сам поставляет инструменты. Вам не нужно вручную описывать каждую функцию в запросе, если они уже предоставляются через
knowledge_base. - Модель сама решает, когда вызвать инструмент. Если для ответа достаточно контекста, она вернет обычный текст. Если ей нужны точные данные из провайдера, она инициирует
tool_call. - Инструменты работают поверх структурированных сущностей. Для XML-фида это особенно полезно, когда нужно не просто найти фрагмент текста, а получить точные значения из каталога, карточки товара или другого структурированного набора данных.
Такой сценарий полезен, когда бот должен отвечать на вопросы по каталогу, прайсу, остаткам, объектам или другим сущностям, представленным в виде структурированных записей, а не только в виде текстовых документов.
4. Управление источниками и привязка
Если у вас создано несколько источников и несколько баз знаний, источники нужно "привязывать" к конкретной базе. В этом примере база называется Default.

- В списке Базы знаний нажмите на кнопку с иконкой цепочки рядом с нужной БЗ.
- Откроется окно "Управление источниками". Здесь вы увидите все доступные источники в системе.
- Нажмите кнопку "Привязать" напротив нужного ресурса.
- После привязки статус источника станет активным для текущей базы, и данные будут учитываться в ответах.
5. Редактирование и обновление источников
Информация в базе знаний должна оставаться актуальной. Если вы загрузили новый файл или изменили контент сайта, нужно выполнить "реингест" (перепарсинг).
5.1 Режим обновления файла
При нажатии на иконку карандаша или названию источника открывается окно редактирования.
- Режим обновления файла:
- Не менять файл: Система оставляет старый индекс. Подойдет, если файл загружен один раз и не меняется, но меняются настройки парсинга.
- Реингест: Система полностью пересоберет индекс на основе новой версии файла. Используйте, если вы обновили PDF с новой информацией.
5.2 Настройки реингеста (Reingest)
Вам нужно выбрать, какие этапы обработки пропустить или перезапустить.

Раскрывающийся список "Реингест с этапа" содержит следующие опции:
- Рендеринг: Конвертация PDF в список картинок (только для PDF).
- Парсинг: Выделение текста (для PDF всегда используется с LLM). Выбирайте, если вы изменили параметры стартовой/конечной страницы.
- Постобработка: Улучшение качества текста.
- Разбиение: Разбивка на чанки. Выбирайте, если вы изменили размер чанка и/или исключенные заголовки.
- Векторизация: Преобразование текста в векторы.
Выберите уровень, который нужно обработать (обычно оставляют все или выбирают "Векторизация", если данные не менялись текстом). Нажмите "Переиндексировать".
5.3 Настройки PDF-парсера
Если тип источника — Файл, откроются дополнительные поля для PDF:
- Стартовая страница / Конечная страница: Можно указать, с какой и по какой страницы обрабатывать файл (полезно для многостраничных PDF).
- Исключенные страницы: Укажите номера страниц, которые нужно игнорировать (например, титульный лист или оглавление).
6. Тестирование базы знаний
Перед запуском обязательно протестируйте базу. В панели базы знаний нажмите на иконку чата.

6.1 Интерактивное тестирование
- Вопрос: Введите тестовый запрос (например, "Как добавить триггер?").
- Спросить: Нажмите синюю кнопку. AI сгенерирует ответ.
- Документы: Прокрутите вниз до раздела Документы. Здесь система покажет, какие куски информации она использовала для формирования ответа.
score: Показывает уверенность (от -0.1 до 1.0). Если score низкий, бот использует этот фрагмент с оговорками или пропускает его.ID: Идентификатор документа в системе.
Убедитесь, что ответы корректны, а использованные фрагменты имеют высокий score. Если score низкий, нужно либо изменить Порог score, либо улучшить качество документов.
Куда идти дальше

Соберём бота, который отвечает по вашей базе
Подключим документы, сайт и товарный фид, настроим поиск и проверим ответы на ваших вопросах.

Обсудим вашу задачу
Расскажите, что хотите автоматизировать, — предложим готовое решение из каталога или соберём под вас. С 2016 года, 40+ проектов.