Раздел подключает сайт как источник знаний для AI-агентов: сохраняет настройки обхода, добавляет URL из sitemap, запускает обработку одобренных страниц и хранит историю сканирований.
Обычно работа строится так: вы создаёте сайт, назначаете ему одного или нескольких агентов, указываете sitemap.xml, запускаете сканирование, затем проверяете найденные URL и отдельно запускаете их обработку.
Быстрый старт
- Откройте Источники данных → Веб-сайты.
- Нажмите Создать.
- Заполните Название, Базовый URL и при необходимости Sitemap URL.
- Выберите Назначенные агенты, если сайт уже должен участвовать в ответах.
- Нажмите Создать.
- Откройте сайт на редактирование.
- В разделе Действия запустите Сканировать карту сайта (sitemap).
- После появления URL проверьте их в разделе URL и только затем запускайте Обработать одобренные URL.
Список сайтов
В таблице отображаются:
- Название;
- Базовый URL;
- URL-источники — количество связанных URL;
- Последний скан — время последнего успешно завершённого сканирования;
- Частота сканирования;
- Создано.
Список можно искать по названию и сортировать по основным колонкам. Из фильтров доступен фильтр Дата создания с диапазоном С и По.
На странице списка доступны:
- Создать — добавление нового сайта;
- Редактировать — переход к полной настройке;
- Удалить — удаление записи;
- Удалить выбранные — групповое удаление.
Если функция недоступна по тарифу, список будет пустым, над таблицей появится предупреждение, а кнопка Создать останется видимой, но заблокированной с подсказкой про тариф PRO.
Создание сайта
На странице создания показывается только базовый блок Сайт. Расширенные настройки, действия и связанные таблицы появляются после первого сохранения.
Название
Внутреннее название сайта для поиска и различения источников. Ограничение — до 255 символов.
Базовый URL
Основной адрес сайта, например:
https://example.com
Поле обязательно. Используйте полный URL с протоколом.
Назначенные агенты
Поле Назначенные агенты сразу связывает сайт с выбранными AI-агентами. После создания сайт появится в наборе источников у этих агентов.
Если меняется организация сайта, связки агентов система обновляет автоматически при сохранении.
Описание
Необязательное внутреннее описание: что это за сайт, для какого проекта он используется и какие материалы на нём лежат.
Редактирование и настройки
После создания открывается полная страница редактирования. Слева остаётся основная карточка сайта, справа появляются сворачиваемые секции настроек.
Главная кнопка Сохранить в верхней части страницы сохраняет форму без ухода со страницы. У каждой правой секции есть собственная кнопка Сохранить внизу — она сохраняет эту же форму и также оставляет вас на текущей странице.
Сайт
Блок Сайт содержит те же поля, что и при создании:
- Название;
- Базовый URL;
- Назначенные агенты;
- Описание.
Настройки сканирования
Sitemap URL
Ссылка на карту сайта, например https://example.com/sitemap.xml.
Кнопка Сканировать карту сайта (sitemap) в меню Действия показывается только после заполнения и сохранения Sitemap URL.
Исключить паттерны URL
Список URL или масок, которые не нужно брать из sitemap. Поддерживаются точные адреса и шаблоны с * и ?.
Подсказка под полем уже содержит рабочие примеры, например:
*/login*
*/admin*
*/user/*/profile
Автоматическое одобрение новых URL
Если переключатель включён, новые URL из sitemap сразу получают признак одобрения. Это не запускает обработку само по себе, но позволяет быстрее перейти к следующему шагу.
Настройки обработки URL
Этот блок управляет тем, как будет очищаться HTML перед чанкингом и эмбеддингами.
Исключить селекторы
Поле Исключить селекторы принимает CSS-селекторы блоков, которые нужно вырезать из страниц: меню, футер, сайдбар, виджеты, баннеры и другой служебный шум.
Рядом с полем есть встроенное действие Подобрать селекторы. Оно открывает отдельную модалку и:
- работает только для уже сохранённого сайта;
- анализирует типовые страницы этого сайта;
- предлагает безопасные и спорные селекторы;
- позволяет добавить выбранные варианты прямо в поле;
- не сохраняет форму автоматически.
После вставки предложений нужно отдельно нажать Сохранить, иначе изменения останутся только в текущей форме.
Модель для чанкинга
Выбирает модель, которая делит очищенный контент на смысловые части. По умолчанию используется gpt-4.1-mini.
Модель для контекстуализации
Выбирает модель, которая добавляет контекст к чанкам перед созданием эмбеддингов. По умолчанию используется gpt-4o-mini.
Действия и фоновые процессы
На странице редактирования в меню Действия доступны два пользовательских действия.
Сканировать карту сайта (sitemap)
Создаёт фоновую задачу сканирования sitemap. Во время неё система:
- читает карту сайта;
- создаёт новые URL или обновляет уже известные;
- применяет Исключить паттерны URL;
- пропускает заблокированные URL;
- обновляет даты последнего и следующего сканирования.
Сканирование не означает, что все найденные страницы сразу попадут в базу знаний агента. Для этого URL должны быть одобрены и отдельно отправлены в обработку.
Обработать одобренные URL
Действие ищет только те URL этого сайта, которые:
- одобрены;
- не заблокированы;
- ещё не были успешно обработаны или требуют повторной обработки.
Для каждого такого URL создаётся отдельная фоновая задача обработки. Если подходящих URL нет, система покажет предупреждение и ничего не запустит.
Во время обработки страница:
- скачивается и очищается;
- делится на чанки;
- чанки контекстуализируются;
- создаются эмбеддинги;
- предыдущие чанки и эмбеддинги этого URL перед повторной обработкой удаляются.
Если лимиты AI-операций исчерпаны, URL может перейти в состояние паузы с сообщением об ошибке.
Связанные данные
На странице редактирования сайта доступны четыре связанные таблицы.
URL источники
Показывает URL, уже привязанные к сайту:
- URL;
- Статус обработки URL;
- Обработано;
- Создано.
Отсюда можно вручную добавить URL через Добавить URL. Новый URL создаётся как не одобренный и сразу получает фоновую задачу на получение заголовка страницы.
Для полноценного управления жизненным циклом URL удобнее использовать отдельный раздел Источники данных → URL. Именно там обычно подтверждают, блокируют и детально проверяют URL.
Сканирования
Хранит историю запусков sitemap-сканирования:
- тип;
- статус;
- сколько URL найдено, создано, обновлено, пропущено и обработано;
- даты запуска и завершения.
Запуски со статусом PENDING или RUNNING можно отменить.
Обработка URL
Это журнал фоновой обработки URL:
- какой URL обрабатывался;
- статус;
- сколько создано чанков и эмбеддингов;
- когда задача стартовала и завершилась;
- текст ошибки, если она была.
Эта таблица нужна для контроля факта обработки. Детальный разбор конкретного URL выполняется в ресурсе URL.
Доступ и ограничения
Раздел видят не все пользователи.
- Операторы и руководители операторов не видят Веб-сайты в меню.
- Просматривать, создавать и редактировать сайты могут менеджеры и выше в рамках своей организации.
- Удалять сайты могут администраторы и выше.
- Функция источников знаний доступна только на тарифе PRO.
Даже если пользователь имеет роль с доступом к разделу, записи другой организации ему недоступны.
Если что-то не работает
- Проверьте, что у организации активен тариф PRO и функция источников знаний не заблокирована тарифом.
- Убедитесь, что у сайта заполнен корректный Sitemap URL, если вы хотите запускать сканирование прямо из меню Действия.
- Если после сканирования URL появились, но не попадают в обработку, проверьте, одобрены ли они и не заблокированы ли в разделе URL.
- Если подбор селекторов не дал результата, сначала сохраните сайт, а затем попробуйте снова на реальных страницах сайта.
- Если после нажатия Добавить выбранные селекторы появились в поле, но не применились, значит форма ещё не сохранена.
- Если обработка URL не двигается, проверьте работу очередей и наличие фоновых workers.
- Если URL зависают в паузе или с ошибкой, проверьте текст ошибки и лимиты AI-операций организации.
- Если список сайтов пустой при открытом разделе, проверьте, не скрыт ли доступ тарифным ограничением.