РЕШАЕМЫЕ ПРОБЛЕМЫ

Превращаем «грязные» номенклатурные данных в упорядоченную структуру

  • Грязные и ненормализованные данные
    Разные форматы, сокращения, опечатки и дубли делают данные несопоставимыми. Семантиум приводит информацию к единому представлению и помогает автоматически находить соответствия.
  • Путаница в товарных атрибутах
    Объём, вес, упаковка, количество и другие характеристики часто указаны непоследовательно или интерпретируются неверно. Система выделяет атрибуты и учитывает их взаимосвязь при сопоставлении.
  • Неэффективный или ошибочный поиск по базам данных
    Обычный поиск часто не находит нужный товар из-за различий в написании или, наоборот, возвращает слишком много нерелевантных результатов. Гибридный поиск объединяет несколько подходов и ранжирует кандидатов по совокупности признаков.
  • Сложности с классификацией
    Одинаковые или похожие товары могут попадать в разные категории, а их признаки — интерпретироваться по-разному. Система определяет вероятную категорию и использует её для корректной интерпретации атрибутов и поиска.

КАК РАБОТАЕТ

Основные возможности
Управляемая система сопоставления наименований товаров и иных
характеристик на основе машинного обучения и правил включает в себя:
Гибридный поиск по базе данных
Понимание товарных атрибутов
Попарная оценка релевантности и обучаемое ранжирование
Обучение на пользовательских исправлениях

Позволяет осуществлять безопасный цикл подготовки, проверки и публикации изменений, чтобы улучшать качество поиска без риска навредить рабочей версии.

Поиск реализован как многоступенчатая система сопоставления товарных позиций. Его задача — не просто найти похожую строку, а надежно связать неточный пользовательский запрос с конкретной карточкой товара или наименованием. Система учитывает бренд, объём, упаковку, количество, категорию, артикулы, синонимы и ошибки в исходных данных.

Каждый запрос проходит через цепочку этапов

  • Нормализация входящего текста
    Приводит исходный запрос к единому виду: устраняет лишние различия в написании, форматах, сокращениях и обозначениях, сохраняя при этом смысловые признаки товара.
    1
  • Извлечение сущностей и товарных признаков
    Выделяет из запроса ключевые элементы — бренд, категорию, объем, вес, упаковку, количество, артикул и другие характеристики, превращая неструктурированный текст в набор признаков.
    2
  • Подбор приоритетных кандидатов
    Формирует широкий список потенциально подходящих номенклатур, используя несколько механизмов поиска. На этом этапе главная задача — не упустить правильный вариант, даже если он существенно отличается от исходного запроса.
    3
  • Построение гипотез о категории товара
    Определяет наиболее вероятную категорию товара и оценивает альтернативные варианты. Это позволяет учитывать контекст и правильно интерпретировать характеристики на следующих этапах.
    4
  • Интерпретация атрибутов с учетом категории
    Проверяет и уточняет значения товарных признаков с учётом категории. Один и тот же показатель может иметь разное значение в разных категориях, поэтому система сопоставляет атрибуты не изолированно, а в контексте товара.
    5
  • Дополнительная попарная оценка запроса и кандидата
    Для каждого перспективного кандидата система проводит детальное сравнение с исходным запросом. Оценивается не только текстовая близость, но и совпадение, конфликт или отсутствие ключевых атрибутов.
    6
  • Финальное обучаемое ранжирование
    Объединяет результаты всех предыдущих этапов и формирует итоговый порядок кандидатов. Ранжирование учитывает накопленный опыт системы и пользовательские исправления, постепенно адаптируясь к особенностям конкретного каталога.
    7

ЧТО ВЫДЕЛЯЕТ ПЛАТФОРМУ

Все атрибуты — под контролем, а не на усмотрении LLM-модели
  • Компиляция нескольких технологий
    В системе одновременно используются лексический поиск, нечеткое сопоставление, поиск по смысловым векторам, строгие атрибутные подсказки, попарная модель оценки и обучаемый ранжировщик. Это особенно важно для товарных каталогов, где короткие строки вроде “кола 033 жб x12” несут много смысла, но плохо работают в обычном семантическом поиске.
  • Явная онтология атрибутов
    Система знает, какие признаки и канонические атрибуты допустимы: например, тип упаковки, объём, количество в упаковке, бренд. Система защищена от галлюцинаций LLM. Это снижает риск неконтролируемого поведения и делает поиск пригодным для корпоративных сценариев.
  • Проверка качества и обучение встроены в жизненный цикл
    Любая коррекция сопоставления превращается в обучающий сигнал: правильный товар, ошибочные кандидаты, инцидент, аннотация или предложение правила. Публикация новых правил, адаптеров или весов проходит через подготовку поискового слоя, контрольную проверку на полном каталоге и отдельный шаг публикации. Проверка учитывает не только сохраненные негативные примеры, но и весь текущий каталог, чтобы находить случаи, где новый товар может вытеснить правильный результат.
  • Языковая модель используется с осторожностью
    Она помогает с первичной разметкой, предлагает аннотации и правила, но не меняет рабочую версию напрямую. Все предложения проходят проверку человеком, попадают в черновик, затем проходят оценку влияния, подготовку кандидата, контрольную проверку и только после этого публикацию. Это позволяет использовать языковую модель как ускоритель настройки, не превращая её в неконтролируемый источник правил.

КЕЙСЫ ПРИМЕНЕНИЯ

Сопоставление номенклатур
Описание ситуации
Торговая сеть получает прайс-листы от 50 поставщиков. Один и тот же товар называется по-разному:
— «Молоко Простоквашино 3,2% 930 мл»
— «Простоквашино молоко 930мл 3.2%»
— «Молоко Простоквашино жирн. 3,2% 0,93л»

Что делает система
Автоматически определяет, что это один и тот же товар, и связывает его с единой карточкой в справочнике

Эффект
Сокращение ручной обработки на 90–95%,
вместо 3–5 минут на позицию — менее 1 секунды, снижение количества дублей в каталоге