Классическое машинное обучение
Богдан Немешаев · Опубликовано:
Определить тему обращения, оценить срок доставки или найти группы похожих покупателей — для таких задач можно обучить модель на накопленных данных. Классическое машинное обучение предлагает несколько подходов: одни учатся по примерам с известными ответами, другие ищут структуру в самих данных.
На карте показана эта часть машинного обучения. Нажмите на узел, чтобы перейти к его пояснению. Ниже разберём, что получает модель на входе, какой результат выдаёт и когда её удобно использовать вместо большой языковой модели.
Карта классического машинного обучения
На узком экране прокручивайте карту внутри рамки. С клавиатуры выбирайте узлы клавишей Tab и открывайте пояснения клавишей Enter. Под картой есть текстовое содержание.
Содержание статьи
Что такое классическое машинное обучение
Классическим машинным обучением обычно называют подходы, которые рассматривают отдельно от глубоких нейросетей: линейные модели, деревья решений, методы ближайших соседей и другие. Модель использует закономерности в данных, чтобы предсказывать ответы или описывать сходство между объектами. Вместо списка правил для каждого случая разработчик выбирает способ обучения и готовит примеры.
Данные часто представляют в виде таблицы: строка — заказ, обращение или покупатель, столбцы — их признаки, то есть характеристики. Для заказа это могут быть расстояние и масса посылки. Текст тоже можно превратить в признаки, например указать, какие слова встречаются в обращении и сколько раз. Выбор такого представления влияет на результат.
Почему обучение называется классическим
Это условное название круга методов, а не строгая граница по дате изобретения. Оно не означает, что все эти методы появились раньше любых нейросетей, и не делает их устаревшими. Если модель решает задачу с нужным качеством и приемлемыми затратами, возраст подхода сам по себе не мешает его применять.
Обучение с учителем и без учителя описывает способ работы с данными; нейросеть — устройство модели. Поэтому нейросети тоже могут обучаться обоими способами. Их место рядом с классическими и ансамблевыми методами показано на общей карте технологий искусственного интеллекта.
Обучение с учителем
При обучении с учителем у каждого обучающего примера есть известный целевой ответ. Для прошлой доставки известен фактический срок, а для обращения — тема, которую отметил сотрудник. «Учителем» называют эти ответы: человеку не нужно подсказывать модели при каждом новом прогнозе.
По примерам модель учится связывать признаки с ответом. Затем ей передают новое обращение или заказ, для которого ответ ещё неизвестен. Качество проверяют на отдельных примерах, которые не использовали при обучении. Хорошо запомнить прошлые данные недостаточно: важно справляться с новыми случаями.
Классификация: выбрать категорию
Классификация относит объект к одной или нескольким заранее определённым категориям. Например, служба поддержки использует темы «оплата», «доставка» и «возврат». Для обучения нужны прошлые обращения с такими отметками. На вход новой модели поступает текст, представленный признаками, на выходе получается предполагаемая тема.
Для сообщения «Деньги списались дважды» ожидаемая категория — «оплата». Если обращение касается сразу нескольких вопросов или новой темы, модель может ошибиться; порядок передачи сложных случаев сотруднику задают отдельно.
Регрессия: спрогнозировать число
Регрессия оценивает числовую величину. Для прогноза срока доставки можно взять расстояние, массу посылки, способ перевозки и день отправления. В обучающих примерах к ним добавляют фактическое время доставки. Для нового заказа модель выдаёт оценку продолжительности, например в часах.
Различие с классификацией задаётся вопросом. «Сколько часов займёт доставка?» — регрессия. «Приедет ли заказ вовремя?» с ответами «да» и «нет» — классификация. Даже если категории записаны цифрами, задача не становится регрессией. Прогноз срока остаётся оценкой: непредвиденная остановка или новый маршрут могут изменить результат.
Обучение без учителя
При обучении без учителя нет заранее заданного целевого ответа для каждого примера. Есть сведения о покупках или характеристиках товаров, а метод ищет в них структуру: похожие группы, частые сочетания или более компактное представление.
Отсутствие учителя не означает отсутствие человека. Нужно выбрать данные, определить, какие признаки учитывать, настроить метод и проверить смысл результата. Найденное разделение покупателей может оказаться полезным для работы магазина, а может отражать лишь случайную особенность выбранного периода.
Кластеризация: найти похожие группы
Кластеризация объединяет похожие объекты в группы — кластеры. Магазин может описать покупателей частотой заказов, средним чеком и давностью последней покупки. Готовых отметок «постоянный» или «редкий» в обучающих данных при этом нет: группы формируются по выбранным признакам и способу измерять сходство.
После расчёта аналитик рассматривает состав групп и решает, как их назвать. Если заменить частоту заказов на любимые категории товаров, разделение может измениться. Кластеризация не открывает единственные «истинные типы» покупателей и не гарантирует, что группы подходят для конкретной акции.
Поиск ассоциативных правил: что встречается вместе
Ассоциативные правила описывают повторяющиеся сочетания. На вход можно подать состав покупок: какие товары оказались в одной корзине. Результат — связи вида «в корзинах с кофе встречаются и бумажные фильтры». Такие правила помогают искать кандидатов для совместных предложений.
Условный пример с кофе нужно проверить на реальных данных: достаточно ли таких покупок и не встречаются ли фильтры часто сами по себе. Совместная покупка не доказывает, что один товар стал причиной покупки другого. Правило описывает наблюдаемую связь, а пользу предложения проверяют отдельно.
Уменьшение размерности: описать данные компактнее
Размерность — число признаков, которыми описан объект. Уменьшение, или снижение, размерности позволяет перейти от множества исходных признаков к меньшему числу новых. Например, вместо десятков связанных характеристик товара получить несколько обобщённых показателей для дальнейшего анализа.
Такое представление может облегчить вычисления или помочь разместить объекты на плоскости для просмотра. Это не обязательно выбор нескольких старых столбцов: новые признаки могут сочетать значения исходных. Часть информации теряется, поэтому нужно проверить, сохранились ли различия, важные для следующей задачи.
Чем обучение с учителем отличается от обучения без учителя
Рассмотрим один интернет-магазин. Он хочет прогнозировать повторную покупку и понять, какие группы покупателей есть в его истории заказов. Предметная область общая, но вопросы к данным разные.
| Что сравниваем | С учителем | Без учителя |
|---|---|---|
| Какие данные нужны | История покупок до выбранной даты и известный ответ: вернулся ли покупатель в следующий месяц. | Характеристики покупок: частота, суммы, давность. Готовых отметок группы нет. |
| Что известно заранее | Какой ответ предсказываем и как он выглядел в прошлых примерах. | По каким признакам сравниваем покупателей. Состав групп ещё не известен. |
| Какой результат получаем | Прогноз повторной покупки для нового случая. | Группы похожих покупателей, которые предстоит изучить и описать. |
В первом случае нельзя давать модели сведения из будущего, например сумму заказов за тот месяц, который она должна предсказать. Во втором не получится просто сравнить группы с заранее известным правильным ответом: оценивают их устойчивость, различия и полезность для задачи.
Какие методы используются
Задача определяет нужный результат, а алгоритм — способ его получить. Классификация не равна дереву решений: её можно решать разными методами. И один метод иногда подходит для нескольких типов задач.
- Линейная регрессия. Прогнозирует число, складывая вклады признаков с подобранными при обучении весами. Подходит как исходный простой вариант, например для оценки срока по расстоянию и другим характеристикам доставки; сложные зависимости такое описание может не передать.
- Логистическая регрессия. Несмотря на название, используется для классификации. Она оценивает вероятность категории, например того, что обращение связано с оплатой. На основе оценки выбирают категорию или решают передать случай человеку.
- Дерево решений. Последовательно проверяет условия: например, способ доставки, затем диапазон расстояния. В конце получает категорию или число. Небольшое дерево можно проследить шаг за шагом, а слишком сложное способно запомнить особенности обучающих примеров.
- Метод ближайших соседей. Ищет похожие примеры среди сохранённых данных. Для категории можно использовать голосование соседей, для числа — среднее их ответов. Результат зависит от того, какие признаки считаются важными и как измеряется сходство.
- k-means, или метод k-средних. Делит объекты на заранее выбранное число групп. Поочерёдно относит их к ближайшим центрам и пересчитывает центры как средние значения признаков внутри групп. Нужное число групп и пригодность такого способа разделения оценивает человек.
- PCA, или метод главных компонент. Создаёт новые признаки как сочетания исходных и сохраняет направления с наибольшим разбросом данных. Его используют для уменьшения размерности. Большой разброс не обязательно означает пользу для конкретного прогноза, поэтому результат преобразования проверяют.
Ансамблевые методы объединяют несколько моделей, например деревьев, в общий прогноз. Они связаны с классическим машинным обучением, но на общей карте выделены отдельно. В этой статье карта сохраняет фокус на двух способах обучения и пяти типах задач.
Где применяется классическое машинное обучение
Ниже — возможные постановки задач, а не описание реальных внедрений. В каждой полезно заранее назвать входные данные, результат и действие, для которого он нужен.
- Определение темы обращения. На входе — признаки текста сообщения, на выходе — категория. Её можно использовать для выбора очереди поддержки; при проверке важно учитывать, какие ошибки направления обходятся дороже.
- Прогноз срока доставки. На входе — характеристики заказа и перевозки, на выходе — число часов или дней. Оценку сравнивают с фактическими сроками новых доставок, прежде чем использовать в обещаниях клиентам.
- Группировка покупателей. На входе — история покупок, на выходе — группы со сходными характеристиками. Аналитик изучает различия между ними, чтобы выбрать дальнейшие вопросы или проверить идеи предложений.
- Поиск совместных покупок. На входе — состав корзин, на выходе — повторяющиеся сочетания товаров. Они дают идеи для подборок, но сами по себе не доказывают, что подборки увеличат продажи.
- Компактное представление признаков. На входе — множество измерений, на выходе — несколько обобщённых показателей. Их можно передать следующей модели или использовать для обзора данных, проверив потери информации.
Когда классические методы удобнее нейросетей и LLM
Нейросети тоже относятся к машинному обучению. Большая языковая модель, или LLM, — нейросетевая модель для работы с языком. Сравнивать стоит конкретные решения одной задачи: например, компактный классификатор обращений и языковую модель, которой поручили выбирать те же категории.
Классические методы удобно рассмотреть, когда нужен определённый результат, есть подходящие признаки и накоплены примеры. Если требуется лишь выбрать тему из известного списка, создание развёрнутого текста может быть лишней работой. При этом классический метод может ошибаться на сложных формулировках, а готовая LLM иногда помогает начать работу, когда размеченных примеров ещё мало.
- Вычисления и скорость. У простой линейной модели или небольшого дерева расчёт ответа может быть коротким. Но измерять нужно весь путь: подготовку данных, сам прогноз и, для облачного сервиса, обмен запросом и ответом. Сложная классическая модель тоже может работать долго.
- Объяснимость. У небольшого дерева можно показать последовательность условий, а у линейной модели — вклады признаков. Это облегчает разбор отдельных решений, но не доказывает причинных связей и не делает любую классическую модель понятной.
- Требования к данным. Для обучения с учителем нужны примеры с корректными ответами, похожие на будущие случаи. Подготовка признаков и разметки требует труда. Готовая LLM уже прошла обучение, но её пригодность для нужного языка, тем и формата ответа всё равно проверяют на своих примерах.
- Границы задачи. Для пересказа документа или свободного диалога языковая модель даёт возможности, которых нет у обычного классификатора. Для прогноза числа или группировки объектов такие возможности могут не понадобиться. Выбор зависит от качества, ресурсов и требований к сопровождению.
Какие ресурсы нужны для работы модели
Обучение и использование — разные затраты. При обучении подбираются параметры или подготавливаются данные, на которых будет основан ответ. После этого готовая модель всё равно выполняет вычисления для новых примеров. Отсутствие повторного обучения на каждом запросе не означает отсутствие расходов на работу.
Локальная LLM. Если языковая модель запускается на своём компьютере или сервере, там должны храниться и обрабатываться её данные. Крупной модели может понадобиться значительный объём оперативной памяти или видеопамяти. Ресурсы зависят от размера и способа хранения модели, длины запроса и ответа, числа одновременно обслуживаемых запросов.
Облачная LLM. Основные вычисления выполняет поставщик, а приложению нужен доступ к сервису для отправки запроса и получения ответа. Остаётся зависимость от соединения, доступности сервиса, ограничений запросов и условий оплаты. Бесплатный доступ или готовая модель не устраняют эти условия эксплуатации.
Компактная классическая модель. Небольшую модель, обученную под конкретную задачу, часто можно использовать на обычном процессоре — CPU — со скромными ресурсами, без мощной видеокарты и внешнего сервиса. Это удобно, если нужные входные данные тоже доступны локально. Для оценки затрат учитывают и подготовку признаков, и ожидаемое число запросов.
Это не универсальное правило. Существуют компактные языковые модели, а классическое решение может требовать много памяти или вычислений: например, при поиске ближайших соседей в большой коллекции. Возможность запустить модель и способность получать ответы достаточно быстро — разные требования.
Что проверять после запуска
Модель нельзя считать обученной один раз навсегда. Меняются товары, маршруты, темы обращений и поведение покупателей. Нужно следить за ошибками, качеством входных данных и временем ответа; при изменениях может потребоваться проверка и переобучение.
Подходы можно сочетать: например, нейросеть преобразует сложный текст в числовое представление, а классическая модель выбирает категорию. Тогда ресурсы нужны для всей цепочки. Практический выбор делают по проверке на одной задаче: подходит ли качество, укладывается ли ответ в нужное время и можно ли поддерживать решение.