Север и рынок. 2026, № 3.
Методы и методология В текущей работе целью кластеризации является разбиение российских регионов на несколько кластеров (групп) так, чтобы объекты внутри каждого кластера были максимально похожи друг на друга, а кластеры — максимально различны. Основным методом кластеризации был выбран k-means, который является достаточно популярным инструментом в экономических исследованиях. В качестве альтернативных методов выступили иерархическая кластеризация, а также Affinity Propagation и DBSCAN. Все расчеты выполнены на Р у Ш оп . Среди используемых библиотек — pandas, sdkit-learn, mathplotlib, seaborn. При описании методов воспользуемся статьями Jain et al. (1999, 2010), а также порталом библиотеки sdkit-learn5. Метод k-means разбивает данные на заданное число кластеров, группируя объекты по близости к центроидам. Он итеративно назначает точки к ближайшему центру и обновляет центроиды как среднее точек в каждом кластере. Процесс повторяется до тех пор, пока центроиды не перестанут изменяться, обеспечивая сходимость алгоритма. Иерархическая кластеризация (в частности, метод Варда) строит древовидную структуру кластеров, начиная либо с отдельных объектов (агломеративный подход), либо с одного большого кластера (дивизионный подход). На каждом шаге алгоритм объединяет или делит кластеры на основе меры сходства или расстояния между ними. В результате получается дендрограмма, позволяющая визуально анализировать структуру данных на разных уровнях детализации [22; 23]. Метод Affinity Propagation кластеризует данные, передавая сообщения между точками, чтобы выявить центроиды (экземпляры) кластеров без необходимости заранее задавать их количество. Алгоритм итеративно обновляет два типа сообщений — «ответственность» и «доступность», отражающих, насколько точка подходит быть центроидом и насколько ей стоит доверять. В итоге каждый кластер формируется вокруг выбранного центроида, который наиболее репрезентативен для своей группы. Стоит отметить, что, в отличие от Affinity Propagation, метод k-means требует изначально задать число кластеров, то есть, чтобы правильно его определить, нам сначала нужно сравнить несколько вариантов кластеризации с помощью метрик качеств (индекс силуэта, индекс Дэвиса — Болдина, внутрикластерное расстояние). 5 Scikit-learn. Machine Learning in Python https://scikit- learn.org/stable/index.html (дата обращения: 10.10.2025). 6 Постановление Правительства РФ от 16.11.2021 № 1946 «О б утверждении перечня районов Крайнего Севера и местностей, приравненных к районам Крайнего Севера, в целях предоставления Метод локтя используется для выбора оптимального количества кластеров в задаче кластеризации через анализ графика зависимости суммы внутрикластерного расстояния от числа кластеров. Точка «локтя» на графике, где снижение ошибки начинает замедляться, считается оптимальным числом кластеров. Индекс силуэта измеряет качество кластеризации, оценивая, насколько объекты похожи на свой кластер по сравнению с соседними кластерами. Значение индекса варьируется от -1 до 1, где близкое к 1 означает хорошее разделение кластеров, а близкое к -1 — неправильное распределение объектов. Индекс Дэвиса — Болдина оценивает качество кластеризации, сравнивая внутрикластерное расстояние с межкластерным расстоянием, при этом меньшие значения индекса указывают на более компактные и хорошо разделенные кластеры. Чем ниже индекс, тем лучше структура кластеров, так как кластеры имеют малую вариативность внутри и большие расстояния между собой. Для того, чтобы оценить финансовое положение домохозяйств, выберем несколько показателей, которые являются достаточно устойчивыми характеристиками их благосостояния. Стоит отметить, что под благосостоянием чаще всего подразумевается величина активов (в частности, чистых, то есть с исключением долга) и доходов. Отобранные показатели приведены в табл. 1. Представленные показатели существенно различаются по масштабу, а также измеряются в различных единицах. Для того, чтобы избежать придания большего веса признакам, которые номинально имеют большие значения, было проведено масштабирование признаков с использованием метода MinMax(). Кластеризация проводилась по данным 85 регионов России, то есть по всем субъектам, по которым полностью доступна вся необходимая статистика. При этом под северными регионами мы понимаем субъекты Российской Федерации, перечисленные в Постановлении Правительства РФ от 16.11.2021 № 1946 в качестве регионов Крайнего Севера6 (полностью или частично). Это: Республика Карелия, Республика Коми, Республика Саха (Якутия) (вся республика), Республика Тыва, Камчатский край (весь край), Красноярский край, Хабаровский край, Архангельская область, Иркутская область, Магаданская область (вся область), Мурманская область (вся область), Сахалинская область, Ненецкий автономный округ (весь округ), Чукотский автономный округ (весь округ), Ямало-Ненецкий автономный округ (весь округ), Ханты- Мансийский автономный округ — Югра. Всего 16 регионов. государственных гарантий и компенсаций для лиц, работающих и проживающих в этих районах и местностях, признании утратившими силу некоторых актов Правительства Российской Федерации и признании не действующими на территории Российской Федерации некоторых актов Совета Министров СССР».
Made with FlippingBook
RkJQdWJsaXNoZXIy MTUzNzYz