АННОТАЦИИ К СТАТЬЯМ (ЖУРНАЛ ``ИНФОРМАТИЗАЦИЯ И СВЯЗЬ`` №3, 2026)
Л.А. Виткова
ОЦЕНКА УСТОЙЧИВОСТИ МОДЕЛЕЙ МАШИННОГО ОБУЧЕНИЯ К ИСКАЖЕНИЯМ РАЗМЕТКИ ДАННЫХ: СРАВНЕНИЕ СЛУЧАЙНОГО ШУМА И АТАК ПОДМЕНЫ МЕТОК
Резюме: Статья посвящена оценке устойчивости моделей машинного обучения к искажениям разметки обучающих данных. Актуальность исследования обусловлена тем, что этап разметки является критическим элементом жизненного цикла модели и одновременно одной из наиболее уязвимых точек при использовании автоматизированной разметки, аутсорсинга и распределённых процессов подготовки данных. Цель работы состоит в количественной оценке влияния случайного шума и целенаправленных атак подмены меток на качество классификатора и в определении предварительных порогов деградации, значимых для практического применения моделей в критической информационной инфраструктуре. Методика исследования сочетает анализ угроз на этапе разметки с воспроизводимым экспериментом на наборе данных Wine с использованием логистической регрессии; качество модели оценивалось на чистой тестовой выборке при последовательном увеличении доли случайно и целенаправленно искажённых меток. Показано, что при случайном шуме до 20% снижение точности остаётся менее 5%, тогда как целенаправленная атака подмены меток (label-flipping) при доле отравленных данных около 8% от общего объёма уже вызывает сопоставимую деградацию. Установлено, что целенаправленное искажение меток является более эффективным по сравнению со случайным шумом и формирует систематический паттерн ошибок. Научная новизна работы заключается в разработке и апробации воспроизводимого подхода к количественной оценке чувствительности моделей к искажениям разметки и в получении предварительных пороговых значений деградации качества. Практическая значимость результатов связана с возможностью их использования при валидации и мониторинге моделей машинного обучения на объектах КИИ, включая введение этапа оценки чувствительности к искажениям меток и фиксацию соответствующих порогов в паспорте безопасности модели.
Ключевые слова: Безопасность машинного обучения; целостность разметки; атаки на разметку данных; атаки подмены меток; отравление обучающих данных; устойчивость моделей к атакам; защита моделей машинного обучения
L.A. Vitkova
ROBUSTNESS OF MACHINE LEARNING MODELS TO LABEL CORRUPTION: COMPARING RANDOM NOISE AND LABEL-FLIPPING ATTACKS
Summary: The paper addresses the robustness of machine learning models to distortions in training data labels. The study is motivated by the fact that data labeling is a critical stage of the model lifecycle and, at the same time, one of its most vulnerable points when automated annotation, outsourcing, and distributed data preparation workflows are used. The aim of the study is to quantify the impact of random label noise and targeted label-flipping attacks on classifier performance and to identify preliminary degradation thresholds relevant to the practical use of models in critical information infrastructure. The research methodology combines an analysis of threats arising at the labeling stage with a reproducible experiment conducted on the Wine dataset using logistic regression; model performance was evaluated on a clean test set under progressively increasing levels of random and targeted label corruption. The results show that random noise of up to 20% leads to an accuracy drop of less than 5%, whereas a targeted label-flipping attack affecting about 8% of the total data already causes a comparable degradation. The study demonstrates that targeted label corruption is more effective than random noise and produces a systematic error pattern. The scientific novelty of the work lies in the development and validation of a reproducible approach to the quantitative assessment of model sensitivity to label distortions and in obtaining preliminary quality degradation thresholds. The practical significance of the results is associated with their potential use in the validation and monitoring of machine learning models deployed in critical information infrastructure, including the introduction of a label-distortion sensitivity assessment stage and the recording of the corresponding thresholds in the model security passport.
Keywords: Machine learning security; label integrity; data labeling attacks; label-flipping attacks; training data poisoning; model robustness to attacks; secure machine learning models.
DOI: 10.34219/2078-8320-2026-16-3-144-153
ИНФОРМАЦИЯ ОБ АВТОРАХ
Виткова Лидия Андреевна – к.т.н., начальник аналитического центра кибербезопасности ООО «Газинформсервис»; старший научный сотрудник, Федеральное государственное бюджетное учреждение науки «Санкт-Петербургский Федеральный Исследовательский Центр Российской Академии Наук» (СПб ФИЦ РАН),
Санкт-Петербургский институт информатики и автоматизации Российской академии наук, Лаборатория проблем компьютерной безопасности e-mail: vitkova@comsec.spb.ru
Vitkova Lidya Andreevna – Ph.D. (Engineering), Head of the Cybersecurity Analytics Center, LLC «Gazinformservice». Senior research fellow, St. Petersburg Federal Research Center of the Russian Academy of Sciences (SPC RAS), St. Petersburg Institute for Informatics and Automation of the Russian Academy of Sciences, Laboratory of Computer Security Problems e-mail: vitkova@comsec.spb.ru