АННОТАЦИИ К СТАТЬЯМ (ЖУРНАЛ ``ИНФОРМАТИЗАЦИЯ И СВЯЗЬ`` №1, 2026)

Е. В. Егоров, Т. П. Яковлева, С. Г. Ермаков, А. Ю. Ширяев

ФИЛЬТРАЦИЯ И ИСПРАВЛЕНИЕ НЕКОРРЕКТНЫХ ЗАПИСЕЙ ПЕРЕД ИХ АНАЛИТИЧЕСКОЙ ОБРАБОТКОЙ

Аннотация: В статье рассмотрены вопросы обеспечения качества данных на преданалитическом этапе посредством фильтрации и исправления некорректных записей. Показано, что в условиях роста объёмов и разнообразия источников данные часто содержат дубликаты, пропуски, ошибки форматов и логические несоответствия, что приводит к искажению метрик, снижению доверия к аналитике и росту издержек. Цель статьи — систематизировать методы выявления и устранения дефектов данных, а также сопоставить инструменты и организационные практики, применимые в корпоративной среде. Методология включает анализ правил валидации, алгоритмов дедупликации и импутации, применение стандартов качества и построение технологических конвейеров с зонами карантина, журналированием и автоматическими тестами. Практический пример иллюстрирует эффект внедрения процедур Data Quality Management (DQM) и автоматизированной валидации. Делается вывод о необходимости интеграции контроля качества в инфраструктуру работы с данными и процессы управления данными (Data Governance), а также о перспективах применения ИИ для контекстного исправления записей.

Ключевые слова: качество данных; очистка данных; фильтрация записей; исправление ошибок; предобработка данных; аналитическая обработка; валидация данных; ETL/ELT; DQM; автоматизация очистки.

Е.V. Egorov, T.P. Yakovleva, S.G. Ermakov, A.Y.

FILTERING AND CORRECTION OF INVALID RECORDS PRIOR TO ANALYTICAL PROCESSING

Abstract: The article addresses issues of ensuring data quality at the pre-analytical stage through filtering and correction of invalid records. It is shown that, under conditions of growing data volumes and increasing diversity of data sources, datasets often contain duplicates, missing values, format errors, and logical inconsistencies. These defects lead to distorted metrics, reduced trust in analytics, and increased operational costs. The purpose of the article is to systematize methods for detecting and eliminating data defects, as well as to compare tools and organizational practices applicable in a corporate environment. The methodology includes analysis of validation rules, deduplication and imputation algorithms, application of data quality standards, and construction of technological pipelines with quarantine zones, logging, and automated tests. A practical example illustrates the effect of implementing Data Quality Management (DQM) procedures and automated validation. The conclusion emphasizes the necessity of integrating data quality control into data infrastructure and data governance processes, as well as the prospects for using artificial intelligence for contextual record correction.

Keywords: data quality; data cleansing; record filtering; error correction; data preprocessing; analytical processing; data validation; ETL/ELT; DQM; data cleansing automation.

DOI: 10.34219/2078-8320-2026-16-1-130-133

ИНФОРМАЦИЯ ОБ АВТОРАХ

Егоров Евгений Витальевич — студент кафедры «Информационные и вычислительные системы» факультета «Автоматизация и интеллектуальные технологии». Научные интересы: большие данные.
е-mail: ummuysi@yandex.ru

Яковлева Татьяна Павловна — студентка кафедры «Информационные и вычислительные системы» факультета «Автоматизация и интеллектуальные технологии». Научные интересы: большие данные. е-mail: sillabika@gmail.com

Ермаков Сергей Геннадьевич — д-р техн. наук, профессор, заведующий кафедрой «Информационные и вычислительные системы». Научные интересы: обработка данных, корпоративные хранилища данных, безопасность данных. е-mail: ermakov@pgups.ru

Ширяев Алексей Юрьевич — Директор по развитию компании «КомплексИС». Научные интересы — защита данных, построение отказоустойчивых систем обработки данных, экономика информационной безопасности и IT, DevSecOps и безопасность гибкой разработки, управление рисками в условиях неопределённости.
е-mail: ShiryaevAU@outlook.com

Egorov Evgeniy Vitalievich — student of the Department of Information and Computing Systems, Faculty of Automation and Intelligent Technologies. Research interests: big data. е-mail: ummuysi@yandex.ru

Yakovleva Tatyana Pavlovna — student of the Department of Information and Computing Systems, Faculty of Automation and Intelligent Technologies. Research interests: big data. е-mail: sillabika@gmail.com

Ermakov Sergey Gennadievich — Doctor of Technical Sciences, Professor, Head of the Department of Information and Computing Systems. Research interests: data processing, enterprise data warehouses, data security.
е-mail: ermakov@pgups.ru

Shiryaev Alexey Yurievich — Director of Development at KompleksIS company. Research interests: data protection, design of fault-tolerant data processing systems, economics of information security and IT, DevSecOps and agile security, risk management under uncertainty. е-mail: ShiryaevAU@outlook.com