В России принят документ, который даст новый импульс развитию ИИ
Обмен наборами данных между организациями упростится, а российские технологии и платформы могут вызвать интерес на зарубежных рынках.

Как оценить качество датасетов
В России утверждена серия из трех предварительных национальных стандартов (ПНСТ), регулирующих создание и использование синтетических данных – искусственно сформированных наборов, воспроизводящих статистические свойства реальных данных, но не связанных напрямую с конкретными людьми. Речь идет о ПНСТ 1064-2026 «Синтез данных. Основные положения», ПНСТ 1065-2026 «Синтез данных. Архитектура процесса синтеза данных. Методы синтеза» и ПНСТ 1066-2026 «Синтез данных. Описание результатов процесса синтеза. Методика оценки качества». Они уже приняты Росстандартом и должны вступить в действие 1 сентября 2026 года.
Стандарты разрабатывались «Ассоциацией больших данных» при участии АНО «Национальный технологический центр цифровой криптографии». Работа началась в 2025 году.
Документы устанавливают общие правила генерации синтетических данных, архитектуру соответствующих систем, методы оценки качества и приватности. Эти данные позволяют создавать большие датасеты там, где реальные сведения недоступны, содержат персональные или коммерчески чувствительные данные либо их сбор слишком дорог. Впервые в России появилась единая методологическая база, по которой компании смогут оценивать качество и безопасность синтетических датасетов.

Обмен данными станет проще
Теперь российским разработчикам будет доступна расширенная ИИ-база данных. Работа с такой базой может быть востребована в областях, где одновременно требуется много данных для машинного обучения и действуют повышенные требования к конфиденциальности: в банках, телекоме, госсекторе, медицине и промышленности. Кроме того, стандартизация может упростить обмен датасетами между организациями: появятся унифицированные требования к генерации данных, документированию процесса, оценке качества и приватности.
Технологии генерации и безопасного обмена данными и корпоративные платформы подготовки датасетов для ИИ со временем могут стать и экспортным продуктом. Во всяком случае, в проектах стандартов указывалось, что прямых международных и региональных аналогов разработанных документов на момент подготовки не было. Это дает России возможность продвигать собственные подходы к стандартизации синтетических данных, в том числе в рамках технологического сотрудничества со странами БРИКС.

От проекта до апробации – полтора года
Еще в 2023 году «Сбер» разработал собственную экосистему генерации синтетических данных для обучения ИИ и работы с конфиденциальными массивами – SyntData. В 2024 году сервис был включен в Единый реестр российского ПО. А уже в январе 2025 года «Ассоциация больших данных» сообщила о разработке предварительного стандарта синтеза данных – совместно со «Сбером» и другими участниками рынка. В сентябре же «Ассоциация больших данных» и Академия криптографии провели семинар, посвященный архитектуре систем синтеза, дифференциальной приватности, GAN- и VAE-генераторам, а также методам оценки качества синтетических данных.
В июне 2026 года о синтетических данных говорили уже как о части более широкой повестки экономики данных. А в июле Росстандарт принял серию ПНСТ 1064–1066. Таким образом, работа, начатая в 2025 году с проекта стандарта, перешла к официальной апробации нормативных документов.

Реальные данные не исчезнут
В ближайшие три года стандарты должны быть испытаны на практике. ПНСТ 1064 и 1066 рассчитаны на срок до 1 сентября 2029 года, после чего накопленный отраслевой опыт может быть использован при пересмотре документов или переводе требований в постоянные национальные стандарты.
Лучший эффект вероятен в сферах, где нехватка доступных качественных данных ограничивает внедрение ИИ. При этом синтетические данные не стоит рассматривать как полную замену реальным: качество моделей непосредственно зависит от того, насколько искусственный датасет воспроизводит реальные закономерности и не переносит ошибки или смещения исходных данных. Именно поэтому отдельный документ серии посвящен методикам оценки качества и приватности.









































