В России разработан национальный стандарт для синтетических данных
В России создан предварительный национальный стандарт для синтетических данных — искусственно сгенерированной информации, которая имитирует реальные данные без указания на конкретных людей. Этот документ призван упростить процесс обучения ИИ-моделей и обмена данными между различными организациями и ведомствами. Об этом рассказывает Вести.
Синтетические данные применяются для обучения искусственного интеллекта, тестирования моделей машинного обучения, а также для обмена данными с контрагентами и обогащения существующих массивов. Ранее в России отсутствовали единые требования к созданию и качеству таких данных.
Работа над стандартом велась Ассоциацией больших данных, в которую входят такие компании, как "Яндекс", VK, "Сбер", Т-банк и МТС, совместно с АНО "Национальный технологический центр цифровой криптографии" с начала 2025 года. В ассоциации отмечают, что без этого стандарта невозможно эффективно обучать суверенные ИИ-модели. Качественные синтетические данные, созданные в соответствии со стандартом, не имеют связи с исходной персональной информацией.
Это позволит использовать большой объем данных, которые ранее были недоступны из-за своей чувствительности, заменяя их легально доступными синтетическими аналогами.
Документ включает в себя нейросетевые методы синтеза, техники управления приватностью и метрики качества. Предварительный стандарт будет действовать в течение трех лет, после чего он может стать полноценным ГОСТом или быть пересмотрен.
Представители "Ростелекома", "МегаФона" и Сбербанка поддержали эту инициативу, указав на то, что стандарт поможет снизить риски утечек и неопределенность при использовании данных, а также ускорит внедрение ИИ-решений в государственном и корпоративном секторах.
На международном уровне единого стандарта пока нет, но работы ведутся в таких организациях, как Международная организация по стандартизации (ISO) и Международная электротехническая комиссия (IEC). Некоторые страны имеют свои собственные рекомендации.
Тем не менее, по мнению разработчиков, российский документ уже сейчас находится на передовом уровне благодаря комплексному подходу, который объединяет передовые математические методы и прикладные требования. Впереди — трехлетний этап апробации, в ходе которого стандарт будет дорабатываться с учетом отраслевого опыта, чтобы в конечном итоге стать полноценным ГОСТом, обязательным для всей страны.


