ИТ-компании предложили Минцифры легализовать использование обезличенных данных для обучения ИИ
Ассоциация больших данных, объединяющая «Сбер», «Яндекс», VK, «Авито», «Ростелеком» и HH, обратилась в Минцифры с запросом выделить технологии повышения приватности (PETs) в отдельную юридическую категорию.

Суть претензии: сегодня любой алгоритмический массив, прошедший обезличивание, юридически остаётся персональными данными — даже если реальный риск идентификации стремится к нулю. Для отрасли это значит, что один из главных параметров обучения модели — объём качественного датасета — остаётся под административным замком.
Откуда взялся запрос
По данным КоммерсантЪ, текущая нормативная база не различает зрелые PETs-решения и промежуточные методы обезличивания. Всё, что прошло математическое преобразование, считается персональными данными с полным набором ограничений — согласие субъекта, хранение по 152-ФЗ, лимиты на трансграничную передачу. Для крупных экосистем это не критично: внутренние и партнёрские массивы ещё закрывают базовые потребности. Но, как отмечает директор по развитию бизнеса Just AI Светлана Захарова, этих данных уже не хватает — особенно для специализированных корпоративных моделей, где нужна отраслевая статистика и поведенческие паттерны.
Альтернативный путь — синтетические данные. Гендиректор Smart Engines Владимир Арлазаров подчёркивает, что генерация позволяет создавать репрезентативные, неперсонифицированные наборы без нарушения прав граждан. Но заменить реальную поведенческую статистику и медицинские выборки синтетикой получается не всегда: на итерации «обучение → валидация → прод» модели начинают галлюцинировать именно там, где синтетика не покрывает реальные распределения.
Что именно предлагают
АБД выложило конкретный набор условий — это не абстрактная «откройте всё», а список ограничителей:
- Нулевой риск идентификации — или не выше малых долей процента.
- Целевое использование — только разработка, обучение и применение ИИ.
- Территориальная привязка — обработка на территории РФ и только российскими компаниями.
- Доверенный посредник — аккредитованная госорганизация, эксплуатирующая информационную систему хранения и доступа к обезличенным массивам.
- Два пула данных — бесплатный (для исполнения требований законодательства) и платный (для коммерческих задач).
Партнёр Zarya Ventures Александр Пономарев оценивает инициативу как потенциальный ускоритель для российского ИИ-рынка: доступ к качественным данным остаётся одним из главных ограничений для обучения современных моделей. Представитель MWS AI (МТС Web Services) добавляет, что для прикладных корпоративных моделей критичны именно отраслевые выборки — без них затруднительно строить специализированные ИИ-продукты.
Что это значит на практике
Для ИИ-инженера и промпт-дизайнера сигнал прямой: если Минцифры поддержит инициативу, появится легальный слой данных, который можно будет использовать для файн-тюнинга без согласований на уровне каждого субъекта. Это расширяет контекстное окно для обучения — не в токенах, а в смысле: больше реальных паттернов, меньше компромиссов на синтетике.
Но есть лимит, который стоит держать в голове. Предложение пока осталось без ответа от Минцифры. Формат «доверенного посредника» — это новый узел в инфраструктуре, а значит, новые итерации согласований, аккредитаций и, вероятно, задержек. Практикам, работающим с российскими моделями, пока разумнее отслеживать два параметра: скорость реакции регулятора и реальную доступность PETs-массивов в пилотных проектах. Синтетические датасеты как запасной вариант никто не отменял — но границы их применимости уже видны.