Новость

ИТ-компании предложили Минцифры легализовать использование обезличенных данных для обучения ИИ

Ассоциация больших данных, объединяющая «Сбер», «Яндекс», VK, «Авито», «Ростелеком» и HH, обратилась в Минцифры с запросом выделить технологии повышения приватности (PETs) в отдельную юридическую категорию.

ИТ-компании предложили Минцифры легализовать использование обезличенных данных для обучения ИИ

Суть претензии: сегодня любой алгоритмический массив, прошедший обезличивание, юридически остаётся персональными данными — даже если реальный риск идентификации стремится к нулю. Для отрасли это значит, что один из главных параметров обучения модели — объём качественного датасета — остаётся под административным замком.

Откуда взялся запрос

По данным КоммерсантЪ, текущая нормативная база не различает зрелые PETs-решения и промежуточные методы обезличивания. Всё, что прошло математическое преобразование, считается персональными данными с полным набором ограничений — согласие субъекта, хранение по 152-ФЗ, лимиты на трансграничную передачу. Для крупных экосистем это не критично: внутренние и партнёрские массивы ещё закрывают базовые потребности. Но, как отмечает директор по развитию бизнеса Just AI Светлана Захарова, этих данных уже не хватает — особенно для специализированных корпоративных моделей, где нужна отраслевая статистика и поведенческие паттерны.

Альтернативный путь — синтетические данные. Гендиректор Smart Engines Владимир Арлазаров подчёркивает, что генерация позволяет создавать репрезентативные, неперсонифицированные наборы без нарушения прав граждан. Но заменить реальную поведенческую статистику и медицинские выборки синтетикой получается не всегда: на итерации «обучение → валидация → прод» модели начинают галлюцинировать именно там, где синтетика не покрывает реальные распределения.

Что именно предлагают

АБД выложило конкретный набор условий — это не абстрактная «откройте всё», а список ограничителей:

  • Нулевой риск идентификации — или не выше малых долей процента.
  • Целевое использование — только разработка, обучение и применение ИИ.
  • Территориальная привязка — обработка на территории РФ и только российскими компаниями.
  • Доверенный посредник — аккредитованная госорганизация, эксплуатирующая информационную систему хранения и доступа к обезличенным массивам.
  • Два пула данных — бесплатный (для исполнения требований законодательства) и платный (для коммерческих задач).

Партнёр Zarya Ventures Александр Пономарев оценивает инициативу как потенциальный ускоритель для российского ИИ-рынка: доступ к качественным данным остаётся одним из главных ограничений для обучения современных моделей. Представитель MWS AI (МТС Web Services) добавляет, что для прикладных корпоративных моделей критичны именно отраслевые выборки — без них затруднительно строить специализированные ИИ-продукты.

Что это значит на практике

Для ИИ-инженера и промпт-дизайнера сигнал прямой: если Минцифры поддержит инициативу, появится легальный слой данных, который можно будет использовать для файн-тюнинга без согласований на уровне каждого субъекта. Это расширяет контекстное окно для обучения — не в токенах, а в смысле: больше реальных паттернов, меньше компромиссов на синтетике.

Но есть лимит, который стоит держать в голове. Предложение пока осталось без ответа от Минцифры. Формат «доверенного посредника» — это новый узел в инфраструктуре, а значит, новые итерации согласований, аккредитаций и, вероятно, задержек. Практикам, работающим с российскими моделями, пока разумнее отслеживать два параметра: скорость реакции регулятора и реальную доступность PETs-массивов в пилотных проектах. Синтетические датасеты как запасной вариант никто не отменял — но границы их применимости уже видны.