Новость

Безопасность данных в эпоху ИИ: почему загрузка файлов в нейросети грозит увольнением

По данным публикации на Хабре, в июле 2026-го топ-менеджера московской инженерной компании уволили за загрузку служебных документов в DeepSeek.

Безопасность данных в эпоху ИИ: почему загрузка файлов в нейросети грозит увольнением

Суд согласился с работодателем — разглашение коммерческой тайны. Для тех, кто собирает ИИ-стек в бизнесе, это не страшилка, а конкретный прецедент: одна кнопка «отправить файл» запускает пайплайн, о котором большинство пользователей не задумывается.

Что происходит внутри после нажатия «отправить»

Когда сотрудник загружает договор, презентацию или фрагмент кода, снаружи выглядит как одно действие. Внутри — разветвлённый конвейер: входной шлюз, backend, системы логирования, хранилище. Дальше PDF или Word парсится — извлекается текст, структура, таблицы, заголовки. Текст разбивается на фрагменты и превращается в эмбеддинги — векторные представления семантического смысла, по которым модель ищет «близких соседей» («корова» ближе к «молоку», чем к «поезду»).

Ярослав Шмулёв, технический директор интегратора R77 AI, объяснил изданию: данные начинают существовать одновременно в нескольких формах — исходный файл, извлечённый текст, фрагменты, эмбеддинги, логи обработки, служебные метаданные. Каждая форма потенциально живёт в своей зоне хранения, со своим уровнем доступа и своим сроком жизни. Удаление в одном месте не гарантирует, что фрагмент не сохранился в логах или в кэше модели.

Масштаб утечки: цифры без иллюзий

TelecomDaily приводит данные: в 2025-м сотрудники 150 российских компаний загрузили в публичные нейросети в 30 раз больше корпоративных данных, чем годом ранее. Авторы не уточняют метрику — гигабайты или токены, — но состав загрузок известен: презентации, аналитика, фрагменты кода, внутренняя переписка. Параллельно: 60% компаний до сих пор не имеют политики работы с ИИ-сервисами. Сотрудники пользуются, руководство не регламентирует, юристы подключаются постфактум — когда уже есть уволенный менеджер и судебное решение.

Что отслеживать в своём стеке

  • Резидентность данных. Где физически лежат серверы, в какой юрисдикции, под какими законами о хранении и доступе.
  • Условия провайдера. Что прописано в EULA про обучение модели на ваших данных, про передачу третьим лицам, про срок хранения после удаления.
  • Граница доверенной зоны. Любая загрузка во внешний сервис — это раскрытие. Если данные под NDA или содержат коммерческую тайну, публичная нейросеть не вариант — только on-premise или приватный контур с изолированным контекстом.
  • Логи и метаданные. Запросы, сессии, привязка к сотруднику — всё это часть следа. Проверьте, как долго хранится, кто имеет доступ, можно ли выгрузить и удалить по запросу.
  • Корпоративная политика. Простой документ из пяти пунктов: что можно загружать, что нельзя, какие сервисы разрешены, как согласовывать новые, кто отвечает за инциденты.

Граница, за которой «удобно» превращается в «нарушено», проходит не по функциям модели, а по тому, куда уходит ваш файл после загрузки. Параметр «контекст» у LLM — это не только размер окна в токенах, но и то, какие реальные документы в него попадают. Один клик — и запускается итерация, которую без суда уже не остановить.