Как анализировать с помощью ИИ личные и рабочие данные: здоровье, финансы,
договоры и клиентские базы, и не слить приватность, свою и чужую. Пять способов, чем они отличаются,
как выбирать и что проверить до того, как нажать «отправить».
5 способовсравнениечек-лист из 9 пунктовюридическая рамка
Перед тем как писать запрос модели, стоит ответить на три вопроса: что это за данные,
что с ними случится после отправки и какой минимум вообще нужен для задачи.
От ответов зависит, сколько усилий вкладывать в защиту.
01
Что это за данные
Медицинские сведения, биометрия и данные о здоровье почти везде выделены в отдельную,
самую защищённую категорию. Финансовые операции, паспорта и договоры идут следом.
Обычная клиентская база это тоже персональные данные, но режим у них мягче.
От категории зависит, сколько усилий имеет смысл вкладывать в защиту.
02
Что произойдёт с ними после отправки
Уйдут ли они в обучение модели, сколько будут храниться, кто ещё получит к ним доступ.
Ответ разный для бесплатного чата, платной подписки и корпоративного договора,
и это не деталь мелким шрифтом, а главный фактор риска.
03
Какой минимум данных нужен для задачи
Чаще всего нужны не сами записи, а закономерности в них. Если вопрос звучит как
«какая доля обращений повторная» или «в каких регионах чек падает», модели не нужны
ни имена, ни отдельные строки.
Матчасть
Что происходит после кнопки «отправить»
Главная развилка не между ChatGPT и Claude, а между обычным и коммерческим тарифом
одного и того же сервиса. Ниже данные по Anthropic как по самому задокументированному примеру,
у других сервисов логика похожая, но проверять нужно отдельно.
Тариф
Идут ли данные в обучение
Сколько хранятся
Потребительский обычный чат, Free и Pro
Да, если не отказаться в настройках приватности. Так с осени 2025 года
5 лет, если разрешили использовать данные. 30 дней, если отказались
Коммерческий API, Claude for Work, Team, Enterprise
Нет, зафиксировано в договоре обработки данных
По условиям договора, данные хранятся, но не используются для обучения
Zero data retention отдельное соглашение
Нет
Не хранятся после обработки, кроме проверки на злоупотребления
Оговорка, которую стоит знать. Отказ от использования данных не абсолютный:
по политике приватности от 8 июля 2026 года переписки, попавшие на проверку безопасности,
могут использоваться для обучения независимо от настроек пользователя.
И zero data retention это не самостоятельный тумблер в интерфейсе, а отдельная договорённость
с сервисом, которая оформляется на организацию.
Главное заблуждение
Почему «я убрал имена» не работает
Человека опознают не по имени, а по редкому сочетанию обычных признаков.
По отдельности каждый признак безобиден, а вместе они указывают на конкретного человека.
87%
американцев однозначно определяются по трём полям: почтовый индекс, пол и дата рождения.
Это результат Латани Суини
по данным переписи 1990 года, одна из самых цитируемых работ в области приватности.
Чтобы доказать, что риск не теоретический, она купила список избирателей штата Массачусетс
за двадцать долларов, сопоставила его с «обезличенной» больничной выпиской
и нашла в ней медкарту действующего губернатора штата.
Проверка на переписи 2000 года дала цифру ниже, 63%, но вывод тот же:
большинство людей вычисляются по трём безобидным полям.
В маленьком городе или в узкой профессиональной среде для опознания хватает и меньшего.
Вот какие поля выдают человека, даже когда имя и фамилия удалены:
возрастгород или районредкий диагноздолжностьдата визитаназвание работодателясумма и дата операциимодель автосостав семьиномер договора
Готовый ориентир, если не хочется изобретать свой. В американском здравоохранении
есть метод Safe Harbor: список из 18 типов идентификаторов, которые нужно вычистить,
чтобы данные считались обезличенными. Там не только имена и адреса,
но и все даты кроме года, номера счетов и устройств, IP-адреса, биометрия и фотографии лица.
Даже если вы не под американским правом, это хороший чек-лист «что вообще считать опасным полем».
Инструменты
Пять способов защиты
Они не заменяют друг друга, а складываются. Цветная метка показывает главное:
уходят ли исходные данные наружу.
01
Локальная модель
данные не уходят
Модель запускается на вашем компьютере или закрытом сервере,
и исходные документы вообще не попадают во внешний сервис.
Что можно делать
Разбирать документы по категориям, вытаскивать темы, искать закономерности, делать выжимки: всё на своей машине, наружу ничего не уходит
Чем запускать
Ollama или LM Studio, обе ставятся как обычное приложение. Модели берутся открытые: Qwen, Gemma, Llama, DeepSeek
Что нужно от железа
Ориентир по памяти: модель на 14 миллиардов параметров в сжатом виде занимает около 8 ГБ, на 32 миллиарда около 19 ГБ. Маки на Apple Silicon удобны тем, что делят память между процессором и видеоядром
Минусы
Локальные модели ощутимо слабее больших облачных вроде Claude и GPT, качество нужно проверять именно на своих данных, а не по бенчмаркам
02
Анонимизация скриптом
уходят обезличенные
Скрипт проходит по тексту, находит имена, телефоны, почты, номера документов, счетов и карт
и заменяет их на метки вроде [клиент_01] и [договор_07].
Наружу уходит уже размеченный текст.
Чем делать
Presidio: открытый фреймворк, работает в два шага. Сначала анализатор находит персональные сущности, потом анонимайзер применяет к ним операцию: удалить, заменить, захешировать или зашифровать
Кто его развивает
Проект начинал Microsoft, сейчас он передан независимому сообществу Data Privacy Stack, лицензия MIT прежняя
Главный плюс
Один раз настроили и повторяете на любом объёме документов. Метки сохраняют связи: один и тот же клиент остаётся одним и тем же [клиент_01], и закономерности не ломаются
Минусы
Решение техническое, нужен человек, который его соберёт. И детектор не идеален: редкие форматы и опечатки он пропускает, поэтому качество надо замерять на своей выборке
03
Облачный анонимизатор
уходят как есть
Готовый сервис-прослойка между вашей базой и нейросетью: сначала находит и закрывает
персональные данные, потом отдаёт очищенный текст модели.
Что есть на рынке
Sensitive Data Protection у Google, бывший Cloud DLP: сотни встроенных типов данных и разные способы обработки, от вымарывания до шифрования с сохранением формата. У Microsoft похожую роль играет Purview
Кому подходит
Тем, кто уже живёт в соответствующем облаке: сервис встраивается в существующие хранилища и работает на потоке
Нюанс, который меняет всё
Исходный текст всё равно сначала уходит облачному провайдеру, иначе он не смог бы его почистить. Это не вариант «данные никуда не уходят», а вариант «данные уходят одному сервису вместо двух»
04
Показатели вместо сырых данных
данные не уходят
Самый недооценённый способ, потому что он не про технологии, а про постановку задачи.
Считаете показатели у себя, а модели отдаёте только их.
Как это выглядит
Средний чек, медиана по регионам, доля возвратов, динамика по месяцам, распределение обращений по категориям. Модель прекрасно рассуждает о трендах и аномалиях, не видя ни одной строки исходника
Почему работает
Чем меньше исходных данных получает нейросеть, тем меньше ущерб от любой утечки. Данных, которых вы не отправили, не может быть в чужом логе
Где осторожнее
Показатель по слишком маленькой группе перестаёт защищать: «средний доход трёх сотрудников отдела» это почти что их зарплаты. Держите разумный минимальный размер группы
05
Закрытый контур и нулевое хранение
уходят по договору
Корпоративный вариант: модель на своих серверах, частное облако или коммерческий тариф
с zero data retention, где запросы и ответы не хранятся после обработки.
Как получить
У Anthropic это не переключатель в настройках, а отдельное соглашение, которое оформляется на организацию через отдел продаж
Что реально даёт
Снимает риск долгого хранения и попадания в обучение. Для многих компаний этого достаточно, чтобы юристы согласовали работу с ИИ
Чего не даёт
Нулевое хранение это не анонимизация. Персональные данные всё равно присутствуют в запросе в момент обработки, просто живут недолго. Если задача требует именно обезличивания, этот способ её не закрывает
Сравнение
Что выбрать под задачу
Способ
Данные уходят наружу
Порог входа
Что закрывает
Локальная модель
Нет
Железо и настройка
Риск целиком, ценой качества модели
Скрипт-анонимизатор
Да, но обезличенные
Нужен разработчик
Прямые идентификаторы, повторяемо и на потоке
Облачный анонимизатор
Да, в исходном виде
Подписка на облако
Утечку дальше по цепочке, но не самому провайдеру
Показатели вместо сырых данных
Нет
Почти нулевой
Риск целиком, если задача про закономерности
Закрытый контур, нулевое хранение
Да, по договору
Юристы и бюджет
Хранение и обучение, но не сам факт передачи
Рабочий порядок решений выглядит так: сначала уменьшить объём того, что вообще нужно отправить,
потом обезличить остаток, и только в последнюю очередь выбирать, куда это отправлять.
Большинство команд начинают с конца и поэтому переплачивают за инфраструктуру,
отправляя туда данные, которые модели были не нужны.
Юридическая рамка
Обезличивание и псевдонимизация это разные вещи
Различие звучит занудно, но именно оно определяет, есть у вас обязанности перед законом или нет.
Псевдонимизация
Данные остаются персональными
Вы заменили имена на метки, но где-то есть таблица соответствий или сами данные позволяют
восстановить личность. По GDPR такие данные прямо остаются персональными
со всеми правами субъекта и обязанностями оператора. Псевдонимизация считается
мерой безопасности, а не способом выйти из-под регулирования.
Анонимизация
Регулирование не применяется
Личность восстановить нельзя никакими разумными средствами, включая сопоставление
с внешними источниками. Только в этом случае данные выходят из-под GDPR.
Планка высокая, и «я удалил колонку с именами» её не берёт.
Практический вывод. Если вы работаете с российскими данными,
логика 152-ФЗ здесь та же: обезличивание должно исключать возможность определить принадлежность
данных конкретному человеку. Пока сохранился хоть какой-то ключ обратного сопоставления,
считайте, что вы обрабатываете персональные данные, и стройте процесс исходя из этого.
Это не юридическая консультация: для медицинских и финансовых данных согласуйте схему с юристом.
Практика
Чек-лист перед отправкой
Пройдитесь по пунктам до того, как приложите файл к чату. Отметки сохраняются в браузере.
Грабли
Частые ошибки
Обезличили текст, но приложили исходный файл
Самая обидная. Скрипт отработал, а в чат ушла оригинальная таблица,
потому что её было удобнее перетащить мышкой. Разделяйте папки: обработанное и исходное
не должны лежать рядом.
Забыли про метаданные файла
В свойствах документа остаются автор, организация и история правок, в таблицах живут
скрытые листы и фильтры, в pdf сохраняется слой текста под замазанным прямоугольником.
Чёрный прямоугольник поверх текста это не удаление текста.
Отправили в чат, чтобы «быстро посмотреть»
Разовая проверка в личном аккаунте на потребительском тарифе создаёт ровно тот же риск,
что и регулярный процесс, только без единого согласования.
Договоритесь в команде, где проходит граница, до того как она понадобится.
Приняли нулевое хранение за анонимизацию
Zero data retention решает вопрос «что будет с данными потом»,
но не вопрос «что вообще ушло наружу». Это разные слои защиты, и один не отменяет другой.