LP Agency

AI-система автоматического обезличивания

документов для B2B

О проекте

Тип:
AI-MVP / Коробочный B2B-продукт
Направление:
Безопасность данных / Автоматизация бизнеса
Отрасль:
Информационная безопасность
Формат:
Автономное on-premise решение
Ссылка:
по запросу

Проект создавался как самостоятельный B2B-продукт для компаний, которые работают с большим количеством документов и персональных или конфиденциальных данных.

Основная идея — автоматизировать процесс обезличивания документов перед их передачей, хранением или использованием в других бизнес-процессах.

Вместо того чтобы сотрудник вручную искал в документе ФИО, номера документов, ИНН, названия организаций и другие чувствительные данные, система самостоятельно анализирует содержимое, находит нужную информацию и заменяет её на специальные маркеры.

При этом оригинальные данные не теряются: система сохраняет возможность восстановить их при наличии соответствующего доступа.

Продукт проектировался как коробочное решение для установки внутри инфраструктуры заказчика. Это было принципиально важно для компаний, которые не могут передавать документы во внешние облачные сервисы.

tikcet2

Задача

Создать систему, которая автоматически:

  • находит чувствительные данные в документах
  • обезличивает их
  • присваивает уникальный код документу
  • сохраняет защищённую версию
  • позволяет восстановить данные при необходимости

Контекст:

  • 438 000+ компаний в РФ являются операторами персональных данных
  • большинство хранят документы на серверах без полноценного обезличивания
  • ручная обработка занимает в 18 раз больше времени
  • основной источник утечек — человеческий фактор

Цель — снизить риски утечки данных через автоматизацию обезличивания.

Ключевая сложность

Основные вызовы:

  • Обнаружение чувствительных данных в произвольных форматах
  • Работа с разными языками, символами, цифрами, QR-кодами
  • Поддержка всех форматов Microsoft Office и аналогов
  • Обработка изображений
  • Работа в полностью автономном режиме (без интернета)
  • Возможность безопасного восстановления данных

Это не просто маскирование текста — это контекстный анализ документа.

Решение

AI-ядро

Разработаны два прототипа:

  • Обезличивание текстовых документов
  • Обезличивание данных на изображениях

Система:

  • анализирует документ
  • определяет чувствительные поля
  • заменяет их на маркеры
  • присваивает уникальный идентификатор
  • сохраняет защищённую копию

Скорость обработки — до 3 секунд на документ.

Гибкая настройка

Компания может:

  • выбирать типы данных для скрытия
  • настраивать правила обезличивания
  • выбирать форматы обрабатываемых файлов

Можно скрывать:

  • ФИО
  • номера документов
  • ИНН
  • QR-коды
  • латиницу
  • цифры
  • названия организаций

Архитектура

  • Полностью автономное решение
  • Не требует подключения к интернету
  • On-premise установка
  • Цифровая подпись для восстановления данных
  • Механизмы защиты от несанкционированного фотографирования

tikcet3

Бизнес-ценность

Снижение рисков утечки

Даже при взломе сервера злоумышленник получает обезличенные данные.

Экономия времени

Если сотрудник вручную тратит 15 минут на обезличивание документа, система делает это за 3 секунды.

15 минут / 3 секунды = 300x быстрее
(консервативно — в 18 раз быстрее по данным пилота)

Соответствие требованиям регуляторов

Продукт снижает риски штрафов и репутационных потерь.

Модель монетизации

  • Коробочный продукт
  • B2B-сегмент
  • Цена зависит от количества обработанных документов
  • Масштабируется по лицензиям

Потенциал масштабирования

Продукт можно развивать в сторону:

  • DLP-интеграций
  • API для корпоративных систем
  • SaaS-версии
  • AI-модели для прогнозирования рисков
  • Интеграции с электронным документооборотом

tikcet1

Что это на самом деле

Это не просто инструмент обезличивания.

Это слой безопасности между сервером компании и человеческим фактором.

Если сервер взломают — данные уже защищены.

Результаты

В рамках проекта был создан рабочий MVP коробочного B2B-продукта, а не просто отдельный AI-модуль.

На выходе получили:

  • два направления автоматического обезличивания — документы и изображения;
  • обработку чувствительных данных на основе контекста;
  • возможность работы с различными типами персональных и идентифицирующих данных;
  • скорость обработки документа до 3 секунд;
  • автономную архитектуру без передачи документов во внешние облачные сервисы;
  • механизм восстановления исходных данных;
  • гибкую настройку правил обезличивания;
  • on-premise формат установки для корпоративной инфраструктуры.

Таким образом, технология была подготовлена не только как демонстрация возможностей AI, но и как основа для дальнейшего развития коробочного продукта для корпоративного рынка.