InfoWatch Data Discovery 2.2 получила модуль машинного обучения с запатентованной потоковой кластеризацией — он систематизирует все файлы автоматически и, по оценкам компании, ускоряет аудит хранилищ до 30 раз.
ГК InfoWatch в рамках цикла обновлений своих продуктов для защиты данных выпустила версию 2.2 решения для аудита хранения данных InfoWatch Data Discovery. Представитель компании сообщил об этом CNews. Главная новинка — модуль машинного обучения, построенный на запатентованной технологии потоковой кластеризации.
Классические инструменты требуют ручной настройки словарей и политик. Новый ML-модуль работает иначе: предварительное обучение ему не нужно. Система сама разбирает 100% документов, распределяет их по тематическим группам, вычленяет ключевые термины и демонстрирует, какие данные в действительности хранятся в ИТ-инфраструктуре организации.
Такой подход убирает «серые зоны» — до 70% неконтролируемых данных, которые при традиционном методе остаются вне поля зрения из-за дороговизны и сложности настройки политик. По подсчётам InfoWatch, аудит рабочей станции или файлового хранилища через кластеризацию может идти в 30 раз быстрее, чем при ручном переборе или анализе классическими средствами. Специалисту больше не нужно неделями составлять словари и пересканировать файлы при добавлении новых категорий — он сразу получает систематизированную картину: документы разложены по смысловым группам, снабжены тегами и готовы к фильтрации.
Индексация всех файлов идёт в фоновом режиме, поэтому поиск по тегам и категориям срабатывает мгновенно, без повторного сканирования. Это даёт быстрый доступ к сведениям о любых типах файлов и местах их хранения. Фильтр редких тегов помогает выявлять «экзотические» документы, не входящие в должностные обязанности сотрудника, а фильтр по дате создания кластера позволяет систематически отслеживать появление новых категорий, не похожих на найденное ранее. Если при расследовании на рабочей станции обнаружена подозрительная категория документов, система тут же показывает, где ещё в компании лежат такие же файлы. Из любого кластера можно собрать коллекцию документов и одной кнопкой сформировать словарь для автолингвиста в InfoWatch Traffic Monitor — настройка DLP-системы под новую категорию данных сокращается с 3–5 дней до нескольких минут.
«Традиционный подход к аудиту данных заставляет ИБ-специалиста описывать категории документов вручную — создавать словари, политики, регулярные выражения. Это трудоёмкий процесс, который может занимать недели и оставляет до 70% данных в «серой зоне». При появлении новых типов документов приходится все переделывать заново. Кластеризация работает иначе: система сама анализирует 100% файлов, группирует их по смыслу, выделяет ключевые термины и показывает реально хранящиеся данные. Это не просто ускорение, это принципиально другой подход — от ручного описания к исследовательскому анализу», — сказал Александр Цветков, ведущий менеджер по развитию продуктов для защиты данных ГК InfoWatch.
