Выпускник университета из Тольятти "научил" компьютеры экономить на хранении

Даниил Данилов из Тольяттинского государственного университета создал прототип системы, которая автоматически сортирует, распределяет и защищает неструктурированные данные компании, почти на треть сокращая затраты на их хранение. Этот проект стал темой его выпускной магистерской диссертации, которую он защитил на "отлично".

Фото: нейросети

Ежесекундно в мире генерируются горы информации: фотографии, видео, сканы договоров, презентации, аудиозаписи совещаний. Все это называют "неструктурированными данными", которые сегодня составляют до 80 % корпоративного информационного мусора. Именно с ними возникает больше всего проблем: файлы теряются, поиск занимает часы, а хранение всего подряд на быстрых, но дорогих дисках опустошает бюджеты.

Проблему постарался решить Даниил Данилов, завершивший в этом году обучение в магистратуре института цифровых технологий тольяттинского вуза. Под научным руководством кандидата педагогических наук и директора интситута Оксаны Гущиной он разработал систему, которая структурирует и упорядочивает этот "цифровой хаос".
Так называемый "умный менеджер" не просто копирует файлы в хранилище – сначала он анализирует их с помощью гибридного подхода, сочетающего детерминированные, то есть, жесткие правила и алгоритмы машинного обучения.

Например, по расширению файла система может сразу определить примерную категорию. Если речь идет о текстовом документе, подключается классификатор на основе искусственного интеллекта: изучает содержимое, определяет тематику и присваивает файлу такие характеристики, как категория, оценка важности и уровень конфиденциальности.

- Задача была сделать так, чтобы компании перестали переплачивать за хранение данных и тратить время на их поиск в корпоративных архивах, - комментирует Даниил Данилов. - Для текстов используются современные методы анализа, а для изображений и сканов – нейросетевые алгоритмы, что позволяет системе одинаково эффективно работать с самыми разными типами файлов.

Главным преимуществом разработки стал алгоритм интеллектуального распределения данных – именно он принимает решение о том, где хранить каждый конкретный файл. Система поддерживает три типа хранилищ: высокоскоростные SSD-диски для критически важных, конфиденциальных и/или часто запрашиваемых документов, экономичные HDD-накопители для файлов средней важности, а большие архивы и редко используемые данные отправляются в дешевое облачное хранилище.

- Только за счет этого компании могут экономить миллионы рублей в год, - говорит Даниил.

Прототип был протестирован на выборке из 50 файлов разных типов и размеров. Система показала снижение затрат на хранение на 28,4 % по сравнению с традиционным подходом, при котором все файлы размещаются на дорогом SSD без учета их реальной ценности.

- Но файлов может быть намного больше, ограничений по количеству нет. Система адаптивна, ее можно масштабировать под любые объемы данных без потери эффективности, - подчеркивает автор.

Решает разработка и другие важные задачи корпоративного управления данными. Например, она разграничивает права администратора, модератора и рядового пользователя, таким образом каждый сотрудник видит только те файлы, к которым у него есть допуск. Поиск осуществляется не только по имени файла, но и по категории, расширению и другим метаданным, которые система присваивает автоматически, ранжируя результаты по степени важности.

- Мы предложили решение, которое автоматизирует рутинные операции и позволяет сосредоточиться на действительно важных задачах, - отмечает Даниил. - Кроме того, система собирает детальную статистику о времени загрузки, точности классификации и распределении файлов по хранилищам – это позволяет администратору отслеживать эффективность ее работы и при необходимости корректировать пороговые значения алгоритмов.

Разработка будет полезна компаниям, у которых есть проблемы хранения и поиска больших объемов данных – юридическим и бухгалтерским фирмам, производственным холдингам, образовательным учреждениям и др. Прототип написан на языке Python с использованием библиотек для машинного обучения и визуализации, что делает его гибким и готовым к дальнейшему развитию.

Даниил Данилов намерен доработать систему: добавить более мощные нейросетевые модели для классификации, интегрировать технологии блокчейн (распределённой системы хранения и передачи данных), чтобы обеспечить неизменяемость и отслеживаемость операций с критически важными документами.

Материал по теме

Полная версия