Данные сегодня — это главный ресурс современной организации, такой же ресурс, как нефть и газ для добывающих компаний или электричество для производственных предприятий.
Чтобы этот ресурс приносил пользу и повышал эффективность и капитализацию организации, требуется внедрение надёжных процессов управления данными. Вопрос уже не в том, нужно ли бизнесу понимать происхождение информации, а в том, как быстро наладить эту прозрачность, чтобы не потерять доверие к отчётности и не погрязнуть в хаосе.
С самого начала было ясно: без Data Lineage не обойтись. Бизнесу важно понимать, откуда именно берутся данные в витринах, и это стало одной из ключевых задач при внедрении дата-каталога.
Сейчас мы на этапе внедрения дата-платформы. Полноценного Data Lineage у нас пока нет, но есть планы по его созданию. При этом для нас важно выбрать не экзотическое, а стандартное решение — такое, по которому на рынке уже накоплена экспертиза, так как не хочет выстраивать процесс с нуля. Разработка ради самой разработки нам неинтересна.
Главное — понять, какие технологии уже используются в компании, и, возможно, заранее задуматься о пересмотре некоторых из них. Мы, например, столкнулись с ситуацией, которая продемонстрировала, что некоторые решения, удобные для разработки, оказываются крайне неудобными для построения Data Lineage.
При разработке продуктов для заказчиков мы перешли от визуального монолита, где все потоки данных были перед глазами, к кодоориентированному подходу, когда приходится разбираться с большим количеством данных, и разобраться в этом почти невозможно, если ты не разработчик этого кода. Дата-каталог как раз сканирует эти данные, строит lineage, объясняя, откуда что берётся. А если разработчики добавляют смысловые комментарии и документируют процессы хотя бы минимально, задача разбираться в потоках данных превращается из невыполнимой миссии во вполне реальную.
Без Data Governance и качества данных ИИ ничего не сделает. У наших основных заказчиков, как у любой крупной компании, закрыт контур для внешних больших моделей из-за высоких рисков утечки информации, и при этом средства защиты информации по этому вопросу практически отсутствуют, так что всё должно выполняться внутри. А внутри она заработает хорошо только при нормальном описании того, что происходит.