Сколько времени понадобится, чтобы ответить на эти простые вопросы?
«Какая таблица содержит нужные данные?»
«Кто за неё отвечает?»
«Можно ли ей доверять?»
«Что сломается, если изменить колонку?»
«Какая таблица содержит нужные данные?»
«Кто за неё отвечает?»
«Можно ли ей доверять?»
«Что сломается, если изменить колонку?»
Часто ответы разбросаны по Slack, Jira и головам отдельных сотрудников.
Тут на помощь приходит OMD — OpenMetadata
Это open-source платформа, которая собирает в одном месте сведения о таблицах, колонках, дашбордах, пайплайнах, ML-моделях и связях между ними.
Важно: OpenMetadata не заменяет хранилище данных — DWH. Его основная задача — объяснить, какие данные у нас есть, откуда они взялись, кто за них отвечает и как ими пользоваться. При включённой настройке он также может сохранять образцы данных.
Что это даёт на практике?
Поиск данных
В OMD можно производить поиск нужных данных по названиям, описаниям и колонкам. В карточке таблицы — её структура, назначение и владелец.

Lineage — граф зависимостей
Показывает путь данных: источник → преобразование → витрина → дашборд. Полнота графа зависит от интеграций и настроек.

Контроль качества данных
Зелёный пайплайн ещё не гарантирует правильный результат. В OMD можно настроить проверки на NULL, дубликаты и допустимые значения, изучать статистику и получать уведомления о проваленных тестах. Результаты доступны рядом с контекстом таблицы.


Для компании удобно, что поиск, зависимости и результаты проверок собраны в одной платформе. Знания о данных становятся доступнее всей команде, а подготовка изменений и поиск ошибок — понятнее.
Проще говоря, OpenMetadata — это карта вашей дата-платформы, которая помогает быстрее найти нужные данные и разобраться в них.
Комментарии 0
Чтобы оставить комментарий, войдите или зарегистрируйтесь.