Сколько времени понадобится, чтобы ответить на эти простые вопросы?
«Какая таблица содержит нужные данные?»
«Кто за неё отвечает?»
«Можно ли ей доверять?»
«Что сломается, если изменить колонку?»
Часто ответы разбросаны по Slack, Jira и головам отдельных сотрудников.

Тут на помощь приходит OMD — OpenMetadata

Это open-source платформа, которая собирает в одном месте сведения о таблицах, колонках, дашбордах, пайплайнах, ML-моделях и связях между ними.
Важно: OpenMetadata не заменяет хранилище данных — DWH. Его основная задача — объяснить, какие данные у нас есть, откуда они взялись, кто за них отвечает и как ими пользоваться. При включённой настройке он также может сохранять образцы данных.
Что это даёт на практике?

Поиск данных

В OMD можно производить поиск нужных данных по названиям, описаниям и колонкам. В карточке таблицы — её структура, назначение и владелец.

Поиск данных в OpenMetadata
Поиск данных · иллюстрация из документации OpenMetadata

Lineage — граф зависимостей

Показывает путь данных: источник → преобразование → витрина → дашборд. Полнота графа зависит от интеграций и настроек.

Граф зависимостей данных в OpenMetadata
Lineage · иллюстрация из документации OpenMetadata

Контроль качества данных

Зелёный пайплайн ещё не гарантирует правильный результат. В OMD можно настроить проверки на NULL, дубликаты и допустимые значения, изучать статистику и получать уведомления о проваленных тестах. Результаты доступны рядом с контекстом таблицы.

Показатели качества данных в OpenMetadata
Data Quality · иллюстрация из документации OpenMetadata
Термины глоссария в OpenMetadata
Glossary · иллюстрация из документации OpenMetadata
Для компании удобно, что поиск, зависимости и результаты проверок собраны в одной платформе. Знания о данных становятся доступнее всей команде, а подготовка изменений и поиск ошибок — понятнее.
Проще говоря, OpenMetadata — это карта вашей дата-платформы, которая помогает быстрее найти нужные данные и разобраться в них.