DataHub là nền tảng metadata (dữ liệu mô tả dữ liệu) thế hệ thứ 3 được phát triển ban đầu tại LinkedIn.
Nó giải quyết bài toán phân mảnh của stack dữ liệu hiện đại bằng cách kết nối các kho dữ liệu (warehouses), hồ dữ liệu (lakes), hệ thống BI (Business Intelligence — phân tích dữ liệu kinh doanh) và học máy (Machine Learning) vào một giao diện quản lý duy nhất.
Thay vì chỉ là một danh mục tĩnh, DataHub là "hệ thần kinh trung ương" giúp bạn tìm kiếm, hiểu và quan sát dòng chảy dữ liệu. Nó được thiết kế để xử lý metadata quy mô lớn, vừa phục vụ nhu cầu tra cứu của con người, vừa cung cấp ngữ cảnh cho các AI Agent (tác nhân AI).
Nếu bạn đang vận hành một hệ thống dữ liệu phức tạp và cần một giải pháp để kiểm soát quyền sở hữu, lineage (đường đi của dữ liệu từ nguồn tới đích) và quản trị mà không muốn bị khóa vào các nhà cung cấp thương mại, DataHub là cái tên đáng cân nhắc nhất trong nhóm mã nguồn mở.

DataHub là gì?
DataHub sinh ra tại LinkedIn để xử lý metadata ở quy mô siêu lớn (hyperscale). Sau khi mã nguồn mở hóa vào năm 2020, dự án kéo về hơn 3.000 tổ chức dùng nó để quản lý hàng triệu tài sản dữ liệu.
Bản chất của DataHub là một đồ thị metadata thống nhất (unified metadata graph). Nó lưu trữ thông tin, và quan trọng hơn, cho phép các công cụ khác nhau trong stack dữ liệu nói chuyện với nhau qua các API chuẩn hóa. Toàn bộ dự án phát hành dưới giấy phép Apache 2.0, nên bạn tự do tùy biến và triển khai trong hạ tầng doanh nghiệp mà không tốn phí bản quyền. Phí bản quyền, nói trước, là khoản rẻ nhất trong tổng chi phí của DataHub.
DataHub theo dõi những gì trong dữ liệu của bạn?
DataHub thu thập và hiển thị các thuộc tính metadata quan trọng để kỹ sư nắm được "ngữ cảnh" của dữ liệu:
- Lineage: Hỗ trợ lineage mức cột (column-level lineage) trên các nền tảng lớn như Snowflake, BigQuery, và Databricks. Thứ tôi thấy đáng giá nhất ở đây là "Parsed lineage": DataHub tự đọc nhật ký truy vấn (query logs) và mã biến đổi để dựng lineage, thay vì bắt bạn khai báo thủ công (declared lineage).
- Dataset Profiles: Hiển thị sơ đồ schema, thống kê chi tiết (số lượng dòng, kích thước, độ phủ dữ liệu), tài liệu hướng dẫn và phân định quyền sở hữu (ownership).
- Quản trị (Governance): Quản lý thẻ tag, thuật ngữ kinh doanh (glossary terms) và các chính sách tuân thủ. Bạn có thể gắn nhãn dữ liệu nhạy cảm (PII) và thiết lập quy trình kiểm soát truy cập dựa trên các nhãn này.
DataHub hoạt động thế nào?
Trái tim kỹ thuật của DataHub là một dịch vụ cốt lõi tên GMS (Generalized Metadata Service), cộng với triết lý hướng luồng (stream-based):

- Kiến trúc hướng luồng: Khác với các catalog quét định kỳ (batch) kiểu cũ, DataHub sử dụng Kafka để truyền tải các thay đổi metadata. Các cập nhật được phản ánh trên hệ thống chỉ trong vài giây.
- Triết lý Model-first: Metadata được định nghĩa bằng ngôn ngữ PDL. Hệ thống cung cấp khả năng truy vấn linh hoạt qua GraphQL, REST API và đặc biệt là hỗ trợ Avro-based API qua Kafka để đăng ký nhận các thay đổi metadata theo thời gian thực.
- Cơ chế Ingestion: Sử dụng khung đẩy/kéo (push/pull) với hơn 80 đầu nối (connectors).
Dưới đây là ví dụ về cấu hình snowflake_recipe.yml để trích xuất metadata:
source:
type: snowflake
config:
account_id: "xy12345.us-east-1"
warehouse: "COMPUTE_WH"
username: "${SNOWFLAKE_USER}"
password: "${SNOWFLAKE_PASSWORD}"
database_pattern:
allow:
- "ANALYTICS_DB"
sink:
type: datahub-rest
config:
server: "http://localhost:8080"Sau khi cấu hình, bạn thực thi lệnh sau trong terminal để bắt đầu nạp metadata:
datahub ingest -c snowflake_recipe.ymlMetadata giúp gì cho hệ thống AI?
Agentic AI (AI tự lên kế hoạch và hành động thay vì chỉ trả lời) chỉ đáng tin khi nó biết thứ dữ liệu nó đụng vào là gì, và metadata chính là "mảnh ghép còn thiếu" đó:

- Quản lý ngữ cảnh (Context Management): AI Agent cần metadata để hiểu ý nghĩa thực sự của các cột dữ liệu, từ đó tránh hiện tượng "ảo giác" (hallucination) khi truy vấn.
- Model Context Protocol (MCP): DataHub cho phép kết nối trực tiếp với Cursor, Claude Desktop hoặc Cline. Điều này giúp AI model truy vấn trực tiếp đồ thị metadata (schemas, lineage) theo thời gian thực để hỗ trợ lập trình và phân tích dữ liệu. Nếu bạn chưa quen giao thức này, xem thêm MCP là gì.
- Ví dụ thực tế: Block (trước đây là Square) đã sử dụng máy chủ MCP của DataHub để mở rộng quy mô quản trị và vận hành AI trên hơn 50 nền tảng khác nhau, cho phép AI Agent hiểu rõ ngữ cảnh dữ liệu trước khi thực thi hành động.
- Analytics Agent: DataHub cung cấp công cụ mã nguồn mở giúp người dùng hỏi đáp dữ liệu bằng ngôn ngữ tự nhiên và nhận lại kết quả SQL hoặc biểu đồ dựa trên ngữ cảnh từ catalog.
Tự vận hành DataHub tốn những gì?
Nói thẳng: DataHub là nền tảng có "gánh nặng vận hành" (operating burden) lớn nhất trong nhóm công cụ metadata mã nguồn mở hiện nay, do kiến trúc streaming phức tạp của chính nó.
- Tài nguyên phần cứng (Docker): Tối thiểu 2 CPUs, 8 GB RAM, 2 GB Swap và 13 GB disk space.
- Nhân sự vận hành: Bạn cần từ 0,25 đến 1 kỹ sư nền tảng (platform engineer) để duy trì. Công việc không chỉ là cài đặt mà còn là sửa lỗi connector khi warehouse cập nhật API và quản lý việc nâng cấp.
- Rủi ro "key person": Hệ thống thường phụ thuộc vào một người duy nhất hiểu cách cấu hình. Một bài kiểm tra thực tế cho doanh nghiệp là: "Hãy kể tên người thứ hai có thể thực hiện nâng cấp hệ thống mà không cần hỗ trợ. Nếu không có tên thứ hai, bạn đang gặp rủi ro phụ thuộc cá nhân chứ không phải đang sở hữu một nền tảng."
Khi nào nên chọn DataHub — và khi nào không?
Câu hỏi đúng không phải DataHub có bao nhiêu tính năng, mà là đội của bạn có nuôi nổi từ 0,25 đến 1 kỹ sư nền tảng cho nó hay không:
- Nên chọn DataHub khi: Bạn có đội ngũ kỹ sư nền tảng cứng và muốn xây dựng các tính năng tùy biến trên metadata (như portal nội bộ, hệ thống cấp quyền tự động). Nó cũng là lựa chọn tối ưu nếu bạn đang ưu tiên hạ tầng cho AI Agent cần truy vấn ngữ cảnh theo thời gian thực.
- Không nên chọn DataHub khi: Đội ngũ mỏng (dưới 10 người), chỉ dùng một warehouse duy nhất, hoặc bạn đang cần "bằng chứng tuân thủ" (Audit Evidence) ngay lập tức cho các cơ quan quản lý (như OJK, MAS, APRA). DataHub cung cấp metadata nhưng không có lớp lưu trữ bằng chứng bất biến (immutable logs) hay quy trình phê duyệt chặt chẽ như các giải pháp thương mại.
Nếu thứ bạn cần là sự đơn giản và triển khai nhanh, OpenMetadata có thể là phương án thay thế nhẹ nhàng hơn, và chọn nó chẳng có gì phải ngại.
Tài liệu tham khảo
- DataHub Docs Overview
- DataHub Architecture Overview
- GitHub - datahub-project/datahub: The Context Platform for your Data and AI Stack
- Release v1.7.0 - datahub-project/datahub
- Open Sourcing DataHub: LinkedIn's Metadata Search and Discovery Platform
- OpenMetadata vs DataHub vs Amundsen vs Commercial (2026) - Decube
- DataHub MCP Server
- Slack Fast-Tracks Metadata Visibility with DataHub
- DataHub Quickstart Guide