Langfuse là nền tảng AI engineering mã nguồn mở chuyên về quan sát (observability), đánh giá (evaluation) và quản lý prompt cho các ứng dụng mô hình ngôn ngữ lớn (Large Language Model, LLM).
Mô hình ngôn ngữ lớn về bản chất là những "hộp đen" không định trước (non-deterministic). Langfuse cung cấp lớp hạ tầng để chuyển quy trình phát triển từ phỏng đoán sang đo lường bằng dữ liệu thật.
Nền tảng này độc lập hoàn toàn với framework (framework-agnostic), và trở thành thành phần lõi trong hệ sinh thái dữ liệu của ClickHouse sau khi được ClickHouse mua lại vào tháng 1/2026.
Bạn tích hợp qua SDK (Python, JS/TS) hoặc OpenTelemetry, nên gỡ lỗi được các luồng agent phức tạp mà không bị khóa chặt (lock-in) vào bất kỳ framework nào.
Kiến trúc ClickHouse bên dưới cho phép hệ thống xử lý hàng triệu trace với độ trễ (latency) thấp ở quy mô production.

Langfuse là gì?
Quy mô hiện tại của Langfuse đã đủ cho môi trường production: hơn 32.900 sao trên GitHub, 23,1 triệu lượt cài đặt SDK mỗi tháng, 63 công ty trong Fortune 500 sử dụng — trong đó có 19 công ty thuộc Fortune 50. Danh sách khách hàng gồm những cái tên như Merck, 7-Eleven, Intuit, Twilio và Khan Academy.
Về lộ trình, Langfuse đi từ một startup YC W23 thành lớp dữ liệu quan sát cho toàn bộ hệ sinh thái ClickHouse. Tốc độ truy vấn của ClickHouse đáp ứng đúng nhu cầu giám sát thời gian thực mà các hệ thống AI agent đặt ra.
Triết lý thiết kế "developer-first" của nền tảng xoay quanh việc định lượng đầu ra của mô hình. Thay vì dựa vào cảm nhận cá nhân, bạn biến các tương tác AI thành tài sản kiểm chứng được và tối ưu được.
Các thành phần chính trong stack của Langfuse:
- Tracing: ghi lại chi tiết vòng đời một yêu cầu, từ prompt đến tool call.
- Prompt Management: quản lý phiên bản prompt tập trung, đổi logic mà không cần deploy lại code.
- Evaluation: hệ thống chấm điểm tự động (LLM-as-a-judge) hoặc thủ công.
- Datasets: dựng tập dữ liệu mẫu từ dữ liệu production để benchmark.
- Playground: môi trường thử nghiệm prompt và model ngay trên giao diện web.

Vì sao ứng dụng LLM cần một lớp quan sát riêng?
Nhiều đội kỹ thuật nhầm lẫn giữa APM truyền thống — các công cụ giám sát hiệu năng ứng dụng như
Datadog hay Honeycomb — và lớp quan sát dành riêng cho LLM. APM chỉ cho bạn biết hệ thống có "sống"
hay không, qua độ trễ và tỷ lệ lỗi chung. Một ứng dụng AI có thể trả về 200 OK hoàn hảo trong khi
nội dung bên trong sai sự thật, bịa đặt hoặc không an toàn. Đó là khoảng trống mà health check
thông thường không chạm tới.

Langfuse đi sâu vào logic bên trong: model có bị ảo giác (hallucination) không? Luồng gọi công cụ (tool calls) có bị lặp vô hạn không? Chất lượng câu trả lời có suy giảm (drift) sau khi cập nhật prompt không?
Kiểm tra bằng cảm giác (vibe-checking) là rủi ro lớn nhất khi đưa AI vào production. Khi ứng dụng mở rộng với logic agentic nhiều tầng, thiếu dữ liệu định lượng đồng nghĩa với mất kiểm soát cả chi phí lẫn chất lượng. Lớp quan sát riêng cho LLM ghi lại đúng những thứ APM bỏ qua: prompt template, nội dung completion, tham số model và lượng token tiêu thụ. Có những dữ liệu đó, mô hình hộp đen trở thành tài sản kiểm toán được.
Những lỗi đặc thù mà Langfuse giúp bạn kiểm soát:
- Vòng lặp agent: phát hiện agent kẹt trong vòng lặp tool-call gây đốt token.
- Model drift: theo dõi hành vi model thay đổi theo thời gian hoặc theo phiên bản.
- Prompt regression: đảm bảo việc tối ưu prompt không làm hỏng các trường hợp đã chạy ổn định.
Trace, observation và session: Langfuse ghi lại những gì?
Từ phiên bản v4, Langfuse chuyển sang mô hình "observations-first", đưa observation thành đối tượng truy vấn chính để tối ưu tốc độ. Cấu trúc dữ liệu phân cấp như sau:
- Trace: toàn bộ vòng đời của một request từ người dùng, từ đầu vào tới phản hồi cuối.
- Observations: các đơn vị thực thi bên trong một trace, gồm spans (logic ứng dụng, ví dụ bước truy xuất) và generations (các lượt gọi model cụ thể). Trong v4, mỗi observation là một bản ghi bất biến (immutable), nên truy vấn nhanh mà không cần join phức tạp.
- Sessions: nhóm nhiều trace lại theo một cuộc hội thoại dài hoặc một tác vụ agent kéo dài.

SDK của Langfuse chạy bất đồng bộ. Dữ liệu được xếp hàng (queuing) và gửi theo lô (batching) dưới nền, nên lớp quan sát không cộng thêm mili giây nào vào luồng chính của ứng dụng.
Đây là cách dùng decorator @observe() để tự động ghi lại trace trong
Python:
from langfuse import observe
from langfuse.openai import openai # drop-in thay cho client OpenAI chuẩn
@observe()
def call_ai_logic():
return openai.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": "Phân tích kiến trúc Langfuse v4"}],
).choices[0].message.content
@observe()
def main_workflow():
return call_ai_logic()
main_workflow()Hệ thống tự ghi lại độ trễ từng bước, số token tiêu thụ, chi phí ước tính và toàn bộ metadata tùy chỉnh để bạn lọc dữ liệu về sau.
Đánh giá và quản lý prompt — nửa còn lại của Langfuse
Ghi dữ liệu mới chỉ là một nửa. Nửa còn lại là bộ công cụ đóng kín vòng cải tiến chất lượng.

Prompt Management
Thay vì gắn cứng prompt vào mã nguồn, bạn quản lý chúng trên Langfuse. Cơ chế caching ở cả phía server lẫn client cho phép bạn sửa nóng một prompt ngay trên giao diện, và ứng dụng nhận thay đổi mà không cần khởi động lại.
Các phương pháp đánh giá
- Tự động: code evaluator kiểm tra điều kiện xác định (regex, JSON schema hợp lệ, từ khóa bị cấm), hoặc LLM-as-a-judge dùng một model mạnh để chấm điểm đầu ra của model khác trên các tiêu chí như ảo giác hay mức hữu ích.
- Thủ công: Annotation Queues đưa trace vào một hàng đợi có cấu trúc để chuyên gia chấm trực tiếp trên giao diện.
- Phản hồi người dùng cuối: thu thập thumb up/down từ chính người dùng rồi đưa vào bộ chỉ số chất lượng.
Playground và Datasets
Khi gặp một trace cho kết quả xấu, bạn đẩy thẳng nó vào Playground để tinh chỉnh prompt. Sau đó lưu trường hợp đó vào Datasets để chạy Experiment, so sánh hiệu quả giữa các phiên bản model hoặc prompt khác nhau trước khi deploy.
Tự host hay dùng bản cloud?
Lựa chọn phụ thuộc vào yêu cầu bảo mật, quy mô và mức độ bạn muốn kiểm soát dữ liệu.

Bản cloud do Langfuse vận hành chia theo bốn mức, cộng một gói bổ sung:
- Hobby: miễn phí, 50.000 unit/tháng, lưu dữ liệu 30 ngày. Đủ cho bản thử nghiệm ý tưởng (POC).
- Core ($29/tháng): 100.000 unit, lưu 90 ngày, không giới hạn số người dùng.
- Pro ($199/tháng): 100.000 unit, lưu 3 năm, kèm báo cáo SOC2 và ISO27001, có BAA cho HIPAA.
- Enterprise ($2.499/tháng): SLA cam kết, audit log, SCIM API và kỹ sư hỗ trợ riêng.
- Teams Add-on ($300/tháng): bổ sung cho Pro/Enterprise, mở SSO doanh nghiệp (ví dụ Okta), ép buộc SSO và phân quyền RBAC chi tiết.
Bản tự host chạy trên stack Postgres + ClickHouse, cộng Redis/Valkey cho hàng đợi và S3 cho lưu trữ đối tượng. Phần lõi dùng giấy phép MIT nên không tốn phí nền tảng — bạn chỉ trả tiền compute và storage — nhưng một số tính năng doanh nghiệp vẫn cần license key riêng. Đây là lựa chọn gần như bắt buộc với tổ chức có yêu cầu khắt khe về data residency (dữ liệu phải nằm trong lãnh thổ quy định).
Triển khai nhanh ở quy mô nhỏ bằng Docker Compose:
git clone https://github.com/langfuse/langfuse.git
cd langfuse
docker compose upỞ quy mô production, bạn dùng Kubernetes qua Helm, hoặc Terraform trên AWS, Azure và GCP.
Langfuse sau khi về ClickHouse: v4 và những gì đã đổi
Phiên bản v4 giải quyết bài toán hiệu năng cho các dự án lớn bằng bảng observation bất biến. Thay
đổi cốt lõi là denormalization: các thuộc tính ở tầng trace như user_id hay session_id được chép
xuống từng dòng của bảng observation, nên hệ thống không còn phải join tốn kém lúc đọc.

Kết quả kỹ thuật:
- Tốc độ: dashboard của các project lớn tải nhanh hơn ít nhất 10 lần.
- Kiến trúc: loại bỏ hoàn toàn nhu cầu khử trùng lặp (deduplication) lúc đọc — vốn là nút thắt quen thuộc của các hệ thống tracing lưu lượng cao.
- Tính năng mới: full-text search trên toàn bộ input và output, hệ thống cảnh báo cho application metrics, cùng Observations API v2 và Metrics API v2 nhanh hơn hẳn.
Về mốc thời gian: các tổ chức tạo mới từ ngày 14/4/2026 mặc định chạy v4, và v4 nay đã phát hành chính thức cho cả bản tự host. ClickHouse cam kết giữ phần lõi Langfuse ở giấy phép MIT, để cộng đồng vẫn tiếp cận được các tính năng quan sát quan trọng nhất.
Khi nào Langfuse là lựa chọn đúng?
Langfuse hợp lý nhất khi bạn cần một nền tảng độc lập framework, tương thích OpenTelemetry, hoặc khi yêu cầu data residency buộc bạn phải tự host. Nếu stack của bạn thuần LangChain và LangGraph, LangSmith tích hợp sâu hơn ở mức đồ thị; nếu đội bạn xuất phát từ ML truyền thống và cần độ chặt chẽ thống kê cùng phát hiện drift, Arize Phoenix là lựa chọn quen tay hơn.

Khuyến nghị thực tế cho hệ thống production là xếp lớp thay vì chọn một: dùng Langfuse cho tầng AI engineering — trace, eval, quản lý prompt — và ghép nó với một APM truyền thống như Datadog cho sức khỏe hạ tầng. Hai công cụ trả lời hai câu hỏi khác nhau, và bạn cần cả hai câu trả lời.
Tài liệu tham khảo
- LLM Observability & Application Tracing (Open Source) — Langfuse
- Evaluation of LLM Applications — Langfuse
- Self-host Langfuse (Open Source LLM Observability) — Langfuse
- Pricing — Langfuse
- Langfuse v4 is live — Langfuse
- GitHub — langfuse/langfuse: Open source AI engineering platform
- ClickHouse welcomes Langfuse: The future of open-source LLM observability — ClickHouse
- Agent Observability Platforms: LangSmith, Langfuse, Arize 2026 — Digital Applied
- Transform Large Language Model Observability with Langfuse — AWS Partner Network Blog