LangSmith là nền tảng quản trị vòng đời agent (Agent Engineering Platform), tập trung vào ba trụ cột: quan sát (observability), đánh giá (evaluation) và triển khai (deployment).
Bạn dùng nó để xử lý tính bất định (non-deterministic) của mô hình ngôn ngữ lớn (Large Language Model, LLM) bằng cách ghi vết và phân tích từng bước trung gian trong luồng suy luận của hệ thống.
Nền tảng này cho phép bạn nhìn thấu "hộp đen" của AI agent, từ giai đoạn thử nghiệm prompt đến khi giám sát vận hành thực tế.
Thay vì phỏng đoán nguyên nhân agent chạy sai, bạn có dữ liệu cấu trúc về luồng RAG, tool call và logic suy luận để tối ưu hiệu suất lẫn kiểm soát chi phí.

LangSmith là gì?
Dưới góc độ kỹ thuật, LangSmith là một nền tảng framework-agnostic — không phụ thuộc vào framework nào. Nó được thiết kế để tích hợp sâu nhất với hệ sinh thái LangChain, nhưng bạn vẫn dùng được cho các hệ thống agent tự viết thông qua SDK Python, JS/TS hoặc chuẩn OpenTelemetry. Đây là hạ tầng kiểm soát toàn bộ vòng đời phát triển của một agent, chứ không chỉ là chỗ ghi log.

Trong vòng đời đó, LangSmith có mặt ở mọi chặng: Playground để thử prompt và xem kết quả tức thì, Tracing để ghi vết các luồng chạy phức tạp, Datasets để dựng bộ dữ liệu kiểm thử từ dữ liệu thật, rồi giám sát khi hệ thống đã lên production. Bạn bóc tách được từng node trong một đồ thị LangGraph hoặc từng bước thực thi của một Deep Agent.
Với kỹ sư hệ thống, giá trị lớn nhất là đo được hiệu suất thay đổi ra sao khi bạn đổi model hoặc sửa instructions trong prompt. Bạn có số liệu cụ thể để chứng minh phiên bản mới tốt hơn phiên bản cũ về độ trễ, chi phí và chất lượng đầu ra — thay vì dựa vào cảm giác thử-sai.
Trace, run, thread và project: LangSmith ghi lại những gì?
Để quản lý dữ liệu quan sát, LangSmith phân cấp thông tin theo một cấu trúc giúp bạn truy vết nhanh. Run là đơn vị công việc cơ bản, tương đương một span trong OpenTelemetry: nó ghi lại input và output của một lần gọi model, một lần chạy công cụ hoặc một truy xuất vector DB. Trace là một cây chứa các run cho một thao tác duy nhất của người dùng. Mỗi trace giới hạn tối đa 25.000 run; vượt quá con số này, hệ thống ngừng ghi nhận thêm.

Thread là chuỗi các trace liên kết qua thread_id, đại diện cho một phiên làm việc nhiều lượt.
Khác với thread — vốn giữ nguyên cấu trúc lồng nhau — trajectory cho bạn một góc nhìn phẳng gồm
các tin nhắn AI, Human và Tool xếp theo thời gian. Trajectory giúp đọc hiểu luồng logic nhanh hơn
vì đã loại bỏ nhiễu từ các bước thực thi ngầm, còn thread giữ lại toàn bộ chi tiết kỹ thuật để
debug.
Dữ liệu được lưu trong các project — mỗi project là một container tách biệt cho từng dịch vụ hoặc từng môi trường (dev, staging, prod).
| Khái niệm | Cấu trúc dữ liệu | Nội dung chứa | Dùng để làm gì |
|---|---|---|---|
| Run | Đơn vị đơn lẻ | Input, output, metadata của một bước | Kiểm tra chi tiết một thao tác cụ thể |
| Trace | Cây | Toàn bộ các bước trong một thao tác | Debug lỗi logic hoặc độ trễ hệ thống |
| Thread | Chuỗi các trace | Lịch sử hội thoại nhiều lượt | Giám sát hành vi agent qua cả phiên |
| Trajectory | Danh sách phẳng | Tin nhắn AI, Human, Tool theo thời gian | Đọc nhanh nội dung trao đổi, giảm nhiễu |
Đánh giá chất lượng: dataset, experiment và LLM-as-judge
Quy trình đánh giá (evaluation) trong LangSmith chuyển từ giám sát thụ động sang kiểm thử chủ động, qua hai giai đoạn: offline trước khi deploy, và online khi đã có traffic thật.

Một vòng đánh giá thường bắt đầu khi bạn phát hiện một trace lỗi trong production. Bạn gắn thẻ cho các trace đó rồi đưa chúng vào một dataset gồm input và reference output (đáp án tham chiếu). Khi cập nhật code hoặc prompt, bạn chạy một experiment trên dataset này. LangSmith hiển thị bảng so sánh side-by-side để bạn chấm điểm thủ công hoặc dùng bộ chấm tự động, và thấy được phiên bản mới cải thiện tới đâu.
Cơ chế LLM-as-judge là trọng tâm để tự động hóa việc chấm điểm ở quy mô lớn. Bạn cấu hình một model mạnh hơn làm giám khảo, đánh giá model đang phát triển theo các tiêu chí như tính trung thực (faithfulness) hay mức độ liên quan (relevance).
- Reference-based evaluator: so đầu ra của agent với đáp án chuẩn trong dataset để kiểm tra độ chính xác.
- Reference-free evaluator: chấm theo các tiêu chí độc lập như độ an toàn, mức độ độc hại (toxicity) hoặc định dạng JSON, không cần đáp án mẫu. Đây là lựa chọn cho giám sát online trên dữ liệu người dùng thật, nơi bạn không có sẵn đáp án đúng.
Context Hub: quản lý prompt và ngữ cảnh như quản lý code
Context Hub tách logic trong code khỏi phần nội dung hướng dẫn của agent. Bạn quản lý các file
AGENTS.md, các kỹ năng (skill) và chính sách (policy) ngay trên giao diện LangSmith.

Hệ thống hỗ trợ versioning và tagging: bạn gắn tag dev, staging hoặc prod cho từng phiên bản
ngữ cảnh. Khi cần đổi hành vi agent, bạn sửa instructions trong Context Hub rồi chuyển tag, và thay
đổi có hiệu lực mà không cần deploy lại code. Cơ chế này cho phép chuyên gia nghiệp vụ trực tiếp
tinh chỉnh hành vi agent mà không đụng tới source code. Bạn cũng tham khảo được các prompt mẫu từ
cộng đồng qua LangChain Hub tích hợp sẵn.
LangSmith Engine và SmithDB: những gì đổi sau Interrupt 2026
Sự kiện Interrupt 2026 mang lại hai nâng cấp đáng kể về hạ tầng và mức độ tự động hóa.
LangSmith Engine tự động theo dõi production trace, gom nhóm các lỗi tương đồng bằng clustering, chẩn đoán nguyên nhân gốc dựa trên code và prompt, rồi mở Pull Request đề xuất cách sửa. Vai trò của bạn chuyển từ dò lỗi thủ công sang xem xét và merge các đề xuất.

SmithDB là database chuyên dụng cho observability của agent, viết bằng Rust trên nền Apache DataFusion và Vortex. Nó dùng object storage để lưu trace bền vững, đi kèm các dịch vụ stateless cho ingestion và query. Kiến trúc này tối ưu cho các truy vấn trace lồng nhau nhiều tầng:
- Tải một cây trace hoàn chỉnh: 92ms (P50).
- Tải một run đơn lẻ: 71ms (P50).
- Nhanh gấp tới 15 lần so với backend cũ, đồng thời giúp hệ thống chạy stateless và dễ mở rộng.
Cloud, hybrid hay self-host?
Tùy yêu cầu bảo mật và mức độ bạn cần kiểm soát dữ liệu, có ba lựa chọn triển khai:
- Cloud (SaaS): dữ liệu nằm trên server của LangChain, chọn được vùng US hoặc EU. Hợp với đội cần triển khai nhanh.
- Hybrid: control plane nằm trên SaaS để quản lý giao diện, còn data plane — nơi lưu trace — nằm tại hạ tầng của bạn.
- Self-host: chạy toàn bộ stack trên hạ tầng riêng qua Kubernetes hoặc Terraform. Đây là lựa chọn của doanh nghiệp có yêu cầu khắt khe về data residency.

Một instance self-host gồm các dịch vụ lõi: frontend Nginx phục vụ giao diện và định tuyến API, backend xử lý CRUD và business logic, platform backend lo ingestion cùng xác thực khối lượng lớn, playground chuyển tiếp request tới các nhà cung cấp model, và ACE backend chạy code tùy ý trong môi trường cô lập.
Về lưu trữ, bản self-host cần ClickHouse cho trace và feedback, PostgreSQL cho dữ liệu vận hành, Redis hoặc Valkey cho hàng đợi và cache, cùng blob storage (S3, GCS hoặc Azure Blob) cho các artifact lớn. Một điểm cần nắm trước khi lên kế hoạch: self-host là add-on của gói Enterprise, thường đi kèm hợp đồng theo năm.
Chi phí tính theo trace và những khoản dễ vượt dự toán
Tính đến giữa năm 2026, LangSmith có ba mức: Developer (miễn phí, 1 seat, 5.000 base trace mỗi tháng), Plus (39 USD/seat/tháng, kèm 10.000 base trace) và Enterprise (báo giá riêng). Vượt hạn mức, base trace lưu 14 ngày có giá 2,50 USD cho mỗi 1.000 trace. Hệ thống còn tính thêm theo LangChain Storage Unit (LSU, 1,00 USD) và LangChain Compute Unit (LCU, 1,50 USD).
Khoản dễ vượt dự toán đầu tiên là extended retention. Nếu cần giữ trace lâu hơn 14 ngày, giá lên 5,00 USD cho mỗi 1.000 trace với thời hạn lưu 400 ngày. Nếu bạn nâng một base trace lên extended sau khi trace đã được ghi nhận, nền tảng tính thêm 2,50 USD cho mỗi 1.000 trace. Khác biệt này quan trọng khi bạn muốn dựng dataset đánh giá dài hạn từ dữ liệu production đã có.
Cái bẫy lớn hơn nằm ở độ mịn (granularity) của instrumentation — cách bạn gắn điểm đo trong code — vì số trace phụ thuộc vào cách bạn đo chứ không phải lưu lượng người dùng. Lấy một agent hỗ trợ khách hàng xử lý 50.000 phiên mỗi tháng: nếu bạn ghi cả phiên thành một lần chạy, bạn phát sinh 50.000 trace, tương đương 100 USD vượt hạn mức. Nếu instrumentation mở một lần chạy mới cho mỗi lượt hội thoại — trung bình sáu lượt một phiên — con số thành 300.000 trace và hóa đơn vượt hạn mức khoảng 725 USD, trong khi giá trị mang lại cho người dùng vẫn y hệt. Chênh lệch sáu lần đó đến từ lựa chọn kỹ thuật, không phải từ tăng trưởng.

Các lượt chạy đánh giá cũng được tính là trace phải trả tiền. Bạn nên cấu hình sampling hoặc kiểm soát trực tiếp bằng biến môi trường:
export LANGSMITH_TRACING=true
export LANGSMITH_TRACING_MODE=otelLangSmith và Langfuse khác nhau ở đâu?
Đối thủ trực tiếp của LangSmith là Langfuse. Cả hai đều đang dịch chuyển sang chuẩn OpenTelemetry GenAI, nhưng khác nhau rõ ở mô hình kinh doanh và độ sâu tích hợp.
| Tiêu chí | LangSmith | Langfuse |
|---|---|---|
| Giấy phép | Độc quyền | MIT ở phần lõi |
| Đơn vị tính phí | Trace | Unit (theo observation) |
| Self-host | Add-on của Enterprise | Miễn phí, chạy bằng Docker Compose |
| Tích hợp LangChain | Sâu nhất, mặc định | Tốt, qua OTel hoặc integration |
Đơn vị tính phí là khác biệt dễ bị bỏ qua nhất. LangSmith tính theo trace, mà một trace chứa được tới 25.000 bước; Langfuse tính theo unit, nghĩa là mỗi span và mỗi điểm chấm đều được đếm riêng. Với các agent "nói nhiều", gọi rất nhiều công cụ trong một lượt, mô hình theo trace của LangSmith dễ dự đoán hơn, còn mô hình theo unit của Langfuse tăng tuyến tính theo độ phức tạp bên trong.
Về định vị sản phẩm, LangSmith là nền tảng đóng gói sẵn: có runtime được quản lý, có Engine tự đề xuất cách sửa lỗi, chạy trên SmithDB. Langfuse chọn hướng mã nguồn mở cho các đội muốn sở hữu hoàn toàn data plane mà không cần hợp đồng doanh nghiệp — và vẫn giữ cam kết mã nguồn mở sau khi được ClickHouse mua lại vào tháng 1/2026.
Khi nào nên chọn LangSmith?
Chọn LangSmith khi hệ thống của bạn đã dựng trên LangChain hoặc LangGraph: phần tích hợp gần như không cần cấu hình, và bạn nhìn được vào các vòng lặp agent mà công cụ đa dụng khó dựng lại. Engine càng đáng giá nếu đội bạn muốn tự động phát hiện các dạng lỗi trong production thay vì ngồi đọc trace thủ công.
Ngược lại, nếu lưu lượng rất lớn và ngân sách hẹp, hãy tính kỹ trước khi cam kết: chi phí theo trace tăng rất nhanh khi instrumentation thiết kế không hợp lý, và bài toán đó xuất hiện trước khi bạn kịp cần tới runtime được quản lý. Nói gọn, đây là lựa chọn giữa chiều sâu hệ sinh thái (LangSmith) và quyền sở hữu data plane (Langfuse) — hãy chọn theo thứ bạn không sẵn sàng đánh đổi.
Tài liệu tham khảo
- LangSmith: AI Agent & LLM Observability and Evals Platform — LangChain
- Observability concepts — Docs by LangChain
- Evaluation concepts — Docs by LangChain
- Prompt & Context Hub — Docs by LangChain
- Self-hosted LangSmith — Docs by LangChain
- LangSmith Plans and Pricing — LangChain
- Everything we shipped at Interrupt — LangChain
- Top LLM Observability and Evaluation Platforms in 2026: Langfuse, LangSmith, Braintrust, Arize, and More Compared — MarkTechPost
- LangSmith Pricing Explained (2026): Traces, Seats & Alternatives — Inference.net