Bỏ qua điều hướng

LangSmith là gì? Quan sát và đánh giá agent AI của LangChain

LangSmith là nền tảng quan sát và đánh giá agent AI của LangChain, giúp kỹ sư tối ưu hiệu suất, kiểm soát chi phí và xử lý tính bất định của LLM.

Tuan Tran Van
13 phút đọc
Mục lục (10 phần)
  1. LangSmith là gì?
  2. Trace, run, thread và project: LangSmith ghi lại những gì?
  3. Đánh giá chất lượng: dataset, experiment và LLM-as-judge
  4. Context Hub: quản lý prompt và ngữ cảnh như quản lý code
  5. LangSmith Engine và SmithDB: những gì đổi sau Interrupt 2026
  6. Cloud, hybrid hay self-host?
  7. Chi phí tính theo trace và những khoản dễ vượt dự toán
  8. LangSmith và Langfuse khác nhau ở đâu?
  9. Khi nào nên chọn LangSmith?
  10. Tài liệu tham khảo

LangSmith là nền tảng quản trị vòng đời agent (Agent Engineering Platform), tập trung vào ba trụ cột: quan sát (observability), đánh giá (evaluation) và triển khai (deployment).

Bạn dùng nó để xử lý tính bất định (non-deterministic) của mô hình ngôn ngữ lớn (Large Language Model, LLM) bằng cách ghi vết và phân tích từng bước trung gian trong luồng suy luận của hệ thống.

Nền tảng này cho phép bạn nhìn thấu "hộp đen" của AI agent, từ giai đoạn thử nghiệm prompt đến khi giám sát vận hành thực tế.

Thay vì phỏng đoán nguyên nhân agent chạy sai, bạn có dữ liệu cấu trúc về luồng RAG, tool call và logic suy luận để tối ưu hiệu suất lẫn kiểm soát chi phí.

Nhìn xuyên vào hộp đen của một agent AI đang chạy, từng bước suy luận hiện thành dữ liệu quan sát được

LangSmith là gì?

Dưới góc độ kỹ thuật, LangSmith là một nền tảng framework-agnostic — không phụ thuộc vào framework nào. Nó được thiết kế để tích hợp sâu nhất với hệ sinh thái LangChain, nhưng bạn vẫn dùng được cho các hệ thống agent tự viết thông qua SDK Python, JS/TS hoặc chuẩn OpenTelemetry. Đây là hạ tầng kiểm soát toàn bộ vòng đời phát triển của một agent, chứ không chỉ là chỗ ghi log.

Vòng đời phát triển agent trong LangSmith gồm build, test, deploy, monitor và improve, cùng ba trụ cột quan sát, đánh giá và triển khai

Trong vòng đời đó, LangSmith có mặt ở mọi chặng: Playground để thử prompt và xem kết quả tức thì, Tracing để ghi vết các luồng chạy phức tạp, Datasets để dựng bộ dữ liệu kiểm thử từ dữ liệu thật, rồi giám sát khi hệ thống đã lên production. Bạn bóc tách được từng node trong một đồ thị LangGraph hoặc từng bước thực thi của một Deep Agent.

Với kỹ sư hệ thống, giá trị lớn nhất là đo được hiệu suất thay đổi ra sao khi bạn đổi model hoặc sửa instructions trong prompt. Bạn có số liệu cụ thể để chứng minh phiên bản mới tốt hơn phiên bản cũ về độ trễ, chi phí và chất lượng đầu ra — thay vì dựa vào cảm giác thử-sai.

Trace, run, thread và project: LangSmith ghi lại những gì?

Để quản lý dữ liệu quan sát, LangSmith phân cấp thông tin theo một cấu trúc giúp bạn truy vết nhanh. Run là đơn vị công việc cơ bản, tương đương một span trong OpenTelemetry: nó ghi lại input và output của một lần gọi model, một lần chạy công cụ hoặc một truy xuất vector DB. Trace là một cây chứa các run cho một thao tác duy nhất của người dùng. Mỗi trace giới hạn tối đa 25.000 run; vượt quá con số này, hệ thống ngừng ghi nhận thêm.

Cấu trúc lồng nhau của dữ liệu quan sát: nhiều run nằm trong một trace, nhiều trace nối thành một thread, còn trajectory là góc nhìn phẳng của cùng dữ liệu đó

Thread là chuỗi các trace liên kết qua thread_id, đại diện cho một phiên làm việc nhiều lượt. Khác với thread — vốn giữ nguyên cấu trúc lồng nhau — trajectory cho bạn một góc nhìn phẳng gồm các tin nhắn AI, Human và Tool xếp theo thời gian. Trajectory giúp đọc hiểu luồng logic nhanh hơn vì đã loại bỏ nhiễu từ các bước thực thi ngầm, còn thread giữ lại toàn bộ chi tiết kỹ thuật để debug.

Dữ liệu được lưu trong các project — mỗi project là một container tách biệt cho từng dịch vụ hoặc từng môi trường (dev, staging, prod).

Khái niệmCấu trúc dữ liệuNội dung chứaDùng để làm gì
RunĐơn vị đơn lẻInput, output, metadata của một bướcKiểm tra chi tiết một thao tác cụ thể
TraceCâyToàn bộ các bước trong một thao tácDebug lỗi logic hoặc độ trễ hệ thống
ThreadChuỗi các traceLịch sử hội thoại nhiều lượtGiám sát hành vi agent qua cả phiên
TrajectoryDanh sách phẳngTin nhắn AI, Human, Tool theo thời gianĐọc nhanh nội dung trao đổi, giảm nhiễu

Đánh giá chất lượng: dataset, experiment và LLM-as-judge

Quy trình đánh giá (evaluation) trong LangSmith chuyển từ giám sát thụ động sang kiểm thử chủ động, qua hai giai đoạn: offline trước khi deploy, và online khi đã có traffic thật.

Vòng lặp đánh giá: một trace lỗi trong production được đưa vào dataset, chạy experiment rồi so sánh phiên bản cũ với phiên bản mới

Một vòng đánh giá thường bắt đầu khi bạn phát hiện một trace lỗi trong production. Bạn gắn thẻ cho các trace đó rồi đưa chúng vào một dataset gồm input và reference output (đáp án tham chiếu). Khi cập nhật code hoặc prompt, bạn chạy một experiment trên dataset này. LangSmith hiển thị bảng so sánh side-by-side để bạn chấm điểm thủ công hoặc dùng bộ chấm tự động, và thấy được phiên bản mới cải thiện tới đâu.

Cơ chế LLM-as-judge là trọng tâm để tự động hóa việc chấm điểm ở quy mô lớn. Bạn cấu hình một model mạnh hơn làm giám khảo, đánh giá model đang phát triển theo các tiêu chí như tính trung thực (faithfulness) hay mức độ liên quan (relevance).

  • Reference-based evaluator: so đầu ra của agent với đáp án chuẩn trong dataset để kiểm tra độ chính xác.
  • Reference-free evaluator: chấm theo các tiêu chí độc lập như độ an toàn, mức độ độc hại (toxicity) hoặc định dạng JSON, không cần đáp án mẫu. Đây là lựa chọn cho giám sát online trên dữ liệu người dùng thật, nơi bạn không có sẵn đáp án đúng.

Context Hub: quản lý prompt và ngữ cảnh như quản lý code

Context Hub tách logic trong code khỏi phần nội dung hướng dẫn của agent. Bạn quản lý các file AGENTS.md, các kỹ năng (skill) và chính sách (policy) ngay trên giao diện LangSmith.

Context Hub gắn tag dev, staging và prod cho từng phiên bản ngữ cảnh, cho phép đổi hành vi agent bằng cách chuyển tag mà không deploy lại code

Hệ thống hỗ trợ versioning và tagging: bạn gắn tag dev, staging hoặc prod cho từng phiên bản ngữ cảnh. Khi cần đổi hành vi agent, bạn sửa instructions trong Context Hub rồi chuyển tag, và thay đổi có hiệu lực mà không cần deploy lại code. Cơ chế này cho phép chuyên gia nghiệp vụ trực tiếp tinh chỉnh hành vi agent mà không đụng tới source code. Bạn cũng tham khảo được các prompt mẫu từ cộng đồng qua LangChain Hub tích hợp sẵn.

LangSmith Engine và SmithDB: những gì đổi sau Interrupt 2026

Sự kiện Interrupt 2026 mang lại hai nâng cấp đáng kể về hạ tầng và mức độ tự động hóa.

LangSmith Engine tự động theo dõi production trace, gom nhóm các lỗi tương đồng bằng clustering, chẩn đoán nguyên nhân gốc dựa trên code và prompt, rồi mở Pull Request đề xuất cách sửa. Vai trò của bạn chuyển từ dò lỗi thủ công sang xem xét và merge các đề xuất.

Vòng lặp tự động của LangSmith Engine: theo dõi trace production, gom nhóm lỗi, chẩn đoán nguyên nhân gốc rồi mở Pull Request đề xuất cách sửa

SmithDB là database chuyên dụng cho observability của agent, viết bằng Rust trên nền Apache DataFusion và Vortex. Nó dùng object storage để lưu trace bền vững, đi kèm các dịch vụ stateless cho ingestion và query. Kiến trúc này tối ưu cho các truy vấn trace lồng nhau nhiều tầng:

  • Tải một cây trace hoàn chỉnh: 92ms (P50).
  • Tải một run đơn lẻ: 71ms (P50).
  • Nhanh gấp tới 15 lần so với backend cũ, đồng thời giúp hệ thống chạy stateless và dễ mở rộng.

Cloud, hybrid hay self-host?

Tùy yêu cầu bảo mật và mức độ bạn cần kiểm soát dữ liệu, có ba lựa chọn triển khai:

  • Cloud (SaaS): dữ liệu nằm trên server của LangChain, chọn được vùng US hoặc EU. Hợp với đội cần triển khai nhanh.
  • Hybrid: control plane nằm trên SaaS để quản lý giao diện, còn data plane — nơi lưu trace — nằm tại hạ tầng của bạn.
  • Self-host: chạy toàn bộ stack trên hạ tầng riêng qua Kubernetes hoặc Terraform. Đây là lựa chọn của doanh nghiệp có yêu cầu khắt khe về data residency.

Ba lựa chọn triển khai LangSmith: Cloud, Hybrid và Self-host, khác nhau ở chỗ control plane và data plane nằm ở đâu

Một instance self-host gồm các dịch vụ lõi: frontend Nginx phục vụ giao diện và định tuyến API, backend xử lý CRUD và business logic, platform backend lo ingestion cùng xác thực khối lượng lớn, playground chuyển tiếp request tới các nhà cung cấp model, và ACE backend chạy code tùy ý trong môi trường cô lập.

Về lưu trữ, bản self-host cần ClickHouse cho trace và feedback, PostgreSQL cho dữ liệu vận hành, Redis hoặc Valkey cho hàng đợi và cache, cùng blob storage (S3, GCS hoặc Azure Blob) cho các artifact lớn. Một điểm cần nắm trước khi lên kế hoạch: self-host là add-on của gói Enterprise, thường đi kèm hợp đồng theo năm.

Chi phí tính theo trace và những khoản dễ vượt dự toán

Tính đến giữa năm 2026, LangSmith có ba mức: Developer (miễn phí, 1 seat, 5.000 base trace mỗi tháng), Plus (39 USD/seat/tháng, kèm 10.000 base trace) và Enterprise (báo giá riêng). Vượt hạn mức, base trace lưu 14 ngày có giá 2,50 USD cho mỗi 1.000 trace. Hệ thống còn tính thêm theo LangChain Storage Unit (LSU, 1,00 USD) và LangChain Compute Unit (LCU, 1,50 USD).

Khoản dễ vượt dự toán đầu tiên là extended retention. Nếu cần giữ trace lâu hơn 14 ngày, giá lên 5,00 USD cho mỗi 1.000 trace với thời hạn lưu 400 ngày. Nếu bạn nâng một base trace lên extended sau khi trace đã được ghi nhận, nền tảng tính thêm 2,50 USD cho mỗi 1.000 trace. Khác biệt này quan trọng khi bạn muốn dựng dataset đánh giá dài hạn từ dữ liệu production đã có.

Cái bẫy lớn hơn nằm ở độ mịn (granularity) của instrumentation — cách bạn gắn điểm đo trong code — vì số trace phụ thuộc vào cách bạn đo chứ không phải lưu lượng người dùng. Lấy một agent hỗ trợ khách hàng xử lý 50.000 phiên mỗi tháng: nếu bạn ghi cả phiên thành một lần chạy, bạn phát sinh 50.000 trace, tương đương 100 USD vượt hạn mức. Nếu instrumentation mở một lần chạy mới cho mỗi lượt hội thoại — trung bình sáu lượt một phiên — con số thành 300.000 trace và hóa đơn vượt hạn mức khoảng 725 USD, trong khi giá trị mang lại cho người dùng vẫn y hệt. Chênh lệch sáu lần đó đến từ lựa chọn kỹ thuật, không phải từ tăng trưởng.

Bẫy chi phí do độ mịn instrumentation: cùng 50.000 phiên, ghi mỗi phiên một trace so với ghi mỗi lượt hội thoại một trace tạo ra chênh lệch sáu lần

Các lượt chạy đánh giá cũng được tính là trace phải trả tiền. Bạn nên cấu hình sampling hoặc kiểm soát trực tiếp bằng biến môi trường:

bash
export LANGSMITH_TRACING=true
export LANGSMITH_TRACING_MODE=otel

LangSmith và Langfuse khác nhau ở đâu?

Đối thủ trực tiếp của LangSmithLangfuse. Cả hai đều đang dịch chuyển sang chuẩn OpenTelemetry GenAI, nhưng khác nhau rõ ở mô hình kinh doanh và độ sâu tích hợp.

Tiêu chíLangSmithLangfuse
Giấy phépĐộc quyềnMIT ở phần lõi
Đơn vị tính phíTraceUnit (theo observation)
Self-hostAdd-on của EnterpriseMiễn phí, chạy bằng Docker Compose
Tích hợp LangChainSâu nhất, mặc địnhTốt, qua OTel hoặc integration

Đơn vị tính phí là khác biệt dễ bị bỏ qua nhất. LangSmith tính theo trace, mà một trace chứa được tới 25.000 bước; Langfuse tính theo unit, nghĩa là mỗi span và mỗi điểm chấm đều được đếm riêng. Với các agent "nói nhiều", gọi rất nhiều công cụ trong một lượt, mô hình theo trace của LangSmith dễ dự đoán hơn, còn mô hình theo unit của Langfuse tăng tuyến tính theo độ phức tạp bên trong.

Về định vị sản phẩm, LangSmith là nền tảng đóng gói sẵn: có runtime được quản lý, có Engine tự đề xuất cách sửa lỗi, chạy trên SmithDB. Langfuse chọn hướng mã nguồn mở cho các đội muốn sở hữu hoàn toàn data plane mà không cần hợp đồng doanh nghiệp — và vẫn giữ cam kết mã nguồn mở sau khi được ClickHouse mua lại vào tháng 1/2026.

Khi nào nên chọn LangSmith?

Chọn LangSmith khi hệ thống của bạn đã dựng trên LangChain hoặc LangGraph: phần tích hợp gần như không cần cấu hình, và bạn nhìn được vào các vòng lặp agent mà công cụ đa dụng khó dựng lại. Engine càng đáng giá nếu đội bạn muốn tự động phát hiện các dạng lỗi trong production thay vì ngồi đọc trace thủ công.

Ngược lại, nếu lưu lượng rất lớn và ngân sách hẹp, hãy tính kỹ trước khi cam kết: chi phí theo trace tăng rất nhanh khi instrumentation thiết kế không hợp lý, và bài toán đó xuất hiện trước khi bạn kịp cần tới runtime được quản lý. Nói gọn, đây là lựa chọn giữa chiều sâu hệ sinh thái (LangSmith) và quyền sở hữu data plane (Langfuse) — hãy chọn theo thứ bạn không sẵn sàng đánh đổi.

Tài liệu tham khảo

Chia sẻ bài viết

X / TwitterFacebookLinkedIn