Prompt caching là kỹ thuật lưu trữ các phần tĩnh của một prompt, tức là hướng dẫn hệ thống (system instructions), tài liệu tham khảo hoặc các ví dụ mẫu, để mô hình không phải xử lý lại chúng từ đầu trong các yêu cầu (request) tiếp theo. Bằng cách tái sử dụng trạng thái tính toán của các tiền tố (prefix), kỹ thuật này giúp bạn giảm chi phí vận hành lên đến 90% và cắt giảm độ trễ phản hồi tới 85%.
Trong hạ tầng AI quy mô lớn, tính đi tính lại cùng một ngữ cảnh (context) dài là chỗ đốt tài nguyên nhiều nhất mà không đem lại gì mới. Prompt caching giải quyết vấn đề này bằng cách cho phép mô hình "nhảy" thẳng đến phần nội dung mới, thay vì phải đọc lại toàn bộ dữ liệu tĩnh từ đầu mỗi khi bạn gửi một tin nhắn mới trong cùng một phiên làm việc.

Prompt caching là gì?
Theo tài liệu kỹ thuật từ Anthropic và IBM, prompt caching là phương thức tối ưu cho phép LLM tiếp tục xử lý từ các tiền tố (prefix) cụ thể đã được lưu trong bộ nhớ đệm. Thay vì mã hóa và tính toán lại toàn bộ dữ liệu đầu vào cho mỗi request, mô hình sẽ truy xuất trạng thái ngữ cảnh đã được xử lý trước đó.
Khác với caching truyền thống (deterministic), vốn trả về cùng một kết quả cố định cho một đầu vào cố định, prompt caching trong LLM lưu trữ trạng thái ngữ cảnh (context state). Điều này có nghĩa là mô hình vẫn tạo ra các phản hồi linh hoạt dựa trên phần biến đổi của prompt, nhưng trên một nền tảng kiến thức tĩnh đã được "tiêu hóa" sẵn. Đặc điểm này đặc biệt quan trọng với các hệ thống RAG (Retrieval-Augmented Generation) hoặc các tác vụ xử lý tài liệu dài.
Prompt caching hoạt động như thế nào?
Quy trình xử lý prompt của mô hình bao gồm ba bước: Tokenization (mã hóa), Vectorization (véc-tơ hóa) và Compute Attention. Trong đó, Compute Attention là bước tốn kém nhất do độ phức tạp O(n²) khi tính tích vô hướng (dot product) giữa mọi token trong prefix. Prompt caching giúp tái sử dụng kết quả của bước này.

Anthropic hiện hỗ trợ hai cơ chế triển khai, một cái gần như không bắt bạn nghĩ gì, một cái bắt bạn phải tính:
- Automatic caching: Hệ thống tự đặt điểm ngắt cache ở khối nội dung hợp lệ cuối cùng. Cơ chế này dịch chuyển điểm ngắt theo sự phát triển của hội thoại, lý tưởng cho chat nhiều lượt.
- Explicit cache breakpoints: Kỹ sư chủ động đánh dấu các khối tĩnh bằng tham số
cache_control. Lưu ý: khối chứacache_controlphải là khối cuối cùng của phần tiền tố tĩnh để đảm bảo hiệu quả.
Cấu hình minh họa:
{
"role": "user",
"content": [
{
"type": "text",
"text": "Đây là tài liệu hướng dẫn kỹ thuật dài 50 trang...",
"cache_control": { "type": "ephemeral" }
},
{
"type": "text",
"text": "Dựa vào tài liệu trên, hãy phân tích lỗi hệ thống sau: [Lỗi]"
}
]
}