Chuyển đến nội dung

Prompt caching: giảm tới 90% chi phí phần lặp lại

Tích hợp & APINâng cao6 phút đọc

Chatbot tra cứu tài liệu, agent có system prompt dài, pipeline chấm bài theo cùng một rubric — tất cả đều gửi lại phần tĩnh ở mọi request. Prompt caching cho phép Claude "ghi nhớ" phần đó: đọc lại từ cache rẻ hơn khoảng 90% và nhanh hơn rõ rệt.

Bạn sẽ học được
  • Hiểu cơ chế cache và điều kiện để cache trúng
  • Sắp xếp prompt theo nguyên tắc tĩnh-trước-động-sau
  • Đặt cache breakpoint và tính điểm hòa vốn
Bạn cần gì
  • Đang gọi Claude API trong ứng dụng thật
  • Một prompt có phần lặp lại ≥ 1.024 token

Cơ chế trong 30 giây

Bạn đánh dấu điểm cache trong request. Lần gọi đầu, Claude xử lý bình thường và lưu lại trạng thái phần trước điểm đánh dấu (ghi cache — đắt hơn một chút). Các lần sau, nếu phần đó GIỐNG HỆT, Claude đọc lại từ cache — rẻ hơn ~90% và bỏ qua toàn bộ thời gian xử lý phần đó.

Chữ "giống hệt" là chìa khóa: chỉ cần lệch một ký tự ở phần cache là trượt, và bạn trả giá đầy đủ.

Nguyên tắc vàng: tĩnh trước, động sau

Chỉ một thay đổi nhỏ chèn vào tầng 1 (ví dụ đóng dấu thời gian hiện tại vào system prompt) là phá sạch cache — lỗi phổ biến số một.

  • Tầng 1 — system prompt, quy tắc, rubric: gần như không bao giờ đổi
  • Tầng 2 — tài liệu nền, ví dụ few-shot: đổi theo phiên bản
  • Tầng 3 — lịch sử hội thoại, câu hỏi mới của người dùng: đổi mỗi request

Đánh dấu cache trong code

response = client.messages.create(
    model="claude-sonnet-4-5",
    system=[{
        "type": "text",
        "text": HUONG_DAN + TAI_LIEU_NEN,   # ~20 trang, bất biến
        "cache_control": {"type": "ephemeral"}
    }],
    messages=history + [{"role": "user", "content": cau_hoi_moi}],
    max_tokens=1024,
)

Khi nào đáng bật

Điểm hòa vốn đơn giản: ghi cache đắt hơn ~25%, đọc rẻ hơn ~90% — chỉ cần dùng lại từ lần thứ hai trong cửa sổ cache là đã lời.

  • Đáng: chatbot nền tri thức, agent gọi nhiều lượt cùng bộ tools, pipeline xử lý hàng loạt cùng một rubric
  • Chưa đáng: phần lặp dưới ~1.024 token (không đủ ngưỡng cache), request thưa thớt (cache hết hạn giữa hai lần gọi)

Đo để xác nhận

Response API trả về các trường usage cho biết bao nhiêu token được ghi cache và bao nhiêu được đọc từ cache. Log hai con số này tuần đầu tiên: tỷ lệ cache-hit thấp nghĩa là phần "tĩnh" của bạn đang lén thay đổi — đi tìm dấu thời gian, ID phiên hay thứ tự trường bị xáo.

Nội dung này có hữu ích không?
Kiểm tra kiến thức

Củng cố những gì bạn vừa học

3 câu trắc nghiệm · đạt từ 70% · câu hỏi và đáp án xáo trộn mỗi lần.

Hội thoại chia sẻ

Cộng đồng đang hỏi Claude điều gì?

Xem tất cả
Nền tảng

Dùng Claude để làm gì trong công việc?

Claude hữu ích nhất cho các việc tốn thời gian nhưng cần tư duy có cấu trúc: đọc/tóm tắt tài liệu dài, viết draft email/report, research & phân tích dữ liệu, hỗ

Ẩn danh6
Nền tảng

Claude phù hợp coding hay viết content?

Claude làm tốt cả coding lẫn content, nhưng nổi bật ở các tác vụ cần ngữ cảnh dài và output nhất quán. [3][5] • Coding: mạnh với debug code phức tạp, multi-file

Ẩn danh30
Nền tảng

thế giới quan liên quan gì đến dùng AI?

Thế giới quan ảnh hưởng trực tiếp đến cách bạn dùng AI: bạn hỏi gì, tin câu trả lời đến đâu, và xem AI là công cụ hay đối tác tư duy. [1][3][5] AI cũng không ho

Ẩn danh35
Nền tảng

Tư duy ứng dụng claude dành cho người lãnh đạo?

Với lãnh đạo, trọng tâm không phải “dùng AI cho vui” mà là tạo leverage cho tư duy và vận hành: - Claude hỗ trợ brainstorming chiến lược, phân tích audience, si

Ẩn danh79
Nền tảng

cách ứng dụng claude cho giảng viên?

Claude có thể hỗ trợ giảng viên ở vài việc lặp lại nhưng tốn thời gian: - Tạo đề thi, ngân hàng câu hỏi, phiếu học tập và tài liệu giảng dạy nhanh hơn [1][2] -

Ẩn danh53
Nền tảng

thế giới quan liên quan gì đến việc ứng dụng AI?

Thế giới quan ảnh hưởng trực tiếp đến cách bạn dùng AI: bạn hỏi gì, tin câu trả lời đến đâu, xem AI là công cụ hay đối tác tư duy. [2][3] AI cũng mang “thế giới

Ẩn danh48
Nền tảng

Claude AI là gì?

Claude AI là trợ lý AI hội thoại do Anthropic phát triển, ra mắt từ 2023. Nó được thiết kế theo hướng “helpful, harmless, honest” — hữu ích, an toàn và trung th

Ẩn danh45
Nền tảng

Cách viết prompt hiệu quả

Prompt hiệu quả thường có 3 phần chính: - Ngữ cảnh: bạn là ai, tình huống gì [1] - Yêu cầu cụ thể: muốn AI làm gì, output ra sao [1] - Ràng buộc: độ dài, tone,

Ẩn danh153
Nền tảng

Claude AI là gì?

Claude AI là trợ lý AI hội thoại do Anthropic phát triển, ra mắt từ 2023. Nó được thiết kế theo hướng “helpful, harmless, honest” — hữu ích, an toàn và trung th

Ẩn danh111
Nền tảng

Claude AI là gì?

Claude AI là trợ lý AI hội thoại do Anthropic phát triển, ra mắt từ 2023. Nó được thiết kế theo hướng “helpful, harmless, honest” — hữu ích, an toàn và trung th

Ẩn danh90
Nền tảng

Claude AI là gì?

Claude AI là trợ lý AI hội thoại do Anthropic phát triển, ra mắt từ 2023. Nó được thiết kế theo hướng “helpful, harmless, honest” — hữu ích, an toàn và trung th

Ẩn danh38

Đăng ký nhận bản tin

Chọn chủ đề bạn quan tâm — nhận bài viết chọn lọc và thông báo sự kiện gửi thẳng vào hộp thư.

Bảo mật thông tin. Hủy đăng ký bất cứ lúc nào. Chính sách bảo mật