Mục lục
Trước khi bắt đầu
Phần này giúp bạn hiểu mục tiêu của hướng dẫn: cách quản lý token khi dùng Claude để kéo dài lượt chat, giảm chi phí và tránh bị khóa giữa chừng.
Nội dung chính
Tóm tắt 12 mẹo thực tế được chia thành 3 nhóm: thay đổi thói quen nhắn tin, tận dụng chức năng hệ thống và chiến thuật quản lý thời gian/hạn mức.
Bài này phù hợp với ai?
- Chuyên viên marketing hoặc người làm nội dung cần phản hồi nhanh và súc tích.
- Người thường xử lý tài liệu dài (PDF, hướng dẫn) và hỏi nhiều lần về cùng một tài liệu.
- Người dùng gói Pro hoặc Team cần đảm bảo công việc không bị dừng giữa chừng.
- Lập trình viên/nhà phân tích cần cân bằng giữa tác vụ nhẹ và tác vụ nặng trên Claude.
Bạn sẽ tạo ra gì?
Bạn sẽ thiết lập quy trình làm việc giúp giảm token tiêu tốn: thói quen nhắn tin gọn, quy trình “tóm tắt → mở chat mới” để làm mới ngữ cảnh, cấu hình Projects/Memory/Style trả lời, chọn mô hình phù hợp và lịch kích hoạt cửa sổ 5 giờ để có lượt chat đều trong ngày.
Bạn cần chuẩn bị gì?
- Tài khoản Claude (Pro/Team nếu cần Extra Usage).
- Tài liệu cần tải lên (PDF, hướng dẫn) nếu dùng Projects/Knowledge.
- Truy cập phần Cài đặt (Settings) → tab General và tab Usage.
- Thời gian vài phút để tạo/soạn bản tóm tắt và gửi tin nhắn “kích hoạt” theo lịch.
- (Tùy chọn) quyết định Monthly Limit ví dụ 20 đô để kiểm soát chi phí.
Tạo một quy trình quản lý token hiệu quả bằng Claude
Dựa trên video, quy trình thực hiện gồm 12 bước chính (mẹo) để tối ưu token — cộng thêm bước kiểm tra cuối cùng. Thực hiện theo từng bước dưới đây.
Dùng nút Chỉnh sửa thay vì nhắn tin nối tiếp

Khi cần sửa yêu cầu ban đầu, nhấn “Chỉnh sửa” (Edit) trên câu hỏi gốc và cập nhật yêu cầu thay vì gửi tin nhắn mới với yêu cầu sửa. Việc này sẽ ghi đè phản hồi cũ và ngăn nội dung sai sót tạo tầng lịch sử mới, tiết kiệm token.
Làm mới đoạn chat sau 15-20 tin nhắn

Khi đoạn chat quá dài, gửi yêu cầu tóm tắt cuối cùng: “Hãy tóm tắt lại toàn bộ nội dung, các quyết định quan trọng và bối cảnh cốt lõi nhất của cuộc hội thoại này một cách ngắn gọn nhưng đầy đủ.” Copy bản tóm tắt, mở chat mới và dán vào với lời nhắn: “Đây là bối cảnh công việc tôi đang làm, hãy dựa vào đây để tiếp tục.” Cách này giữ được bối cảnh chính nhưng giảm token đọc lịch sử.
Gộp các yêu cầu liên quan vào một tin nhắn duy nhất

Thay vì gửi nhiều tin nhắn nhỏ, liệt kê tất cả tác vụ trong một lần gửi. Ví dụ: “Hãy giúp tôi thực hiện 3 việc sau đây: (1) Tóm tắt văn bản này, (2) Trích xuất 5 ý chính liên quan đến Marketing từ văn bản trên, và (3) Dịch văn bản sang tiếng Anh”. Claude chỉ cần đọc ngữ cảnh một lần.
Viết câu lệnh ngắn gọn, cô đọng

Loại bỏ lời chào và từ thừa trước khi gửi. Ví dụ so sánh trong video:
- Dài: “Chào Claude. Mình có một đoạn văn bản ở dưới đây, bạn vui lòng tóm tắt giúp mình thành 3 ý chính ngắn gọn để mình gửi cho sếp được không?”
- Ngắn: “Tóm tắt văn bản dưới đây thành 3 ý chính.”
Trước khi gửi, tự hỏi: “Từ này có giúp Claude hiểu yêu cầu tốt hơn không? Nếu không, hãy xóa nó.”
Dùng Projects và tải tài liệu vào Knowledge (Context Caching)

Với tài liệu dài, tạo một Project và tải file vào phần Knowledge để Claude truy xuất từ bộ nhớ đệm thay vì đọc lại toàn bộ file mỗi lần. Điều này giảm chi phí token khi hỏi nhiều lần về cùng tài liệu.
Thiết lập Memory trong Settings → General

Nhập thông tin công việc và sở thích trả lời để Claude tự nhớ, ví dụ:
- “What best describes your work?”: chọn đúng lĩnh vực (ví dụ giáo dục, marketing).
- “What personal preferences should Claude consider in responses?”: ví dụ “Tôi là một chuyên gia marketing, thích sự súc tích và luôn tập trung vào dữ liệu.”
Việc này giảm token bạn phải nhập lặp lại khi bắt đầu chat mới.
Thiết lập cách Claude trả lời (trong Settings → General)

Cấu hình yêu cầu trả lời mặc định để giảm đầu ra thừa, ví dụ: “Hãy trả lời ngắn gọn, trọng tâm bỏ qua mọi lời chào hỏi xã giao, đi thẳng vào kết quả.” Vì token tính cho cả đầu vào và đầu ra, thiết lập này tiết kiệm token và giúp đọc nhanh hơn.
Tắt các tính năng không cần thiết (Web search / Research)

Nếu không cần tra cứu web hoặc nghiên cứu phức tạp, tắt các chế độ như Web search/Research vì chúng kèm theo lệnh hệ thống dài và nhiều bước suy luận, làm tăng tiêu thụ token. Chỉ bật khi thực sự cần.
Chọn mô hình phù hợp cho từng loại công việc
Phân loại công việc:
- Haiku: tác vụ nhẹ (sửa chính tả, dịch ngắn, phân loại đơn giản) - nhanh, ít tiêu tốn token.
- Sonnet: tác vụ trung bình/khó (viết sáng tạo, lập trình phức tạp) - cân bằng trí tuệ và hiệu suất.
- Opus: chỉ cho việc rất khó, nghiên cứu sâu hoặc phân tích khối lượng lớn - tiêu tốn token nhiều nhất. Dùng Opus khi thực sự cần.
Quản lý cửa sổ 5 giờ (rolling window) và điều khiển thời điểm mở cửa sổ
Hiểu rằng hạn mức là một “cửa sổ 5 tiếng” bắt đầu khi bạn gửi tin nhắn đầu tiên. Chiến lược của Linh: chia ngày thành hai khung cố định và gửi “tin nhắn kích hoạt” vào đầu mỗi khung để điều khiển cửa sổ, ví dụ 7:00–12:00 và 13:00–18:00. Gửi tin nhắn khởi động đúng giờ để đảm bảo lượt chat đủ dùng trong suốt khung làm việc.
Tránh giờ cao điểm máy chủ Mỹ (ít dùng tác vụ nặng)
Giờ cao điểm máy chủ rơi vào ~8:00–14:00 theo giờ miền Đông Mỹ (khoảng 19:00–01:00 giờ Việt Nam). Tránh thực hiện các tác vụ nặng vào khung giờ này để giảm khả năng bị siết hạn mức và trải nghiệm chậm.
Bật Extra Usage và đặt Monthly Limit trong Settings → Usage

Với gói Pro/Team, bật tính năng Vượt hạn mức (Extra Usage) để hệ thống chuyển sang chế độ pay-as-you-go khi hết hạn mức chính. Để tránh sốc hóa đơn, cài Monthly Limit (ví dụ 20 đô). Khi chi phí vượt mức này, hệ thống sẽ dừng tính phí thêm.
Kiểm tra trước khi chia sẻ
Trước khi bắt đầu phiên làm việc hoặc gửi kết quả cho người khác, kiểm tra nhanh:
- Project/Knowledge đã tải tài liệu cần thiết chưa.
- Memory và Style trả lời trong Settings → General đã lưu đúng không.
- Bạn đã dán bản tóm tắt vào chat mới khi chuyển ngữ cảnh chưa.
- Mô hình chọn phù hợp với độ nặng công việc (Haiku/Sonnet/Opus).
- Extra Usage và Monthly Limit đã bật/cài đặt nếu cần.
Đảm bảo những mục này để tiết kiệm token và tránh bị dừng giữa chừng.



