Bạn đang chạy việc trơn tru với Claude, ý tưởng đang tuôn, thì màn hình hiện dòng "You've hit your usage limit" — hết lượt, không gõ thêm được câu nào. Giống như chạy marathon bị chặn lại ngay trước vạch đích.
Điều ít người mới nhận ra: vấn đề thường không nằm ở việc bạn hỏi nhiều hay ít, mà ở cách bạn quản lý token. Nếu coi Claude như một trợ lý, thì token là "năng lượng" cho mỗi lần nó suy nghĩ. Không biết cách tối ưu, bạn đốt hết năng lượng đó một cách lãng phí mà không hay.
Bài này đi qua cơ chế token và các mẹo thực tế để dùng ít token hơn cho cùng một khối lượng công việc.
Trước tiên: token hoạt động thế nào
Token là đơn vị AI dùng để xử lý yêu cầu — hình dung như dung lượng của một gói mạng: việc đơn giản tốn ít, việc phức tạp hoặc đoạn chat dài tốn nhiều.
Điểm mấu chốt nằm ở đây, và nó giải thích gần như mọi mẹo bên dưới: mỗi khi bạn gửi một tin nhắn mới, Claude không chỉ đọc riêng tin đó — nó đọc lại toàn bộ đoạn chat từ đầu đến cuối để hiểu ngữ cảnh.
Hình dung như mỗi lần bạn hỏi một câu, người trợ lý phải đọc lại cả cuốn sổ ghi mọi câu đã trao đổi từ đầu buổi rồi mới trả lời. Chat càng dài, cuốn sổ càng dày. Hệ quả: tin nhắn thứ 20 tốn gấp nhiều lần tin nhắn đầu tiên. Đây là lý do một đoạn chat kéo quá dài làm token hao đi rất nhanh.
Nắm được nguyên tắc này rồi, phần còn lại chỉ là mấy thói quen nhỏ.
Nhóm 1 — Thay đổi thói quen nhắn tin
1. Dùng nút "Chỉnh sửa" thay vì chat nối tiếp để sửa

Khi Claude trả lời chưa đúng, phản xạ thường gặp là gõ thêm một câu: "chưa đúng, sửa lại giúp tôi...". Về mặt token, bạn vừa tạo thêm một tầng lịch sử: giờ Claude phải đọc lại câu hỏi gốc + câu trả lời sai + yêu cầu sửa.
Thay vào đó, bấm nút "Edit / Chỉnh sửa" ngay tại câu hỏi gốc rồi viết lại. Claude sẽ ghi đè lên phản hồi cũ — nội dung sai bị loại khỏi đoạn chat, không còn bị đọc lại mỗi lượt sau. Thói quen nhỏ, hiệu quả lớn.
2. Làm mới đoạn chat sau khoảng 15–20 tin nhắn
Mỗi tin nhắn gửi đi và mỗi câu trả lời đều tích lũy token. Chat càng dài, Claude xử lý càng chậm, dễ quên yêu cầu phía trên, và tốn token nhanh hơn.
Cách làm mới mà không mất mạch việc:
- Trước khi kết thúc, yêu cầu Claude: "Tóm tắt toàn bộ nội dung, các quyết định quan trọng và bối cảnh cốt lõi của cuộc hội thoại này, ngắn gọn nhưng đầy đủ."
- Copy bản tóm tắt đó.
- Mở một chat mới, dán vào kèm câu: "Đây là bối cảnh công việc tôi đang làm, dựa vào đây để tiếp tục."
Giống như chắt lấy ý chính của một cuốn sách dày ra một tờ ghi chú rồi mang sang phòng mới. Bạn bắt đầu lại với token tối thiểu nhưng vẫn giữ được trí nhớ công việc.
3. Gộp các yêu cầu liên quan vào một tin nhắn
Mỗi lần bấm Gửi là một lần Claude đọc lại toàn bộ lịch sử. Nên đừng hỏi lắt nhắt từng câu rời rạc.
Thay vì hỏi 3 lần: "tóm tắt văn bản này" → "trích 5 ý chính" → "dịch sang tiếng Anh", hãy gộp thành một tin:
"Giúp tôi 3 việc với văn bản dưới đây: (1) tóm tắt, (2) trích 5 ý chính, (3) dịch sang tiếng Anh."
Claude chỉ cần đọc lại ngữ cảnh một lần để làm cả ba — giảm cả token lẫn thời gian xử lý.
4. Viết prompt ngắn gọn, bỏ từ thừa
Token tính cho cả phần bạn gõ vào lẫn phần Claude trả ra. Những câu xã giao dài dòng — "Chào Claude, bạn có thể giúp tôi một việc nhỏ được không..." — đều tốn token mà không giúp Claude hiểu rõ hơn.
Thay vì: "Chào bạn, mình có đoạn văn dưới đây, bạn vui lòng tóm tắt giúp mình thành 3 ý để gửi sếp nhé?" Chỉ cần: "Tóm tắt văn bản dưới đây thành 3 ý chính."
Kết quả tương đương. Trước khi gửi, tự hỏi: "Từ này có giúp Claude hiểu tốt hơn không? Nếu không, xoá." Cách này cũng hợp với văn hoá đi thẳng vấn đề của team.
Nhóm 2 — Tận dụng tính năng hệ thống
5. Dùng Projects cho tài liệu dài

Nếu bạn có một tài liệu dài cần hỏi đi hỏi lại qua nhiều đoạn chat, đừng upload lại mỗi lần — mỗi lần như vậy Claude phải xử lý lại từ đầu, token cạn rất nhanh.
Thay vào đó, tạo một Project và tải tài liệu vào phần Knowledge của Project. Hệ thống sẽ truy xuất tài liệu một cách tối ưu thay vì đọc lại từ đầu cho mọi tin nhắn. Upload một lần, dùng lại nhiều lần trong Project đó — mở bao nhiêu chat mới trong Project cũng không phải tải lại.
6. Thiết lập thông tin cá nhân để Claude ghi nhớ
Đừng mỗi lần mở chat mới lại dán một đoạn dài nhắc Claude bạn là ai, muốn trả lời ra sao. Việc lặp lại này vừa tốn thời gian vừa tốn token.

Vào phần Cài đặt → thông tin cá nhân, khai báo một lần: tên, công việc (ví dụ product management), bối cảnh công việc, và phong cách phản hồi bạn muốn (ví dụ "trả lời ngắn gọn, đi thẳng kết quả, bỏ lời chào xã giao"). Từ đó Claude tự áp dụng cho mọi cuộc hội thoại, không cần nhắc lại.
⚠️ Lưu ý bảo mật cho môi trường VNPAY — đọc kỹ. Phần khai báo này không phải chỗ để nhập dữ liệu nhạy cảm: số liệu giao dịch, thông tin khách hàng, dữ liệu tài chính chưa công bố, chi tiết hệ thống nội bộ. Chỉ khai báo bối cảnh chung về vai trò và phong cách làm việc. Trước khi đưa bất kỳ thông tin công ty nào vào công cụ AI, hãy kiểm tra quy định sử dụng AI hiện hành của VNPAY và xác nhận với bộ phận phụ trách.
7. Tắt các tính năng không dùng tới
Các tính năng như Web search hay Research đi kèm những bước xử lý ẩn khá dài. Nếu bạn chỉ cần sửa một lỗi chính tả hay viết lại một câu, bật chế độ nghiên cứu là lãng phí — Claude thực hiện nhiều bước hơn, mỗi bước đều tính vào hạn mức. Chỉ bật khi thực sự cần.
8. Dùng đúng mô hình cho từng loại việc
Đây là sai lầm phổ biến nhất: dùng mô hình mạnh nhất cho mọi việc. Vừa chậm vừa tốn token. Phân loại công việc thành ba mức:
| Mức việc | Ví dụ | Nên dùng |
|---|---|---|
| Dễ | Sửa chính tả, dịch đoạn ngắn, phân loại dữ liệu đơn giản | Dòng Haiku — nhanh, tốn ít token |
| Vừa & khó | Viết sáng tạo, xử lý logic, lập trình | Dòng Sonnet — cân bằng thông minh và hiệu suất |
| Cực khó | Phân tích sâu, khối lượng dữ liệu lớn | Dòng Opus — mạnh nhất, nhưng đốt token nhanh nhất |
Nguyên tắc: đừng lấy xe tải 10 tấn đi mua ổ bánh mì đầu ngõ.
Nhóm 3 — Thời gian và hạn mức
9. Hiểu cơ chế "cửa sổ trượt 5 giờ"
Hiểu lầm phổ biến: lượt chat được làm mới vào lúc nửa đêm. Không phải. Claude dùng cơ chế cửa sổ trượt 5 tiếng, bắt đầu tính từ đúng thời điểm bạn gửi tin nhắn đầu tiên.
Ví dụ: gửi tin đầu lúc 10:00 sáng → cửa sổ của bạn kéo dài đến khoảng 15:00 chiều. Số lượt trong mỗi cửa sổ tuỳ gói đăng ký. Vấn đề nảy sinh khi bạn làm dồn dập và dùng hết lượt từ sớm — phải đợi hết cửa sổ mới có lượt mới, dễ bị khoá ngay giữa việc.
Mẹo: chủ động điều khiển khung giờ này khớp với lịch làm việc. Ví dụ chia ngày làm 2 khung cố định (sáng / chiều); đầu mỗi khung, gửi một tin "kích hoạt" để mở cửa sổ 5 tiếng đúng lúc bạn bắt đầu. Nhờ vậy luôn đủ lượt cho cả ngày, tránh bị khoá giữa chừng.
10. Bật Extra Usage nếu không được phép gián đoạn

Với môi trường chuyên nghiệp — nơi bị dừng giữa chừng ảnh hưởng tiến độ — tuỳ gói, bạn có thể bật Extra Usage trong phần cài đặt. Khi hết hạn mức của gói chính, hệ thống chuyển sang tính phí theo lượng dùng thực tế (pay as you go).
Để tránh sốc hoá đơn cuối tháng, đặt thêm giới hạn chi tiêu hàng tháng (ví dụ 20 USD). Vượt mức, hệ thống tự dừng. Con số này chỉ là ví dụ — team tự đặt theo nhu cầu và quy định chi tiêu nội bộ.
Năm điểm cốt lõi cần nhớ
- Claude đọc lại toàn bộ lịch sử chat mỗi lần trả lời → chat càng dài càng tốn token.
- Thói quen nhỏ, hiệu quả ngay: dùng nút Edit, làm mới chat, gộp yêu cầu, viết súc tích.
- Tận dụng tính năng hệ thống: Project, ghi nhớ thông tin cá nhân, thiết lập phong cách trả lời — để khỏi lặp lại bối cảnh.
- Đúng mô hình cho đúng việc, tắt tính năng không cần.
- Chủ động quản lý cửa sổ 5 giờ để không bị khoá đột ngột.
Làm việc hiệu quả với Claude không chỉ là biết đặt câu hỏi, mà là biết quản lý tài nguyên. Bắt đầu từ thói quen đơn giản nhất — dùng nút chỉnh sửa và viết prompt gọn hơn — bạn sẽ thấy khác biệt trong vài ngày.
References:
Tvl, S. (2026, May 7). Tại sao bạn nhanh hết lượt chat với Claude? 12 cách quản lý token thông minh. Skills Bridge. https://www.skillsbridge.vn/blogs/all-posts/12-cach-quan-ly-token-thong-minh
