Token là gì và vì sao ảnh hưởng chi phí AI
TL;DR: Token là đơn vị nhỏ mà LLM dùng để đọc input và sinh output. Bạn không cần đếm token thủ công mỗi ngày, nhưng phải hiểu token để biết vì sao prompt dài tốn tiền hơn, context bị giới hạn, và output nhiều có thể làm workflow chậm hoặc đắt.
Cập nhật 31/07/2026: Không dùng bảng giá cố định trong bài training này. Giá token, quota và subscription thay đổi theo nhà cung cấp; luôn kiểm tra pricing/docs chính thức trước khi tính chi phí cho khách hoặc nội bộ.
Token là gì?
Token là mảnh nhỏ của văn bản. Một token có thể là một từ ngắn, một phần của từ, dấu câu, khoảng trắng, hoặc một đoạn ký tự trong code. Khi bạn gửi prompt cho AI, model không đọc “trang tài liệu” như con người; nó đọc chuỗi token.
Ví dụ đơn giản:
| Nội dung | Cách hiểu thực dụng |
|---|---|
| Một câu ngắn | Ít token, xử lý nhanh |
| Một file code dài | Nhiều token, tốn context |
| Một transcript meeting | Nhiều token, cần tóm tắt hoặc chia đoạn |
| Một repo lớn | Không thể nhét hết; phải chọn file liên quan |
Vì sao token quan trọng?
Token ảnh hưởng bốn thứ: chi phí, tốc độ, context window và chất lượng đầu ra.
- Chi phí: nhiều input/output token hơn thường tốn nhiều tiền hơn trên API.
- Tốc độ: context dài làm model đọc lâu hơn và phản hồi chậm hơn.
- Context window: mỗi model có giới hạn lượng token có thể xử lý trong một lượt.
- Chất lượng: nhồi quá nhiều thông tin không liên quan làm model khó tập trung.
Có nên tối ưu token bằng cách viết prompt cực ngắn không?
Không. Prompt quá ngắn thường làm AI đoán, và đoán sai thì chi phí sửa còn cao hơn. Tối ưu token đúng nghĩa là đưa đủ context liên quan, bỏ phần nhiễu.
Cách làm tốt:
- Đưa mục tiêu và tiêu chí hoàn thành trước.
- Trích đúng đoạn tài liệu hoặc file cần xử lý.
- Dùng link/path/source rõ ràng thay vì paste cả vault.
- Yêu cầu AI hỏi lại nếu thiếu dữ kiện quan trọng.
- Với tài liệu dài, chia thành bước: summarize, extract, then decide.
Token trong coding khác gì token trong content?
Code thường tốn token theo cách khó thấy hơn văn bản thường. Một file TypeScript nhiều import, type, JSX, test case và error log có thể chiếm rất nhiều context. Vì vậy agent coding giỏi không phải là agent đọc toàn bộ repo, mà là agent biết tìm đúng file.
Ở Diginno, vòng lặp nên là:
| Bước | Token dùng cho gì |
|---|---|
Search bằng rg |
Tìm đúng file thay vì paste toàn repo |
| Đọc file liên quan | Nạp context có giá trị cao |
| Chạy test/build | Lấy error output cụ thể |
| Sửa lại | Dùng token cho vấn đề thật, không cho nhiễu |
Khi nào cần tóm tắt context?
Cần tóm tắt khi conversation dài, transcript dài, hoặc task chuyển pha. Tóm tắt tốt không phải là rút gọn cho đẹp; nó phải giữ các quyết định, ràng buộc, file đã sửa, test đã chạy, lỗi còn lại và next action.
Template tóm tắt:
Mục tiêu: ...
Đã làm: ...
Quyết định: ...
File/doc liên quan: ...
Kiểm chứng đã chạy: ...
Còn thiếu/rủi ro: ...
Next action: ...
Bài học cần nhớ
Token là “ngân sách chú ý” của AI. Muốn dùng AI hiệu quả, đừng chỉ nghĩ cách giảm token; hãy nghĩ cách tăng mật độ thông tin hữu ích trong mỗi token. Context ít nhưng đúng thường tốt hơn context rất dài nhưng nhiễu.
Bài viết hữu ích?
Chia sẻ để nhiều người biết đến!
>_ LLM-Friendly Copy
Copy as Markdown to use with ChatGPT, Claude, or other AI tools