Là gì ChatGPT Token Counter?
▾
Bộ đếm mã thông báo ChatGPT ước tính số lượng mã thông báo trong một văn bản nhất định và tính toán chi phí API liên quan cho các mô hình OpenAI bao gồm GPT-4o, GPT-4 Turbo, GPT-3.5 Turbo và các LLM khác. Mã thông báo là đơn vị xử lý văn bản cơ bản trong các mô hình ngôn ngữ lớn — chúng không phải là ký tự hoặc từ mà là các đơn vị từ phụ thường có trung bình khoảng 4 ký tự hoặc 0,75 từ cho mỗi mã thông báo bằng tiếng Anh. Hiểu số lượng mã thông báo là điều cần thiết để quản lý chi phí API, kỹ thuật nhanh chóng và duy trì trong giới hạn cửa sổ ngữ cảnh mô hình. GPT-4o hỗ trợ cửa sổ ngữ cảnh mã thông báo 128K, nghĩa là một cuộc hội thoại có thể bao gồm khoảng 96.000 từ đầu vào và đầu ra kết hợp. Vì việc thanh toán API dựa trên số lượng mã thông báo với tỷ lệ riêng biệt cho mã thông báo đầu vào và đầu ra nên việc ước tính mã thông báo chính xác sẽ ảnh hưởng trực tiếp đến ngân sách phát triển và chi phí ứng dụng.
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
Công thức
▾
Số lượng mã thông báo (xấp xỉ) = Số ký tự / 4 hoặc Số từ / 0,75. Chi phí API = (Mã thông báo đầu vào / 1.000.000) x Giá đầu vào trên mỗi triệu + (Mã thông báo đầu ra / 1.000.000) x Giá đầu ra trên mỗi triệu.Chú giải biến
▾
| Ký hiệu | Tên | Đơn vị | Mô tả |
|---|---|---|---|
| T | Số lượng mã thông báo | tokens | Số lượng mã thông báo trong văn bản đầu vào hoặc đầu ra, được xác định bởi mã thông báo của mô hình (ví dụ: cl100k_base cho GPT-4) |
| C | Số ký tự | characters | Tổng số ký tự trong văn bản - khoảng 4 ký tự cho mỗi mã thông báo bằng tiếng Anh |
| Pi | Giá đầu vào | USD per 1M tokens | Giá mỗi triệu mã thông báo đầu vào (nhắc nhở) cho mô hình đã chọn |
| Po | Giá đầu ra | USD per 1M tokens | Chi phí trên một triệu mã thông báo đầu ra (hoàn thành) cho mô hình đã chọn — thường cao hơn 2-4 lần so với giá đầu vào |
| W | Cửa sổ ngữ cảnh | tokens | Mã thông báo đầu vào + đầu ra kết hợp tối đa mà mô hình hỗ trợ trong một yêu cầu |
Cách ChatGPT Token Counter
▾
- 1Dán hoặc nhập văn bản của bạn vào trường nhập bộ đếm mã thông báo — công cụ xử lý văn bản đó theo thời gian thực.
- 2Bộ đếm ước tính số lượng mã thông báo bằng cách sử dụng xấp xỉ ~4 ký tự cho mỗi mã thông báo (hoặc sử dụng mã thông báo cl100k_base thực tế để đếm chính xác).
- 3Chọn mô hình AI bạn định sử dụng — GPT-4o, GPT-4 Turbo, GPT-3.5 Turbo, Claude 3, v.v. — vì giá cả có sự khác biệt đáng kể.
- 4Máy tính áp dụng giá mỗi triệu mã thông báo của mô hình cho số lượng mã thông báo đầu vào và số lượng mã thông báo đầu ra ước tính của bạn.
- 5Tổng chi phí API được tính: (Mã thông báo đầu vào x Tỷ lệ đầu vào) + (Mã thông báo đầu ra x Tỷ lệ đầu ra).
- 6Công cụ này cũng hiển thị lượng cửa sổ ngữ cảnh của mô hình mà lời nhắc của bạn sử dụng, giúp bạn duy trì trong giới hạn.
- 7Đối với các hoạt động hàng loạt, hãy nhân chi phí mỗi yêu cầu với số lệnh gọi API để ước tính tổng chi phí dự án.
Ví dụ có lời giải
▾
200 từ / 0,75 = ~267 mã thông báo đầu vào. Ở mức giá GPT-4o (2,50 USD/1 triệu đầu vào, 10,00 USD/1 triệu đầu ra): chi phí đầu vào = 267/1 triệu x 2,50 USD = 0,00067 USD, chi phí đầu ra = 267/1 triệu x 10,00 USD = 0,00267 USD. Tổng số mỗi yêu cầu = 0,00334 USD. Với 10.000 lượt tương tác của khách hàng/tháng, tổng chi phí là khoảng 33,40 USD.
10.000 từ / 0,75 = ~13.333 mã thông báo đầu vào. 500 từ / 0,75 = ~667 mã thông báo đầu ra. Chi phí đầu vào: 13.333/1M x 2,50 USD = 0,0333 USD. Chi phí đầu ra: 667/1M x 10,00 USD = 0,00667 USD. Tổng cộng = ~$0,04 mỗi tài liệu. Việc tóm tắt 1.000 tài liệu sẽ tốn khoảng 40 USD.
GPT-3.5 Turbo: (1.000/1 triệu x 0,50 USD) + (500/1 triệu x 1,50 USD) = 0,0005 USD + 0,00075 USD = 0,00125 USD. GPT-4o: (1.000/1 triệu x 2,50 USD) + (500/1 triệu x 10,00 USD) = 0,0025 USD + 0,005 USD = 0,0075 USD. GPT-4o đắt hơn 6 lần cho mỗi yêu cầu nhưng mang lại chất lượng lý luận và làm theo hướng dẫn tốt hơn đáng kể.
Mã thông báo đầu vào hàng ngày: 500 x 100.000 = 50M. Token đầu ra hàng ngày: 300 x 100.000 = 30M. Chi phí đầu vào: 50 triệu/1 triệu x 0,15 USD = 7,50 USD. Chi phí đầu ra: 30M/1M x 0,60 USD = 18,00 USD. Tổng số hàng ngày = 25,50 USD, hàng tháng = ~ 765 USD. GPT-4o mini được thiết kế cho các ứng dụng có khối lượng lớn, trong đó hiệu quả chi phí quan trọng hơn khả năng lý luận đỉnh cao.
Ứng dụng thực tế
▾
Dự báo ngân sách API: Các nhà phát triển ước tính chi phí API OpenAI hàng tháng dựa trên khối lượng yêu cầu dự kiến, thời lượng nhắc nhở trung bình và lựa chọn mô hình để đặt ngân sách kỹ thuật.
Tối ưu hóa nhanh chóng: Các kỹ sư đo lường số lượng mã thông báo của các thiết kế nhanh chóng khác nhau để tìm ra công thức tiết kiệm chi phí nhất nhằm duy trì chất lượng đầu ra.
Lập mô hình chi phí Chatbot: Nhóm sản phẩm tính toán chi phí mỗi cuộc trò chuyện cho chatbot AI để xác định mức giá, tỷ suất lợi nhuận và liệu có nên sử dụng các mô hình rẻ hơn cho các truy vấn đơn giản hơn hay không.
Quy trình xử lý tài liệu: Các công ty ước tính chi phí xử lý kho tài liệu lớn (hợp đồng, hồ sơ y tế, hồ sơ pháp lý) thông qua GPT-4 để tóm tắt, trích xuất hoặc phân tích.
Lựa chọn mô hình: Trưởng nhóm kỹ thuật so sánh chi phí mỗi tác vụ giữa các mô hình khác nhau (GPT-4o so với Claude so với Gemini) để chọn mô hình tối ưu cho từng trường hợp sử dụng trong ứng dụng của họ.
Trường hợp đặc biệt
▾
Văn bản không phải tiếng Anh và mã thông báo đa ngôn ngữ
Các chữ viết không phải tiếng Latinh (tiếng Trung, tiếng Nhật, tiếng Hàn, tiếng Ả Rập, tiếng Hindi) thường tiêu thụ số mã thông báo mỗi từ nhiều hơn 2-3 lần so với tiếng Anh vì mã thông báo chủ yếu được đào tạo trên văn bản tiếng Anh. Một văn bản tiếng Trung 1.000 ký tự có thể sử dụng 700-1.000 mã thông báo, trong khi cùng độ dài bằng tiếng Anh sẽ chỉ sử dụng 250 mã thông báo. Điều này tác động đáng kể đến chi phí cho các ứng dụng đa ngôn ngữ.
Mã thông báo mã
Mã nguồn thường mã hóa khác với văn xuôi. Các từ khóa và cú pháp lập trình phổ biến thường là các mã thông báo đơn lẻ, nhưng tên biến, chuỗi và nhận xét rất khác nhau. Thụt lề và khoảng trắng tiêu thụ mã thông báo. Mã rút gọn sử dụng ít mã thông báo hơn mã được định dạng. Python thường mã hóa hiệu quả hơn các ngôn ngữ dài dòng như Java.
Mã thông báo đầu vào được lưu vào bộ nhớ đệm (Bộ nhớ đệm nhắc nhở)
OpenAI giảm giá 50% cho mã thông báo đầu vào được lưu trong bộ nhớ đệm cho GPT-4o và GPT-4o mini khi sử dụng lại cùng một tiền tố lời nhắc trong các lệnh gọi API. Nếu lời nhắc hệ thống của bạn (giả sử là 2.000 mã thông báo) giống hệt nhau trong các yêu cầu, thì bạn phải trả toàn bộ giá cho cuộc gọi đầu tiên và một nửa giá cho các cuộc gọi tiếp theo cho các mã thông báo được lưu trong bộ nhớ đệm đó. Điều này có thể giảm chi phí từ 20-40% cho các ứng dụng có lời nhắc hệ thống dài.
Giá mô hình OpenAI (2025)
▾
| Người mẫu | Đầu vào (trên 1M token) | Đầu ra (trên 1M token) | Cửa sổ ngữ cảnh |
|---|---|---|---|
| GPT-4o | $2,50 | $10,00 | 128K token |
| GPT-4o mini | 0,15 USD | 0,60 USD | 128K token |
| GPT-4 Turbo | $10,00 | $30,00 | 128K token |
| GPT-3.5 Turbo | 0,5 USD | $1,50 | 16K token |
| o1 (lý luận) | $15,00 | $60,00 | 200K token |
| o1-mini | $3,00 | $12,00 | 128K token |
| Claude 3.5 Sonnet (Nhân chủng học) | $3,00 | $15,00 | 200K token |
| Song Tử 1.5 Pro (Google) | 1,25 USD | $5,00 | 1 triệu token |
Câu hỏi thường gặp
▾
Chính xác thì token là gì?
Mã thông báo là đơn vị từ phụ được LLM sử dụng để xử lý văn bản. Các từ phổ biến như 'the' hoặc 'và' là các mã thông báo đơn lẻ, trong khi các từ dài hơn hoặc bất thường có thể được chia thành nhiều mã thông báo (ví dụ: 'tiền điện tử' có thể là 'tiền điện tử' + 'tiền tệ' = 2 mã thông báo). Trong tiếng Anh, 1 mã thông báo trung bình có ~4 ký tự hoặc ~0,75 từ. Các ngôn ngữ và mã không phải tiếng Anh thường có tỷ lệ mã thông báo trên mỗi từ khác nhau.
Tại sao mã thông báo đầu ra đắt hơn mã thông báo đầu vào?
Mã thông báo đầu ra (hoàn thành) yêu cầu tính toán nhiều hơn mã thông báo đầu vào (nhắc) vì mô hình phải tạo từng mã thông báo đầu ra một cách tuần tự, thực hiện chuyển tiếp đầy đủ qua mạng thần kinh cho từng mã thông báo. Mã thông báo đầu vào có thể được xử lý song song. Sự bất cân xứng về chi phí tính toán này được phản ánh qua mức giá cao gấp 2-4 lần cho mã thông báo đầu ra.
Ước tính ~4 ký tự cho mỗi mã thông báo chính xác đến mức nào?
Phép tính gần đúng 4 ký tự có độ chính xác hợp lý đối với văn xuôi tiếng Anh chuẩn (trong vòng 10-15%). Tuy nhiên, nó trở nên kém chính xác hơn đối với mã (có thể sử dụng 2-3 ký tự cho mỗi mã thông báo do ký hiệu cú pháp), tập lệnh không phải tiếng Latinh (tiếng Trung/tiếng Nhật có thể sử dụng 1-2 ký tự cho mỗi mã thông báo) và thuật ngữ chuyên ngành. Để đếm chính xác, hãy sử dụng thư viện tiktoken của OpenAI hoặc trình mã thông báo thực tế.
Cửa sổ ngữ cảnh là gì và tại sao nó lại quan trọng?
Cửa sổ ngữ cảnh là số lượng mã thông báo tối đa (kết hợp đầu vào + đầu ra) mà một mô hình có thể xử lý trong một yêu cầu. GPT-4o có cửa sổ mã thông báo 128K (~96.000 từ). Nếu đầu vào của bạn vượt quá cửa sổ ngữ cảnh, bạn phải cắt bớt, tóm tắt hoặc sử dụng thế hệ tăng cường truy xuất (RAG). Vượt quá giới hạn sẽ trả về lỗi API.
Lời nhắc của hệ thống và lịch sử hội thoại có được tính vào việc sử dụng mã thông báo không?
Đúng. Mọi lệnh gọi API đều bao gồm toàn bộ lời nhắc hệ thống, tất cả lịch sử hội thoại và tin nhắn người dùng mới dưới dạng mã thông báo đầu vào. Trong chatbot, lịch sử hội thoại sẽ tăng lên theo mỗi lượt, do đó chi phí sẽ tăng lên khi cuộc trò chuyện kéo dài hơn. Triển khai các chiến lược cắt ngắn hoặc tóm tắt cuộc hội thoại để kiểm soát chi phí trong các ứng dụng nhiều lượt.
Giá GPT-4o so với Claude và các mẫu khác như thế nào?
Kể từ năm 2025: GPT-4o là 2,50 USD/10,00 USD cho mỗi 1 triệu mã thông báo (đầu vào/đầu ra). Sonnet Claude 3.5 nhân chủng học có giá $3,00/$15,00 mỗi 1 triệu. Google Gemini 1.5 Pro có giá 1,25 USD/5,00 USD mỗi 1 triệu. GPT-4o mini ở mức 0,15 USD/0,60 USD là tùy chọn mẫu biên giới rẻ nhất. Giá cả thay đổi thường xuyên khi các nhà cung cấp cạnh tranh về hiệu quả chi phí.
Lỗi thường gặp cần tránh
▾
- !Giả sử 1 mã thông báo = 1 từ - trong tiếng Anh, 1 mã thông báo xấp xỉ 0,75 từ (hoặc 1 từ = ~1,33 mã thông báo) và tỷ lệ này thay đổi đáng kể đối với các ngôn ngữ khác.
- !Quên rằng lịch sử cuộc trò chuyện sẽ tích lũy mã thông báo mỗi lượt - một cuộc trò chuyện chatbot kéo dài 20 lượt có thể gửi hơn 10.000 mã thông báo đầu vào cho mỗi yêu cầu ngay cả khi mỗi tin nhắn riêng lẻ ngắn.
- !Không tính đến chi phí mã thông báo nhắc nhở của hệ thống, được bao gồm trong mỗi lệnh gọi API và có thể là 500-2.000 mã thông báo để được hướng dẫn chi tiết.
- !So sánh giá mẫu mà không xem xét sự khác biệt về chất lượng đầu ra — GPT-4o mini rẻ hơn 17 lần so với GPT-4o nhưng có thể cần nhiều mã thông báo hơn để đạt được kết quả tương tự do khả năng suy luận thấp hơn.
- !Bỏ qua việc định giá riêng cho mã thông báo đầu vào và đầu ra — mã thông báo đầu ra đắt hơn gấp 2-4 lần, do đó, các ứng dụng tạo ra phản hồi dài sẽ có giá cao hơn một cách không tương xứng.
Mẹo Chuyên Nghiệp
Để giảm chi phí API mà không làm giảm chất lượng: (1) Sử dụng GPT-4o mini cho các tác vụ đơn giản như phân loại và trích xuất, dành riêng GPT-4o cho lý luận phức tạp. (2) Triển khai bộ nhớ đệm lời nhắc để được giảm giá 50% cho các lời nhắc hệ thống lặp lại. (3) Đặt max_tokens để ngăn đầu ra dài bất ngờ. (4) Tóm tắt lịch sử hội thoại thay vì gửi bản ghi đầy đủ. Một ứng dụng được tối ưu hóa tốt có thể cắt giảm chi phí 60-80% so với việc sử dụng API đơn giản.
Bạn có biết?
Từ 'mã thông báo' trong AI có một cách sống kép kỳ lạ - trong xử lý ngôn ngữ tự nhiên, nó có nghĩa là chia văn bản thành các đơn vị từ phụ, trong khi trong an ninh mạng, nó có nghĩa là thay thế dữ liệu nhạy cảm bằng các phần giữ chỗ không nhạy cảm. Cả hai ý nghĩa đều liên quan đến việc chuyển đổi thông tin thành các đơn vị nhỏ hơn nhưng nhằm mục đích hoàn toàn khác nhau. Mã thông báo cl100k_base của OpenAI có vốn từ vựng chính xác là 100.256 mã thông báo duy nhất.
Regional Guides
▾
United States▾
European Union▾
Asia-Pacific▾
Tài liệu tham khảo
Nhận Mẹo Toán Hàng Tuần
Tham gia cùng 12.000+ người đăng ký để nhận mẹo về máy tính mỗi tuần.