Token 估算器

LLM API 按 token 计费,上下文窗口也受 token 数限制。本工具在本地估算文本的 token 数量,帮助在发送前评估成本、裁剪 prompt 或检查是否接近模型上限。配合 pii-scanner 在提交前脱敏,用 structured-output-validator 校验模型 JSON 输出是否符合 schema。

阅读完整指南: LLM Prompt 与上下文:Token 预算与模板 →

隐私提示:本地解析,不上传服务器。

↓ 在下方输入区粘贴内容,结果会立即显示

在此粘贴 Prompt 或文本

实时统计字符、词数与 Token 估算,适合控制 LLM 上下文长度。

输出结果

字符数

81

词数

10

行数

1

中日韩字符

17

GPT 估算 Token

31

Claude 估算 Token

30

注释说明

Token 估算说明

以下为启发式估算,与 OpenAI tiktoken 等官方计数器可能略有偏差,但足以做上下文预算与 Prompt 长度规划。 当前约 31 GPT Token。

LLM API 按 token 计费,上下文窗口也受 token 数限制。本工具在本地估算文本的 token 数量,帮助在发送前评估成本、裁剪 prompt 或检查是否接近模型上限。配合 pii-scanner 在提交前脱敏,用 structured-output-validator 校验模型 JSON 输出是否符合 schema。

快速开始

  1. 粘贴文本

    支持多行 Prompt、代码块、中英文混排。

  2. 查看统计

    字符、词数、CJK 字符数一目了然。

  3. 对照模型预算

    用 GPT / Claude 估算列规划上下文长度。

什么是 Token

大模型把文本切成 Token 计费与限长。英文约 4 字符 1 Token; 中文通常更省或更费; 取决于分词器。

估算准确吗

本工具用启发式公式; 与官方 tiktoken 可能差几个 Token; 但足够做预算与裁剪。

典型工作流

在编写 LLM 提示词时,先在此工具粘贴文本,实时观察 Token 变化。当接近模型限制(如 GPT-4 的 8k)时,工具会高亮提醒。此时可删减冗余内容或拆分 Prompt,确保完整信息能送入模型。

对于技术文档翻译等长文本,用「段落模式」逐段检查。先处理标题和关键段落,保留 20% Token 余量给模型回复。中英混排时,注意中文 1 字≈1.5 Token 的消耗特点。

计费与上下文窗口

OpenAI、Anthropic 等按 input/output token 计费。发送前用本工具估算 prompt 长度,避免意外账单或截断。不同模型 tokenizer 可能略有差异——本工具给出近似值,临界场景留 5–10% 余量。

RAG 管道中,chunk + system prompt + user question 总和必须低于 context window。配合 json-formatter 查看 retrieved docs 体积,structured-output-validator 约束输出长度。

中英文与代码 token

中文通常每字 1–2 token,高于英文词均 token 数。代码块(JSON、SQL)因符号密集 token 密度高。粘贴前删除无关 log 行可显著降本。

llm-json-extractor 提取 JSON 后再计数,避免 Markdown 包装占用 token。pii-scanner 在发送前脱敏,减少无效字符同时降泄露风险。

团队规范

建立 prompt 模板最大 token 预算;PR review 大 prompt 变更时附 token 估算截图。text-analyzer 统计字符,token-counter 估算模型 token——两者互补。

微调数据集准备时,统计样本分布避免极端长例主导 loss。

Prompt 预算与截断策略

先为 system、检索片段、用户问题、工具 schema 分配预算,再用本工具分别计数后求和。超限时优先截断检索片段而非删除安全相关 system 规则。structured-output-validator 约束输出 schema,避免模型用超长散文烧掉输出配额。

把预算表写进团队 Prompt 规范;大变更 PR 附上计数结果。临界窗口留 5–10% 余量,因各厂商 tokenizer 存在细微差别。

脱敏后再计数的习惯

日志与工单进模型前:pii-scanner → 人工替换 → token-counter。先计数再脱敏会低估安全流程耗时,也容易把密钥计进「必要上下文」。jwt-decoder 仅用于确认 token 类型后删除原文,不要把完整 JWT 留在 prompt。

本地计数不上传文本,但你粘贴到聊天产品时仍会离开浏览器。Towalles 只解决估算步骤的本地化。

多模型切换时的对照方法

同一段中文在不同厂商 tokenizer 下计数可能差 10–20%。做法:固定一段「黄金样本」(含中英、代码、标点),在本工具与目标 API usage 各记一笔,算出系数后再做预算。不要假设「字符/4」通用于所有模型。

更换模型家族时重测黄金样本;把系数表放进内部 wiki。RAG 场景分别统计 query、top-k 片段与 system,避免只看总数。

工具调用与结构化输出的隐藏成本

Function/tool schema、JSON Schema 枚举值、长 system 安全策略都会占输入 token。先把 schema 单独计数,再决定是否内联巨大 enum。输出端若强制长 JSON,预留输出预算,否则会在末尾截断导致解析失败。

用 structured-output-validator 验证最小成功响应,再反推「最小必要 schema」。配合 pii-scanner,避免把真实客户字段名写进示例 schema。

多模型报价与路由决策

同一段 prompt 在不同模型上的 token 数与单价都不同。用本工具得到稳定输入长度后,再乘各厂商价目做「成本上限」表:简单分类走小模型,长文档摘要走大模型。把阈值写进路由配置,而不是每次靠感觉。

变更 system prompt 时重新计数并更新预算表。隐藏的工具 schema / function calling 定义也会占配额——把它们单独计数后再求和。

RAG 切片与重叠的代价

切片重叠能提高召回,但会线性推高检索拼进 prompt 的 token。先对单片、重叠区、最终拼装结果分别计数,再决定 overlap。用 structured-output-validator 限制答案结构,避免模型用冗长复述吃掉输出预算。

把「最大检索片段 token」写成服务配置;超限时截断并记录指标,而不是静默超账单。

示例

短 Prompt

Input

Summarize this article in 3 bullet points.

英文短句约十余 Token。

FAQ

和 ChatGPT 显示的一致吗?

不一定完全一致; 但量级相同; 适合上线前自检。

代码怎么算?

按字符启发式估算; 符号密集时代码 Token 可能偏多。

为什么相同字数不同语言的 Token 计数差异大?

因为 Token 化算法差异:英文按词/subword 分割,中文按字/词。像「深度学习」可能被分成 2-4 个 Token。工具使用与 OpenAI 一致的 tiktoken 库,结果与 API 计费一致。

与官方 tokenizer 一致吗?

近似一致;精确计费以 API 返回 usage 为准。

图片 token 怎么算?

本工具仅文本;多模态模型见各厂商文档。

为何中文更耗 token?

BPE 对 CJK 常按字或短序列切分,密度高于英文词。

本地计数吗?

是,文本不上传。

输出 token 怎么估?

按期望回答长度经验估,或看历史 usage。本工具主要服务输入侧规划。

和字符数差多少?

英文约 4 字符/token 量级;中文与代码密度更高。勿用字符数直接当分账依据。

图片/音频怎么计 token?

多模态按厂商规则折算,本工具主要服务文本。以官方 pricing/usage 为准。

流式输出如何估费?

按最终完整输出计量;流式只影响体验。用历史 usage 中位数做预估更稳。

中英文混合怎么估?

不要用单一「每词四字符」规则。对本工具实际粘贴混合文本计数,并为中文段落留更大余量。

图片/音频怎么计?

本工具面向文本。多模态计费看厂商文档;不要假设与文本同一公式。