Token(词元)是大模型 API 的计费最小单位,不是直接按汉字 / 单词计费,输入、输出分开计价,输出单价普遍高于输入。
一、核心公式
总费用 = 输入Token数 × 输入单价 + 输出Token数 × 输出单价
输入 Token(Prompt):系统提示词、历史全部对话、用户本次提问、上传文档、图片转 token,全部算输入。
输出 Token(Completion):模型返回的全部回答、思考内容、JSON、代码,全部算输出。
为什么输出更贵:输入可以 GPU 并行计算;输出必须一个 token 一个串行生成,算力开销大,输出价格一般是输入 2‑5 倍。
计价单位:大多平台标注 元 / 百万 Token(元 / M tokens) 或者美元 / 百万 Token。

二、Token 和文字粗略换算(仅估算,不同模型分词器结果不一样)
中文:1 汉字 ≈ 1~2 Token,含标点、空格也要计数;高频成语会合并为 1 个 token,生僻字会拆成多个 token。
英文:1 个单词≈1‑1.3 Token,长单词会拆成多段。
代码、JSON、URL 符号多,会显著更耗 Token。
⚠️估算只能做参考,真实消耗以 API 返回的 usage 字段为准,每个模型分词器不一样,同样文本 token 数量会不同。
示例粗算:一段 1000 汉字的提问,大约 1200‑1500 token。
三、简单算费示例
假设模型:输入 1 元 / 百万 token,输出 4 元 / 百万 token
调用:输入 1200token,输出 2000token
费用 = (1200 ÷ 1000000) ×1 + (2000 ÷1000000) ×4
=0.0012 +0.008 = 0.0092元
四、特殊计费规则
上下文累积消耗:多轮对话,每轮都会带上全部历史对话,输入 token 会持续上涨,对话越长越费钱,需要做截断。
缓存 token(部分厂商支持):重复上下文命中缓存,单价大幅降低,约普通输入 1/10 价格。
图片 / 多模态:图片会转成 token,按输入 token 计费,大图消耗 token 数量很高OpenAI。
阶梯定价:用量越大单价越低;部分平台区分普通调用、批量任务不同价格。

五、怎么拿到真实 token 数量
API 返回体中
usage对象,会返回input_tokens、output_tokens;使用对应模型的 tokenizer 工具预计算(OpenAI tiktoken、各厂商提供的 token 统计接口);
平台控制台调用日志,查看每一次请求消耗。
六、踩坑点
只看输入单价,忽略输出;输出往往才是大头;
忽略 system prompt 系统角色词,它每次都计入输入;
长对话不截断,历史上下文越堆越多,token 暴涨;
拿汉字数直接当作 token 数,会和实际账单有偏差。
本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。
原文链接
欢迎访问 小易撩挨踢