告别海外账号与网络限制稳定直连全球优质大模型限时半价接入中。 点击领取海量免费额度1. 先把 AA 页面上的两列摘下来Artificial Analysis 是一个把模型放进统一评测集里跑分、再把分数和价格并排展示的站点。它最有价值的地方不是谁第一而是让你在同一张表里看到智能指数和每百万 token 价格这两个维度。GLM 5.3 Flash 这类定位偏轻量的模型通常就是靠分数够用、单价够低来抢场景的。这篇要做的是一件很具体的事打开 Artificial Analysis 的模型页只摘 GLM 5.3 Flash 的智能指数与价格两列不抄任何没在页面上看到的数字然后用 TaoToken 建一把 Key把 Base URL 指向https://taotoken.net/api跑同一组 20 条中文提示记录耗时、输出长度和估算成本最后拼成一张质量/成本对照表。适合谁看手上有一批中文短任务摘要、改写、分类、抽取想判断要不要把默认模型换成 Flash 档的人。你不需要先懂评测方法论只要会复制粘贴、会跑一个 Python 文件就行。先说清楚边界本文不含排行分数也不对 GLM 5.3 Flash 做任何好/坏的结论。AA 上的数值会随评测集更新而变动所以下面给的是摘录模板具体数字请以你打开页面那一刻为准。1.1 AA 两列摘录模板打开 Artificial Analysis 的模型对比页找到 GLM 5.3 Flash 那一行只填这两列。建议直接建一个 Markdown 文件后面跑完基线再往里补第三、第四列。| 字段 | 值 | 来源 | 摘录日期 | | --- | --- | --- | --- | | 模型名 | GLM 5.3 Flash | Artificial Analysis 模型页 | YYYY-MM-DD | | 智能指数Intelligence Index | 页面原值未核验不填 | 同上 | YYYY-MM-DD | | 价格输入每百万 token | 页面原值 | 同上 | YYYY-MM-DD | | 价格输出每百万 token | 页面原值 | 同上 | YYYY-MM-DD | | 备注 | 价格单位与币种以页面标注为准 | 同上 | YYYY-MM-DD |注意AA 的智能指数是它自己那套评测集的综合分不等于你的业务效果价格列有时分输入/输出、有时带缓存档位抄的时候把单位一起抄下来否则后面算成本会错一个数量级。摘录这一步别偷懒。我见过有人只记了输入价结果算成本时把输出 token 按输入价乘最后结论完全反过来。输出 token 通常比输入贵好几倍而中文任务里输出往往还更长。2. 用 TaoToken 建 Key 并设为默认供应商拿到 AA 的两列之后下一步是让脚本真的能调 GLM 5.3 Flash。这里走 TaoToken在 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_generateutm_contentaa_flash_cost 创建 Key然后把脚本的 Base URL 设成https://taotoken.net/api模型名填 GLM 5.3 Flash 对应的标识。具体操作顺序打开上面的链接完成账号创建进控制台在 API Keys 页面新建一把 Key命名建议带上用途比如aa-flash-baseline方便以后按项目吊销复制 Key只存到环境变量里不要写进代码文件更不要提交到 Git确认你要用的模型标识。模型列表和命名以接入文档为准别凭记忆猜。控制台和文档入口控制台https://taotoken.net/console?utm_sourcetaotoken_aicg_blog_generateutm_mediumcsdnutm_campaigngenerateAPI Keyshttps://taotoken.net/api-keys?utm_sourcetaotoken_aicg_blog_generateutm_mediumcsdnutm_campaigngenerate接入文档https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_generateutm_mediumcsdnutm_campaigngenerate2.1 环境变量与最小可运行脚本先设环境变量。Linux / macOSexport TAOTOKEN_API_KEYsk-你的Key export TAOTOKEN_BASE_URLhttps://taotoken.net/apiWindows PowerShell$env:TAOTOKEN_API_KEY sk-你的Key $env:TAOTOKEN_BASE_URL https://taotoken.net/api然后是一个最小 Python 脚本。它做三件事读环境变量、发一次 chat 请求、把耗时和输出长度打出来。依赖只有openai这个 SDK因为 TaoToken 的接口是 OpenAI 兼容风格换 Base URL 就能用。# baseline_flash.py import os import time from openai import OpenAI client OpenAI( api_keyos.environ[TAOTOKEN_API_KEY], base_urlos.environ.get(TAOTOKEN_BASE_URL, https://taotoken.net/api), ) MODEL glm-5.3-flash # 以接入文档中的模型标识为准 PROMPTS [ 把下面这句话压缩到 30 字以内……, 给这段客服对话打一个意图标签只输出标签名……, # 这里放满 20 条保持每次跑的是同一组 ] def run_one(prompt: str) - dict: t0 time.perf_counter() resp client.chat.completions.create( modelMODEL, messages[{role: user, content: prompt}], temperature0.2, ) elapsed time.perf_counter() - t0 text resp.choices[0].message.content or usage resp.usage return { elapsed_s: round(elapsed, 3), out_chars: len(text), prompt_tokens: usage.prompt_tokens if usage else None, completion_tokens: usage.completion_tokens if usage else None, } if __name__ __main__: rows [] for i, p in enumerate(PROMPTS, 1): r run_one(p) r[idx] i rows.append(r) print(r)跑之前先做一次连通性检查避免 20 条全跑完才发现 Key 是错的python -c import os from openai import OpenAI c OpenAI(api_keyos.environ[TAOTOKEN_API_KEY], base_urlos.environ[TAOTOKEN_BASE_URL]) print(c.models.list().data[:3]) 能列出模型说明 Key 和 Base URL 都对上了。这一步比直接跑全量省时间得多。3. 20 条中文提示怎么设计才可比基线要可比关键在同一组提示、同一套参数、同一台机器。20 条不用花哨覆盖你真实会遇到的几类就行。我一般这么分类别条数目的观察点短摘要5看压缩能力输出长度是否稳定意图分类5看指令遵循是否只输出标签信息抽取5看结构化输出字段是否齐全改写润色5看中文语感是否跑题参数固定temperature0.2不加max_tokens或统一设一个上限system prompt 全部留空或全部一致。任何一条提示改了整组就得重跑否则耗时和长度没法横向比。记录时至少留这几列后面拼表直接用它| 序号 | 类别 | 耗时(s) | 输出字符数 | prompt_tokens | completion_tokens | 估算成本 | | --- | --- | --- | --- | --- | --- | --- | | 1 | 短摘要 | | | | | | | ... | | | | | | | | 20 | 改写润色 | | | | | | | 合计 | — | | | | | |估算成本用 AA 摘下来的单价乘 token 数公式写清楚估算成本 prompt_tokens / 1_000_000 * 输入单价 completion_tokens / 1_000_000 * 输出单价单价用你摘录那天的值币种保持一致。如果 AA 页面标的是美元你账户结算用的是别的币种就在表头注明别混着加。3.1 质量/成本对照表表头跑完基线把 AA 的两列和实测的四列拼在一起表头建议这样| 模型 | AA 智能指数 | AA 输入价 | AA 输出价 | 实测平均耗时(s) | 实测平均输出字符 | 实测总 token | 实测估算成本 | 备注 | | --- | --- | --- | --- | --- | --- | --- | --- | --- | | GLM 5.3 Flash | 页面原值 | 页面原值 | 页面原值 | | | | | 20 条中文提示temperature0.2 |这张表的价值在于AA 那两列是别人测的后面几列是你自己测的。两者放一起你才能判断页面上的便宜在你的任务里是不是真的便宜——因为如果你的任务输出特别长输出单价才是主导项。4. 可验证结果与失败分支跑完之后你应该能拿到三样东西一份 20 行的明细、一份合计、一张对照表。验证方式很直接明细里每行的completion_tokens加起来应该等于合计行的值用合计 token 反算成本应该和逐行成本相加的结果一致差在小数位是正常的同一类别内输出字符数的波动如果特别大比如摘要类从 20 字跳到 200 字说明提示本身有歧义先修提示再谈模型。失败分支按现象排查别一上来就怀疑模型现象可能原因处理401Key 没读到或已吊销检查环境变量名是否拼错去 API Keys 页确认状态404Base URL 或模型标识写错Base URL 用https://taotoken.net/api模型名查接入文档429触发限流加 sleep 或降低并发别硬重试超时单条提示太长或网络抖动先单条重试确认不是提示问题输出为空提示要求太模糊加只输出结果不要解释这类约束注意401 和 404 是最常见的两个但原因完全不同。401 是身份问题404 是路径或模型名问题。先把这两个分开能省掉一半排查时间。如果某一条一直失败把它单独拎出来跑别让它拖垮整组。基线跑的是正常情况下的表现异常样本单独记录就行。5. 限制、成本与模型选择几个必须说清的限制。第一AA 的智能指数是综合分覆盖的任务和你的 20 条中文提示未必重合。它高不代表你的场景好它低也不代表不能用。把它当入场参考别当最终结论。第二价格列会变。AA 上的标价不等于你账户的实际结算价也不等于你所在地区的最终价格。本文所有成本都是按摘录单价估算真实账单以 TaoToken 控制台为准。第三20 条样本量很小。它够用来发现明显不行或明显够用但不足以做精细排序。要更稳的结论把样本扩到 100 条以上并且固定同一时间段跑避开高峰期波动。模型选择上我的做法是先用 Flash 档跑一遍基线如果质量能过你的验收线就把它设为默认把重任务留给更强的档位如果过不了再往上试。TaoToken 在这里的作用是让你用同一把 Key、同一个 Base URL 切换模型不用为每个模型单独配一套环境——换模型只改MODEL那一行对照表就能继续往下加行。长期跑这类基线的话Coding Plan 会比按量更省心https://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_generateutm_mediumcsdnutm_campaigngenerate 。如果你只是想先验证一下按量 API Keys 就够了。最后补一个实操细节把 20 条提示和脚本一起放进 Git但 Key 走环境变量。这样下次 AA 更新了数值你只要重跑脚本、更新摘录日期对照表就能滚动维护而不是每次从零开始。 告别海外账号与网络限制稳定直连全球优质大模型限时半价接入中。 点击领取海量免费额度