预算少时,正确问题不是“哪个模型每 1M Tokens 最便宜”,而是“完成这项任务的每个合格结果要花多少”。单价低但经常答错、需要重复生成,或者必须塞入更长提示词,最终可能比单价更高的模型贵。先把任务、质量底线和调用量写清楚,再比较价格。
先定义任务再看价格
学生项目常见工作可以先分成三类:
- 轻量且可验证:文本分类、字段提取、格式转换、关键词标注。结果容易用规则检查,适合先测低成本模型。
- 通用生成:摘要、邮件草稿、学习提纲、简单代码解释。需要兼顾价格、稳定性、上下文和语言表现。
- 高难度任务:复杂 Debug、多文件编程、严谨推理、长文证据整合。错误代价较高,不能只按 Token 单价选。
还要先定“合格”的含义。例如结构化提取可用字段准确率和 JSON 通过率;代码任务可用测试通过率;有事实要求的回答可检查引用是否支持结论。没有验收标准,所谓便宜只是在比较账单,没有比较产出。
每个合格结果的成本 =(全部请求成本 + 重试成本 + 人工复核成本)÷ 合格结果数统一用量下的成本对比
下表统一假设每次请求使用 2,400 Input Tokens、生成 600 Output Tokens,不计缓存;每个 Provider 展示该用量下成本最低的已收录模型。这是为了比较费率而设置的示例,不代表各模型输出质量相同。费率和结果从站内集中数据源动态计算,核验日期为 2026-08-13。
| 模型 | Input / 1M | Output / 1M | 2,000 次成本 | 100,000 次成本 |
|---|---|---|---|---|
| Ministral 3 3B | $0.1 | $0.1 | $0.6000 | $30.00 |
| DeepSeek V4 Flash | $0.14 | $0.28 | $1.01 | $50.40 |
| GPT-5.6 Luna | $0.2 | $1.2 | $2.40 | $120.00 |
| Gemini 3.5 Flash-Lite | $0.3 | $2.5 | $4.44 | $222.00 |
| Grok Build 0.1 | $1 | $2 | $7.20 | $360.00 |
| Claude Haiku 4.5 | $1 | $5 | $10.80 | $540.00 |
在这组候选与固定用量中,纯 Token 成本最低的是 Ministral 3 3B,2,000 次约为 $0.6000。这个结论只对当前表内模型、当前费率和该输入输出比例成立;改变输出长度、缓存命中率、长上下文档位或任务成功率,排序都可能变化。
低频与高频怎么选
低频调用:能力差异可能比单价差异重要
如果每月只做几十次课程资料分析或代码检查,总账单通常较小。以上表相同的单次用量为例,每月 30 次时,各模型对应成本可在成本计算器中直接复算。此时,少一次返工可能比压低每 1M Tokens 的单价更有价值。
再看一个质量优先示例:每月用 Claude Sonnet 5 处理 12 次较长任务,每次假设 8,000 输入、2,500 输出且无缓存,按当前默认费率约为 $0.4920。它并不能证明该模型一定更好,只说明在低频情境里,可以先算清“选更强模型”的绝对金额,再决定是否值得。
高频调用:微小差价会被放大
分类器、批量摘要、机器人后台任务和 Agent 子步骤可能每月运行数万甚至更多次。此时应把请求按难度分层:简单任务走低成本模型;规则校验失败、置信度不足或用户明确要求高质量时,再升级到能力更强的模型。不要把所有请求一刀切,也不要让低成本模型无限重试。
高频系统至少要监控四个指标:单次 Token、成功率、平均重试次数、升级比例。总成本更接近:
月成本 = 基础请求成本 + 重试成本 + 升级模型成本 + 缓存/工具附加成本三档预算策略
几乎零预算:先验证需求
先用很小的测试集和严格的调用上限证明功能有用,再扩大规模。Provider 的免费额度、地区可用性和活动规则容易变化,不应把它们当作长期成本模型;即使当前有免费额度,也要准备额度结束后的付费预算。开发时用固定样本,关闭不必要的自动重试,并为 API Key 设置消费上限。
小额月预算:默认便宜,困难任务升级
为每个功能指定默认模型与升级模型。提取、分类等先从表中低成本候选做评测;复杂代码、重要长文再交给通过质量测试的模型。把月预算拆成“常规流量、复杂任务、实验余量”三部分,避免一次长上下文实验吃掉整月额度。
稳定项目预算:按数据优化
请求量稳定后,重点从“选一个便宜模型”转向“优化整条链路”:缩短无效上下文、提高缓存前缀复用、为异步作业评估 Batch、合并小请求、减少 Agent 空转。任何优化都应同时看成功率;只看账单下降,可能只是把成本转移给人工复核。
最低价为什么未必最省
| 风险 | 怎样增加实际成本 | 怎样验证 |
|---|---|---|
| 任务能力不足 | 重复生成、人工改写、升级重跑 | 用真实样本计算一次通过率 |
| 结构化输出不稳 | 解析失败,触发修复请求 | 检查 schema / JSON 通过率 |
| 上下文不够或长文退化 | 分块次数增加,信息遗漏 | 在实际长度上测试,不只测短样本 |
| 延迟或限流不合适 | 超时重试,用户流失 | 记录 P50/P95 延迟和限流错误 |
| 工具调用可靠性不足 | Agent 多走步骤或调用错误工具 | 统计每任务步骤数与工具成功率 |
| Preview 或规则变化 | 版本迁移与回归测试 | 锁定模型 ID,保留替代方案 |
价格页还可能包含不同服务等级、长上下文阶梯、多模态费率和缓存存储费。本站列表使用每个模型的默认文本口径;采购或上线前应打开模型详情阅读限制,并到官方来源复核。
用小样本做一次公平评测
- 从自己的真实任务中抽取 20–50 个样本,移除隐私信息,并覆盖简单、普通和困难情况。
- 固定提示词、temperature、最大输出长度和输出格式,让候选模型在相同条件下运行。
- 盲评质量,或用测试、字段准确率等可重复指标评分;不要凭一条“惊艳回答”决定。
- 记录每个样本的 Input、Cached Input、Output、延迟、重试和是否合格。
- 计算每个合格结果的成本,再检查最差案例是否触及不可接受的风险。
评测花掉的一小笔 API 费,通常比在没有数据的情况下长期选错模型便宜。
可执行选型清单
- 低频、高价值任务:先比较绝对月成本,再优先满足质量底线。
- 高频、可验证任务:从低成本候选开始,用失败升级和硬性步骤上限兜底。
- 长固定前缀:验证 Cached Input 规则及写入/存储费,不把缓存折扣想当然。
- 异步批处理:比较 Batch 费率、完成时间与服务保证是否匹配。
- 上线前:设置 Key 权限、日/月消费告警、预算硬上限和模型替代方案。
最后,把自己的调用量放入API 成本计算器,再用模型对比页检查上下文、适用场景与限制。便宜是约束,不是唯一目标;对预算最友好的方案,是在达到最低质量要求后,总完成成本最低的方案。