低预算选型

学生党如何选择便宜的 AI API?主流模型成本对比

从任务难度、调用频率、失败重试和预算上限出发选择 AI API,并用统一 Token 假设比较当前模型成本。

预算少时,正确问题不是“哪个模型每 1M Tokens 最便宜”,而是“完成这项任务的每个合格结果要花多少”。单价低但经常答错、需要重复生成,或者必须塞入更长提示词,最终可能比单价更高的模型贵。先把任务、质量底线和调用量写清楚,再比较价格。

先定义任务再看价格

学生项目常见工作可以先分成三类:

  • 轻量且可验证:文本分类、字段提取、格式转换、关键词标注。结果容易用规则检查,适合先测低成本模型。
  • 通用生成:摘要、邮件草稿、学习提纲、简单代码解释。需要兼顾价格、稳定性、上下文和语言表现。
  • 高难度任务:复杂 Debug、多文件编程、严谨推理、长文证据整合。错误代价较高,不能只按 Token 单价选。

还要先定“合格”的含义。例如结构化提取可用字段准确率和 JSON 通过率;代码任务可用测试通过率;有事实要求的回答可检查引用是否支持结论。没有验收标准,所谓便宜只是在比较账单,没有比较产出。

每个合格结果的成本 =(全部请求成本 + 重试成本 + 人工复核成本)÷ 合格结果数

统一用量下的成本对比

下表统一假设每次请求使用 2,400 Input Tokens、生成 600 Output Tokens,不计缓存;每个 Provider 展示该用量下成本最低的已收录模型。这是为了比较费率而设置的示例,不代表各模型输出质量相同。费率和结果从站内集中数据源动态计算,核验日期为 2026-08-13。

模型 Input / 1M Output / 1M 2,000 次成本 100,000 次成本
Ministral 3 3B $0.1 $0.1 $0.6000 $30.00
DeepSeek V4 Flash $0.14 $0.28 $1.01 $50.40
GPT-5.6 Luna $0.2 $1.2 $2.40 $120.00
Gemini 3.5 Flash-Lite $0.3 $2.5 $4.44 $222.00
Grok Build 0.1 $1 $2 $7.20 $360.00
Claude Haiku 4.5 $1 $5 $10.80 $540.00

在这组候选与固定用量中,纯 Token 成本最低的是 Ministral 3 3B,2,000 次约为 $0.6000。这个结论只对当前表内模型、当前费率和该输入输出比例成立;改变输出长度、缓存命中率、长上下文档位或任务成功率,排序都可能变化。

低频与高频怎么选

低频调用:能力差异可能比单价差异重要

如果每月只做几十次课程资料分析或代码检查,总账单通常较小。以上表相同的单次用量为例,每月 30 次时,各模型对应成本可在成本计算器中直接复算。此时,少一次返工可能比压低每 1M Tokens 的单价更有价值。

再看一个质量优先示例:每月用 Claude Sonnet 5 处理 12 次较长任务,每次假设 8,000 输入、2,500 输出且无缓存,按当前默认费率约为 $0.4920。它并不能证明该模型一定更好,只说明在低频情境里,可以先算清“选更强模型”的绝对金额,再决定是否值得。

高频调用:微小差价会被放大

分类器、批量摘要、机器人后台任务和 Agent 子步骤可能每月运行数万甚至更多次。此时应把请求按难度分层:简单任务走低成本模型;规则校验失败、置信度不足或用户明确要求高质量时,再升级到能力更强的模型。不要把所有请求一刀切,也不要让低成本模型无限重试。

高频系统至少要监控四个指标:单次 Token、成功率、平均重试次数、升级比例。总成本更接近:

月成本 = 基础请求成本 + 重试成本 + 升级模型成本 + 缓存/工具附加成本

三档预算策略

几乎零预算:先验证需求

先用很小的测试集和严格的调用上限证明功能有用,再扩大规模。Provider 的免费额度、地区可用性和活动规则容易变化,不应把它们当作长期成本模型;即使当前有免费额度,也要准备额度结束后的付费预算。开发时用固定样本,关闭不必要的自动重试,并为 API Key 设置消费上限。

小额月预算:默认便宜,困难任务升级

为每个功能指定默认模型与升级模型。提取、分类等先从表中低成本候选做评测;复杂代码、重要长文再交给通过质量测试的模型。把月预算拆成“常规流量、复杂任务、实验余量”三部分,避免一次长上下文实验吃掉整月额度。

稳定项目预算:按数据优化

请求量稳定后,重点从“选一个便宜模型”转向“优化整条链路”:缩短无效上下文、提高缓存前缀复用、为异步作业评估 Batch、合并小请求、减少 Agent 空转。任何优化都应同时看成功率;只看账单下降,可能只是把成本转移给人工复核。

最低价为什么未必最省

风险怎样增加实际成本怎样验证
任务能力不足重复生成、人工改写、升级重跑用真实样本计算一次通过率
结构化输出不稳解析失败,触发修复请求检查 schema / JSON 通过率
上下文不够或长文退化分块次数增加,信息遗漏在实际长度上测试,不只测短样本
延迟或限流不合适超时重试,用户流失记录 P50/P95 延迟和限流错误
工具调用可靠性不足Agent 多走步骤或调用错误工具统计每任务步骤数与工具成功率
Preview 或规则变化版本迁移与回归测试锁定模型 ID,保留替代方案

价格页还可能包含不同服务等级、长上下文阶梯、多模态费率和缓存存储费。本站列表使用每个模型的默认文本口径;采购或上线前应打开模型详情阅读限制,并到官方来源复核。

用小样本做一次公平评测

  1. 从自己的真实任务中抽取 20–50 个样本,移除隐私信息,并覆盖简单、普通和困难情况。
  2. 固定提示词、temperature、最大输出长度和输出格式,让候选模型在相同条件下运行。
  3. 盲评质量,或用测试、字段准确率等可重复指标评分;不要凭一条“惊艳回答”决定。
  4. 记录每个样本的 Input、Cached Input、Output、延迟、重试和是否合格。
  5. 计算每个合格结果的成本,再检查最差案例是否触及不可接受的风险。

评测花掉的一小笔 API 费,通常比在没有数据的情况下长期选错模型便宜。

可执行选型清单

  • 低频、高价值任务:先比较绝对月成本,再优先满足质量底线。
  • 高频、可验证任务:从低成本候选开始,用失败升级和硬性步骤上限兜底。
  • 长固定前缀:验证 Cached Input 规则及写入/存储费,不把缓存折扣想当然。
  • 异步批处理:比较 Batch 费率、完成时间与服务保证是否匹配。
  • 上线前:设置 Key 权限、日/月消费告警、预算硬上限和模型替代方案。

最后,把自己的调用量放入API 成本计算器,再用模型对比页检查上下文、适用场景与限制。便宜是约束,不是唯一目标;对预算最友好的方案,是在达到最低质量要求后,总完成成本最低的方案。