企业怎么选大模型 API 供应商:6 项可实测的验证清单(2026)
被「超低价 API」坑过的团队都懂:降智、跑路、扣费黑箱。6 项开工前就能实测的验证标准——模型真伪探针、标价=实扣、失败不计费、主体可追溯——不用赌,全部当场验,包括拿来验我们。
1. 为什么「最便宜」往往最贵
大模型 API 的成本结构其实是透明的:上游厂商的价格就摆在官网上。所以一家长期以显著低于上游成本的价格卖货的供应商,收入覆盖不了成本,只可能靠两件事活着——要么在烧钱换量(那么补贴停止或资金断裂时就是你的业务中断日),要么货不对板(降智、套壳、来路不明的额度)。对企业来说,真正的账要这么算:集成成本 + 迁移成本 + 业务中断成本,远高于每百万 token 省下的那点差价。接入一家供应商是有沉没成本的,中途换一次的代价通常够你多付好几个月的差价。所以选型的标准应该是「可持续的便宜」,而不是「不可解释的便宜」——后者本质上是在拿业务连续性换单价。
2. 第一项:模型真伪,一小时消除最大疑虑
「降智」是这个行业最大的信任黑洞:你付的是旗舰模型的钱,拿到的可能是更便宜的替代品在冒充,而且从返回结果的表面上看不出来——它确实在正常回答,只是能力不对。这件事不需要靠信任解决,可以直接测。我们把检测工具开源了(probe.cocodot.co),用多类探针从能力指纹上验证模型真伪,它对任何供应商都可用,包括拿来测我们自己。企业采购时把这一步放进 checklist,一小时就能消除最大的那块不确定性。顺带一个红旗信号:如果一家供应商明确拒绝被这类工具测试,或者测出来的结果异常,那么后面五项就不用测了。
3. 第二、三项:标价=实扣,失败不计费
这两项一起测,方法很简单:充一笔最小额度,跑十次调用,然后逐笔核对账单。要核的是:每一笔的模型名对不对、token 数与你的输入输出对不对得上、扣费金额是否等于「token 数 × 标价」。如果对不上,或者供应商根本不提供逐笔明细(只给你一个不断减少的余额数字),直接排除——对不了账就审不了计,财务那关过不去。接着测第三项:故意触发一次超时和一次错误,看这两笔扣不扣钱。合格的做法是失败不计费。这一项之所以重要,是因为它在正常使用中不显眼,但一旦你的业务有重试逻辑,失败计费会在高并发或上游抖动时把账单放大到离谱。
4. 第四、五项:主体可追溯,价格可持续
第四项问的是「出事的时候我找谁」:有没有一个可查的注册主体、有没有能真的联系上并且会回复的支持渠道。测法就是在付钱之前先发一个技术问题过去,看多久回、回得专不专业——这既测响应能力,也测这家是不是真有人在运营。红旗是匿名收款、只有一个聊天号、以及问技术问题答非所问。第五项是拿计算器算一遍:对照上游官网价,看这家的报价还剩多少毛利空间。这不是要求供应商便宜或不便宜,而是要求价格能被解释——一个能说清自己为什么能便宜(规模采购、合同折扣)的供应商,比一个便宜得莫名其妙的可持续得多。
5. 第六项:敢写「不支持什么」的更可信
这一项最反直觉,却是我们踩过教训才学会的:宣传和实现之间的每一处缝隙,最后都会变成客户的一张事故单。一家在文档里明确写出「我们不支持 X、Y 在某些情况下不保证」的供应商,通常比一家宣传全能零缺点的更可信——因为前者是在用短期的转化率换长期的信任,而后者只是把问题推迟到你接入之后才暴露。测法是去翻文档,看有没有「限制」「不支持」这类章节,以及这些说明是写在显眼处还是藏在条款最底下。顺便说:这也是你评估任何技术供应商的通用标准,不限于 API。
6. 我们自己怎么过这份清单
按第六项的标准,如实交代我们自己在这六项上的情况:① 探针开源可测,包括拿来测我们;② 标价=实际扣费,逐笔流水可查可导出;③ 失败调用不计费;④ 海外注册公司实名运营,有可联系的支持渠道;⑤ 价格结构可解释——各型号售价均不超过对应官网价,折扣幅度逐型号不同:有的型号折扣明显,也有型号就是官网同价(部分国产型号本身定价已经很低),具体以价格页或模型接口的实时标价为准,别按「全线统一折扣」去估算;⑥ 边界写在明处:目前不提供发票、超大并发需提前评估容量、部分型号有长上下文阶梯价、我们是转发通道不存储调用内容。第六条我们是踩过教训才学会的。
7. 一个常被忽略的维度:退出成本
前面六项都是「进场前怎么验」,这里补一项「进场后怎么才能走得掉」。企业选型时应该同时问一句:如果三个月后我要换掉这家,代价有多大? 降低退出成本的做法有几条,建议在接入时就做好:① 用标准接口而不是私有 SDK——OpenAI 兼容意味着换供应商只改 `base_url` 和 `api_key`;② 只依赖通用参数,不要把业务逻辑建立在某家的私有扩展上;③ 把模型名做成配置项,不硬编码进代码;④ 自己留一份调用日志,不要完全依赖供应商后台看数据。做到这四条,换供应商就从「重构一次」降级成「改配置」,你的议价能力和抗风险能力都会完全不同。
8. 把清单压成一次一小时的验证流程
最后给一个可以直接执行的顺序,总耗时约一小时:① 先跑探针(10 分钟)——不通过就到此为止,不用往下测;② 充最小额度(5 分钟);③ 跑十笔真实调用并导出账单逐笔核对(20 分钟)——同时验证第二项标价一致和明细完整性;④ 故意触发一次超时、一次错误(5 分钟),看失败是否计费;⑤ 发一个技术问题给支持渠道(等回复,同时进行下一步);⑥ 翻文档找「限制/不支持」章节,并对照上游官网价算一遍毛利空间(15 分钟);⑦ 汇总。注意这七步全部是在小额度、测试环境下完成的,不涉及切换生产流量——把不确定性消化在这一小时里,比接入之后才发现问题便宜得多。
6 项验证清单(全部可在付费前完成)
| # | 验证项 | 怎么测 | 红旗信号 |
|---|---|---|---|
| 1 | 模型真伪 | 开源探针跑一遍(probe.cocodot.co) | 拒绝被测 / 结果异常 |
| 2 | 标价=实扣 | 小额充值跑十笔,逐笔对账 | 账单对不上 / 没有逐笔明细 |
| 3 | 失败计费 | 故意触发超时和错误各一次 | 失败也扣钱 |
| 4 | 主体追溯 | 查注册信息、试着联系支持 | 匿名收款 / 只有一个聊天号 |
| 5 | 价格可持续 | 对照上游官网价算毛利空间 | 长期显著低于上游成本价 |
| 6 | 边界诚实 | 看文档有没有写明不支持项 | 宣传全能、零缺点 |