LLM 网关价格与延迟基准 —— 自己跑

「又快又稳」是说法;能重跑的数字才是证据。这里教你如何在 OpenAI 兼容网关上测连通率、p50/p95 延迟和每百万 token 价格 —— 可复现且安全。

更新于 2026-07-20

它测什么#

可用率

N 次重复中 HTTP 200 的占比 —— 连通率。

延迟

一个极小固定请求的 p50 / p95 / 平均往返时间。

价格

每百万输入/输出 token 的美元价,来自你从官方页填写的价格文件。

它如何保持诚实(方法论)#

  • 结构上就已脱敏。 一条记录只含:模型 id、ok 标志、HTTP 状态、延迟(毫秒)、token 总数与粗粒度错误分类。你的 key、prompt 与响应文本从不打印或存储。
  • 可复现。 任何人都能对着自己的账户与模型重跑。
  • 是快照,不是判决。 某时点的极小请求不代表总体质量或长期可靠性。
  • 设计上公平。 可加入任何其他 OpenAI 兼容网关并排对比。

示例 leaderboard(仅示意)#

这些是「示例」数字,不是测量

下表数值只是为了在花钱前能把表格渲染出来。带 ~ 的是示意值;价格单元格保持占位符,直到你从 daoxe.com/pricing 填入。跑一次真实测量才有真数字。

模型(示例 id)成功率 %p50 msp95 ms$/1M 输入$/1M 输出
example/gemini-2.5-flash示例~350~430见定价见定价
example/gpt-4o-mini示例~390~470见定价见定价
example/claude-haiku示例~430~520见定价见定价
对照开源 leaderboard 的示意样例 —— 请用你自己的运行结果替换。

怎么跑#

每个数据点是一个极小的 POST /v1/chat/completions,固定 prompt,max_tokens=8temperature=0stream=false。克隆 llm-gateway-benchmark 仓库后:

bash
# 刷新「示例」leaderboard(无需 key、零花费)
npm run sample

# 真实测量(发送实时、可能计费的请求)
export DAOXE_API_KEY="你的key"
export DAOXE_MODELS="id-1,id-2"
npm run measure && npm run aggregate

成本与预算

一次真实运行会发送 模型数 × 重复次数 个请求(默认 5 次),每个上限 8 个输出 token。先查当前价格与余额。测试预算:待确认

加入另一个网关#

任何 OpenAI 兼容 endpoint 都行:填它的 /v1 base URL 和模型 ID,并加一列清楚标注的数据。诚实对比才是全部意义 —— 包括把 DaoXE 和官方 API 对比。

从说法到数字

跑过之后,你就不必再信任何人的营销 —— 包括我们的。把它和掉包鉴别结合,就能同时检查模型真伪,而不只是速度。

常见问题#

benchmark 会看到我的 key 吗?

不会。它本地运行,从不打印或存储你的 key、prompt 或模型响应 —— 只有脱敏指标。

能测 DaoXE 以外的供应商吗?

能 —— 它与供应商无关。对准官方 API 和任何 OpenAI 兼容网关做对比即可。

为什么 leaderboard 数字标着「示例」?

为了零花费也能渲染表格。只有在你跑了真实测量并从官方页填入价格后,才会出现真数字。

一次运行能当作质量判决吗?

不能 —— 它只是极小请求的快照。请按计划重跑,并结合能力探针综合判断。

试用 DaoXE —— 并亲自 benchmark 它

一个 key 调 GPT、Claude、Gemini、DeepSeek 等。用开源 benchmark 对准我们做对比 —— 别只听我们说。