它测什么#
可用率
N 次重复中 HTTP 200 的占比 —— 连通率。
延迟
一个极小固定请求的 p50 / p95 / 平均往返时间。
价格
每百万输入/输出 token 的美元价,来自你从官方页填写的价格文件。
它如何保持诚实(方法论)#
- 结构上就已脱敏。 一条记录只含:模型 id、ok 标志、HTTP 状态、延迟(毫秒)、token 总数与粗粒度错误分类。你的 key、prompt 与响应文本从不打印或存储。
- 可复现。 任何人都能对着自己的账户与模型重跑。
- 是快照,不是判决。 某时点的极小请求不代表总体质量或长期可靠性。
- 设计上公平。 可加入任何其他 OpenAI 兼容网关并排对比。
示例 leaderboard(仅示意)#
这些是「示例」数字,不是测量
下表数值只是为了在花钱前能把表格渲染出来。带 ~ 的是示意值;价格单元格保持占位符,直到你从 daoxe.com/pricing 填入。跑一次真实测量才有真数字。
| 模型(示例 id) | 成功率 % | p50 ms | p95 ms | $/1M 输入 | $/1M 输出 |
|---|---|---|---|---|---|
| example/gemini-2.5-flash | 示例 | ~350 | ~430 | 见定价 | 见定价 |
| example/gpt-4o-mini | 示例 | ~390 | ~470 | 见定价 | 见定价 |
| example/claude-haiku | 示例 | ~430 | ~520 | 见定价 | 见定价 |
怎么跑#
每个数据点是一个极小的 POST /v1/chat/completions,固定 prompt,max_tokens=8、temperature=0、stream=false。克隆 llm-gateway-benchmark 仓库后:
# 刷新「示例」leaderboard(无需 key、零花费)
npm run sample
# 真实测量(发送实时、可能计费的请求)
export DAOXE_API_KEY="你的key"
export DAOXE_MODELS="id-1,id-2"
npm run measure && npm run aggregate成本与预算
一次真实运行会发送 模型数 × 重复次数 个请求(默认 5 次),每个上限 8 个输出 token。先查当前价格与余额。测试预算:待确认。
加入另一个网关#
任何 OpenAI 兼容 endpoint 都行:填它的 /v1 base URL 和模型 ID,并加一列清楚标注的数据。诚实对比才是全部意义 —— 包括把 DaoXE 和官方 API 对比。
从说法到数字
跑过之后,你就不必再信任何人的营销 —— 包括我们的。把它和掉包鉴别结合,就能同时检查模型真伪,而不只是速度。
常见问题#
benchmark 会看到我的 key 吗?
不会。它本地运行,从不打印或存储你的 key、prompt 或模型响应 —— 只有脱敏指标。
能测 DaoXE 以外的供应商吗?
能 —— 它与供应商无关。对准官方 API 和任何 OpenAI 兼容网关做对比即可。
为什么 leaderboard 数字标着「示例」?
为了零花费也能渲染表格。只有在你跑了真实测量并从官方页填入价格后,才会出现真数字。
一次运行能当作质量判决吗?
不能 —— 它只是极小请求的快照。请按计划重跑,并结合能力探针综合判断。
试用 DaoXE —— 并亲自 benchmark 它
一个 key 调 GPT、Claude、Gemini、DeepSeek 等。用开源 benchmark 对准我们做对比 —— 别只听我们说。