「掉包」和「降级」是什么#
- 模型掉包: 你要旗舰模型,中转给你便宜的。
- 量化 / 降级: 同一家族,但更低精度或蒸馏版本,推理更差。
- 上下文截断: 你的长 prompt 被悄悄截断,召回下降。
- 悄悄漂移: 注册时正常,等你上了车再降级。
为什么「你是什么模型」没用#
让模型自报身份极易被伪造 —— 中转可以注入任意系统 prompt 或改写答案。掉包不能靠问出来;要靠测能力并与已知良好的基准对比。
测行为,别信自报
身份字符串、响应头、`model` 字段都能伪造。只有可复现的能力探针和并排 diff 才是可靠信号。
方法#
- 固定一套探针。 多步推理、长上下文「针」召回、严格 JSON 格式,以及拒答行为。
- 固定参数。
temperature=0、相同max_tokens、相同系统 prompt —— 去掉随机性。 - 测量。 多次运行的 p50/p95 延迟与错误率。
- 与官方 API 做 diff。 相同探针、相同参数、同一天。
- 每周重跑。 悄悄降级是随时间发生的,不在第一天。
python
# 测「能力」,而不是问「你是什么模型」(后者极易被伪造)。
# 固定 temperature=0,把输出和官方 API 做 diff。
from openai import OpenAI
client = OpenAI(base_url="https://daoxe.com/v1", api_key="你的DaoXE_key")
probe = "只返回 JSON: {\"sum\": <2147483647 + 1>}"
r = client.chat.completions.create(
model="你的准确模型ID",
temperature=0,
max_tokens=32,
messages=[{"role": "user", "content": probe}],
)
print(r.choices[0].message.content) # 跨供应商 / 跨时间对比红旗自查清单#
- 在
temperature=0下,难推理题的质量低于官方 API。 - 官方模型能做到的长上下文召回,这里做不到(可能被截断)。
- 相对产出的 token 计量低得不合理。
- 注册数周后延迟与行为突然变化。
- 你要求 benchmark 时,供应商躲闪。
DaoXE 为通过此测试而设计#
- 一个开源可复现 benchmark,可对准 DaoXE 和官方 API。
- 账户维度
/v1/models—— 你看到的就是你能调的。 - 原生 Anthropic Messages,因此 Claude 表现得像 Claude(工具、流式)。
- 透明的按模型用量,可对账。
用同样方法验我们
把 benchmark 对准 DaoXE 和官方 API 做对比。我们公开工具,正是为了不让你只能靠信任。
常见问题#
能证明一个中转到底跑的哪个模型吗?
从外部无法密码学证明。但能力探针与对官方 API 的并排 diff,能给出强而可复现的掉包/降级信号。
查响应头不就够了?
不够 —— 响应头与任何自报身份都能被中转伪造。请测行为。
验证工具会看到我的 key 吗?
不会。开源 benchmark 本地运行,从不传输或存储你的 key、prompt 与响应。
能测 DaoXE 以外的供应商吗?
能 —— 这正是重点。它与供应商无关,可测官方 API 和任何网关,包括我们。
试用 DaoXE —— 并亲自 benchmark 它
一个 key 调 GPT、Claude、Gemini、DeepSeek 等。用开源 benchmark 对准我们做对比 —— 别只听我们说。