你的「Claude」或 GPT 是真的吗?如何鉴别中转掉包

有些中转会悄悄给你换更小、量化或降级的模型 —— 常常在注册数周之后。这里给出一套可复现方法,抓出任何中转里的掉包、量化降级与上下文截断。

更新于 2026-07-20

「掉包」和「降级」是什么#

  • 模型掉包: 你要旗舰模型,中转给你便宜的。
  • 量化 / 降级: 同一家族,但更低精度或蒸馏版本,推理更差。
  • 上下文截断: 你的长 prompt 被悄悄截断,召回下降。
  • 悄悄漂移: 注册时正常,等你上了车再降级。

为什么「你是什么模型」没用#

让模型自报身份极易被伪造 —— 中转可以注入任意系统 prompt 或改写答案。掉包不能靠问出来;要靠测能力并与已知良好的基准对比。

测行为,别信自报

身份字符串、响应头、`model` 字段都能伪造。只有可复现的能力探针和并排 diff 才是可靠信号。

方法#

  1. 固定一套探针。 多步推理、长上下文「针」召回、严格 JSON 格式,以及拒答行为。
  2. 固定参数。 temperature=0、相同 max_tokens、相同系统 prompt —— 去掉随机性。
  3. 测量。 多次运行的 p50/p95 延迟与错误率。
  4. 与官方 API 做 diff。 相同探针、相同参数、同一天。
  5. 每周重跑。 悄悄降级是随时间发生的,不在第一天。
python
# 测「能力」,而不是问「你是什么模型」(后者极易被伪造)。
# 固定 temperature=0,把输出和官方 API 做 diff。
from openai import OpenAI

client = OpenAI(base_url="https://daoxe.com/v1", api_key="你的DaoXE_key")
probe = "只返回 JSON: {\"sum\": <2147483647 + 1>}"
r = client.chat.completions.create(
    model="你的准确模型ID",
    temperature=0,
    max_tokens=32,
    messages=[{"role": "user", "content": probe}],
)
print(r.choices[0].message.content)  # 跨供应商 / 跨时间对比

红旗自查清单#

  • temperature=0 下,难推理题的质量低于官方 API。
  • 官方模型能做到的长上下文召回,这里做不到(可能被截断)。
  • 相对产出的 token 计量低得不合理。
  • 注册数周后延迟与行为突然变化。
  • 你要求 benchmark 时,供应商躲闪。

DaoXE 为通过此测试而设计#

  • 一个开源可复现 benchmark,可对准 DaoXE 和官方 API。
  • 账户维度 /v1/models —— 你看到的就是你能调的。
  • 原生 Anthropic Messages,因此 Claude 表现得像 Claude(工具、流式)。
  • 透明的按模型用量,可对账。

用同样方法验我们

benchmark 对准 DaoXE 和官方 API 做对比。我们公开工具,正是为了不让你只能靠信任。

常见问题#

能证明一个中转到底跑的哪个模型吗?

从外部无法密码学证明。但能力探针与对官方 API 的并排 diff,能给出强而可复现的掉包/降级信号。

查响应头不就够了?

不够 —— 响应头与任何自报身份都能被中转伪造。请测行为。

验证工具会看到我的 key 吗?

不会。开源 benchmark 本地运行,从不传输或存储你的 key、prompt 与响应。

能测 DaoXE 以外的供应商吗?

能 —— 这正是重点。它与供应商无关,可测官方 API 和任何网关,包括我们。

试用 DaoXE —— 并亲自 benchmark 它

一个 key 调 GPT、Claude、Gemini、DeepSeek 等。用开源 benchmark 对准我们做对比 —— 别只听我们说。