Что такое «подмена» и «даунгрейд»#
- Подмена модели: вы просите топовую модель, релей отдаёт дешевле.
- Квантизация/даунгрейд: то же семейство, но менее точный или дистиллированный вариант, который хуже рассуждает.
- Обрезка контекста: ваш длинный промпт тихо режется, и recall падает.
- Тихий дрейф: при регистрации всё хорошо, затем деградирует, когда вы уже привязались.
Почему «какая ты модель?» не работает#
Просьба к модели представиться легко подделывается — релей может подставить любой системный промпт или переписать ответ. Подмену нельзя поймать вопросом; её ловят проверкой способностей и сравнением с эталоном.
Проверяйте поведение, а не самоотчёты
Строки идентификации, заголовки и поле «model» подделываются. Надёжны только воспроизводимые пробы способностей и сравнение бок о бок.
Метод#
- Зафиксируйте набор проб. Многошаговое рассуждение, recall «иголки» в длинном контексте, строгий JSON и поведение при отказе.
- Зафиксируйте параметры.
temperature=0, тот жеmax_tokens, тот же системный промпт — уберите случайность. - Измерьте. p50/p95 задержку и долю ошибок за несколько прогонов.
- Сравните с официальным API. Те же пробы, те же параметры, в тот же день.
- Перезапускайте еженедельно. Тихий даунгрейд случается со временем, а не в первый день.
# Проверяем СПОСОБНОСТИ, а не "какая ты модель?" (это легко подделать).
# Ставим temperature=0 и сравниваем вывод с официальным API.
from openai import OpenAI
client = OpenAI(base_url="https://daoxe.com/v1", api_key="ВАШ_КЛЮЧ_DAOXE")
probe = "Верни только JSON: {\"sum\": <2147483647 + 1>}"
r = client.chat.completions.create(
model="ТОЧНЫЙ_ID_МОДЕЛИ",
temperature=0,
max_tokens=32,
messages=[{"role": "user", "content": probe}],
)
print(r.choices[0].message.content) # сравните между провайдерами / во времениЧек-лист тревожных признаков#
- Качество на сложных рассуждениях ниже, чем у официального API при
temperature=0. - Recall длинного контекста падает там, где официальная модель справляется (возможна обрезка).
- Учёт токенов выглядит неправдоподобно низким для выданного объёма.
- Задержка и поведение резко меняются спустя недели после регистрации.
- Провайдер уходит от вопроса о бенчмарке.
Почему DaoXE проходит этот тест#
- Открытый воспроизводимый бенчмарк, который можно направить на DaoXE и официальный API.
- Список моделей по аккаунту
/v1/models— что видите, то и вызываете. - Нативный Anthropic Messages, поэтому Claude ведёт себя как Claude (инструменты, стриминг).
- Прозрачный расход по моделям, который можно сверить.
Проверяйте и нас так же
Прогоните бенчмарк против DaoXE и официального API и сравните. Мы публикуем инструмент именно чтобы нам не верили на слово.
Частые вопросы#
Можно доказать, какую модель гоняет прокси?
Криптографически снаружи — нет. Но пробы способностей и сравнение с официальным API дают сильные воспроизводимые сигналы подмены или даунгрейда.
Разве проверки заголовков недостаточно?
Нет — заголовки и любую самоидентификацию релей может подделать. Проверяйте поведение.
Инструмент проверки видит мой ключ?
Нет. Открытый бенчмарк работает локально и не передаёт и не хранит ключ, промпт и ответы.
Можно тестировать не только DaoXE?
Да — в этом и смысл. Он провайдер-независимый: тестируйте официальный API и любой шлюз, включая нас.
Попробуйте DaoXE — и проверьте его сами
Один ключ для GPT, Claude, Gemini, DeepSeek и других. Направьте открытый бенчмарк на нас и сравните — не верьте на слово.