Что измеряется#
Доступность
Доля ответов HTTP 200 за N повторов — процент успеха.
Задержка
p50 / p95 / среднее время ответа для маленького фиксированного запроса.
Цена
$/1M входных и выходных токенов из файла цен, который вы заполняете с официальной страницы.
Почему это честно (методология)#
- Очищено по замыслу. В записи только: id модели, флаг ok, HTTP-статус, задержка (мс), число токенов и грубая категория ошибки. Ключ, промпт и текст ответа не печатаются и не хранятся.
- Воспроизводимо. Любой может перезапустить против своего аккаунта и моделей.
- Снимок, а не приговор. Крошечный запрос в один момент — не суждение об общем качестве или долгой надёжности.
- Честно по устройству. Добавьте любой другой OpenAI-совместимый шлюз и сравните бок о бок.
Примерный leaderboard (только иллюстрация)#
Это ПРИМЕРНЫЕ числа, не измерение
Значения ниже нужны, чтобы таблица рисовалась до трат. Пометки с ~ — иллюстративные; ячейки цены остаются плейсхолдерами, пока вы не заполните их с daoxe.com/pricing. Запустите реальный прогон, чтобы получить настоящие числа.
| Модель (пример id) | Успех % | p50 мс | p95 мс | $/1M вход | $/1M выход |
|---|---|---|---|---|---|
| example/gemini-2.5-flash | пример | ~350 | ~430 | см. цены | см. цены |
| example/gpt-4o-mini | пример | ~390 | ~470 | см. цены | см. цены |
| example/claude-haiku | пример | ~430 | ~520 | см. цены | см. цены |
Как запустить#
Каждая точка — один маленький POST /v1/chat/completions с фиксированным промптом, max_tokens=8, temperature=0, stream=false. Клонируйте репозиторий llm-gateway-benchmark и выполните:
# обновить ПРИМЕРНЫЙ leaderboard (без ключа и расходов)
npm run sample
# реальный прогон (отправляет живые, возможно платные запросы)
export DAOXE_API_KEY="ваш_ключ"
export DAOXE_MODELS="id-1,id-2"
npm run measure && npm run aggregateСтоимость и бюджет
Реальный прогон отправляет модели × повторы запросов (по умолчанию 5), каждый с лимитом 8 токенов. Сначала проверьте цену и баланс. Тестовый бюджет: уточняется.
Добавьте другой шлюз#
Подойдёт любой OpenAI-совместимый endpoint: укажите его /v1 base URL и его ID моделей и добавьте отдельную подписанную колонку. Честное сравнение — весь смысл, включая сравнение DaoXE с официальными API.
От утверждения к числу
Прогнав его, вы больше не обязаны верить чьему-либо маркетингу — включая наш. Совместите это с распознаванием подмены модели, чтобы проверять и целостность, а не только скорость.
Частые вопросы#
Бенчмарк видит мой ключ?
Нет. Он работает локально и не печатает и не хранит ключ, промпт или ответ модели — только очищенные метрики.
Можно тестировать не только DaoXE?
Да — он провайдер-независимый. Направьте его на официальный API и любой OpenAI-совместимый шлюз и сравните.
Почему числа помечены ПРИМЕР?
Чтобы таблица рисовалась без трат. Настоящие числа появляются только после реального прогона и заполнения цен с официальной страницы.
Один прогон — это вердикт о качестве?
Нет — это снимок крошечного запроса. Перезапускайте по расписанию и совмещайте с пробами способностей.
Попробуйте DaoXE — и проверьте его сами
Один ключ для GPT, Claude, Gemini, DeepSeek и других. Направьте открытый бенчмарк на нас и сравните — не верьте на слово.