Бенчмарк цены и задержки LLM-шлюзов — запустите сами

«Быстро и надёжно» — утверждение; число, которое можно перезапустить, — доказательство. Вот как измерить связность, p50/p95 задержку и цену за 1M токенов у OpenAI-совместимых шлюзов — воспроизводимо и безопасно.

Обновлено 2026-07-20

Что измеряется#

Доступность

Доля ответов HTTP 200 за N повторов — процент успеха.

Задержка

p50 / p95 / среднее время ответа для маленького фиксированного запроса.

Цена

$/1M входных и выходных токенов из файла цен, который вы заполняете с официальной страницы.

Почему это честно (методология)#

  • Очищено по замыслу. В записи только: id модели, флаг ok, HTTP-статус, задержка (мс), число токенов и грубая категория ошибки. Ключ, промпт и текст ответа не печатаются и не хранятся.
  • Воспроизводимо. Любой может перезапустить против своего аккаунта и моделей.
  • Снимок, а не приговор. Крошечный запрос в один момент — не суждение об общем качестве или долгой надёжности.
  • Честно по устройству. Добавьте любой другой OpenAI-совместимый шлюз и сравните бок о бок.

Примерный leaderboard (только иллюстрация)#

Это ПРИМЕРНЫЕ числа, не измерение

Значения ниже нужны, чтобы таблица рисовалась до трат. Пометки с ~ — иллюстративные; ячейки цены остаются плейсхолдерами, пока вы не заполните их с daoxe.com/pricing. Запустите реальный прогон, чтобы получить настоящие числа.

Модель (пример id)Успех %p50 мсp95 мс$/1M вход$/1M выход
example/gemini-2.5-flashпример~350~430см. ценысм. цены
example/gpt-4o-miniпример~390~470см. ценысм. цены
example/claude-haikuпример~430~520см. ценысм. цены
Иллюстративный пример по образцу открытого leaderboard — замените своим прогоном.

Как запустить#

Каждая точка — один маленький POST /v1/chat/completions с фиксированным промптом, max_tokens=8, temperature=0, stream=false. Клонируйте репозиторий llm-gateway-benchmark и выполните:

bash
# обновить ПРИМЕРНЫЙ leaderboard (без ключа и расходов)
npm run sample

# реальный прогон (отправляет живые, возможно платные запросы)
export DAOXE_API_KEY="ваш_ключ"
export DAOXE_MODELS="id-1,id-2"
npm run measure && npm run aggregate

Стоимость и бюджет

Реальный прогон отправляет модели × повторы запросов (по умолчанию 5), каждый с лимитом 8 токенов. Сначала проверьте цену и баланс. Тестовый бюджет: уточняется.

Добавьте другой шлюз#

Подойдёт любой OpenAI-совместимый endpoint: укажите его /v1 base URL и его ID моделей и добавьте отдельную подписанную колонку. Честное сравнение — весь смысл, включая сравнение DaoXE с официальными API.

От утверждения к числу

Прогнав его, вы больше не обязаны верить чьему-либо маркетингу — включая наш. Совместите это с распознаванием подмены модели, чтобы проверять и целостность, а не только скорость.

Частые вопросы#

Бенчмарк видит мой ключ?

Нет. Он работает локально и не печатает и не хранит ключ, промпт или ответ модели — только очищенные метрики.

Можно тестировать не только DaoXE?

Да — он провайдер-независимый. Направьте его на официальный API и любой OpenAI-совместимый шлюз и сравните.

Почему числа помечены ПРИМЕР?

Чтобы таблица рисовалась без трат. Настоящие числа появляются только после реального прогона и заполнения цен с официальной страницы.

Один прогон — это вердикт о качестве?

Нет — это снимок крошечного запроса. Перезапускайте по расписанию и совмещайте с пробами способностей.

Попробуйте DaoXE — и проверьте его сами

Один ключ для GPT, Claude, Gemini, DeepSeek и других. Направьте открытый бенчмарк на нас и сравните — не верьте на слово.