Как проверить, что вам отвечает настоящая модель
Подмена и урезание моделей: 5 схем · чек-лист ручной проверки · что делать при подтверждении
TL;DR — самое короткое правило
Если нет времени читать целиком, запомните два пункта: ① цена, необъяснимо низкая для этой модели, — самый надёжный сигнал проблемы; ② прежде чем пополнять крупную сумму, прогоните свои реальные задачи на минимальном пополнении и сверьтесь с колонкой «Проверка модели» в рейтинге.
⚠ Возможно, вы покупаете не то, за что платите — данные независимого исследования
45.83%
из 24 проверенных API-эндпоинтов не прошли проверку подлинности модели
83.82%→37%
заявлен Gemini-2.5-flash — точность на том же наборе задач падает вдвое
$14.84→$5.70
платите за GPT-5, а фактическая ценность токенов — меньше половины
17 / 187
API-сервисов, цитируемых в 187 научных работах, уличены в подмене
Зафиксированные подмены (что выбрали → что отвечало на самом деле):
GPT-5 → glm-4-9b-chat | GPT-4o-mini → Qwen2.5-7B | DeepSeek-Reasoner (thinking) → версия без reasoning | подмена Gemini-2.0-flash с тарификацией в 7× дороже
GPT-5 → glm-4-9b-chat | GPT-4o-mini → Qwen2.5-7B | DeepSeek-Reasoner (thinking) → версия без reasoning | подмена Gemini-2.0-flash с тарификацией в 7× дороже
Источник: CISPA Helmholtz Center for Information Security, «Real Money, Fake Models: Deceptive Model Claims in Shadow APIs» (2026, 24 эндпоинта / 17 сервисов) · arXiv:2603.01919. Подмена и урезание моделей — задокументированное массовое явление, а не единичное невезение.
1. Пять схем подмены и урезания
1. Подмена на дешёвую модель. Тарификация по цене Claude, а отвечает GPT-4o-mini / Qwen / DeepSeek. Ответы «похожи на правду», но сложные рассуждения и длинные цепочки задач выдают подмену.
2. Подмена версии. Выбираете Sonnet 4.6 / Opus 4.8 — получаете более старую и дешёвую версию: способности не соответствуют заявленной.
3. Урезание контекста и вывода. Заявлен длинный контекст — на деле тихо обрезается; либо занижен максимум вывода: на длинных текстах модель «теряет память» или обрывается.
4. Маскировка ответов. Ответ сторонней модели упаковывается в структуру Anthropic (имя модели, stop_reason, поля тарификации) — на глаз и простым скриптом не отличить.
5. Периодическая подмена. Дешёвый бэкенд подставляется только в часы пик — «один раз проверил, всё нормально» ничего не гарантирует.
Цена сама по себе — не улика: перепродажа подписок и бесплатные лимиты IDE дают настоящую модель заметно дешевле официальной цены (разбор источников дешёвого API). Подозревать подмену стоит там, где сервис не может объяснить происхождение низкой цены.
2. Подмена версии. Выбираете Sonnet 4.6 / Opus 4.8 — получаете более старую и дешёвую версию: способности не соответствуют заявленной.
3. Урезание контекста и вывода. Заявлен длинный контекст — на деле тихо обрезается; либо занижен максимум вывода: на длинных текстах модель «теряет память» или обрывается.
4. Маскировка ответов. Ответ сторонней модели упаковывается в структуру Anthropic (имя модели, stop_reason, поля тарификации) — на глаз и простым скриптом не отличить.
5. Периодическая подмена. Дешёвый бэкенд подставляется только в часы пик — «один раз проверил, всё нормально» ничего не гарантирует.
Цена сама по себе — не улика: перепродажа подписок и бесплатные лимиты IDE дают настоящую модель заметно дешевле официальной цены (разбор источников дешёвого API). Подозревать подмену стоит там, где сервис не может объяснить происхождение низкой цены.
2. Чек-лист ручной проверки — бесплатно, 5 шагов
Первичную проверку можно сделать без всяких инструментов:
① Сверьте цену. Сравните цену модели с рыночным минимумом (в наших таблицах есть множители к официальной цене) и посмотрите, объясняет ли сервис источник канала. Сильно ниже рынка + без объяснений = главный сигнал риска. Этот шаг самый дешёвый и самый информативный.
② Фиксированный набор вопросов. Подготовьте несколько знакомых вам сложных задач и прогоните их через доверенный канал и через проверяемый: сравните стиль, глубину рассуждений, детальность.
③ Тест длинного контекста. Отправьте длинный текст и в конце спросите деталь, которая была только в начале — обрезанный контекст сразу видно.
④ Тест возможностей версии. Задайте задачу, которую новая версия решает, а старая/дешёвая — нет: соответствуют ли способности заявленной версии.
⑤ Повторите в разное время. Не тестируйте один раз — меняйте время суток и сеть, чтобы поймать периодическую подмену.
Ограничение ручного метода: вы видите только «похоже / не похоже». Отпечатки на уровне тарификации и статистики вывода вручную не проверить — это субъективно и обманываемо.
① Сверьте цену. Сравните цену модели с рыночным минимумом (в наших таблицах есть множители к официальной цене) и посмотрите, объясняет ли сервис источник канала. Сильно ниже рынка + без объяснений = главный сигнал риска. Этот шаг самый дешёвый и самый информативный.
② Фиксированный набор вопросов. Подготовьте несколько знакомых вам сложных задач и прогоните их через доверенный канал и через проверяемый: сравните стиль, глубину рассуждений, детальность.
③ Тест длинного контекста. Отправьте длинный текст и в конце спросите деталь, которая была только в начале — обрезанный контекст сразу видно.
④ Тест возможностей версии. Задайте задачу, которую новая версия решает, а старая/дешёвая — нет: соответствуют ли способности заявленной версии.
⑤ Повторите в разное время. Не тестируйте один раз — меняйте время суток и сеть, чтобы поймать периодическую подмену.
Ограничение ручного метода: вы видите только «похоже / не похоже». Отпечатки на уровне тарификации и статистики вывода вручную не проверить — это субъективно и обманываемо.
3. Что проверяем мы
Для сервисов из рейтинга мы прогоняем программные проверки по их API: служебные поля и поведение протокола, статистические отпечатки токенизатора, соответствие заявленной версии — измеримые признаки, которые сложнее подделать, чем «стиль ответа». Результат — в колонке «Проверка модели» рейтинга: пройдена / под вопросом / не пройдена / нет данных.
Как читать результат: разовая проверка шумная — «не пройдена» означает серьёзное подозрение, а не приговор; «нет данных» значит только то, что проверка ещё не проводилась. Подробнее — в методологии.
Как читать результат: разовая проверка шумная — «не пройдена» означает серьёзное подозрение, а не приговор; «нет данных» значит только то, что проверка ещё не проводилась. Подробнее — в методологии.
4. Подмена подтвердилась — что делать
• Не пополняйте этот сервис больше, особенно крупными суммами;
• Переходите на сервис среднего ценового сегмента со стабильными результатами проверок — экономия на канале, происхождение которого не объясняют, не окупает потерь;
• Сравнить цены и посмотреть статусы проверок можно в рейтинге; как выбирать без потерь — в гайде по выбору.
• Переходите на сервис среднего ценового сегмента со стабильными результатами проверок — экономия на канале, происхождение которого не объясняют, не окупает потерь;
• Сравнить цены и посмотреть статусы проверок можно в рейтинге; как выбирать без потерь — в гайде по выбору.