За пять дней три ведущих китайских AI-лаборатории сделали ходы, которые на поверхности противоречат друг другу. DeepSeek поднял API-цены на отдельных тирах до ~1100%. Alibaba открыла веса флагмана на 2.4T параметров, который раньше не выпускала. Zhipu выкатила GLM-5.3 и подняла coding-бенчмарки примерно в 6x на той же базовой модели — без повторного претрейна. Разбор для разработчиков и закупщиков: таймлайн, тарифная сетка, три стратегии, head-to-head, спорные тезисы и FAQ. Общий сигнал: китайские лаборатории уходят от конкуренции только ценой к конкуренции ценовой властью.
Типичная ошибка — принимать ~1100% за весь инвойс. Сначала даты, затем отдельно держать ось биллинга, тип лицензии и источник бенчмарка.
| Дата | Событие |
|---|---|
| 16 июля 2026 | Moonshot AI открывает веса Kimi K3 (2.8T параметров), что вызывает проверку со стороны US security |
| 2–3 августа 2026 | Alibaba анонсирует, затем запускает Qwen3.8-Max как hosted API |
| 10 августа 2026 | Meta выпускает Muse Glimmer (30B, Apache 2.0) и дразнит открытыми весами флагмана Muse Spark 1.2 |
| 12 августа 2026 | Alibaba публикует открытые веса Qwen3.8-2.4T-A95B на Hugging Face / ModelScope; xAI выкатывает Grok 4.6 |
| 13 августа 2026 | DeepSeek-V4-Pro выходит в GA и объявляет повышение цен с 17 августа; Google выпускает уценённый Gemini 3.7 Flash |
| 14 августа 2026 | Zhipu выпускает GLM-5.3, переиспользуя базу 743B от GLM-5.2 |
| 17 августа 2026, 00:00 по пекинскому времени | Новые тарифы DeepSeek вступают в силу |
Шире: 30 июля OpenAI срезала цены на самый дешёвый тир (GPT-5.6 Luna, −80%), а 6–7 августа сделала Luna бесплатным дефолтом с безлимитными текстовыми чатами. Пока китайские лаборатории поднимали цены и открывали веса флагманов, американские резали цены и уходили в бесплатный consumer-слой — синхронно. Это две стороны одной ценовой войны.
Считать ~1100% всей суммой счёта. Цифра относится к кэш-хит input в пике — тиру, который раньше был ближе всего к нулю.
Игнорировать пекинские пиковые окна. Пик: 9–12 и 14–18 по пекинскому времени. Анонс явно просит сдвинуть нагрузку.
Называть любой открытый чекпоинт Apache 2.0. Qwen3.8-Max идёт под кастомной лицензией. Muse Glimmer — другая ставка.
Повторять слух о geo-ban. В опубликованной лицензии нет территориальной оговорки USA / EU / UK / Korea.
Читать GLM-5.3 как новую foundation-модель. Та же база 743B, что у 5.2. Скачок — масштаб RL на пост-тренинге.
Считать китайскую модель автоматически самой дешёвой. DeepSeek вне пика всё ещё дешевле Claude Opus 5. Luna и международный Qwen уже бьют DeepSeek.
Цены ниже — из официального анонса DeepSeek, сверка с Wall Street CN, IT Home и V2EX. Скоры GLM — собственные цифры Zhipu. Независимого стороннего рерана пока нет.
Вступает в силу 17 августа 2026, 00:00 по пекинскому времени. Пик: 9–12 и 14–18 по пекинскому времени. Единица: за 1M токенов.
| Позиция биллинга | Старая цена | Новая вне пика | Новая пиковая | Рост в пике |
|---|---|---|---|---|
| V4-Flash кэш-хит (input) | ¥0.02 | ¥0.05 | ¥0.10 | ~400% |
| V4-Flash кэш-мисс (input) | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash output | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro кэш-хит (input) | ¥0.025 | ¥0.15 | ¥0.30 | ~1100% |
| V4-Pro кэш-мисс (input) | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro output | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
Контекст: Заголовочные ~1100% относятся к кэш-хит input в пике. Output, который доминирует в большинстве реальных счетов, вырос на 350%. Независимое моделирование тяжёлой нагрузки (примерно 84M токенов/месяц, в основном вне пика, половина кэш-хитов) даёт рост счёта ближе к 1.8x.
| Спецификация | Деталь |
|---|---|
| Параметры | 2.4T всего, 95B активных на токен (MoE, 512 experts, 10 routed + 1 shared) |
| Контекстное окно | 262,144 токена нативно (открытый чекпоинт), расширяется до ~1.01M; hosted Max по умолчанию 1M |
| Каденция релиза | Preview 2 августа → API 3 августа → открытые веса 12 августа |
| API-тариф (international) | $2/M input, $6/M output |
| Лицензия | Не Apache 2.0 — кастомная Qwen3.8-Max License |
| Почему это важно | Впервые Alibaba открыла веса Max-флагмана; Qwen3.5 / 3.6 / 3.7 Max оставались API-only |
| Бенчмарк | GLM-5.2 | GLM-5.3 | Изменение |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 pts |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 pts |
| Agents' Last Exam (CLI) | 23.8% | 28.5% | +4.7 pts |
| CyberGym | 77.2% | 84.5% | +7.3 pts |
| AutomationBench | 26.2% | 48.2% | +22.0 pts |
Оговорка: Это собственные цифры Zhipu. На Terminal-Bench 3.0 GLM-5.3 всё ещё позади GPT-5.6 Sol (34.6%) и Claude Fable 5 (33.7%). Топ среди open-weight, не безусловная победа на frontier.
Три лаборатории. Три партии. Вопрос под ними один: когда usage растёт быстрее GPU, а отдача претрейна схлопывается, у кого остаётся ценовая власть.
Самое дешёвое чтение: «самая дешёвая китайская модель наконец сдалась маржинальному давлению». Структура тарифа читается наоборот: компания делает compute-ограничения явными в прайсе. Плоская всегда-дешёвая цена работала как инструмент привлечения, пока GPU-ёмкость успевала. Когда usage вырос экспоненциально, а ёмкость — нет, что-то должно было стать явным. «Поощрять более гибкое планирование нагрузки» — корпоративный язык для «пиковый compute дефицитен, сдвиньте нагрузку сами».
Деталь, которую международное покрытие почти пропустило: в пике официальный API DeepSeek теперь дороже ряда сторонних реселлеров (GMI Cloud, Novita и другие сейчас ставят V4 Pro ниже нового пикового тарифа DeepSeek). Допущение, что официальный API всегда самый дешёвый способ гонять DeepSeek, сломано впервые.
Alibaba сделала два хода сразу. Выложила полный чекпоинт на 2.4T параметров в свободную загрузку и навесила кастомную лицензию — не permissive Apache 2.0 младших Qwen. Любой бизнес Model-as-a-Service или AI Work Assistant с выручкой свыше $50M за любой 12-месячный период обязан отдельно согласовать коммерческую лицензию. Продукты с 100M MAU или $20M месячной выручки должны заметно указывать имя модели.
Отдать веса, чтобы забрать mindshare разработчиков, особенно международный. Удержать ценовой рычаг над горсткой компаний, которые могут поверх этого собрать конкурирующий inference-бизнес. Это принципиально другая ставка, чем Muse Glimmer у Meta, который идёт под неограниченным Apache 2.0.
Слух закрыть: Утверждения, что лицензия Alibaba запрещает загрузки из США, ЕС, Великобритании и Южной Кореи, ложны. В опубликованном тексте нет географической или территориальной оговорки. Смотреть файл LICENSE, не тред анонса.
Самый интересный факт — метод: та же база 743B параметров, что у GLM-5.2, без повторного претрейна, и скачок примерно 6x на Terminal-Bench 3.0 (4.6% → 28.3%) за счёт масштабирования RL-окружений на пост-тренинге. Когда законы масштабирования претрейна дают убывающую отдачу, масштаб RL на пост-тренинге становится независимым рычагом качества с куда более низким полом затрат, чем переобучение новой foundation-модели. Лаборатории среднего эшелона без compute-бюджета уровня OpenAI всё ещё могут закрывать разрыв на агентных и coding-бенчмарках.
Китайские AI-лаборатории уходят от конкуренции только ценой к конкуренции самой ценовой властью.
Конвертация RMB–USD около ¥7.15/$1, ориентир. При расхождении побеждают официальные анонсы.
| Модель | Input (за 1M токенов) | Output (за 1M токенов) | Открытые веса? |
|---|---|---|---|
| DeepSeek V4-Pro (пик) | ¥9.0 (~$1.26) | ¥27.0 (~$3.78) | Нет |
| DeepSeek V4-Pro (вне пика) | ¥4.5 (~$0.63) | ¥13.5 (~$1.89) | Нет |
| Qwen3.8-Max (international API) | $2.00 | $6.00 | Да (кастомная лицензия) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | Нет |
| Claude Opus 5 (implied, по сравнительному коэффициенту Alibaba) | ~$5.00 | ~$25.00 | Нет |
Короткий ответ: нет. Внепиковый тариф DeepSeek V4-Pro всё ещё заметно ниже Claude Opus 5, но это уже не безусловно самый дешёвый вариант. Международный тариф Qwen3.8-Max и Luna от OpenAI бьют внепиковую ставку DeepSeek. «Китайская модель = самая дешёвая модель» держалось большую часть 2025 и начало 2026. Это больше не безопасное допущение.
Разрезать инвойс на три колонки. Кэш-хит input, кэш-мисс input и output. Не бюджетировать по одному заголовку ~1100%.
Наложить джобы на пекинский пик. 9–12 и 14–18 по пекинскому времени биллятся как peak. Что можно — в остальные 17 часов.
Измерить долю кэш-хитов. Модельная тяжёлая нагрузка (~84M токенов/месяц, в основном вне пика, половина хитов) даёт около 1.8x, не 12x.
Сравнить официальный пик с реселлерами. GMI Cloud и Novita сейчас ставят V4 Pro ниже нового пика DeepSeek. Официальный канал больше не автоматически самый дешёвый.
Прочитать LICENSE до коммерческого использования. Пороги Qwen: $50M выручки MaaS / AI Work Assistant и 100M MAU либо $20M месячной выручки для атрибуции. Geo-ban нет.
Принять GLM-5.3 как рычаг пост-тренинга. Официальный Terminal-Bench 3.0: 28.3% против 4.6%. Всё ещё позади Sol 34.6% и Fable 5 на 33.7%. Валидировать на этой базе.
# DeepSeek V4-Pro output (за 1M токенов, официальная карта) Старый flat: ¥6.0 Новый вне пика: ¥13.5 (+125% vs old; половина пика) Новый пик: ¥27.0 (+350% vs old) # Три вопроса до цитаты заголовка 1) Кэш-хит input, кэш-мисс input или output? 2) Пик или вне пика? 3) Какова реальная доля кэш-хитов?
Примерно за последний месяц ведущие китайские лаборатории выдавали крупные релизы в темпе, который внутренняя финансовая пресса уже называет «три обновления модели в неделю» (一周三更) — DeepSeek, Alibaba и Zhipu, плюс Kimi K3 от Moonshot (открытые веса 16 июля, 2.8T параметров) и MiniMax H3. Китайское покрытие в целом ставит рамку так: китайские open-weight релизы принуждают отрасль к глобальному пересмотру цен на ИИ.
Американские лаборатории на consumer-слое играют противоположную партию: OpenAI срезала на 80% самый дешёвый тир (30 июля), затем через неделю сделала эту модель бесплатной и безлимитной (6–7 августа); Google выпустила coding-модель за половину цены трёхнедельного предшественника (13 августа). Китайские лаборатории открывают веса флагманов и вводят ступенчатый, более высокий прайс на compute-дефицитном верхнем конце. Американские бегут к бесплатному и дешёвому на потребительском конце.
Есть и геополитический слой, который стоит называть аккуратно. Открытие весов Kimi K3 у Moonshot в июле уже вызвало проверку US security. То, что Alibaba выбрала именно это окно, чтобы открыть флагман 2.4T, часть аналитиков читает как ход закрепить международный mindshare и нарратив «технологического паритета» до возможного ужесточения регулирования. Это обоснованная интерпретация, не подтверждённый факт — и её легко пропустить, если читать только англоязычные product-посты.
Источники: официальный прайс-анонс DeepSeek, сверка с Wall Street CN, IT Home, AIGC.cn и V2EX; официальные репозитории Qwen Alibaba (Hugging Face / ModelScope) и South China Morning Post по условиям лицензии; техническая страница GLM-5.3 Zhipu (Z.ai), плюс VentureBeat и StableLearn; официальный блог Meta AI Research; китайские финансовые издания (Yicai, Sohu Finance) по темпу релизов. Перед перепечаткой сверять актуальные официальные тарифы и лицензию. Детали, помеченные выше как unverified, независимо не подтверждены.
Пиковый / внепиковый API-биллинг делает always-on flagship-инференс дороже и хуже прогнозируемым. Селфхост MoE на 2.4T — задача датацентра, не ноутбука. Реселлеры могут срезать пик, но посадка прод-агентов, Xcode-сборок и длинных сессий в общую inference-очередь оставляет слабую изоляцию. Для более стабильного продакшена под iOS CI/CD и автоматизацию AI-агентов облачная аренда Mac Mini у NodeMini обычно подходит лучше — выделенный Apple Silicon, биллинг на уровне ноды, без борьбы за те же пекинские пиковые часы в том же GPU-инвойсе.
Тариф вне пика по-прежнему ниже Claude Opus 5, но это уже не самый дешёвый вариант в целом. GPT-5.6 Luna от OpenAI ($0.20/$1.20 за миллион токенов) и международный тариф Qwen3.8-Max от Alibaba ($2/$6) теперь бьют новые внепиковые ставки DeepSeek хотя бы по одной оси. Если coding-агентов нужно снять с общей пиковой очереди, сравните цены аренды Mac Mini.
Да, в большинстве сценариев. Личные проекты и внутренняя корпоративная эксплуатация не затронуты. Ограничение срабатывает только если вы ведёте бизнес Model-as-a-Service или AI Work Assistant с выручкой свыше $50M за любой непрерывный 12-месячный период.
Нет. Этот тезис гулял в сети, но он ложный. В опубликованной лицензии нет географических ограничений. Ограничения завязаны на выручку, а не на то, где находитесь вы или ваши пользователи.
На уровне базовой модели — ничем. Обе используют одну и ту же foundation-модель на 743B параметров. Прирост (примерно 6x на Terminal-Bench 3.0) целиком даёт масштабирование reinforcement learning на этапе пост-тренинга.
Пока нет. Muse Glimmer — дистиллированная 30B-модель, не настоящий флагман Meta. Марк Цукерберг заявил, что открытые веса Muse Spark 1.2 появятся скоро. На момент публикации этого релиза не было. Заметки по изоляции и доступу — в справочном центре.