GLM 5.3 Flash: как «стелс»-модель Ox Alpha оказалась новой нейросетью Z.ai
Пару недель разработчики гадали, что за мощная модель без имени появилась на OpenRouter под кодом Ox Alpha. 26 августа китайская Z.ai раскрыла карты: это GLM 5.3 Flash — первая нативно мультимодальная модель серии GLM-5. Разбираемся, что она умеет, откуда взялась и стоит ли ей доверять свои данные.

Пару недель в чатах разработчиков висел один и тот же вопрос: что за зверь этот Ox Alpha? Модель появилась в каталоге OpenRouter и в опенсорсном агенте OpenCode без единого предупреждения — ни имени команды, ни карточки, ни строчки документации. Просто откуда-то взялась сильная нейросеть, которую вдобавок раздавали бесплатно. Люди гоняли её на своих задачах, кидали друг другу скрины, спорили, кто автор. 26 августа 2026-го интрига закрылась: китайская лаборатория Z.ai вышла и сказала — да, это мы, и зовут модель GLM 5.3 Flash.
История сама по себе забавная, но за ней стоит вещь поинтереснее сплетни про анонимный релиз. Давайте по порядку: что это за «стелс»-запуски, как комьюнити вычислило автора ещё до анонса, что реально умеет GLM 5.3 Flash и, главное, есть ли смысл переключаться на неё в повседневной работе.
Зачем вообще выкатывать модель анонимно
Приём называется «стелс»-релиз, и последний год им особенно увлеклись китайские лаборатории. Схема простая: модель выкладывают на какую-нибудь общую площадку вроде OpenRouter, но без бренда — под нейтральным кодовым именем. Дают доступ, часто бесплатный, и просто смотрят, что будет.
Смысл в том, чтобы получить честную обратную связь. Когда на карточке написано «новая модель от условной большой лаборатории», половина реакции — это ожидания и репутация, а не сама модель. А безымянного «Ox Alpha» никто не боится и никому не должен: разработчики просто берут его в работу, ломают на своих реальных задачах и в тех же чатах пишут, где он хорош, а где сыпется. Для команды это дешёвый способ снять метрики с живого использования до того, как включать пиар-машину.
Ещё один сигнал стоил внимания отдельно. OpenCode рассказывал про запас порядка сотни триллионов токенов в сутки — и всё это раздавалось даром. Так дорого «просто ради тестов» никто не жжёт. Похоже, кто-то сознательно прогонял через модель огромный поток настоящих запросов, а не десяток демо-примеров для красивого анонса.
Как раскусили автора ещё до анонса
Самое интересное, что Z.ai толком не успела удивить. Комьюнити раскусило родословную Ox Alpha задолго до официального признания — и не по красивым догадкам, а по мелким техническим уликам.
Во-первых, токенизатор. То, как модель режет текст на кусочки, — это почти отпечаток пальца семейства. У Ox Alpha он подозрительно совпадал с тем, что уже видели у GLM. Во-вторых, поведение на скользких темах: модель характерно уходила от вопросов про китайскую политику — ровно так, как это делают модели, обученные внутри Китая. Плюс отдельные коды ошибок в API, которые тоже перекликались с известными семействами. По отдельности каждая улика — совпадение, но вместе они складывались в довольно уверенное «это кто-то из китайских фронтир-лабораторий, скорее всего линейка GLM».
Так и вышло. 26 августа Z.ai подтвердила, что Ox Alpha и GLM 5.3 Flash — одна и та же модель, и заодно выложила её веса и бенчмарки.
Что такое GLM 5.3 Flash
Теперь по существу. GLM 5.3 Flash — это, по словам самой Z.ai, первая нативно мультимодальная модель в серии GLM-5. «Нативно» здесь ключевое слово: модель не приклеили к отдельному распознавателю картинок задним числом, а с самого начала учили работать с разными типами данных как с единым потоком.
Под капотом — архитектура Mixture-of-Experts (MoE). Если совсем на пальцах: вместо одной гигантской сети, которая целиком напрягается на каждый запрос, модель разбита на много «экспертов», и на каждый токен включается только небольшая их часть. Формально в GLM 5.3 Flash 320 миллиардов параметров, но активны в любой момент только около 18 миллиардов. За счёт этого модель ведёт себя как крупная и умная, но по стоимости ближе к небольшой. Дополнительно там используется гибридное разрежённо-линейное внимание — механизм, который помогает держать точность на очень длинном контексте, не раздувая счёт за вычисления.
Ключевые характеристики, если свести в один список:
- Контекст — до 1 миллиона токенов. Это буквально целые кодовые базы или толстые документы, загруженные за один заход.
- Максимальный ответ — до 131 072 токенов за раз.
- Вход — текст, изображения и видео.
- Специализация — код и агентные сценарии: многошаговые задачи, где модель сама вызывает инструменты и доводит дело до результата.
- Веса — опубликованы на HuggingFace под лицензией MIT. То есть модель по-настоящему открытая: её можно скачать и запускать у себя.
Последний пункт стоит подчеркнуть. Открытая лицензия MIT — это не «посмотреть и восхититься», а разрешение использовать модель в своих продуктах почти без ограничений. Для фронтир-модели такого уровня это до сих пор редкость.
Насколько она хороша
Цифры Z.ai приводит по своему внутреннему бенчмарку Code Bench v1.0. По нему GLM 5.3 Flash «явно превосходит» предыдущую GLM-5.2 на всех уровнях сложности и «выступает на равных» с Claude Opus 4.8 в программировании и агентных задачах. К внутренним бенчмаркам всегда стоит относиться со здоровым скепсисом — их считает та же команда, что и обучала модель, — но даже с поправкой на это заявка серьёзная. Держаться вровень с Opus 4.8 в коде — это уровень топовых западных моделей, а не «крепкий середняк».
И вот тут вступает вторая половина истории — цена. У провайдера GLM 5.3 Flash стоит откровенно дёшево для такого класса:
| Тип токенов | Цена за 1M |
|---|---|
| Входные | $0,15 |
| Выходные | $0,50 |
| Кэшированные входные | $0,03 |
Для сравнения: сопоставимые по силе западные модели обычно дороже в разы, а то и на порядок. Вот это сочетание — «почти как Opus в коде, но по цене лёгкой модели» — и есть главная причина, почему вокруг Ox Alpha было столько шума ещё до того, как выяснилось, чья она.
В чём подвох
Совсем без нюансов не обходится, и честнее сказать о них сразу.
Первое — приватность. Провайдер, который раздавал модель, сохраняет у себя промпты и ответы. Формально — не для обучения, но факт остаётся фактом: ваши запросы где-то оседают. Для публичных задач это не проблема, а вот рабочие секреты, коммерческую переписку или персональные данные в такую модель лучше не отправлять.
Второе — это всё-таки свежий релиз. Внутренние бенчмарки выглядят красиво, но полную картину дадут только независимые прогоны и месяцы живого использования. Пока модель стоит воспринимать как очень многообещающую, но ещё не обкатанную временем.
GLM 5.3 Flash на MaxGPT
Мы добавили эту модель ещё в её «стелс»-фазе, под именем Ox Alpha, а к официальному релизу обновили — сменили эндпоинт на актуальный, поправили название и цены. Попробовать её можно прямо сейчас: открыть чат с GLM 5.3 Flash. Что важно знать:
- Модель доступна по подписке PRO и работает без VPN, с привычным русскоязычным интерфейсом. Никаких плясок с зарубежными картами и прокси.
- Мы намеренно убрали её из автоподбора. Из-за той самой истории с сохранением запросов на стороне провайдера мы не хотим, чтобы модель молча становилась дефолтной. Пусть GLM 5.3 Flash будет осознанным выбором: вы её включаете, когда понимаете зачем.
По ощущениям это отличный вариант для кода и длинных агентных сценариев, особенно когда нужен большой контекст и не жалко потратить на задачу целую кодовую базу. А ещё это хороший повод сравнить свежую нейросеть Z.ai с привычными GPT, Claude и Gemini прямо в одном окне — на MaxGPT для этого достаточно переключить модель в чате.
Коротко
Ox Alpha оказался не загадочным новичком, а GLM 5.3 Flash — новой мультимодальной моделью Z.ai. Она сильна в коде, держит миллион токенов контекста, стоит копейки по меркам своего класса и выложена под открытой лицензией. Из минусов — провайдер сохраняет запросы, и модель ещё слишком свежая, чтобы судить о ней окончательно. Попробовать точно стоит: на MaxGPT она уже доступна по подписке PRO.
Попробуйте лучшие ИИ-модели на MaxGPT
GPT, Claude, Gemini, GLM и другие нейросети в одном окне — на русском и без VPN.