Логотип
Талант без гения ненамного возвышается над уровнем голой виртуозности (Г. Гегель).

У США самые дорогие и производительные модели в мире. Проблема в том, что у Китая они почти такие же хорошие и намного дешевле

У США самые дорогие и производительные модели в мире. Проблема в том, что у Китая они почти такие же хорошие и намного дешевле

Несколько недель назад был выпущен DeepSeek V4-Flash, а на этой неделе мы стали свидетелями появления еще двух впечатляющих моделей: Qwen3.8-Flash и GLM-5.3-Flash. Все они отличаются тем, что они хорошие, красивые и, прежде всего, дешевые. Раньше китайские модели с открытым весом были привлекательны только своей ценой, но теперь они достигли чего-то умопомрачительного: они почти так же хороши, как более продвинутые модели Frontier от OpenAI и Anthropic. Берегись.

Китай давит. OpenAI, Anthropic и (на данный момент) Google обычно остаются главными действующими лицами, когда речь заходит о пограничных моделях с самой высокой производительностью, но китайские компании начинают конкурировать по другому показателю, который может оказаться не менее важным: сколько интеллекта получает человек за каждый потраченный доллар. Последние выпуски Alibaba, Z.ai и DeepSeek демонстрируют очень похожую стратегию: максимально приблизиться к лучшим западным моделям, одновременно снижая стоимость их использования до уровня, который почти невозможно игнорировать.

Qwen3.8-Вспышка, наглядный пример. Alibaba представляет это как предварительный просмотр будущей архитектуры Qwen4: модель MoE (Mixture-of-Experts) со 125 миллиардами параметров, в которой только около 6 миллиардов активны в каждый момент времени. Компания утверждает, что конкурирует с гораздо более крупными моделями в области программирования и агентских задач, но делает это с помощью API, который стоит всего 0,16 / 0,47 доллара за миллион токенов ввода / вывода. Это смехотворная цена, если сравнивать ее с конкурентами, и эффективность здесь — это то, что составляет основу архитектуры, которая угрожает архитектуре моделей OpenAI и Anthropic.

По цене/характеристикам никто не сравнится с GLM-5.3-Flash прямо сейчас. GPT5.6 Moon неплохо справляется, но, если можно так выразиться, более «тупой». Источник: Искусственный анализ.

 

Читать  Утечка кода Claude Code используется для распространения вредоносного ПО через GitHub

Но дело в том, что GLM-5.3-Flash так же хорош или лучше. В наши дни мы знаем его как Ox Alpha, таинственную модель, о которой все говорили, и которая, как оказалось, была этой новой моделью Z.ai . У него 320 миллиардов параметров, хотя он активирует только 18 миллиардов на токен. Кроме того, у него есть миллион токенов, и они уже опубликовали свои открытые песо с лицензией MIT. Artificial Analysis дает ему 57 баллов по индексу интеллекта, что очень близко к 60 у GLM-5.3 Max, но его средняя стоимость задания составляет 0,09 доллара по сравнению с 0,68 доллара у его старшего брата. Разница в интеллекте небольшая, в цене — огромная.

Вопрос, который становится все более важным. DeepSeek и открытые модели китайских компаний в последние месяцы постоянно задают один и тот же вопрос: насколько мы можем удешевить один ИИ, прежде чем он перестанет иметь смысл платить за другой? В DeepSeek V4-Flash 0,22/0,66 доллара за миллион токенов ввода-вывода (после повышения цен) уже были тревожным сигналом. Возможно, это была не самая умная модель на рынке, но она была намного дешевле, чем GPT-5.6 Sol (4/20) или Claude Fable 5 (10/50).

GLM-5.3-Flash (57 баллов), Qwen3.9 Flash Next (56) и DeepSeek v4 Flash (51) очень и очень близки к Opus 5 (63), самой «умной» модели на сегодняшний день. И им это удается по цене, которая в 100 раз ниже. Источник: Искусственный анализ.

 

Независимость от Запада. Китайские компании выясняют, как спроектировать свои модели, чтобы они становились все более эффективными и, следовательно, дешевыми. Такие методы, как Mixture of Experts (для активации лишь небольшой части общих параметров), разреженный или линейный подход, позволяющий избежать ненужной обработки всего контекста, меньшие кэши и архитектуры, оптимизированные для обслуживания огромного количества токенов, все чаще оказываются успешными. впечатляющие вехи.

Читать  ИИ ускоряет проведение кибератак. Готова ли ваша сеть?

Жетоны в тутиплен. В случае с GLM-5.3-Flash есть и еще один поразительный признак: инфраструктура. Ox Alpha предлагалась бесплатно с заявленной мощностью до 100 триллионов токенов в день, и Z.ai теперь он подтвердил, что полностью работает на китайских чипах. SemiAnalysis добавляет, что эта инфраструктура достигла аппаратной эффективности и стоимости за токен, сопоставимых с таковыми у графических процессоров Nvidia. 100 триллионов токенов в день были заявленной пропускной способностью, а не фактическим трафиком, но все это показывает, в какой степени Китай начинает создавать не только конкурентоспособные модели, но и внутреннюю инфраструктуру, необходимую для их обслуживания в больших масштабах.

Граница Парето. В последнее время специалисты по искусственному анализу особо выделяют график, который они называют «Индекс интеллекта против. Стоимость задачи индекса интеллекта». По оси X* — стоимость за задачу. В И, насколько «умна» модель. Там GLM-5.3-Flash нарушает показатели, и именно он лучше всего преодолевает так называемую границу Парето. Модель особенно привлекательна, когда вы не можете получить гораздо больше мощностей, не заплатив при этом значительно больше, и и GLM, и Qwen успешно преодолевают этот рубеж. Конечно, они не самые лучшие, но сколько вы готовы заплатить, чтобы получить на 5 или 10% больше «интеллекта»?

Достаточно хорошие модели. Для пользователей и особенно компаний, которым необходимо решать миллионы запросов, планировать относительно рутинные задачи или развертывать сотни агентов, нет необходимости использовать GPT-5.6 Sol или Claude Fable 5. Вам нужна достаточно хорошая, надежная и дешевая модель. Мы уже видели нечто подобное в других случаях в технологической отрасли: технически лучший продукт мог доминировать в сегменте high-end, но достаточно хороший продукт — это тот, которому удается захватить большую часть рынка благодаря своей цене и доступности.

Читать  Oracle сокращает сотрудников из-за роста затрат на искусственный интеллект

Если вы нашли ошибку, пожалуйста, выделите фрагмент текста и нажмите Ctrl+Enter.

Редактор: AndreyEx

Рейтинг: 5 (1 голос)
Если статья понравилась, то поделитесь ей в социальных сетях:

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

пять × 5 =

Это может быть вам интересно


Спасибо!

Теперь редакторы в курсе.

Прокрутить страницу до начала