Бизнес

Архитектура Qwen4 появилась раньше срока: задействуется 6 млрд параметров из 125 млрд

Команда Qwen компании Alibaba выпустила Qwen3.8-Flash-Next — предварительную версию архитектуры с открытыми весами, которую она планирует использовать для Qwen4. Модель насчитывает 125 миллиардов параметров, но при генерации каждого токена активирует только 6 миллиардов. Ее лицензия может не подпадать под исключения для систем с открытым исходным кодом в рамках Закона ЕС об искусственном интеллекте (AI Act).

Архитектура Qwen4 появилась раньше срока: задействуется 6 млрд параметров из 125 млрд

Команда Qwen компании Alibaba опубликовала архитектуру, на базе которой планирует построить Qwen4. Qwen3.8-Flash-Next содержит 125 млрд параметров, но для каждого генерируемого токена задействует лишь 6 млрд.

Основной упор здесь делается на экономичность, а не на возможности. Команда заявляет, что их беспокоит влияние архитектурных решений на счета за инференс в условиях, когда агентные задачи с очень длинным контекстом становятся стандартной рабочей нагрузкой.

В качестве сравнения приводятся показатели их собственной прошлой модели. Qwen3.7-Plus имеет 397 млрд параметров и активирует 17 млрд, то есть новая модель работает примерно на трети от объема активных вычислений предшественницы.

Три из четырех изменений вполне традиционны. Новая схема разреженного внимания (sparse attention) работает с микроблоками вместо выбора отдельных токенов, механизм шлюзованных остаточных связей (gated residual mechanism) контролирует передачу данных между слоями, а методология обучения полностью отказывается от разогрева размера батча (batch-size warmup).

Четвертое изменение выглядит необычно. Вместо добавления экспертов модель подключает 51 млрд параметров в качестве отдельного эмбеддинга, индексируемого по двух- и трехсимвольным фрагментам. По утверждению команды, это требует меньше вычислений и упрощает выгрузку на ускорители с ограниченным объемом памяти.

Эту последнюю фразу стоит прочитать дважды. Проектирование с расчетом на ускорители с дефицитом памяти — это то, чем приходится заниматься, когда у вас нет возможности купить лучшие чипы. Именно в таком положении из-за экспортных ограничений оказались китайские лаборатории.

Цифры, которыми все это подкрепляется, предоставлены самой Alibaba. Издание TNW отмечало в этом месяце, что компания назвала Qwen3.8 второй лучшей моделью в мире, не представив никаких доказательств, и эти баллы также получены с помощью внутренних тестов команды.

Некоторые решения озвучены с необычной откровенностью. В карточке модели указано, что ее результат в тесте Humanity’s Last Exam оценивался с помощью GPT-4o, а не собственным оценщиком бенчмарка, что скорее является раскрытием информации, чем проявлением нейтральности.

Вопросы у Европы вызывает лицензия. Весы размещены на платформе Hugging Face под лицензией qwen-community, и 7 августа TNW сообщило, что Alibaba намерена взимать плату с крупнейших коммерческих пользователей.

Закон об ИИ рассматривает это различие как ключевое. Статья 53(2) отменяет две обязанности по ведению документации для моделей под бесплатной лицензией с открытым исходным кодом, а преамбула (Recital) 103 гласит, что компоненты, предоставляемые за плату или монетизируемые иным образом, не должны получать такое освобождение от требований.

Европейские компании не ждут окончательного ответа. Thomson Reuters построила свою модель на базе Qwen, и любой, кто поступает так же, автоматически берет на себя все последствия, к которым в итоге приведет лицензия.

Опубликовано 26 августа 2026 - 12:55 Наверх