Разрыв в миллиард долларов между открытым и платным ИИ схлопывается: Qwen выпустила 3.8 Flash Next

Спустя всего несколько дней после релиза новая модель Qwen3.8-Flash-Next уже обходит некоторые из лучших открытых ИИ-систем — и, возможно, даже DeepSeek 4 Pr...

Aravana··1 мин

Спустя всего несколько дней после релиза новая модель Qwen3.8-Flash-Next уже обходит некоторые из лучших открытых ИИ-систем — и, возможно, даже DeepSeek 4 Pro, модель значительно крупнее её по размеру. В новом выпуске канала Two Minute Papers ведущий Карой Жолнаи-Фехер разобрал, что стоит за этим скачком.

В линейке Qwen3.8 теперь три модели: огромная Max, плотная 27B, для запуска которой хватает мощного ноутбука или десктопа, и новая Flash Next — модель среднего размера, но устроенная принципиально иначе. Это mixture-of-experts архитектура: для обработки каждого токена задействуется лишь небольшая часть модели, зато требования смещаются в сторону большого объёма памяти при более медленной пропускной способности — то есть системы вроде Nvidia DGX Spark подходят ей идеально. Жолнаи-Фехер тестировал модель сразу на двух Spark и в первый же день получил около 38 токенов в секунду — по его словам, весьма достойный результат.

Автор выделяет три ключевых новшества Flash Next. Первое — Qwen sparse attention (QSA). Обычное полное внимание имеет квадратичную сложность: удвоение контекста означает примерно четырёхкратный рост вычислений. DeepSeek пытался решить эту проблему с помощью DSA, отбирающего отдельные важные токены. QSA идёт дальше — группирует токены в небольшие блоки и ищет только среди них, что делает работу с растущим контекстом ещё дешевле.

Второе новшество — gated residual. Обычно слои модели переписывают одну и ту же промежуточную информацию о токене поверх друг друга. Flash Next вместо этого использует не одну, а четыре ветви, так что часть информации может оставаться нетронутой, пока меняется остальное.

Третье — ngram embedding. Короткие сочетания токенов вроде "hot dog" по смыслу сильно отличаются от суммы отдельных слов "hot" и "dog". Qwen группирует такие сочетания в отдельную память для быстрого и дешёвого поиска — это вариация подхода, который уже применяет DeepSeek. Разница в том, что DeepSeek распределяет эту память по нескольким слоям, а Qwen концентрирует её в одном большом слое ближе к началу сети.

Вместе эти три решения дают систему, которая уже сейчас конкурирует с куда более крупными открытыми моделями — и всё это доступно бесплатно, без подписки, в виде открытых весов, которые можно скачать и запускать самостоятельно. На сегодня видео на канале Two Minute Papers набрало 108 046 просмотров, 1988 лайков и 188 комментариев.

Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.

Тип материала: Пост из Telegram

Поделиться:TelegramXLinkedIn
Как вам материал?

Хотите получать подобные материалы раньше?

Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.

Узнать про Intelligence

Не пропускайте важное

Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.

Похожие материалы

Anthropic представила Claude Fable 5.1 для сложных многоэтапных задач

Anthropic представила Claude Fable 5.1 для сложных многоэтапных задач

Anthropic выпустила Claude Fable 5.1 — обновление своего наиболее производительного класса моделей, рассчитанное на сложную и продолжительную работу. В качес...

·1 мин
GPT-6 Astra решила головоломку DEF CON с официальной подсказкой

GPT-6 Astra решила головоломку DEF CON с официальной подсказкой

В опубликованном OpenAI фрагменте Бен Дэвис рассказал, как проверил GPT-6 Astra на сложных головоломках с DEF CON. Некоторые из этих заданий он и его друзья ...

·1 мин
Питер Гостев: GPT-6 Astra справилась с приложением примерно на 150 тысяч строк без постоянного контроля

Питер Гостев: GPT-6 Astra справилась с приложением примерно на 150 тысяч строк без постоянного контроля

GPT-6 Astra практически без дополнительного вмешательства улучшила приложение примерно на 150 тысяч строк кода, с которым Питеру Гостеву прежде приходилось р...

·1 мин