Как запустить DiffusionGemma на своём компьютере
Первая диффузионная языковая модель от Google DeepMind -- в 4 раза быстрее обычных LLM, поддерживает 256K контекст и запускается локально
Что это и для кого
DiffusionGemma -- это принципиально новая языковая модель от Google DeepMind, выпущенная 10 июня 2026 года под лицензией Apache 2.0. В отличие от всех известных LLM, которые генерируют текст пошагово -- токен за токеном слева направо, -- DiffusionGemma использует диффузионный подход: модель начинает с «облака» случайных заполнителей и постепенно итерационно улучшает их, сходясь к высококачественному тексту за несколько проходов. Это та же идея, которую Stable Diffusion применяет для генерации изображений, но теперь перенесённая на генерацию текста.
Результат впечатляет: DiffusionGemma 26B генерирует текст в 4 раза быстрее, чем сопоставимые авторегрессионные модели на том же железе. На одном NVIDIA H100 модель выдаёт более 1000 токенов в секунду, а на RTX 5090 -- более 700. Это означает, что длинные задачи (суммаризация документа на 100+ страниц, написание большого отчёта, многошаговые рассуждения) выполняются значительно быстрее, чем в любом другом опенсорс-инструменте для локального запуска.
Модель построена на архитектуре Mixture of Experts (MoE) с 26 миллиардами параметров (точно 25.2B), из которых при каждом запросе активируется только около 4 миллиардов. Благодаря этому квантизованная версия умещается примерно в 18 ГБ видеопамяти -- то есть доступна на видеокартах класса RTX 3090, 4090 и аналогичных потребительских GPU. DiffusionGemma поддерживает контекстное окно 256 000 токенов (одно из самых больших среди локальных моделей), понимает текст, изображения и видео в качестве входных данных, работает на более чем 140 языках, включая русский.
Кому подойдёт этот инструмент? Прежде всего -- разработчикам и технически грамотным пользователям, которые уже работали с Ollama, LM Studio или vLLM и хотят попробовать нечто принципиально новое по архитектуре. Также он интересен исследователям и аналитикам, которым регулярно нужна обработка огромных документов в приватной локальной среде. Наконец, DiffusionGemma отлично подходит разработчикам приложений, которые ищут мощный бесплатный движок под коммерческой лицензией без ограничений. Если у вас есть подходящий GPU и базовые навыки работы с командной строкой, этот инструмент определённо стоит попробовать.
Важная оговорка: DiffusionGemma -- это экспериментальная модель, ориентированная прежде всего на скорость и работу с длинными контекстами. В задачах, требующих тонких рассуждений, ролевого диалога или сложной инструкции, она пока уступает лучшим закрытым моделям. Это инструмент для конкретных сценариев, а не универсальный чат-бот на замену Claude или ChatGPT.
Как установить и запустить
Для запуска DiffusionGemma вам понадобится видеокарта с не менее 18 ГБ видеопамяти в режиме 4-bit квантизации. Подходят RTX 3090, RTX 4090, A6000, а также серверные GPU класса H100. Для полной точности (bf16) понадобится 48+ ГБ VRAM. На Mac с чипами Apple M3 Ultra или M4 Max/Ultra также возможен запуск через объединённую память при наличии не менее 36 ГБ RAM -- через фреймворк MLX. Без подходящего GPU или большого объёма памяти модель будет работать слишком медленно для реального использования.
Способ 1: NVIDIA RTX AI Garage (самый простой). Зайдите на сайт NVIDIA и скачайте NVIDIA RTX AI Garage для вашей операционной системы (Windows или Linux). Запустите установщик и дождитесь завершения. В каталоге моделей найдите DiffusionGemma 26B-A4B-IT и нажмите Download -- модель весит около 18 ГБ. После загрузки нажмите Run. У вас откроется локальный чат-интерфейс с готовой к работе моделью без какой-либо ручной настройки Python-окружения.
Способ 2: через vLLM (рекомендуется для разработчиков). Сначала установите Python 3.11 или новее и создайте виртуальное окружение. Затем выполните команду: pip install vllm huggingface_hub. Скачайте модель с Hugging Face: huggingface-cli download google/diffusion-gemma-26b-a4b-it --local-dir ./diffusiongemma. Для скачивания нужно принять лицензионное соглашение на странице модели на Hugging Face (достаточно бесплатного аккаунта). После этого запустите сервер: vllm serve ./diffusiongemma --diffusion-mode. Сервер поднимется на порту 8000 и будет совместим с OpenAI API -- вы сможете подключить к нему любое приложение, которое работает с OpenAI-клиентом, просто изменив base_url на http://localhost:8000/v1.
Способ 3: через Hugging Face Transformers напрямую. Установите зависимости: pip install transformers torch accelerate. Загрузите модель через Python: from transformers import AutoModelForCausalLM, AutoTokenizer. Затем: model = AutoModelForCausalLM.from_pretrained('google/diffusion-gemma-26b-a4b-it', torch_dtype='auto', device_map='auto'). Важно: DiffusionGemma требует специального диффузионного сэмплера -- стандартные параметры temperature и top_p без диффузионного режима не дадут правильного результата. Обязательно следуйте официальному руководству от Google на ai.google.dev/gemma/docs/diffusiongemma, где описаны нужные параметры генерации.
Поддержка llama.cpp для DiffusionGemma на момент написания находится в разработке (соответствующий pull request открыт). Ollama также пока не поддерживает диффузионный режим для этой модели. Если вам нужен привычный интерфейс Ollama или LM Studio -- подождите несколько недель или выберите один из описанных выше способов. Для Open WebUI можно подключить vLLM-бэкенд через кастомный OpenAI API endpoint.
Первый запуск -- что попробовать
После того как модель запущена, начните с простых задач, чтобы сразу почувствовать её скорость и характер. Попросите DiffusionGemma написать подробное объяснение технической темы -- например: «Объясни разницу между авторегрессионными и диффузионными языковыми моделями» или «Напиши подробное руководство по настройке PostgreSQL для высоких нагрузок». Вы сразу заметите, что текст появляется иначе, чем у обычных LLM: модель не «печатает» токены последовательно, а сначала набрасывает «черновик», который за несколько итераций быстро уточняется и финализируется в качественный ответ.
Второй отличный тест -- работа с очень длинным документом. Загрузите PDF или вставьте большой текст (DiffusionGemma поддерживает до 256К токенов -- это примерно 200 000 слов или небольшая книга). Попросите сделать подробную суммаризацию, выделить ключевые тезисы или ответить на конкретные вопросы по содержанию. Именно в этом сценарии DiffusionGemma особенно сильна: скорость обработки огромных контекстов ощутимо превосходит конкурирующие локальные модели.
Если вы запустили модель через vLLM, попробуйте интегрировать её в привычные инструменты. Open WebUI подключается к vLLM-серверу через настройки OpenAI API: укажите Base URL как http://localhost:8000/v1 и model ID как diffusion-gemma-26b-a4b-it. Расширение Continue для VS Code и Cursor позволяют использовать DiffusionGemma как локальный AI-ассистент для кода. Это даёт полноценный локальный аналог платных API с сохранением приватности данных.
Обязательно попробуйте многоязычные задачи. DiffusionGemma обучена на 140+ языках и показывает заметно лучшее качество русскоязычного текста, чем большинство западных опенсорс-моделей сопоставимого размера. Попробуйте написать деловое письмо, технический перевод или научный текст на русском -- результат приятно удивит.
Для тестирования мультимодальных возможностей передайте модели изображение (схему, диаграмму, скриншот кода) вместе с вопросом. Например: «Что изображено на этой архитектурной схеме и какие потенциальные проблемы ты видишь?» Это работает через API с параметром images в формате base64 или по URL.
Ключевые фишки
Диффузионная генерация -- главное структурное преимущество DiffusionGemma. Вместо последовательной генерации токен за токеном модель обрабатывает весь выходной буфер одновременно за несколько итераций уточнения. Это даёт 4-кратный прирост скорости по сравнению с эквивалентными авторегрессионными моделями. На практике: страница связного текста появляется за секунды, а не за полминуты.
Mixture of Experts: при 26B суммарных параметрах (точно 25.2B) при каждом запросе активируются только около 4B. Модель автоматически «выбирает» наиболее релевантных экспертов для каждого токена. Это сочетает качество большой модели с вычислительной эффективностью маленькой -- что особенно важно при локальном запуске на потребительском железе.
Гигантское контекстное окно в 256 000 токенов является одним из самых больших среди моделей, доступных для локального запуска. Большинство других локальных моделей ограничены 8К-32К токенами. DiffusionGemma позволяет обрабатывать целые книги, большие кодовые базы или многочасовые транскрипты в рамках одного запроса без необходимости разбивать текст на части.
Нативная мультимодальность: модель понимает текст, изображения и видео в качестве входных данных. Хотите проанализировать скриншот, техническую диаграмму или кадры из видео -- DiffusionGemma справляется без дополнительных инструментов. Это редкость среди открытых локальных моделей.
Apache 2.0 лицензия означает полную свободу: коммерческие проекты, модификация, дистрибуция -- без ограничений и роялти. Вы можете встроить DiffusionGemma в своё коммерческое приложение, создать на её основе сервис и распространять его. Это существенное отличие от закрытых API, где использование в коммерческих продуктах требует отдельных договорённостей.
Поддержка 140+ языков, включая все основные европейские, азиатские и редкие языки -- существенно выше, чем у большинства западных опенсорс-альтернатив. Русскоязычный текст DiffusionGemma обрабатывает и генерирует заметно лучше, чем такие модели, как Llama 4 Scout или Mistral 3 сопоставимого размера.
Цены и ограничения
DiffusionGemma полностью бесплатна для скачивания и использования: лицензия Apache 2.0 не накладывает ограничений ни на личное, ни на коммерческое применение. Единственные расходы -- ваше собственное железо. Видеокарта с 18+ ГБ видеопамяти (на момент написания это RTX 3090 или RTX 4090) стоит от 50 000 до 200 000 рублей в зависимости от модели и рынка. Если подходящего GPU нет, можно арендовать облачный GPU: RTX 4090 на Vast.ai или RunPod обходится примерно в 0,30-0,80 USD в час -- итого несколько десятков рублей за час работы с моделью.
Для тех, кто не хочет разворачивать инфраструктуру самостоятельно, DiffusionGemma доступна через Google AI Studio API. На момент написания в AI Studio действует бесплатный уровень с ограниченным числом запросов в минуту -- актуальные лимиты уточняйте на aistudio.google.com, так как они периодически меняются. Платный уровень через Google AI Studio открывает более высокие лимиты и приоритетный доступ.
Из технических ограничений важно учитывать следующее. Во-первых, модель требует специального диффузионного сэмплера -- не всё программное обеспечение поддерживает это нативно. Во-вторых, llama.cpp и Ollama пока не поддерживают DiffusionGemma (поддержка в разработке). В-третьих, по качеству связного диалога и сложных рассуждений модель уступает лучшим закрытым системам -- Claude Opus 4.8, GPT-5.5 Pro. Её конкурентное преимущество -- скорость на длинных контекстах, а не качество тонких рассуждений. В-четвёртых, мультимодальные возможности (видео, изображения) в режиме локального запуска требуют дополнительной настройки -- по умолчанию работает только текстовый режим.
Нужен ли VPN из России
Для скачивания модели с Hugging Face VPN, как правило, не требуется -- сайт в основном доступен из России. Однако при скачивании файлов весом 18+ ГБ в некоторых российских сетях могут возникать сбои соединения, особенно в корпоративных окружениях. В таком случае VPN с европейскими или американскими серверами стабилизирует соединение. Используйте команду huggingface-cli download с флагом --resume-download для возобновления прерванной загрузки.
Google AI Studio (aistudio.google.com) официально недоступен в России без VPN. Для доступа к веб-интерфейсу и API AI Studio выбирайте VPN-серверы в США или ЕС. После получения API-ключа в AI Studio все последующие запросы к API можно делать с VPN или без него -- зависит от того, не блокирует ли ваша сеть запросы к серверам Google.
NVIDIA RTX AI Garage скачивается с сайта NVIDIA (nvidia.com), который работает в России без ограничений. Если вы используете корпоративную сеть, уточните у системного администратора возможность загрузки крупных файлов с внешних ресурсов. После установки и загрузки модели NVIDIA RTX AI Garage работает полностью локально и не требует интернет-соединения или VPN для использования.
Для локального запуска через vLLM или Transformers -- после успешного скачивания модели VPN не нужен. Модель работает полностью офлайн, ваши данные не покидают устройство. Это одно из ключевых преимуществ локального запуска для пользователей, работающих с конфиденциальной информацией.
Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.
Хотите получать подобные материалы раньше?
Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.
Узнать про IntelligenceНе пропускайте важное
Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.
Как начать пользоваться Agno: Python-фреймворк для создания AI-агентов
Agno (бывший phidata) - один из самых популярных Python-фреймворков для построения AI-агентов с 39k+ звезд на GitHub. Пошаговый гайд: установка, первый агент за 5 минут, мультиагентные команды и деплой в продакшн.
Seedance 2.5: как начать пользоваться генератором видео от ByteDance
Seedance 2.5 от ByteDance генерирует нативное 30-секундное видео в один проход, принимает до 50 мультимодальных референсов и позволяет редактировать отдельные фрагменты без перегенерации всего клипа.
ChatGPT Work: как начать пользоваться агентным рабочим столом OpenAI
9 июля 2026 OpenAI запустила ChatGPT Work -- агента, который берёт у вас целый проект, сам планирует шаги, работает часами в фоне и возвращает готовый документ, таблицу или презентацию.