Poolside Laguna XS 2.1: как запустить локальную AI-модель для кода

Poolside Laguna XS 2.1 -- открытая Apache 2.0 модель на 33B параметров для агентного программирования. Работает на Ollama, бесплатна, показывает 44.5% на SWE-bench Pro. Идеальна для кодирования на мощном ноутбуке или рабочей станции.

·7 мин

Что это и для кого

Poolside Laguna XS 2.1 -- это открытая языковая модель американской компании Poolside, специально оптимизированная для задач программирования и агентного кодирования. Модель выпущена под лицензией OpenMDW-1.1, что означает: вы можете использовать её бесплатно, в том числе в коммерческих проектах, и весь сгенерированный ею код принадлежит вам без каких-либо ограничений со стороны Poolside.

Что делает Laguna XS 2.1 примечательной на фоне других открытых моделей? Poolside -- компания, специально построенная под задачи программирования. В отличие от универсальных LLM, которые обучаются на широком корпусе текстов и кода, Poolside сконцентрировалась исключительно на software engineering: их модели обучены на более чем 30 триллионах токенов, преимущественно связанных с кодом, инструментами разработки и агентными сценариями. Компания была основана выходцами из Google DeepMind и Meta AI, и с момента основания привлекла более $1 миллиарда финансирования.

Laguna XS 2.1 вышла 2 июля 2026 года как обновление XS.2. Оригинальная XS.2 показала 44.5% на SWE-bench Pro -- ведущем бенчмарке для оценки способности AI-моделей решать реальные программные задачи на GitHub. Для ориентира: первые облачные модели уровня GPT-4 показывали около 12-15% на аналогичных задачах в 2023 году. Достичь 44.5% при полностью локальном запуске -- серьёзный результат для открытой модели. Кроме того, XS.2 показала 30.1% на Terminal-Bench 2.0 -- бенчмарке для агентных задач в терминале.

Модель использует архитектуру Mixture-of-Experts (MoE): 33 миллиарда параметров всего, но при каждом запросе активируется только около 3 миллиардов. Это даёт качество мышления 33B-модели при скорости, близкой к 3B-модели. Laguna XS 2.1 запускается на железе, которое формально предназначено для моделей в 10 раз меньшего размера, и при этом показывает конкурентные результаты на кодовых задачах.

Для кого эта модель наиболее полезна:

  • Разработчики, которые ценят приватность кода. Весь вывод обрабатывается локально -- ничего не отправляется в облако. Для работы с закрытыми корпоративными репозиториями или проприетарным кодом это принципиально важно.
  • Те, кто хочет мощную coding-модель без ежемесячной подписки. Laguna XS 2.1 бесплатна по OpenMDW-1.1. Никаких токен-квот при локальном использовании, никаких ограничений на количество запросов в день.
  • Разработчики на M5 MacBook Pro и мощных рабочих станциях. Модель оптимизирована под MacBook с Apple Silicon M5 Max (36 ГБ unified memory) и GPU с 40+ ГБ VRAM.
  • Те, кто строит локальные AI-агенты для кода. Laguna XS 2.1 имеет 131K-токенный контекст и оптимизирована для многошаговых агентных задач -- идеальна как основа для Cline, OpenHands или самописных агентов.
  • Команды в регионах с ограниченным доступом к западным сервисам. Полностью локальная модель не зависит от доступности OpenAI, Anthropic или других зарубежных API и работает при любых условиях подключения.
  • Важное уточнение: Laguna XS 2.1 -- это не готовое приложение с графическим интерфейсом, а языковая модель, которую нужно запустить через Ollama или mlx-lm. Этот инструмент рассчитан на технически грамотных пользователей, знакомых с командной строкой. Если хотите более простой вариант -- воспользуйтесь Open WebUI поверх Ollama (отдельный гайд есть на сайте).

    Как зарегистрироваться / установить

    Регистрация нигде не требуется -- модель полностью открыта и доступна для скачивания без аккаунта. Установка через Ollama занимает несколько минут плюс время на скачивание около 20 ГБ весов.

    Шаг 1. Проверьте требования к железу. Laguna XS 2.1 -- MoE-модель с 33B параметров. Для комфортной работы (5+ токенов в секунду) потребуется:

    • Mac с Apple Silicon: M5 Max с 36 ГБ unified memory -- рекомендуемый минимум. M5 Pro с 24 ГБ может работать в режиме сниженного квантования (Q2/Q3).
    • GPU NVIDIA: RTX 6000 Ada (48 ГБ), A100 (80 ГБ), H100 или аналоги с 40+ ГБ VRAM. Возможна работа на двух картах по 24 ГБ с sharding через Ollama.
    • CPU + RAM (медленный режим): 64+ ГБ оперативной памяти и NVMe SSD. Скорость 0.5-2 токена в секунду -- подходит для пакетной обработки, но не для интерактивной работы.
    • Шаг 2. Установите Ollama.

      • macOS: скачайте .dmg с ollama.com и перетащите в Applications, или через Homebrew: brew install ollama
      • Linux: выполните в терминале: curl -fsSL https://ollama.com/install.sh | sh
      • Windows: скачайте установщик с ollama.com (требуется Windows 10 или новее).
      • Шаг 3. Запустите Ollama-сервер. На macOS Ollama запускается как background-сервис автоматически. На Linux запустите вручную: ollama serve или настройте systemd:

        sudo systemctl enable ollama
        sudo systemctl start ollama

        Шаг 4. Скачайте и запустите модель. В новом окне терминала:

        ollama run poolside/laguna-xs-2.1

        Ollama автоматически скачает оптимально квантованную версию модели с Hugging Face. После завершения загрузки откроется интерактивный чат в терминале. Типичная скорость загрузки -- 15-45 минут в зависимости от скорости интернета.

        Шаг 5 (опционально). Максимальная скорость на Apple Silicon через mlx-lm. MLX-фреймворк от Apple использует Neural Engine и обеспечивает более высокую скорость генерации на M-чипах по сравнению со стандартным Ollama:

        pip install mlx-lm
        mlx_lm.generate --model poolside/Laguna-XS-2.1 --max-tokens 512 --prompt 'Review this Python function for bugs:'

        Первый запуск -- что попробовать

        После запуска через Ollama (ollama run poolside/laguna-xs-2.1) вы окажетесь в интерактивном чате в терминале. Попробуйте несколько типовых задач для первого знакомства с возможностями модели.

        Сценарий 1: Анализ кода. Скопируйте фрагмент своего кода прямо в чат и попросите: «Найди потенциальные проблемы в этом коде и предложи конкретные исправления». Laguna XS 2.1 анализирует не только синтаксис, но и семантику: обнаруживает утечки памяти, неэффективные алгоритмы, потенциальные состояния гонки в асинхронном коде. В отличие от поверхностных линтеров, модель объясняет, почему конкретный паттерн является проблемой и как его исправить.

        Сценарий 2: Написание тестов. «Напиши pytest-тесты для этой функции, включая edge-кейсы». Модель генерирует осмысленные тест-кейсы с разнообразными входными данными -- не просто шаблонный код с очевидными проверками, а реальные граничные условия.

        Сценарий 3: Документация. «Напиши подробные docstrings для этого модуля в формате Google/NumPy». Laguna XS 2.1 понимает структуру кода и генерирует точные описания параметров, возвращаемых значений и возможных исключений.

        Интеграция с Cline в VS Code. Установите расширение Cline из VS Code Marketplace. В настройках Cline выберите «OpenAI Compatible» как провайдер, укажите Base URL: http://localhost:11434/v1 и Model: poolside/laguna-xs-2.1. Теперь Cline использует Laguna XS 2.1 для всех агентных задач в редакторе -- с полным доступом к файловой системе, терминалу и браузеру, при этом всё остаётся локальным.

        Использование через Open WebUI. Open WebUI (отдельный гайд на сайте) автоматически обнаруживает Laguna XS 2.1 в Ollama и добавляет её в список доступных моделей. Поддерживает загрузку файлов, историю разговоров и несколько одновременных сессий.

        API для собственных скриптов. Ollama поднимает совместимый с OpenAI API на http://localhost:11434/v1. Любая библиотека, работающая с OpenAI (openai-python, LangChain, LlamaIndex), работает и с Laguna XS 2.1 через простую замену base_url -- без изменения остального кода.

        Ключевые фишки

        MoE-архитектура: мощность 33B, скорость 3B. Из 33 миллиардов параметров при каждом шаге генерации активируется лишь около 3 миллиардов. Это принципиально снижает требования к VRAM и ускоряет вывод без существенной потери качества рассуждений. Laguna XS 2.1 нередко работает быстрее, чем многие полноразмерные 13B-модели с плотной архитектурой.

        Sliding Window Attention с per-head gating. 30 из 40 слоёв используют скользящее внимание с адаптивными воротами. Модель не тратит одинаковое внимание на все токены контекста, а концентрируется на наиболее релевантных. Результат -- 131K контекст без экспоненциального роста вычислений при увеличении размера входа.

        131K токенов контекста. Длинный контекст позволяет передавать в модель целые файлы, историю агентных шагов и документацию одновременно. Для агентного кодирования, где агент должен помнить десятки предыдущих действий и текущее состояние проекта, это принципиально важно.

        OpenMDW-1.1 -- никаких ограничений использования. В отличие от Llama-4 (ограничения для компаний с 700M+ MAU) или других условно-открытых моделей, OpenMDW-1.1 разрешает всё: коммерческое использование, встраивание в продукты, fine-tuning без уведомления разработчика.

        Нулевая переменная стоимость. При локальном запуске стоимость генерации равна стоимости электричества. Для интенсивных сценариев (агент, делающий сотни запросов в день) отсутствие платы за токены даёт предсказуемые и низкие операционные затраты.

        Цены и ограничения

        Локальный запуск -- полностью бесплатно. Веса модели доступны на Hugging Face (poolside/Laguna-XS-2.1) под OpenMDW-1.1. Скачайте один раз -- используйте без ограничений и без интернета.

        Облачный API. На момент запуска XS.2 Poolside предоставляла бесплатный API-доступ через OpenRouter. Для XS 2.1 условия могут отличаться -- проверяйте актуальные тарифы на openrouter.ai и poolside.ai.

        Ограничения, о которых стоит знать:

        • Высокие требования к железу. Минимум 36 ГБ unified memory (Apple M5 Max) или 40+ ГБ GPU VRAM. На обычных ноутбуках модель не запустится или будет работать слишком медленно.
        • Узкая специализация на коде. Для написания текстов, анализа документов или общих знаний лучше подходят универсальные модели.
        • Нет интерфейса из коробки. Требуется Ollama или mlx-lm; для GUI нужен Open WebUI или IDE-интеграция через Cline или Continue.dev.
        • XS.2 снята с API с 9 июля 2026 года. Актуальная версия -- XS 2.1. При работе через OpenRouter убедитесь, что используете правильную версию.
        • Нужен ли VPN из России

          Нет. Laguna XS 2.1 распространяется через Hugging Face, доступный из России без VPN. Скачать веса модели можно напрямую командой ollama pull poolside/laguna-xs-2.1 или через huggingface-cli. Ollama, mlx-lm и Open WebUI также не имеют региональных ограничений доступа.

          Поскольку работа модели полностью локальна -- после скачивания никаких запросов к серверам Poolside не происходит. Это делает Laguna XS 2.1 независимой от блокировок и санкционных ограничений: один раз скачали, и пользуйтесь хоть без интернета. Для корпоративного использования в России это особенно ценно.

          Практические нюансы для российских пользователей:

          • Скорость скачивания. Модель весит около 20 ГБ в квантованном Q4-формате. При соединении 100 Мбит/с -- около 30 минут.
          • Облачный API через OpenRouter доступен из России без VPN, но для оплаты нужна иностранная карта (Visa/Mastercard международного выпуска).
          • Сайт poolside.ai и документация открываются из России без ограничений.
          • Итог: Laguna XS 2.1 -- один из лучших вариантов среди открытых coding-моделей для российских разработчиков. Не требует VPN, не требует подписки, не отправляет код за рубеж. Главный барьер -- требования к железу: нужен MacBook с M5 Max или мощная GPU-рабочая станция.

            SWE-bench Multilingual: 63.1%. Помимо результатов на SWE-bench Pro, Laguna XS 2.1 показала 63.1% на бенчмарке SWE-bench Multilingual - тесте, оценивающем способность модели решать задачи программирования на нескольких языках (Python, JavaScript, TypeScript, Java и другие). Это один из лучших показателей среди открытых моделей на момент выхода.

            Доступ через OpenRouter. Для тех, у кого нет подходящего железа для локального запуска, Laguna XS 2.1 доступна через облачный API на OpenRouter. На момент написания стоимость составляет $0.10 за млн входных токенов, $0.20 за млн выходных токенов и $0.05 за млн кешированных токенов. Это делает модель доступной для тестирования без необходимости скачивать 20 ГБ весов.

            Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.

            DFlash Speculator Models: удвоение скорости токенов при локальном запуске. Вместе с релизом XS 2.1 Poolside выпустила набор DFlash speculator models – специализированных моделей-спекуляторов, разработанных для ускорения вывода при локальном запуске. Технология speculative decoding позволяет генерировать несколько токенов за один проход: основная модель проверяет кандидатов, предложенных спекулятором, а не генерирует каждый токен последовательно. На практике это означает удвоение скорости генерации токенов без потери качества ответов. DFlash speculator models доступны в том же репозитории Hugging Face и подключаются через параметры конфигурации в llama.cpp и Ollama.

            XS.2 отключён на официальном API с 9 июля 2026 года. Если вы использовали Laguna XS.2 через облачный API Poolside или OpenRouter, обратите внимание: доступ к оригинальной версии XS.2 прекращён 9 июля 2026 года. Для продолжения работы через API необходимо перейти на XS 2.1. Локальные веса XS.2, скачанные ранее, по-прежнему работают без ограничений – Poolside не контролирует локально запущенные копии. Для новых установок используйте только XS 2.1.

            Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.

            Поделиться:TelegramXLinkedIn
            Как вам материал?

            Хотите получать подобные материалы раньше?

            Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.

            Узнать про Intelligence

            Не пропускайте важное

            Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.

            Похожие материалы

            Как начать пользоваться Agno: Python-фреймворк для создания AI-агентов

            Agno (бывший phidata) - один из самых популярных Python-фреймворков для построения AI-агентов с 39k+ звезд на GitHub. Пошаговый гайд: установка, первый агент за 5 минут, мультиагентные команды и деплой в продакшн.

            ·8 мин

            Seedance 2.5: как начать пользоваться генератором видео от ByteDance

            Seedance 2.5 от ByteDance генерирует нативное 30-секундное видео в один проход, принимает до 50 мультимодальных референсов и позволяет редактировать отдельные фрагменты без перегенерации всего клипа.

            ·7 мин

            ChatGPT Work: как начать пользоваться агентным рабочим столом OpenAI

            9 июля 2026 OpenAI запустила ChatGPT Work -- агента, который берёт у вас целый проект, сам планирует шаги, работает часами в фоне и возвращает готовый документ, таблицу или презентацию.

            ·8 мин