Как запустить Mistral 3 на своём компьютере: установка через Ollama

Mistral 3 -- семейство из 10 открытых моделей от французской компании Mistral AI: от 3B до 675B параметров, поддержка 40+ языков, зрение в каждой модели. Всё это бесплатно и можно запустить локально.

·7 мин

Mistral Vibe Agent (июль 2026): Mistral объединил все агентные возможности в единый Vibe Agent -- один агент для длительных многошаговых задач. Доступен через le.chat.mistral.ai.

Mistral Les Ulis -- новый дата-центр (анонс июль 2026): Mistral AI открывает собственный вычислительный центр Les Ulis мощностью 10 МВт в Q3 2026 во Франции.

Mistral 3: как запустить семейство моделей на своем компьютере

Полное руководство: Mistral 3 локально

Mistral 3 (Mistral AI, декабрь 2025) - 7B параметров с улучшенным multimodal режимом (текст + изображения) и reasoning capabilities. Контекстное окно 128K токенов. Лицензия Apache 2.0 - полностью коммерческое использование. Ollama: ollama pull mistral3:7b. VRAM: 6 ГБ в fp16 или 4 ГБ в Q4_K_M.

Multimodal режим Mistral 3: передавайте изображения через base64 или URL в API запросах. Пример через Ollama: messages с role 'user' и content как массив [{type: 'image_url', image_url: {url: 'data:image/jpeg;base64,...'}}, {type: 'text', text: 'Что на изображении?'}]. Качество visual reasoning сопоставимо с LLaVA при меньшем размере.

Reasoning в Mistral 3: цепочки рассуждений (chain-of-thought) активируются через системный промпт 'Think step by step' или через explicit /think тег в запросе. Mistral Magistral - специализированная версия для задач требующих глубокого рассуждения, доступна через API Mistral AI.

Производительность Mistral 3 7B: RTX 4060 Ti 16GB - 35-45 токен/с в fp16; RTX 3060 12GB - 20-30 токен/с в fp16; Apple M3 16GB - 25-35 токен/с через MLX; CPU Intel i9 32GB RAM - 3-8 токен/с через llama.cpp. Рекомендуемый вариант для большинства: Q8_0 GGUF через LM Studio.

Что такое Mistral 3

Mistral 3 - семейство открытых языковых моделей французской компании Mistral AI. В 2026 году линейка получила значительные обновления: мультимодальность для всех размеров, удвоенное контекстное окно, режимы рассуждения и нативная поддержка 40+ языков. Модели оптимизированы для запуска на потребительском оборудовании - от телефонов до рабочих станций.

Состав семейства Mistral 3

Mistral Large 3: флагманская модель архитектуры MoE с 41 миллиардом активных параметров из пула в 675 миллиардов. Обрабатывает текст и изображения, контекстное окно 256 000 токенов. Для локального запуска требует многопроцессорный GPU-кластер или профессиональные GPU с большим VRAM.

Ministral 3 серия: три размера - 3B, 8B и 14B параметров. Каждый доступен в вариантах base, instruct и reasoning. Все варианты поддерживают понимание изображений. Оптимальный выбор для большинства пользователей с потребительским оборудованием.

Mistral Small 4 (март 2026): единая модель на 119 миллиардов параметров с активацией 24 миллиардов параметров на один шаг инференса. Объединяет следование инструкциям, глубокое рассуждение, понимание изображений и написание кода в одной компактной модели.

Mistral Small 3.2 -- новейшая модель семейства, выпущенная в июне 2025 года. Это улучшенная версия Mistral Small с оптимизированным следованием инструкциям, поддержкой function calling и улучшенными мультиязычными возможностями. Доступна через Ollama: ollama pull mistral-small:3.2 и через официальный API Mistral AI.

Важно: Mistral Small 3.2 завершит работу 30 июня 2026 года и будет переведена в deprecated-статус. Для новых проектов рекомендуется использовать Mistral Small 4 (ollama pull mistral-small4), которая является актуальным преемником. Если у вас уже есть код с ollama pull mistral-small:3.2 -- обновите его до ollama pull mistral-small4 до 30 июня 2026 года.

Требования к оборудованию

Ministral 3B: минимум 6 ГБ VRAM или RAM. Работает на большинстве современных ноутбуков с дискретной или интегрированной графикой (включая Apple Silicon).

Ministral 8B: от 10 ГБ VRAM/RAM. Оптимально на GPU с 12+ ГБ или Apple Silicon M2/M3.

Ministral 14B: от 18 ГБ VRAM/RAM. Требует GPU с 24 ГБ VRAM или Apple Silicon с 24+ ГБ unified memory.

Mistral Small 4: требует профессиональный GPU класса NVIDIA A100 или несколько потребительских GPU.

Запуск через Ollama (самый простой способ)

Шаг 1: Установите Ollama. Для macOS: скачайте с ollama.com/download и запустите установщик. Для Linux: curl -fsSL https://ollama.com/install.sh | sh. Для Windows: скачайте .exe установщик с сайта.

Шаг 2: Загрузите нужную модель. Для Ministral 8B instruct: ollama pull mistral:8b-instruct. Для Ministral 3B (самый легкий вариант): ollama pull mistral:3b.

Шаг 3: Запустите чат: ollama run mistral:8b-instruct. Модель загружается в память и начинает отвечать на запросы в терминале.

Шаг 4: Для использования через API запустите сервер: ollama serve. Теперь модель доступна по адресу http://localhost:11434 с OpenAI-совместимым API.

Запуск через vLLM 0.20+ (для серверного использования)

Установка: pip install vllm==0.20. Запуск сервера: python -m vllm.entrypoints.openai.api_server --model mistralai/Mistral-3-8B-Instruct --port 8000. vLLM 0.20+ обеспечивает высокопроизводительный инференс с поддержкой батчевой обработки - идеально для API-сервера под нагрузкой.

Multimodal использование

Все модели Mistral 3 поддерживают изображения. Через Ollama: при запуске модели можно передавать изображения вместе с текстовым запросом. Через API: используйте формат messages с вложением image_url в content.

Режим рассуждения: добавьте /think в начало запроса для активации расширенного пошагового рассуждения. Модель покажет внутренний ход мыслей перед финальным ответом.

Использование официального API

Для доступа к более мощным моделям без локального запуска: зарегистрируйтесь на console.mistral.ai. Mistral La Plateforme предоставляет API с оплатой по использованию. Документация доступна на docs.mistral.ai на английском языке.

Mistral Medium 3.5 -- frontier agentic модель

Mistral Medium 3.5 -- frontier agentic модель (июнь 2026): Это модель frontier-класса от Mistral AI, ориентированная на агентные задачи. Важно: Mistral Medium 3.5 является API-only моделью -- она не доступна для локального запуска через Ollama или другие локальные инструменты. Для аgentic многошаговых задач (Work mode) рекомендуется использовать через официальный Mistral API. Архитектура Dense с полными 141B параметрами -- для локального запуска требовалось бы 80+ ГБ VRAM. Для локального использования на обычном компьютере выбирайте модели из семейства Ministral (3B, 8B, 14B).

Контекст релизов: Mistral Small 3.2 вышла в июне 2025 года и стала значительным обновлением Small-серии. В июне 2026 года, к годовщине Small 3.2, Mistral AI выпустила Mistral Medium 3.5 -- модель frontier-класса для агентных задач. Таким образом, обе модели связаны с июнем, но разных годов: Small 3.2 (2025) и Medium 3.5 (2026).

Для локального запуска Medium 3.5 требуется серверное оборудование (80+ ГБ VRAM). Большинству пользователей рекомендуется использовать через официальный API: pip install mistralai и ключ с console.mistral.ai.

from mistralai import Mistral client = Mistral(api_key='YOUR_KEY') response = client.chat.complete(model='mistral-medium-3.5', messages=[{'role': 'user', 'content': 'Твой запрос'}]) print(response.choices[0].message.content)

Voxtral -- Text-to-Speech от Mistral

Voxtral -- открытая (open-weight) модель синтеза речи (TTS) от Mistral AI, выпущенная в 2026 году. Это первый шаг Mistral в сторону голосовых возможностей с открытыми весами. Voxtral отличается натуральным звучанием и поддержкой многоязычного синтеза, включая русский язык. Веса модели доступны на Hugging Face.

Доступна через Mistral API: endpoint /v1/audio/speech. Пример использования через Python:

response = client.audio.speech.create(model='voxtral', input='Привет, это тест синтеза речи', voice='nova') with open('output.mp3', 'wb') as f: f.write(response.content)

Voxtral доступна через API и через открытые веса на Hugging Face. На момент написания наиболее удобный способ использования -- через Mistral API, поскольку локальный запуск требует дополнительной настройки инференс-фреймворка для TTS-моделей.

MCP Connectors в Mistral Studio (июнь 2026)

В июне 2026 Mistral добавил в Mistral Studio поддержку MCP (Model Context Protocol) Connectors. Это позволяет моделям Mistral напрямую подключаться к внешним инструментам: файловой системе, базам данных, браузеру, GitHub и другим MCP-совместимым источникам.

Настройка MCP в Mistral Studio: перейдите в le.chat.mistral.ai -- Settings -- Integrations -- добавьте MCP-совместимый endpoint. Модели Mistral Small 4, Medium 3.5 и Large 3 поддерживают MCP в агентном режиме.

Для разработчиков: интеграция MCP через API доступна в параметре tools при запросах к mistral-small-4 и выше. Это открывает возможности для создания агентов, работающих с реальными данными в реальном времени.

Mistral Small 4 -- локальный запуск

Mistral Small 4 -- гибридная модель (март 2026) с 119B параметрами (24B активных на токен). Мультимодальная (текст + изображения), контекст 256K токенов. Для локального запуска нужна следующая конфигурация:

  • Минимально: несколько GPU с 40+ ГБ суммарного VRAM (например, 2x RTX 4090)
  • Рекомендуется: NVIDIA A100 40GB или H100 для комфортной работы
  • Apple Silicon: MacBook Pro M2/M3 Ultra с 192+ ГБ unified memory

Загрузка через Ollama (после добавления модели в библиотеку): ollama pull mistral-small4. Либо через vLLM: vllm serve mistralai/Mistral-Small-4-Instruct --port 8000

Для компактного локального использования на обычных компьютерах по-прежнему лучше всего подходит Ministral 8B: отличная производительность при 10-12 ГБ VRAM.

Обновления Mistral Studio (июнь 2026): Добавлена поддержка Connectors и MCP API: теперь Mistral Studio может подключаться к внешним инструментам и агентным пайплайнам через стандартный протокол MCP. Это открывает возможности для автоматизации задач с локальными моделями.

Mistral Medium 3.5 -- новый флагман для облака и локального запуска (май 2026). Mistral AI выпустила Mistral Medium 3.5 (128B параметров, плотная архитектура) 2 мая 2026 года. Это первая унифицированная модель Mistral, объединяющая следование инструкциям, рассуждение и программирование в одних весах. SWE-Bench Verified: 77,6% (превосходит Sonnet 4.5). Настраиваемое усилие рассуждения per request. Для локального запуска: требует минимум 4 GPU с достаточным объёмом VRAM -- это уровень серверного оборудования. Доступна на Hugging Face и через Ollama: ollama pull mistral-medium-3.5. Для домашних компьютеров Mistral 3 (7B, описана в этом руководстве) и Ministral 8B остаются оптимальным выбором -- запускаются на RTX 3080/4080 и MacBook Pro с 32 ГБ памяти. Medium 3.5 -- это вариант для тех, у кого есть A100/H100 или мощный multi-GPU кластер.

Локальные модели Mistral: что выбрать по характеристикам железа

В июне 2026 года семейство Mistral значительно расширилось. Вот актуальная карта выбора в зависимости от вашего оборудования:

Ноутбуки и обычные ПК (8-16 ГБ RAM/VRAM):

  • Mistral 3 (7B) -- лучший выбор для большинства пользователей. Требует 4-6 ГБ VRAM (Q4_K_M через Ollama). Быстрая генерация, хорошее качество для чата, кода и анализа текста. Команда: ollama run mistral3.
  • Ministral 3B -- если нужна максимальная скорость или очень ограниченные ресурсы. Помещается в 3-4 ГБ VRAM.

Рабочие станции (24-48 ГБ VRAM или 32+ ГБ RAM):

  • Mistral Small 3.1 (22B) -- оптимальный выбор для рабочих станций. Обеспечивает заметно более высокое качество при разумных требованиях. Через Ollama: ollama run mistral-small:3.1. Через LM Studio: найдите Mistral-Small-3.1-Instruct-GGUF в каталоге.
  • Mistral Small 4 (119B, 24B активных) -- если есть 2+ GPU или Apple Silicon Ultra с 192 ГБ. Флагман для локального использования на профессиональном оборудовании.

Серверное оборудование (64+ ГБ VRAM):

  • Mistral Medium 3.5 (128B) -- см. отдельный раздел ниже.

Mistral Medium 3.5 локально: требования и команды

Mistral Medium 3.5 (выпущена в мае 2026 года) -- это мощная модель с 128 миллиардами параметров и плотной архитектурой (не MoE). Для локального запуска требования существенно выше, чем у остальных моделей семейства:

Минимальная конфигурация: 64 ГБ VRAM + совместимый GPU (например, 2x NVIDIA A100 40GB или 1x H100 80GB). Скорость генерации на минимальной конфигурации -- около 10-20 токенов/с.

Рекомендуемая конфигурация: 80+ ГБ VRAM (H100 80GB или A100 80GB). Скорость 30-50 токенов/с.

Apple Silicon: MacBook Pro M2/M3 Ultra с 192 ГБ unified memory. На этой конфигурации Mistral Medium 3.5 запускается через llama.cpp с Metal, скорость около 5-10 токенов/с из-за bandwidth ограничений.

Запуск через Ollama (если модель добавлена в библиотеку):

ollama run mistral-medium:128b

Альтернативно через vLLM для серверного использования:

vllm serve mistralai/Mistral-Medium-3.5-Instruct \
  --tensor-parallel-size 2 --port 8000

Через LM Studio: найдите Mistral-Medium-3.5-Instruct-GGUF в каталоге или добавьте модель вручную, указав URL репозитория на Hugging Face.

Когда использовать локальный Mistral, а когда -- облако

Выбор между локальным и облачным запуском зависит от задачи, конфиденциальности данных и имеющегося оборудования.

Используйте локальный Mistral, если:

  • Вы обрабатываете конфиденциальные данные (медицинские записи, юридические документы, финансовые отчёты), которые нельзя отправлять на внешние серверы.
  • Вы делаете много коротких запросов -- локальная модель быстрее для задач типа «переформулируй это предложение» или «проверь синтаксис кода».
  • У вас нет стабильного интернета или вы работаете офлайн.
  • Вы разрабатываете и тестируете приложение с AI -- локальная модель позволяет итерировать быстро без затрат на API.

Используйте облачный Mistral (API), если:

  • Вам нужны модели Mistral Medium 3.5, Mistral Large 3 или Mistral Magistral -- их локальный запуск требует серверного оборудования.
  • Вы работаете с длинными документами (100K+ токенов) -- облако справляется лучше из-за большего контекстного окна и скорости.
  • Задачи нерегулярные -- платить за API дешевле, чем держать мощный GPU круглосуточно.
  • Нужны самые последние обновления модели без скачивания новых весов.

Для регистрации и получения API-ключа Mistral: console.mistral.ai. Тарификация по токенам, есть бесплатный tier с ограниченным количеством запросов.

Семейство Mistral в июне 2026: обзор

В июне 2026 года семейство Mistral значительно расширилось. Краткий обзор для понимания контекста:

  • Mistral 3 (7B) -- лучший выбор для локального запуска на потребительском железе. Команда: ollama run mistral3. Требует 4-6 ГБ VRAM.
  • Mistral Medium 3.5 (128B Dense) -- флагман для облачного API. 77,6% на SWE-bench Verified -- лучше Claude Sonnet 4.5. Требует серверное оборудование (64+ ГБ VRAM).
  • Mistral Small 3.2 -- обновление Small-серии, доступно через официальный API Mistral AI.
  • Mistral Magistral -- специализированная reasoning-модель для задач, требующих пошагового рассуждения. Доступна через облачный API. Аналог o3/R1, но от Mistral.

Для домашних компьютеров: новые модели (Medium 3.5, Magistral) требуют облачного API или серьёзного сервера. Mistral 3 (7B) и Ministral 8B по-прежнему оптимальны для локального запуска.

GGUF-фиксы и Ministral варианты

Команда Mistral выпустила исправленные GGUF-файлы для Mistral 3, устраняющие проблему с артефактами в длинных контекстах. Если вы загружали модель до июня 2026, рекомендуется перезагрузить квантизованные веса через `ollama pull mistral3:latest` для получения исправленной версии.

Для задач, где важна компактность, доступны Ministral варианты - облегчённые версии Mistral 3 с меньшим числом параметров. Ministral 3B подходит для быстрых ответов на слабом железе, Ministral 7B - оптимальный баланс качества и скорости. Запуск: `ollama pull ministral:3b` или `ollama pull ministral:7b`.

Ministral модели особенно эффективны для задач классификации, извлечения данных и суммаризации коротких текстов. Для генерации кода или длинных ответов предпочтительна полная версия Mistral 3.

Mistral OCR 4 (23 июня 2026): Mistral выпустила Mistral OCR 4 -- специализированный инструмент для распознавания и интеллектуальной обработки документов. Ключевые возможности: поддержка 170 языков, извлечение структурированных данных из PDF, таблиц и сканов, высокая точность распознавания рукописного текста. Доступен в трёх вариантах: облачный API через console.mistral.ai, а также вариант для самостоятельного развёртывания (self-hosted) на собственной инфраструктуре. Для локального запуска через Ollama Mistral OCR 4 пока недоступен -- используйте API или self-hosted вариант с официального сайта.

Серия Ministral 3: выбор для слабого железа

Серия Ministral 3 -- это расширенная линейка компактных моделей от Mistral AI, которая охватывает три размера для разных задач и конфигураций оборудования. Все модели серии доступны под лицензией Apache 2.0 и поддерживают понимание изображений.

Варианты по размеру и типу:

  • Ministral 3B -- самый компактный вариант. Три типа: ministral-3b-base (базовая модель без дообучения), ministral-3b-instruct (для диалога и выполнения инструкций), ministral-3b-reasoning (с chain-of-thought рассуждением). Требует от 4 до 6 ГБ VRAM. Работает на большинстве современных ноутбуков.
  • Ministral 8B -- оптимальный баланс. Три типа аналогично 3B: base, instruct, reasoning. Требует 10-12 ГБ VRAM. Рекомендуется для большинства задач на потребительском железе.
  • Ministral 14B -- наиболее мощный из компактных. Три типа: base, instruct, reasoning. Требует 18-20 ГБ VRAM.

Все варианты Ministral 3 поддерживают понимание изображений (image understanding) -- можно передавать изображения через API вместе с текстовым запросом. Загрузка через Ollama:

ollama pull ministral:3b-instruct
ollama pull ministral:8b-instruct
ollama pull ministral:14b-instruct
# Для reasoning-вариантов:
ollama pull ministral:8b-reasoning

Серия Ministral 3 особенно актуальна для пользователей, у которых нет GPU класса RTX 3090+ или Mac с большим unified memory. Для подавляющего большинства задач (ответы на вопросы, анализ текста, написание кода под 5-10K токенов) Ministral 8B instruct даёт результаты, сопоставимые с более тяжёлой Mistral 3 7B, при меньших требованиях к железу.

Обновление: новые модели (июль 2026)

  • Leanstral 1.5 (3 июля 2026): открытая (Apache 2.0) модель-агент для формальных доказательств на языке Lean 4. Решает 587 из 672 задач PutnamBench -- лучший результат среди открытых моделей.
  • Mistral OCR 4: мультиязычное извлечение текста с привязкой к координатам (bounding boxes). Оценка 85,20 на бенчмарке OlmOCRBench. Доступна через Mistral Studio, Microsoft Azure AI Foundry и Amazon SageMaker.

Новая open-weight MoE модель Mistral (ранний доступ, июль 2026). В июле 2026 года Mistral AI анонсировала новую открытую модель с архитектурой Mixture-of-Experts, охарактеризованную командой как 'fat but sparse' (большая, но разреженная). Модель предназначена для задач, где нужна высокая точность при разумных требованиях к ресурсам в момент инференса. На момент написания модель доступна только в режиме раннего доступа (early access) и не предназначена для локального деплоя - Mistral планирует выпустить открытые веса позднее. Следите за анонсами на mistral.ai и в официальном Discord.

Mistral OCR 4 (июль 2026): Новая версия Mistral OCR поддерживает 170 языков, распознавание с bounding boxes (координаты каждого текстового блока на странице) и inline confidence scores (оценка уверенности прямо в выводе). Ключевое отличие от предыдущей версии – возможность self-hosted развёртывания в одном Docker-контейнере без внешних зависимостей. Это делает Mistral OCR 4 практичным вариантом для корпоративных систем обработки документов, где данные не должны покидать периметр компании.

Robostral Navigate, Leanstral 1.5 и Mistral Medium 3.5 (июль 2026): Mistral AI расширяет семейство специализированными моделями. Robostral Navigate – модель для автономной навигации роботов: принимает на вход поток с камеры и текстовые инструкции, возвращает команды управления. Leanstral 1.5 – модель для формальной верификации математических доказательств в системе Lean 4, ориентирована на исследователей и разработчиков верифицированного ПО. Mistral Medium 3.5 занимает промежуточное положение между Small и Large в линейке коммерческих моделей Mistral.

Анонс новой open-weight MoE-модели (июль 2026): Mistral AI анонсировала новую открытую модель с архитектурой Mixture-of-Experts, описанную командой как «fat but sparse» (большой общий объём параметров, но малое число активных при каждом запросе). Модель входит в early access в июле 2026. Подробности о размерах и требованиях к железу будут опубликованы при выходе из early access – следите за официальным блогом mistral.ai.

Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.

Поделиться:TelegramXLinkedIn
Как вам материал?

Хотите получать подобные материалы раньше?

Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.

Узнать про Intelligence

Не пропускайте важное

Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.

Похожие материалы

Как начать пользоваться Agno: Python-фреймворк для создания AI-агентов

Agno (бывший phidata) - один из самых популярных Python-фреймворков для построения AI-агентов с 39k+ звезд на GitHub. Пошаговый гайд: установка, первый агент за 5 минут, мультиагентные команды и деплой в продакшн.

·8 мин

Seedance 2.5: как начать пользоваться генератором видео от ByteDance

Seedance 2.5 от ByteDance генерирует нативное 30-секундное видео в один проход, принимает до 50 мультимодальных референсов и позволяет редактировать отдельные фрагменты без перегенерации всего клипа.

·7 мин

ChatGPT Work: как начать пользоваться агентным рабочим столом OpenAI

9 июля 2026 OpenAI запустила ChatGPT Work -- агента, который берёт у вас целый проект, сам планирует шаги, работает часами в фоне и возвращает готовый документ, таблицу или презентацию.

·8 мин