Как запустить Kimi K2 на своем компьютере: лучшая open-source модель 2026 года
Kimi K2.6 - ведущая open-source модель с 1 триллионом параметров от Moonshot AI, доступна через Ollama. Полный гайд по запуску локально: системные требования, установка, первые запросы, coding-сценарии.
ВАЖНО (июль 2026): Kimi K2.6 API прекратил работу 7 июля 2026. Поддержка Kimi K2.6 через официальный API Moonshot завершилась 7 июля 2026 года. Серия kimi-k2 base была официально прекращена 25 мая 2026 года. Пользователям API необходимо перейти на Kimi K2.7 Code (срок 7 июля истёк): ollama pull kimi-k2.7-code. Для локального использования: GGUF-файлы K2.6 остаются работоспособными офлайн -- ограничение касается только официального API-эндпоинта Moonshot. Если вы используете K2.6 через Ollama с облачным тегом -- обновите тег на kimi-k2.7-code.
Kimi K2.7 Code -- актуальная версия для кодинга (2026)
Kimi K2.7 Code -- последняя модель Moonshot AI в серии K2, позиционируется как самая мощная coding-модель компании. Архитектура MoE с 1 триллионом параметров. Через Ollama: ollama pull kimi-k2.7-code.
Kimi K2.6: как запустить модель Moonshot AI на своем компьютере
Полное руководство: Kimi K2.6 локально
Kimi K2.6 (Modified MIT лицензия) - 1 триллион параметров total, 32 миллиарда активных на токен (MoE архитектура). Контекстное окно 256K токенов. Для локального запуска требуется серьёзное железо: FP16 - минимум 240 ГБ VRAM (8x H100 или 4x H200). Для большинства пользователей рекомендуется квантизация.
Квантизированные версии Kimi K2.6: INT4 QAT через Unsloth Studio - наиболее практичный вариант для домашних систем. INT4 KV Cache через llama.cpp: модель запускается на системе с 128 ГБ RAM (без GPU в очень медленном режиме). bfloat16 + GGUF Q4_K_M: оптимальное соотношение качество/ресурсы, нужен кластер из нескольких GPU.
Agent Swarm на локальной Kimi K2.6: масштабирование до 300 специализированных субагентов доступно через официальный Moonshot API (platform.moonshot.cn) или Cloudflare Workers AI endpoint. Для локального Agent Swarm нужна custom оркестрация на базе LangGraph или AutoGen с несколькими K2.6 инстансами.
Практические альтернативы для локального запуска мощных моделей: Llama 4 Maverick (17B активных) через Ollama на RTX 4090, Qwen3.6-27B через LM Studio на 32 ГБ RAM, DeepSeek V4 Flash (21B активных MoE) на RTX 3090. Эти модели дают 80-90% возможностей K2.6 при доступных ресурсах.
Что такое Kimi K2.6
Kimi K2.6 - флагманская открытая модель Moonshot AI, выпущенная 20 апреля 2026 года под лицензией Modified MIT, разрешающей коммерческое использование. Это мультимодальная агентная модель нового поколения с 1 триллионом параметров, лидирующая в задачах визуального понимания, программирования, агентных задачах, работы с длинным контекстом и чата.
Актуально на июнь 2026: 12 июня 2026 выпущена Kimi K2.7-Code -- специализированная версия для задач программирования с +21.8% на Kimi Code Bench v2 и на 30% меньше токенов рассуждения. Для кодинга через API рекомендуется K2.7-Code. K2.6 остаётся актуальным для локального запуска и общих задач.По сравнению с Kimi K2.5: та же архитектура, но K2.6 добавляет нативную INT4 QAT-квантизацию для более быстрого инференса. Масштаб агентной системы вырос с 100 до 300 специализированных субагентов, с 1500 до 4000 координированных шагов за один автономный запуск. K2.6 добавляет нативный ввод видео (форматы MP4, MOV, AVI, WebM, разрешение до 2K) -- эта возможность отсутствует в оригинальном K2.
Технические характеристики
Параметры: 1 триллион (гибридная модель с режимом мышления). Активные параметры: не раскрываются публично, архитектура оптимизирована для инференса. Контекстное окно: 256K токенов. Поддерживает непрерывные фоновые запуски продолжительностью 12+ часов с тысячами вызовов инструментов. Нативный видеоввод: MP4, MOV, AVI, WebM до 2K разрешения.
Требования к оборудованию
Full precision (FP16): требует около 610 ГБ дискового пространства - это уровень серверного кластера, недоступный для домашнего использования.
Dynamic 2-bit квантизация: около 350 ГБ (-43% от полного размера). Требует несколько GPU высокого класса или специализированное оборудование для инференса.
INT4 QAT (рекомендуется для практического использования): модель обучалась с учетом INT4, поэтому потеря качества минимальна по сравнению с post-training квантизацией. Требования существенно ниже, подходит для конфигураций с несколькими GPU потребительского уровня.
Для большинства пользователей более практичен облачный или API доступ.
Локальный запуск через Unsloth
Шаг 1: Установите Unsloth. Рекомендуется использовать Unsloth Studio (GUI версия): скачайте с unsloth.ai/docs/models/kimi-k2.6. Для продвинутых пользователей: pip install unsloth.
Шаг 2: В интерфейсе Unsloth Studio найдите "Kimi K2.6" в строке поиска. Выберите нужную квантизацию - для домашних систем рекомендуется INT4 QAT или более агрессивные варианты квантизации.
Шаг 3: Нажмите Download. Время загрузки зависит от скорости интернета и выбранной квантизации - INT4 вариант занимает значительно меньше времени.
Шаг 4: После загрузки нажмите Run. Unsloth автоматически определит оптимальные параметры инференса для вашего оборудования.
Запуск через llama.cpp
Загрузите GGUF версию модели с Hugging Face (репозиторий unsloth/Kimi-K2.6-GGUF). Выберите квантизацию в зависимости от доступной памяти. Запустите: ./llama-server -m kimi-k2.6.Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99.
Облачный и API доступ
Для большинства задач API-доступ практичнее локального запуска. Kimi K2.6 доступна через:
Официальный API Moonshot: platform.moonshot.cn - полный доступ к модели с фактурацией по токенам. Документация на английском языке.
DeepInfra: deepinfra.com/Kimi-k2.6 - удобный API-совместимый с OpenAI формат, конкурентные цены.
Сферический (Spheron): облачное развертывание для production-нагрузок.
Практические применения
Агентные задачи: K2.6 особенно хорошо подходит для длительных автономных задач. Система из 300 субагентов позволяет параллельно обрабатывать сложные многоэтапные рабочие процессы.
Мультимодальный анализ: загружайте изображения, документы и код вместе с текстовыми запросами для комплексного анализа.
Kimi K2.6 vs K2.5: ключевые улучшения
Kimi K2.6 выпущена 20 апреля 2026 года. По сравнению с K2.5:
- Нативная INT4 QAT-квантизация -- K2.6 обучалась с учётом INT4 с самого начала (quantization-aware training). Это принципиально отличается от post-training квантизации: потеря качества минимальна (менее 1-2% на бенчмарках).
- Улучшенный агентный swarm -- масштабирование до 300 субагентов и 4000 координированных шагов стало более стабильным.
- Agent Swarm API -- официальный API для оркестрации мульти-агентных систем через platform.moonshot.cn.
- 262.1K контекст -- немного больше, чем у K2.5 (около 256K).
Локальный запуск через llama.cpp: подробная инструкция
Для наиболее практичного локального запуска используйте llama.cpp или Unsloth с GGUF-файлами из репозитория unsloth/Kimi-K2.6-GGUF на Hugging Face.
Шаг 1: установите llama.cpp
git clone https://github.com/ggerganov/llama.cpp && cd llama.cpp && cmake -B build -DLLAMA_CUBLAS=ON && cmake --build build --config Release -j
Шаг 2: скачайте GGUF файл с Hugging Face
Для систем с 24-48 ГБ VRAM (рекомендуется INT4 QAT Q4_K_M): huggingface-cli download unsloth/Kimi-K2.6-GGUF Kimi-K2.6-Q4_K_M.gguf --local-dir ./models
Для систем с 60+ ГБ VRAM (INT4 без потери качества): huggingface-cli download unsloth/Kimi-K2.6-GGUF Kimi-K2.6-Q8_0.gguf --local-dir ./models
Шаг 3: запустите сервер
./build/bin/llama-server -m ./models/Kimi-K2.6-Q4_K_M.gguf --host 0.0.0.0 --port 8080 -ngl 99 --ctx-size 32768
Параметр -ngl 99 переносит все слои на GPU. Если памяти недостаточно -- уменьшите значение. Параметр --ctx-size определяет размер контекстного окна (максимум 262144).
Требования к оборудованию: детали
Kimi K2.6 -- огромная модель. Реальные требования:
- Минимальная конфигурация (INT4 QAT, качество ~97% от FP16): NVIDIA RTX 4090 x2 (48 ГБ VRAM суммарно) или NVIDIA A100 40GB. Скорость: 5-15 токенов/сек.
- Рекомендуемая конфигурация (INT4, хорошее качество): NVIDIA A100 80GB x2 или H100 80GB. Скорость: 20-40 токенов/сек.
- Профессиональная конфигурация (INT4 QAT, полная скорость): NVIDIA H100 80GB x4+ или DGX H100. Скорость: 60+ токенов/сек.
- Apple Silicon: M2 Ultra (192 ГБ) или M3 Ultra минимально. Требуется через llama.cpp с Metal.
Для большинства разработчиков рекомендуется API-доступ: Moonshot API (platform.moonshot.cn), DeepInfra, или Cloudflare Workers AI -- значительно дешевле аренды нужного железа.
Актуальные бенчмарки Kimi K2.6
По данным на апрель-май 2026:
- SWE-bench Verified: 65.8% (примечание: SWE-bench Verified и SWE-bench Pro -- разные бенчмарки; данные выше относятся к SWE-bench Verified) -- выше Llama 4 Scout (54.7%) и сравнимо с Claude Opus 4.7 (72.5%).
- MATH-500: 91.2% -- отличный результат для математических задач.
- Agentic benchmark: задачи с 100+ шагами -- K2.6 показывает значительно лучший результат, чем конкуренты, благодаря архитектуре swarm.
- Стоимость инференса через API: на момент написания -- конкурентная цена на платформах DeepInfra и Moonshot, уточняйте актуальные тарифы на сайтах провайдеров.
Обновления Kimi K2.6 (2026): На бенчмарке HLE-Full модель набрала 54,0 балла, опередив все другие модели по состоянию на апрель 2026 года. Режим Kimi K2.6 Thinking доступен как отдельный инструмент с расширенным пошаговым рассуждением для особо сложных задач.
Kimi K2.7-Code (12 июня 2026) -- новое поколение для кодинга: Moonshot AI выпустила Kimi K2.7-Code с улучшенными бенчмарками по сравнению с K2.6: +21.8% на Kimi Code Bench v2, на 30% меньше токенов рассуждения при аналогичном качестве ответов. Архитектура: 1T параметров (32B активных), 256K контекст, MIT лицензия, доступна на HuggingFace. Для задач кодирования рекомендуется K2.7-Code через API (Moonshot API, DeepInfra) как более мощный вариант. Для локального запуска K2.6 остаётся актуальным: GGUF-квантизации для K2.7-Code на момент написания недоступны -- инструкции из этого гайда по-прежнему применимы для K2.6. Раздел будет обновлён при появлении GGUF-весов K2.7-Code на Hugging Face.
Kimi K2.7 Code (12 июня 2026). Moonshot AI выпустила специализированную версию K2.7 Code, ориентированную на программирование. Ключевые улучшения по сравнению с K2.6: +21,8% на Kimi Code Bench v2, +31,5% на MLS Bench Lite, на 30% меньше токенов рассуждения. Архитектура: 1 триллион параметров MoE, 32 миллиарда активных параметров, 384 эксперта. Доступна на Hugging Face под лицензией Modified MIT. HighSpeed режим (с 15 июня 2026): ~180 токенов/с в медианных задачах кодирования, до 260 токенов/с на коротком контексте -- через Kimi Code Beta. Для общих задач рекомендуется продолжать использовать K2.6, K2.7 оптимизирован именно под код. Развёртывание: vLLM, SGLang, KTransformers по аналогии с K2.6.
Kimi K2.7 Code: новая версия для программирования (12 июня 2026)
12 июня 2026 года Moonshot AI выпустила Kimi K2.7 Code -- специализированную версию для задач программирования. Архитектура: 1 триллион параметров MoE, 32 миллиарда активных параметров, 384 эксперта, контекстное окно 256K токенов. Лицензия Modified MIT, доступна на Hugging Face.
Ключевые улучшения K2.7 Code по сравнению с K2.6:
- +21.8% на Kimi Code Bench v2 -- специализированный бенчмарк для задач программирования.
- +31.5% на MLS Bench Lite -- мультиязычный бенчмарк для кода.
- На 30% меньше токенов рассуждения при аналогичном качестве ответов -- агент решает задачи быстрее и дешевле.
- HighSpeed режим (с 15 июня 2026): около 180 токенов/с в медианных задачах, до 260 токенов/с на коротком контексте через Kimi Code Beta.
Требования к оборудованию для K2.7 Code
K2.7 Code имеет те же базовые требования, что и K2.6, так как архитектура идентична (1T параметров, 32B активных). Локальный запуск по-прежнему требует серьёзного железа:
- FP16 (полная точность): минимум 240 ГБ VRAM -- это уровень серверного кластера (8x H100 или 4x H200). Недоступно для домашнего использования.
- INT4 QAT (рекомендуется): минимум 2x RTX 4090 (48 ГБ суммарного VRAM) или NVIDIA A100 40GB. Скорость 5-15 токенов/с. Это минимальная практичная конфигурация.
- Apple Silicon: M2 Ultra (192 ГБ unified memory) или M3 Ultra -- через llama.cpp с Metal.
Важно: GGUF-квантизации для K2.7 Code на момент написания находятся в процессе подготовки сообществом. Следите за репозиторием unsloth/Kimi-K2.7-Code-GGUF на Hugging Face -- как только веса появятся, инструкция по запуску через llama.cpp (описана ниже для K2.6) будет применима и к K2.7 Code без изменений.
INT4-квантизация для K2.7 Code через Unsloth
Unsloth поддерживает INT4 QAT-квантизацию для K2.7 Code. Подход аналогичен K2.6:
Шаг 1: установите Unsloth Studio (GUI-версия) с unsloth.ai или через pip:
pip install unslothШаг 2: в интерфейсе Unsloth Studio найдите Kimi K2.7-Code в строке поиска. Выберите квантизацию INT4 QAT -- она обеспечивает минимальную потерю качества (менее 1-2% на бенчмарках) по сравнению с FP16.
Шаг 3: скачайте модель (загрузка займёт время в зависимости от скорости интернета) и нажмите Run.
Для запуска через llama.cpp после появления GGUF-файлов команда аналогична K2.6:
./build/bin/llama-server -m ./models/Kimi-K2.7-Code-Q4_K_M.gguf \
--host 0.0.0.0 --port 8080 -ngl 99 --ctx-size 32768Что выбрать: K2.6 или K2.7 Code
Выбор между версиями зависит от ваших задач и способа доступа:
Выбирайте Kimi K2.6, если:
- Вам нужны общие задачи: анализ текста, ответы на вопросы, агентные задачи не связанные с кодом.
- Вы хотите запустить модель локально прямо сейчас -- GGUF-файлы K2.6 уже доступны на Hugging Face.
- Вы используете видеоввод (MP4, MOV) или мультимодальные сценарии.
- Вам важны агентные swarm-возможности (300 субагентов, 4000 шагов).
Выбирайте Kimi K2.7 Code, если:
- Ваши основные задачи -- программирование: написание, отладка, рефакторинг кода.
- Вы используете API-доступ (Moonshot API, DeepInfra) -- модель уже доступна через облако. Стоимость API: на момент написания около $0.95/M входных токенов.
- Для вас важна скорость генерации: K2.7 Code тратит на 30% меньше токенов рассуждения.
- Вы готовы подождать появления GGUF-квантизаций для локального запуска.
Практический вывод: для большинства разработчиков оптимальная стратегия -- использовать K2.7 Code через API для задач программирования и K2.6 локально (через llama.cpp или Unsloth) для общих и агентных задач.
СРОЧНО: Обновление тегов Ollama (16 июня 2026)
16 июня 2026 старые теги Ollama для Kimi K2 устарели. Теги kimi-k2:1t-cloud и kimi-k2-thinking больше не поддерживаются и не будут обновляться. Если вы уже установили модель по старым инструкциям, необходимо переустановить по актуальным тегам.
Актуальные команды: `ollama pull kimi-k2:latest` для стандартной версии и `ollama pull kimi-k2:thinking-latest` для версии с reasoning. Перед установкой удалите старые версии: `ollama rm kimi-k2:1t-cloud` и `ollama rm kimi-k2-thinking`.
После обновления тегов API-совместимость сохранена - конфигурации OpenClaw и Open WebUI менять не нужно. Обновите только команды pull в своих скриптах автоматизации, если они используют жёстко прописанные теги.
Kimi Work: официальный desktop-агент (12 июня 2026)
Kimi Work - локальный desktop-агент от Moonshot AI на базе Kimi K2. Возможности: рой из 300 субагентов для параллельного выполнения крупных задач, WebBridge для взаимодействия с браузером. Доступен для скачивания на kimi.ai. Kimi Work дополняет локальный запуск через Ollama: агент может использовать как локальную модель, так и облачную в зависимости от задачи.
Kimi K2.7-Code через Ollama: облачный тег
Kimi K2.7-Code доступна в Ollama через специальный облачный тег kimi-k2.7-code:cloud. Этот тег не скачивает модель локально, а направляет запросы к облачному API Moonshot через интерфейс Ollama. Для использования:
ollama pull kimi-k2.7-code:cloud
После этого работайте с моделью как обычно через Ollama API на localhost:11434. Это удобный способ использовать K2.7-Code для задач программирования, не имея железа уровня серверного кластера. Запросы тарифицируются по токенам Moonshot API.
Инструменты развертывания K2.7-Code: для тех, кто хочет запустить K2.7-Code именно локально (при наличии подходящего оборудования), модель совместима с теми же инструментами, что и K2.6: vLLM, SGLang и KTransformers. Архитектура K2.7 идентична K2.6 (1T параметров, 32B активных), поэтому существующие конфигурации запуска K2.6 применимы к K2.7 с минимальными изменениями.
Kimi K2.7 Code - основная API-модель для кодинга с июля 2026. После прекращения работы K2.6 API 7 июля 2026 года Kimi K2.7 Code стала основной рекомендуемой моделью для задач программирования через Moonshot API. Модель показывает значительно лучшие результаты на coding-бенчмарках: +21.8% на Kimi Code Bench v2 и +31.5% на MLS Bench Lite по сравнению с K2.6. Для подключения через Ollama используйте: ollama pull kimi-k2.7-code:cloud. Через официальный API Moonshot модель доступна по идентификатору kimi-k2.7-code на platform.moonshot.cn.
Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.
Хотите получать подобные материалы раньше?
Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.
Узнать про IntelligenceНе пропускайте важное
Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.
Как начать пользоваться Agno: Python-фреймворк для создания AI-агентов
Agno (бывший phidata) - один из самых популярных Python-фреймворков для построения AI-агентов с 39k+ звезд на GitHub. Пошаговый гайд: установка, первый агент за 5 минут, мультиагентные команды и деплой в продакшн.
Seedance 2.5: как начать пользоваться генератором видео от ByteDance
Seedance 2.5 от ByteDance генерирует нативное 30-секундное видео в один проход, принимает до 50 мультимодальных референсов и позволяет редактировать отдельные фрагменты без перегенерации всего клипа.
ChatGPT Work: как начать пользоваться агентным рабочим столом OpenAI
9 июля 2026 OpenAI запустила ChatGPT Work -- агента, который берёт у вас целый проект, сам планирует шаги, работает часами в фоне и возвращает готовый документ, таблицу или презентацию.