Как запустить NVIDIA Nemotron 3 Nano Omni на своём компьютере

NVIDIA Nemotron 3 Nano Omni -- первая открытая модель, которая понимает видео, аудио, изображения и текст одновременно. Доступна бесплатно через Ollama и Hugging Face. Разбираемся, как установить и использовать.

·7 мин

Что это и для кого

NVIDIA Nemotron 3 Nano Omni (выпущена 28 апреля 2026 года) -- это открытая мультимодальная языковая модель, которая умеет обрабатывать текст, изображения, аудио и видео в рамках одного запроса. В отличие от большинства локальных моделей, которые работают только с текстом или в лучшем случае с изображениями, Nemotron 3 Nano Omni объединяет все эти возможности в одной нейросети.

Модель выпущена NVIDIA под открытой лицензией и доступна бесплатно. Она заняла первые места сразу на шести лидербордах по обработке документов, видео и аудио на момент выхода в 2026 году. По характеристикам она соперничает с крупными проприетарными системами, но работает локально -- данные не покидают ваш компьютер.

Кому это нужно: разработчикам, которые хотят создавать приложения с мультимодальным AI без платы за API; исследователям, которым важна воспроизводимость и контроль над данными; пользователям, которые хотят анализировать корпоративные документы, видеозаписи или аудиофайлы без отправки их в облако.

Модель подходит для конкретных задач: расшифровка записей совещаний, анализ медицинских изображений, понимание содержимого PDF с таблицами и схемами, ответы на вопросы по видеоуроку. Для общих разговорных задач лучше подойдут специализированные текстовые модели -- они меньше весят и быстрее отвечают.

Технически модель имеет 30 миллиардов параметров, из которых активны 3 миллиарда на каждый токен (архитектура Mixture of Experts). Это позволяет добиться высокой производительности при умеренных аппаратных требованиях. Версия с расширенным мышлением (reasoning) обеспечивает особенно точные ответы на сложные вопросы.

Как установить

Есть несколько способов запустить Nemotron 3 Nano Omni. Самый простой -- через Ollama, если вам не нужна работа с видео. Для полных мультимодальных возможностей (видео и аудио) лучше использовать Unsloth Studio или llama.cpp.

Способ 1: Через NVIDIA NIM (облако, бесплатно)

Самый быстрый старт -- попробовать модель в облаке через NVIDIA Build. Перейдите на build.nvidia.com, найдите Nemotron 3 Nano Omni Reasoning и нажмите 'Try API'. Вам предложат API-ключ для первых 1000 бесплатных запросов. Это хороший способ убедиться, что модель решает вашу задачу, до установки локально.

Способ 2: Через Ollama (текст и изображения)

Если у вас ещё не установлен Ollama -- скачайте его на ollama.com для вашей операционной системы (macOS, Windows, Linux). После установки откройте терминал и выполните:

ollama run nemotron-3-nano

Ollama автоматически скачает модель (около 20 GB) и запустит её. Первый запуск может занять 10-20 минут в зависимости от скорости соединения. После загрузки вы попадёте в интерактивный чат. Для работы с изображениями через Ollama используйте команду:

ollama run nemotron-3-nano 'Что на этом изображении?' --image /путь/к/файлу.jpg

Способ 3: Через Unsloth Studio (полные мультимодальные возможности)

Для работы с видео и аудио нужен Unsloth Studio -- веб-интерфейс для локального запуска моделей. Установка: перейдите на unsloth.ai, скачайте Unsloth Studio для вашей ОС. После установки найдите Nemotron 3 Nano Omni в каталоге моделей и нажмите Download. В интерфейсе вы сможете загружать файлы видео (.mp4, до 2 минут) и аудио (.wav, .mp3, до 1 часа) прямо в чат.

Требования к железу: минимум 25 GB оперативной памяти или видеопамяти для версии 4-bit quantization. Для 8-bit версии нужно 36 GB. Видеокарта NVIDIA с CUDA ускоряет работу в 5-10 раз по сравнению с CPU. На Apple Silicon (MacBook Pro M3/M4) модель работает через Metal и показывает хорошую скорость.

Nemotron 3 Nano 4B -- меньшая версия модели для видеокарт с ограниченной памятью VRAM. Требует минимум 6 ГБ VRAM и подходит для систем с GPU 8-12 ГБ. Запуск: ollama run nemotron-3-nano:4b. Поддерживает текст и изображения, но не аудио и видео. Хороший выбор для первого знакомства с семейством Nemotron на потребительском железе.

Первый запуск -- что попробовать

После установки рекомендуем начать с простых задач, чтобы понять возможности модели.

Тест 1: Анализ изображения. Загрузите любую фотографию или скриншот и спросите: 'Что изображено на картинке? Опиши подробно.' Nemotron 3 Nano Omni хорошо справляется с описанием сцен, читает текст на изображениях, распознаёт графики и схемы.

Тест 2: Работа с документом. Сфотографируйте страницу из договора или технической документации и задайте вопрос по содержанию. Модель умеет читать таблицы, формулы и структурированные документы -- это одна из её сильных сторон согласно бенчмаркам.

Тест 3: Расшифровка аудио. Через Unsloth Studio загрузите аудиофайл совещания или лекции и попросите: 'Транскрибируй этот аудиофайл и выдели ключевые решения.' Модель поддерживает русский язык, хотя точность расшифровки на русском несколько ниже, чем на английском.

Тест 4: Анализ видео. Загрузите короткое видео (до 2 минут) и спросите: 'Кратко опиши, что происходит в этом видео.' Это уникальная возможность, которой нет в большинстве других локальных моделей.

Для включения расширенного режима мышления (рекомендуется для сложных аналитических задач) добавьте в начало запроса: 'Думай шаг за шагом перед ответом.' Модель начнёт рассуждать вслух, что значительно повышает точность для логических и технических вопросов.

Скорость ответа зависит от железа: на NVIDIA RTX 4090 модель генерирует около 30-40 токенов в секунду в режиме 4-bit. На MacBook Pro M4 Max -- около 15-20 токенов в секунду. На CPU без GPU ускорения -- 2-5 токенов в секунду, что уже некомфортно для интерактивного использования.

Если вы хотите использовать модель в Python-приложении, вот минимальный пример через Ollama API после локального запуска:

import ollama; response = ollama.chat(model='nemotron-3-nano', messages=[{'role': 'user', 'content': 'Привет! Расскажи о себе.'}]); print(response['message']['content'])

Для мультимодальных запросов с изображением через Python: передайте путь к файлу в параметре images списка сообщений. Ollama обработает изображение и включит его в контекст запроса автоматически.

Ключевые фишки

Единая модель для всех типов данных. Главное отличие Nemotron 3 Nano Omni от других локальных моделей -- она обрабатывает видео, аудио, изображения и текст в одном запросе. Вы можете загрузить скриншот, аудиозапись и написать вопрос -- модель учтёт все три источника информации одновременно.

Длинный контекст. Модель поддерживает контекстное окно в 128 000 токенов -- это примерно 100 000 слов или большая книга. Вы можете загружать длинные документы целиком и задавать вопросы по всему содержанию.

Топ-6 лидербордов по документам и медиа. На момент выхода в 2026 году Nemotron 3 Nano Omni занял первые места на шести академических бенчмарках, включая тесты по пониманию документов с таблицами, видеопониманию и транскрипции аудио. Это говорит о высоком качестве мультимодального понимания относительно размера модели.

Режим мышления для сложных задач. В версии Reasoning модель сначала строит цепочку рассуждений (chain-of-thought), а потом даёт ответ. Это особенно полезно для анализа данных, написания кода и решения технических задач. Для простых запросов используйте обычный instruct-режим -- он быстрее.

Совместимость со стандартом OpenAI API. Если вы разрабатываете приложение, вы можете подключить Nemotron 3 Nano Omni через любой клиент, совместимый с OpenAI API. Достаточно изменить base_url на адрес вашего локального сервера Ollama или llama-server.

Полная конфиденциальность данных. Все данные -- включая видео, аудио и изображения -- обрабатываются локально. Ничего не отправляется в облако. Это критично для работы с медицинскими данными, юридическими документами, корпоративными материалами.

Интеграция с популярными фреймворками. Модель работает через vLLM, SGLang и llama.cpp, что позволяет интегрировать её в существующие Python-приложения буквально несколькими строками кода. Есть готовые примеры на Hugging Face для обработки каждого типа медиа.

Цены и ограничения

NVIDIA Nemotron 3 Nano Omni бесплатна для скачивания и локального использования. Никаких подписок и ограничений по количеству запросов нет.

Облачный API через NVIDIA NIM: бесплатные 1000 запросов при регистрации на build.nvidia.com. После исчерпания лимита -- платные планы. Точные цены зависят от типа запроса (с видео стоит дороже, чем текст). Проверяйте актуальные тарифы на build.nvidia.com.

Через OpenRouter: Nemotron 3 Nano Omni доступна на OpenRouter.ai в бесплатном тире с лимитами по запросам в минуту. Хороший вариант, если вы хотите попробовать облачную версию без регистрации в NVIDIA.

Главные технические ограничения:

Видеофайлы принимаются только в формате MP4, максимум 2 минуты. Если видео длиннее -- нужно разрезать его на части. Аудиофайлы: WAV и MP3, максимум 1 час. Изображения: большинство популярных форматов (JPEG, PNG, WebP).

Точность на русском языке хорошая, но несколько ниже, чем на английском. Особенно это заметно при расшифровке аудио с акцентом или техническими терминами. Для критически важных задач рекомендуем проверять результаты.

На компьютерах без выделенной видеокарты (или с GPU менее 20 GB видеопамяти) потребуется CPU-режим -- он работает, но медленно. Для продуктивного использования нужна видеокарта NVIDIA RTX 3090/4090 или Apple Silicon M3/M4 с достаточным объёмом памяти.

Модель не подходит для генерации видео или изображений -- только для их анализа. Для создания изображений используйте Stable Diffusion или Flux, для видео -- Wan 2.6 или Kling.

Нужен ли VPN из России

Для локального использования Nemotron 3 Nano Omni VPN не нужен вообще. Модель скачивается с Hugging Face (huggingface.co) -- сайт доступен из России без VPN. Если Ollama не может скачать модель -- попробуйте через VPN, но обычно это не требуется.

Для доступа к облачному API NVIDIA Build (build.nvidia.com) сайт технически доступен из России. Регистрация требует email, VPN для регистрации обычно не нужен. Оплата принимается через международные карты -- если возникают проблемы с оплатой, попробуйте использовать VPN.

Для доступа к OpenRouter (openrouter.ai) ситуация аналогичная: сайт доступен без VPN, регистрация простая, для бесплатного тира карта не нужна вовсе.

Главное преимущество локального запуска для пользователей из России -- полная независимость от санкций и ограничений. Один раз скачали модель -- и она работает без интернета, без подписок, без проблем с платежами. Это особенно важно для корпоративных пользователей, которым критично сохранять конфиденциальность данных.

Для скачивания модели через Ollama используйте команду: ollama pull nemotron-3-nano. Если скачивание идёт медленно или обрывается -- попробуйте через VPN или используйте прямую загрузку с Hugging Face и последующую конвертацию через llama.cpp.

Hugging Face (huggingface.co) работает из России стабильно. Модель доступна по адресу huggingface.co/nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16. Для скачивания потребуется аккаунт на Hugging Face -- регистрация бесплатная и не требует VPN. Объём файлов около 20-30 GB в зависимости от выбранного формата (BF16 или GGUF для llama.cpp).

После локальной установки модель работает полностью офлайн. Это означает, что даже при блокировке внешних сервисов или отключении интернета ваши AI-задачи не прерываются. Для критически важных рабочих процессов это ключевое преимущество перед облачными решениями.

Семейство Nemotron 3: Super и Ultra (2026)

Nemotron 3 Nano Omni -- это компактная модель семейства. В 2026 году NVIDIA расширила линейку двумя более мощными вариантами:

  • Nemotron 3 Super (120B-A12B, март 2026) -- модель среднего класса с 120 миллиардами параметров. Предназначена для корпоративного развёртывания на серверах с несколькими GPU. Поддерживает те же мультимодальные возможности (текст, изображения, аудио, видео). Оптимальна для edge-серверов уровня предприятия.
  • Nemotron 3 Ultra (550B MoE, 4 июня 2026) -- флагманская модель, анонсированная на GTC Taipei и официально выпущенная 4 июня 2026. 550 миллиардов параметров при архитектуре MoE (из них 55 миллиардов активны на токен). Гибридная архитектура Mamba-Attention для более эффективного инференса. Обучение: 20 триллионов токенов и 400 миллионов видеоклипов. Ключевые характеристики: 9x higher throughput по сравнению с аналогами, 300+ токенов в секунду на NVIDIA DGX H200. Доступна на HuggingFace (nvidia/Nemotron-3-Ultra-550B). Распространяется под лицензией Linux Foundation.

Позиционирование Nano Omni в семействе: Nemotron 3 Nano Omni -- самая компактная и доступная модель линейки, оптимизированная для локального запуска на потребительском железе. Если Super и Ultra требуют профессиональных серверов, то Nano Omni запускается на GPU с 25+ ГБ видеопамяти.

Немотрон 3 Ultra завершает линейку Nemotron 3. С выходом Nemotron 3 Ultra (4 июня 2026) линейка Nemotron 3 полностью сформирована: Nano Omni (локальный запуск), Super (120B, корпоративные серверы), Ultra (550B, датацентры). NVIDIA анонсировала Nemotron 4. Nemotron 3 Ultra доступна на HuggingFace, DeepInfra, OpenRouter и NVIDIA NIM. Архитектура: гибридная Mamba-Attention (MoE), 550 млрд параметров, 55 млрд активных на токен.

Уточнение характеристик семейства Nemotron 3 (апрель-июнь 2026): Nemotron 3 Nano Omni выпущена 28 апреля 2026 года. Nemotron 3 Super -- модель 120B-A12B (120 миллиардов параметров, 12 миллиардов активных на токен через MoE). Nemotron 3 Ultra (550B) обеспечивает пропускную способность в 9 раз выше по сравнению с аналогичными моделями. На OpenRouter.ai Nemotron 3 Nano Omni доступна в бесплатном тире с лимитами по запросам -- это хороший вариант для первого знакомства без регистрации в NVIDIA Build.

Обновление: Nemotron Coalition (июль 2026)

NVIDIA объявила о запуске Nemotron Coalition -- альянса AI-компаний (Black Forest Labs, Cursor, LangChain, Mistral AI, Perplexity AI и другие) для разработки семейства открытых frontier-моделей Nemotron 4.

Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.

Поделиться:TelegramXLinkedIn
Как вам материал?

Хотите получать подобные материалы раньше?

Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.

Узнать про Intelligence

Не пропускайте важное

Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.

Похожие материалы

Как начать пользоваться Agno: Python-фреймворк для создания AI-агентов

Agno (бывший phidata) - один из самых популярных Python-фреймворков для построения AI-агентов с 39k+ звезд на GitHub. Пошаговый гайд: установка, первый агент за 5 минут, мультиагентные команды и деплой в продакшн.

·8 мин

Seedance 2.5: как начать пользоваться генератором видео от ByteDance

Seedance 2.5 от ByteDance генерирует нативное 30-секундное видео в один проход, принимает до 50 мультимодальных референсов и позволяет редактировать отдельные фрагменты без перегенерации всего клипа.

·7 мин

ChatGPT Work: как начать пользоваться агентным рабочим столом OpenAI

9 июля 2026 OpenAI запустила ChatGPT Work -- агента, который берёт у вас целый проект, сам планирует шаги, работает часами в фоне и возвращает готовый документ, таблицу или презентацию.

·8 мин