Содержание
Granite 4.2: как скачать открытую AI-модель IBM и запустить её локально
IBM выпустила Granite 4.2 – новое семейство открытых языковых моделей для тех, кому нужен не очередной чат в браузере, а собственный AI-ассистент под свои задачи. В линейке три размера: 3B, 8B и 30B параметров. Все модели доступны по лицензии Apache 2.0: их можно скачать, запускать на своей инфраструктуре и встраивать в продукт.
Главная особенность Granite 4.2 – переключаемый режим рассуждений. На сложном запросе модель может потратить больше токенов на внутренний разбор, а на простом – ответить без этой паузы. Есть и промежуточный low-effort режим. У моделей также есть нативный tool calling: 8B и 30B обучали на задачах, где AI работает с терминалом, поиском и кодом, а не только пишет текст.
Это не замена ChatGPT для человека, который хочет нажать одну кнопку и поговорить. Зато Granite 4.2 – интересная база для локального помощника в компании, AI-функции в сервисе, ассистента для разработчиков или закрытого контура, где нельзя отдавать данные внешнему провайдеру.
Где попробовать
Скачать модели и выбрать нужный размер можно в официальной коллекции Granite 4.2 на Hugging Face. Там лежат 3B, 8B и 30B версии, включая варианты для более экономного запуска.
IBM также выложила репозиторий Granite 4.2 на GitHub и документацию Granite. Для локального API под агентные инструменты в исходном анонсе есть рецепт для vLLM и отдельный гайд SGLang.
Готового публичного чат-сервиса в этом релизе IBM не анонсировала: это именно открытые веса. Для первого теста разумно взять 3B-версию, а 8B и 30B оставить для более серьёзных задач с кодом, терминалом и вызовом инструментов.
Ниже – минимальный порядок запуска из официального примера IBM. Для агентного сценария модели принимают описания функций в формате OpenAI function calling: например, можно дать ассистенту поиск по базе знаний, создание задачи и получение статуса заказа. Модель 8B или 30B сможет выбирать нужный инструмент вместо попытки угадать ответ из головы.
Как начать
Выберите версию модели
Откройте официальную коллекцию Granite 4.2 на Hugging Face и для первого теста выберите ibm-granite/granite-4.2-3b.Подготовьте окружение
Создайте Python-окружение с PyTorch и установите зависимости: pip install torch accelerate transformers.Загрузите модель через Transformers
Используйте AutoTokenizer.from_pretrained(model_path) и AutoModelForCausalLM.from_pretrained(model_path, device_map="cuda", torch_dtype=torch.bfloat16), как в официальном примере IBM.Включите рассуждения для сложной задачи
Передайте запрос через chat template с enable_thinking=True. Для проверки попросите модель разобрать техническое ТЗ, найти противоречия и составить план реализации.Выберите более быстрый режим, когда анализ не нужен
Для коротких задач используйте enable_thinking=False. Для простых, но не совсем тривиальных запросов можно оставить рассуждения и добавить low_effort=True.FAQ
Можно ли открыть Granite 4.2 в браузере как ChatGPT?
Нет, готовый публичный чат в анонсе не заявлен. IBM опубликовала веса моделей, документацию и код для самостоятельного запуска.
Какую версию взять первой?
Для проверки пайплайна и эксперимента начните с 3B. Версии 8B и 30B дополнительно проходили агентное обучение для задач с терминалом, поиском и разработкой.
Нужно ли всегда включать режим рассуждений?
Нет. Он полезен для многошаговых задач и анализа. Для обычных коротких запросов IBM предусмотрела non-thinking и low-effort режимы, чтобы не тратить лишнее время на ответ.
Модель бесплатна?
Веса выпущены по Apache 2.0. Но локальный запуск требует собственного оборудования или платного облачного сервера, если своего GPU нет.