Нейросеть Кандинский 4.0: Полный обзор возможностей и инструкция по использованию

Подробный гид по нейросети Кандинский 4.0 от Сбера: история версий, функционал, инструкции по генерации изображений, анимации и видео, советы по созданию промтов и ответы на частые вопросы.

Что такое нейросеть Кандинский и как она появилась

Нейросеть Кандинский — это семейство моделей искусственного интеллекта для генерации изображений, анимации и видео по текстовому описанию, разработанное компанией «Сбер» при поддержке учёных Института искусственного интеллекта AIRI. Первая версия, известная как ruDALL-E XL, была представлена в ноябре 2021 года и содержала 1,3 миллиарда параметров. Уже в июне 2022 года вышла полноценная модель Kandinsky с 12 миллиардами параметров, обученная на 179 миллионах пар «изображение — текст».

С тех пор нейросеть прошла несколько крупных обновлений. В ноябре 2022 года появилась Kandinsky 2.0 с мультиязычной поддержкой (101 язык) и архитектурой Latent Diffusion. Версия 2.1 (апрель 2023) увеличила число параметров до 3,3 миллиарда и улучшила качество генерации. Kandinsky 2.2 (июль 2023) добавила фотореализм, поддержку прямоугольных изображений и инструмент ControlNet для локального редактирования. В ноябре 2023 года была представлена Kandinsky 3.0 с принципиально новой архитектурой, улучшенным пониманием запросов и глубоким знанием русской культуры. Версия 3.1 (апрель 2024) ускорила генерацию в 10 раз (режим Flash) и добавила функцию улучшения промтов. Наконец, в декабре 2024 года вышла Kandinsky 4.0, ориентированная на создание HD-видео длительностью до 12 секунд.

Основные версии нейросети: от 2.0 до 4.0

Каждая версия Кандинского привносила значительные улучшения. Kandinsky 2.0 стала первой мультиязычной моделью, понимающей запросы на 101 языке, и использовала архитектуру Latent Diffusion с блоком UNet на 1,2 миллиарда параметров. Kandinsky 2.1 увеличила разрешение до 768×768 пикселей, заменила текстовые энкодеры на XLM-Roberta-Large-Vit-L-14 и добавила image prior модель. За первые четыре дня после выхода пользователи сгенерировали более 3 миллионов изображений.

Kandinsky 2.2 подняла разрешение до 1024×1024 пикселей, добавила поддержку прямоугольных изображений с разным соотношением сторон и функцию ControlNet для локального изменения сцены. В октябре 2023 года в эту версию добавили генерацию 4-секундных анимационных роликов с частотой 24 кадра в секунду. Kandinsky 3.0 перешла на одностадийную генерацию из закодированных текстовых токенов, используя языковую модель FLAN-UL2 и блоки BigGAN-deep в U-Net. Модель стала лучше понимать запросы и генерировать фотореалистичные изображения, арты и скетчи, а также получила глубокие знания русской культуры и фольклора.

Kandinsky 3.1 представила функцию улучшения текстового промта с помощью языковой модели Neural-Chat-v3-1, обновила механизмы inpainting/outpainting и сократила количество шагов генерации с 50 до 4 без потери качества. Режим Flash позволяет создавать изображения в 10 раз быстрее базовой модели. Kandinsky 4.0, анонсированная в декабре 2024 года, сосредоточена на генерации видео: она способна создавать ролики в формате HD длительностью до 12 секунд.

Где и как пользоваться Кандинским: все платформы

Нейросеть Кандинский доступна на нескольких платформах, каждая из которых имеет свои особенности.

Fusion Brain — официальный портал, где можно попробовать все функции последней версии. Здесь доступны генерация по текстовому запросу, создание на основе загруженного изображения, дорисовка (inpainting/outpainting), ластик для удаления деталей, выбор качества и ориентации, негативные промты, генерация анимации и видео. Интерфейс полностью русскоязычный, интуитивно понятный, с подсказками и горячими клавишами.

Сайт ruDALL-E — упрощённая версия с урезанным функционалом. Можно выбрать версию нейросети (3.1, 2.2, 2.1 и архивные), но сайт иногда работает нестабильно.

Чат-бот ВКонтакте — позволяет генерировать изображения по текстовому запросу с выбором ориентации (1:1, 3:2, 2:3). Расширенные настройки отсутствуют, версия нейросети может быть не самой актуальной. Подходит для быстрой визуализации идей.

Чат-бот Telegram Kandinsky by Sber AI — поддерживает свежую версию 3.1 и архивные 2.2 и 2.1. Умеет генерировать изображения, смешивать изображения (2.1, 2.2), переносить стиль (2.2), создавать вариации (2.1, 2.2) и стикеры (2.2).

Чат-бот Kandinsky Video by Sber AI — отдельный бот для генерации видео. Для использования требуется оставить заявку и дождаться одобрения.

Виртуальный ассистент «Салют» — доступен в мобильном приложении и на умных устройствах под управлением Салют ТВ по команде «Включи художника».

API — для продвинутых пользователей и разработчиков, позволяющий интегрировать Кандинский в собственные проекты.

Пошаговая инструкция: как создать изображение на Fusion Brain

Создание изображения на Fusion Brain состоит из нескольких этапов.

  1. Выбор качества и разрешения. Качество автоматически меняется при выборе ориентации. Стандартная квадратная картинка 1:1 имеет разрешение 1024×1024 пикселя. Доступны также прямоугольные форматы.
  1. Формулировка промта. Введите текстовый запрос в соответствующее поле. Чем точнее и детальнее описание, тем лучше результат. Используйте ключевые слова, описывающие объект, фон, стиль, освещение, настроение.
  1. Оценка результата и негативный промт. После первой генерации внимательно изучите изображение. Если есть лишние или нежелательные детали, укажите их в поле «негативный промт». Например, если на картинке появились лишние люди, напишите «без людей».
  1. Корректировка промта. Дополните обычный промт недостающими деталями. Повторяйте шаги 3 и 4 до получения желаемого результата. При точечных правках объект и фон в целом сохраняются, меняются только детали.
  1. Использование ластика. Если изображение в целом удачное, но имеет слишком крупный план или объект обрезан, воспользуйтесь инструментом «ластик». Выделите область, которую нужно дорисовать, и опишите, что там должно быть. Важно, чтобы новая область генерации захватывала часть исходного изображения — чем больше пересечение, тем выше вероятность плавного продолжения.
  1. Сохранение. Готовое изображение можно скачать на компьютер.

Создание анимации и видео: что умеет Кандинский

Возможности Кандинского не ограничиваются статичными изображениями. Начиная с версии 2.2, нейросеть умеет создавать анимационные ролики, а с версии 3.0 — полноценное видео.

Анимация создаётся на вкладке «Видео» в Fusion Brain. Нужно выбрать модель «Анимация», определить количество сцен (до 4 секунд каждая) и написать текстовый запрос для каждой. Дополнительно можно указать направление камеры. Чем больше сцен, тем дольше время генерации.

Видео генерируется по одному текстовому запросу для всего ролика. Расширенные настройки пока отсутствуют. Время генерации — около 4 минут. Качество видео и соответствие запросу пока уступают изображениям, но с каждой версией улучшаются. Kandinsky Video 1.1 (апрель 2024) генерирует в два раза более качественные ролики по сравнению с предыдущей моделью. Kandinsky 4.0 (декабрь 2024) способна создавать HD-видео длительностью до 12 секунд с частотой 30 кадров в секунду и разрешением 512×512 пикселей. Нейросеть состоит из двух частей: первая генерирует опорные кадры, вторая — интерполяционные, обеспечивающие плавность движения.

Как правильно составлять промты: советы и примеры

Качество результата напрямую зависит от того, насколько точно и детально сформулирован запрос. Вот несколько рекомендаций.

Будьте конкретны. Вместо «красивый пейзаж» напишите «закат над горным озером, сосны на переднем плане, отражение в воде, фотореализм». Чем больше деталей, тем точнее нейросеть поймёт, что вы хотите.

Используйте стили. Указывайте желаемый художественный стиль: «масляная живопись», «акварель», «киберпанк», «стиль аниме», «фотография на плёнку». Кандинский хорошо понимает такие указания.

Указывайте освещение и настроение. «Мягкий утренний свет», «мрачная атмосфера», «яркое солнце», «туман» — эти детали сильно влияют на результат.

Негативный промт — ваш друг. Если на изображении появляются нежелательные элементы, перечислите их в негативном промте. Например: «без людей, без текста, без водяных знаков».

Экспериментируйте с длиной. Иногда короткий запрос даёт неожиданно хороший результат, но для сложных сцен лучше использовать развёрнутые описания.

Примеры:

  • «Космический корабль приземляется на поверхность Марса, красная пыль, закат, фотореализм, высокая детализация».
  • «Портрет девушки в стиле киберпанк, неоновые огни, дождь, отражение в луже, цифровое искусство».
  • «Кот в шляпе волшебника, сидит на книге заклинаний, свечи, таинственная атмосфера, стиль фэнтези».

Практические примеры использования Кандинского

Нейросеть Кандинский может применяться в самых разных сферах.

Дизайн и маркетинг. Создание иллюстраций для статей, постов в соцсетях, баннеров, обложек. Быстрая визуализация идей для логотипов, упаковки, мерча. Генерация вариантов дизайна для A/B-тестирования.

Образование и презентации. Визуализация сложных концепций, создание наглядных материалов для уроков, инфографики. Например, генерация изображений исторических событий или научных процессов.

Творчество и хобби. Создание артов для личных проектов, генерация персонажей для игр или комиксов, вдохновение для рисования. Кандинский хорошо понимает русскую культуру и фольклор, поэтому может создавать изображения в стиле гжели, жостовской росписи, с персонажами русских сказок.

Ретушь и редактирование. Дорисовка фона, удаление лишних объектов, изменение стиля загруженного изображения. Например, можно превратить обычное фото в картину маслом или добавить на него фантастические элементы.

Создание контента для соцсетей. Быстрая генерация уникальных картинок для постов, аватарок, обложек. Чат-боты ВКонтакте и Telegram позволяют делать это прямо в мессенджере.

Прототипирование. Создание визуальных концептов для сайтов, приложений, игр до этапа работы дизайнера.

Ограничения и важные нюансы при работе с нейросетью

Несмотря на впечатляющие возможности, у Кандинского есть ряд ограничений, которые стоит учитывать.

Лицензия на использование. Изображения, созданные нейросетью, предназначены только для некоммерческого использования в соответствии с пользовательским соглашением. Для коммерческих проектов可能需要 уточнять условия.

Качество видео. Генерация видео пока уступает по качеству изображениям. Соответствие запросу может быть низким, а время генерации — до 4 минут. Kandinsky 4.0 значительно улучшила ситуацию, но до уровня профессиональных видеоредакторов ещё далеко.

Отсутствие истории генераций. На Fusion Brain нет ленты генераций других пользователей и истории ваших запросов. Это может быть неудобно для отслеживания прогресса.

Стабильность работы. Сайт ruDALL-E иногда работает нестабильно и может не отправлять запросы на сервер. Fusion Brain более надёжен.

Версии в чат-ботах. Версия нейросети в чат-ботах не всегда самая актуальная, поэтому качество может быть ниже, чем при генерации через Fusion Brain.

Ограничения по длине видео. В Kandinsky 4.0 максимальная длина видео — 12 секунд. Для более длинных роликов потребуется склеивать несколько генераций.

Необходимость точных промтов. Для получения качественного результата требуется практика в составлении запросов. Нейросеть может неправильно интерпретировать абстрактные или двусмысленные описания.

Будущее Кандинского: что дальше?

Развитие нейросети Кандинский продолжается. Каждая новая версия приносит значительные улучшения: увеличение разрешения, скорости генерации, качества видео, расширение функционала. Можно ожидать, что будущие версии будут ещё лучше понимать сложные запросы, генерировать более длинные и качественные видео, получат поддержку новых форматов и стилей.

Уже сейчас Кандинский является одним из лучших российских инструментов для генерации изображений, занимая второе место в рейтинге нейросетей для генерации изображений после Midjourney. Благодаря бесплатному доступу, русскоязычному интерфейсу и глубокому пониманию русской культуры, он остаётся востребованным среди дизайнеров, маркетологов, художников и обычных пользователей.

С учётом темпов развития, можно предположить, что в ближайших версиях появятся ещё более продвинутые функции редактирования, интеграция с другими сервисами Сбера, улучшенная генерация видео и, возможно, поддержка 3D-моделей. Кандинский продолжает эволюционировать, и за ним стоит следить.

Вопросы и ответы

Сколько стоит использование нейросети Кандинский?

На данный момент нейросеть Кандинский полностью бесплатна для всех пользователей. Платных тарифов нет. Доступ к генерации изображений, анимации и видео осуществляется через сайт Fusion Brain, чат-боты в Telegram и ВКонтакте, а также через виртуального ассистента «Салют».

Какая версия Кандинского сейчас самая актуальная?

По состоянию на начало 2026 года самой актуальной версией для генерации изображений является Kandinsky 3.1, а для генерации видео — Kandinsky 4.0, представленная в декабре 2024 года. На сайте Fusion Brain и в чат-ботах обычно доступна последняя стабильная версия.

Можно ли использовать сгенерированные изображения в коммерческих целях?

Согласно пользовательскому соглашению, изображения, созданные нейросетью Кандинский, предназначены только для некоммерческого использования. Для коммерческих проектов рекомендуется уточнять условия на официальном сайте Сбера или в документации.

Как улучшить качество изображения, если результат не устраивает?

Используйте негативный промт, чтобы указать, чего не должно быть на картинке. Дополняйте обычный промт недостающими деталями. Экспериментируйте с формулировками, добавляйте указания на стиль, освещение, настроение. Также можно воспользоваться инструментом «ластик» для дорисовки отдельных областей.

В чём разница между анимацией и видео в Кандинском?

Анимация создаётся на основе нескольких текстовых запросов для каждой сцены (до 4 секунд каждая) и позволяет указывать направление камеры. Видео генерируется по одному запросу для всего ролика, имеет меньше настроек, но более высокое качество и длительность (до 12 секунд в Kandinsky 4.0).

Какие форматы изображений поддерживает Кандинский?

Нейросеть поддерживает квадратные изображения (1:1) с разрешением 1024×1024 пикселя, а также прямоугольные изображения с различным соотношением сторон (например, 3:2, 2:3). Выбор ориентации доступен на сайте Fusion Brain и в чат-боте ВКонтакте.

Как получить доступ к генерации видео через Telegram?

Для использования чат-бота Kandinsky Video by Sber AI необходимо оставить заявку. После её одобрения вы сможете тестировать функционал генерации видео. Обычно заявки рассматриваются в течение нескольких дней.