Назад к блогу

FLUX 3 Image: управление раскладкой через bounding boxes и агентный режим

FLUX 3 Image: управление раскладкой через bounding boxes и агентный режим

Black Forest Labs формализовала управление композицией в генеративных моделях: FLUX 3 Image позволяет задавать раскладку сцены через bounding boxes с поэлементным контролем и править отдельные объекты, не затрагивая остальное изображение. Агентный режим перекладывает планирование композиции на LLM, что открывает путь к автоматизации задач с жёсткими пространственными отношениями — вёрсток, коллажей и плотных многоэлементных сцен.

Black Forest Labs выпустила FLUX 3 Image — модель генерации изображений, вышедшую 1 октября как часть семейства FLUX 3. Модель умеет text-to-image и image-to-image, поддерживает раскладку сцены через заданные участки (bounding boxes), многошаговое редактирование объектов, до 10 референсов и генерацию до 4K.

FLUX 3 в целом анонсирована 23 июля 2026 года как единая мультимодальная система, обучаемая совместно на изображениях, видео и аудио в одной архитектуре и расширяемая до предсказания действий для робототехники.

Что именно изменилось

FLUX 3 Image принимает текст и референсные изображения. Композиция задаётся через bounding boxes: пользователь сам рисует прямоугольник для каждого элемента и описывает, что в нём должно быть, вместо того чтобы просить модель расставить объекты произвольно. Каждый бокс можно переописать, заменить или переместить, а всё нетронутое остаётся как было — изображение выдерживает серию правок подряд и не искажается.

Референсы получают имена ref_image_0, ref_image_1 и так далее в порядке добавления, и на них можно ссылаться в промпте.

В агентном режиме пользователь передаёт одну строку и соотношение сторон, а планированием раскладки занимается LLM. Она формирует caption и таблицу элементов, где для каждого значимого объекта указаны бокс и семантический id. Все боксы остаются редактируемыми: не понравившиеся можно переместить, и FLUX 3 генерирует внутри остальных так, как их разместил агент. Промпт-апсемплер может дописать caption вокруг нарисованных боксов и предложить новые элементы, но каждый исходный бокс доходит до модели дословно — с тем же id и координатами.

Такой подход рассчитан на композиции со множеством частей в строгих отношениях: вёрстки вокруг фотографии, коллажи, сетки панелей, редакционные развороты, плотные сцены.

Предыстория

Линейка началась 1 августа 2024 года с семейства FLUX.1 — трёх моделей генерации изображений по текстовому промпту на гибридной архитектуре с 12 млрд параметров. FLUX.1 [pro] работала только через платный API, веса не выпускались. FLUX.1 [dev] получена из [pro] дистилляцией, веса открыты, но лицензия некоммерческая. FLUX.1 [schnell] выпущена под лицензией Apache 2.0.

17 декабря 2025 года вышла FLUX.2 max — флагман для профессионального использования с поддержкой до 10 референсных изображений, доступна только через API. FLUX.2 поддерживала только изображения как модальность, генерация видео не поддерживалась.

23 июля 2026 года появился FLUX 3 как первая нативно мультимодальная модель: изображение, видео, аудио и предсказание действий для роботов обучались в одной архитектуре. В начале августа 2026 года Flux 3 Video стал общедоступным через API BFL и партнёров — клипы до 20 секунд в HD и Full HD с нативным звуком и диалогами с липсинком более чем на 14 языках. 1 октября 2026 года вышел Flux 3 Image.

Почему это сделали

Авторы решают проблему неуправляемой раскладки объектов: вместо того чтобы просить нейросеть «как-нибудь расставить» элементы, пользователь сам задаёт для каждого элемента прямоугольную область и описывает, что в ней должно быть. Это даёт максимальный контроль над каждым пикселем и точное следование промпту, поскольку каждый объект привязан к заданному участку, а не размещается моделью произвольно.

Дополнительно решается проблема порчи изображения при правках: каждый бокс можно переописать, заменить или переместить, а всё нетронутое остаётся как было. Точность также подтверждается тем, что модель хорошо рисует текст и фотореализм, а мелкие детали вроде рукописных символов на вывеске высотой порядка 225 px читаются при зуме.

Что это меняет на практике

API и параметры

В API FLUX 3 доступны параметры prompt (строка, обязательный для всех вариантов), images_list (массив URL, применяется в Image-to-Image и Image-to-Video), aspect_ratio (строка с вариантами 16:9, 9:16, 1:1, 4:3, 3:4, 2:3, 3:2, 21:9; по умолчанию 1:1, применяется в вариантах для изображений), resolution (строка: 1k/2k/4k для изображений или 480p/720p/1080p для видео; по умолчанию 2k для изображений и 720p для видео, применяется везде), duration (целое число от 4 до 10, по умолчанию 5, только для видео) и generate_audio (булево true/false, по умолчанию true, только для видео).

Для image_to_image референсные изображения перечисляются в images_list, а в prompt на них ссылаются по порядку: первый URL в списке соответствует первому референсу, второй — второму и так далее. Например, можно взять продукт с первого референса и поместить его на поверхность со второго референса, сохраняя форму и цвет продукта.

Процесс генерации

Все эндпоинты MuAPI возвращают request_id — идентификатор задачи, по которому затем опрашивается результат. Опрос выполняется GET-запросом на https://api.muapi.ai/api/v1/predictions/{request_id}/result с заголовком x-api-key, и ответ содержит поля status и outputs. Если status равен completed, возвращается первый элемент outputs; если failed — выбрасывается исключение с текстом из поля error. Цикл повторяется с паузой poll_interval (по умолчанию 5 секунд) до истечения timeout (по умолчанию 300 секунд), после чего выбрасывается TimeoutError.

SDK и интеграция

Для разработчиков доступен Python SDK, устанавливаемый через pip командой pip install flux-3-dev-api, и MCP-сервер. Python SDK позволяет запустить генерацию с параметрами prompt, aspect_ratio и resolution, а затем дождаться её завершения и получить результат. MCP-сервер запускается через python3 mcp_server.py при условии, что в окружении задан MUAPI_API_KEY. Конфигурация выполняется через файл .env в корневой директории с ключом MUAPI_API_KEY=your_muapi_api_key_here.

Цены

Генерация видео через API FLUX 3 тарифицируется по секундам: для Text-to-Video и Image-to-Video указана цена «$0.25/sec @720p, $0.42/sec @1080p». Для чернового режима Text-to-Video (draft) действует отдельный тариф «$0.09/sec flat» — фиксированные 0,09 доллара за секунду. Такой же тариф указан для чернового режима Video Extend. Цены на генерацию изображений не приводятся: для MuAPI указано «TBD at launch», у Black Forest Labs — «Not published».

Разрешение

Максимальный размер изображения — 5456×3072 пикселей (около 16,8 МП), этот пример демонстрируется в демо. На официальной странице FLUX 3 Image тот же пример подписан как «Soba shop, 5456 × 3072 pixels, all from the model». Также упоминается возможность рендеринга в нативном 4K.

Ограничения и открытые вопросы

Существуют пять вариантов FLUX 3, различающихся по назначению. FLUX 3 Text-to-Image создаёт изображение по текстовому описанию, FLUX 3 Image-to-Image редактирует изображение по инструкции, FLUX 3 Dev — быстрая и недорогая версия с открытыми весами, FLUX 3 Text-to-Video и FLUX 3 Image-to-Video генерируют видео со звуком — по тексту и из неподвижного изображения соответственно. FLUX 3 Text-to-Image и FLUX 3 Image-to-Image помечены как «Rolling out in the coming weeks», то есть ещё не доступны. FLUX 3 Dev — «Planned, open-weight later in 2026», то есть запланирован, но не выпущен. FLUX 3 Text-to-Video и FLUX 3 Image-to-Video уже доступны: в одном источнике они отмечены как «Early access», в другом — как «live».

В другом источнике эти же три варианта помечены как «coming soon», причём для Text-to-Image указан эндпоинт POST https://api.muapi.ai/api/v1/flux-3-text-to-image. Точная календарная дата запуска не приводится; сказано лишь, что MuAPI «will activate each one automatically for existing API keys as Black Forest Labs opens general availability — no separate waitlist required».

Авторы признают, что редактирование уже созданного изображения доступно: можно вносить несколько точечных правок сразу, каждую рамку можно переописать, заменить или переместить, а всё нетронутое остаётся на месте. Также они указывают, что FLUX 3 не меняет нарисованные пользователем рамки: промпт-апсемплер может дописать подпись и предложить новые элементы, но каждая нарисованная рамка доходит до модели дословно с тем же id и координатами.

Источники

Похожее