Black Forest Labs представили FLUX 3 - мультимодальный прорыв с генерацией видео, родного звука и физикой реального мира!
Совсем недавно разработчики из Black Forest Labs официально анонсировали FLUX 3 и открыли Early Access.
Если прошлые версии пытались конкурировать с Midjourney в генерации статических картинок, то FLUX 3 это шаг в сторону "Visual Intelligence" (зрительного интеллекта) и полноценных мультимодальных моделей реального мира.
1️⃣ Главный архитектурный сдвиг: Единая модель (Omni-architecture)
Большинство
нейросетей на рынке используют "связку": одна нейросеть генерирует
видео, вторая сверху прикручивает звук, третья обрабатывает текст.
нейросетей на рынке используют "связку": одна нейросеть генерирует
видео, вторая сверху прикручивает звук, третья обрабатывает текст.
FLUX 3 устроена иначе:
- Это единая монолитная сеть (Unified Multimodal Foundation Model), которая одновременно обучалась на изображениях, видеоряде, аудиопотоке и физических действиях.
- Модель понимает взаимосвязь между модальностями: она «знает», какой именно звук должен издавать предмет при ударе, как должна двигаться ткань с учетом массы и ветра и как меняется освещение во времени.
2️⃣ Что умеет FLUX 3: Ключевые модули 🚀
Линейка FLUX 3 разделена на несколько специализированных направлений:
🎥 1. FLUX 3 Video:
- Генерация видео до 20 секунд в высоком качестве (включая 720p и 1080p).
- Нативный звук: Модель сама генерирует синхронные звуковые эффекты, шумы окружения и даже многоязычную речь/диалоги, идеально совпадающие с артикуляцией персонажей.
- Режиссура и связка кадров: Можно объединять отдельные 20-секундные клипы в единые многоминутные сцены с полным сохранением внешности персонажей, стиля и освещения.
- Режимы: Поддерживаются Text-to-Video, Image-to-Video, Video-to-Video и управление по ключевым кадрам.
🖼 2. FLUX 3 Image:
- Радикальное улучшение генерации статики по сравнению с прошлыми версиями.
- Идеальный многоязычный текст: Текст на баннерах, вывесках и этикетках рендерится без ошибок и артефактов на десятках языков.
- In-Context Editing: Встроенные возможности редактирования фрагментов изображения прямо по промпту (без сторонних Inpainting-костылей).
🤖 3. FLUX 3 Action:
- Это модуль для управления физическими объектами.
3️⃣ Как FLUX 3 показывает себя в сравнении с конкурентами? 📊
Разработчики опубликовали результаты слепого A/B-тестирования (когда тестировщикам показывают два видео без указания нейросети и просят выбрать лучшее):
В парных сравнениях эксперты и пользователи выбирали качество видео FLUX 3:
- В 93% случаев — чаще, чем у Luma Ray 3.2
- В 77% случаев — чаще, чем у Runway Gen-4.5
- В 60% случаев — чаще, чем у Kling v3 Pro
- В 52% случаев — чаще, чем у Seedance 2.0
Главное преимущество FLUX 3 генерирует видео и синхронный звук за один проход, а не склеивает их разными сетями.
4️⃣ Открытый код и варианты доступа 🔓
Политика Black Forest Labs осталась верна традициям:
- Early Access (Ранний доступ): Уже открыта подача заявок на официальном сайте https://bfl.ai/models/flux-3.
- Ранние партнеры: Модель уже интегрируют и тестируют крупные сервисы: Canva, Magnific, Krea, Picsart, Burda.
- Open Weights (Открытые веса): Разработчики подтвердили, что в планах релиза стоит FLUX 3 Dev версия с открытыми весами для комьюнити и локального запуска!
Если верить словам разработчиков и инсайтам то FLUX
3 это больше не просто "конкурент Midjourney". Black Forest Labs
создали фундаментальную модель реального мира, объединяющую генерацию
фото, кино с родным звуком и физику.
3 это больше не просто "конкурент Midjourney". Black Forest Labs
создали фундаментальную модель реального мира, объединяющую генерацию
фото, кино с родным звуком и физику.
Записаться в список ожидания на Early Access можно уже сейчас на официальном сайте BFL!
flux3
bfl
black forest labs
ai video
ai art
flux