New-ZZZ
RU / EN

Meta запускает Muse Image и показывает предварительную версию Muse Video

Р
Редакция New-ZZZ
AI at Meta Blog · 1 месяц назад

Meta представила Muse Image и показала превью Muse Video, первых моделей генерации медиа, разработанных Meta Superintelligence Labs. Muse Image позиционируется как самая продвинутая на данный момент система генерации изображений Meta, созданная не только для превращения промптов в картинки, но и для следования подробным инструкциям, точного редактирования, объединения множества референсных изображений и использования социального контекста из Instagram. Модель уже доступна в приложении Meta AI, на meta.ai, в Instagram Stories в США и в WhatsApp в отдельных странах; поддержка Facebook запланирована позже. Muse Video пока находится в превью и, как ожидается, скоро станет доступна авторам и Meta AI.

Главная идея Muse Image в том, что она ведёт себя скорее как агент, чем как традиционный генератор изображений. Вместо того чтобы просто напрямую сопоставлять текстовый промпт с изображением, она может использовать инструменты, рассуждать над задачей, дорабатывать собственный результат и тратить больше вычислений на этапе инференса для улучшения качества. Meta говорит, что модель может вызывать инструменты поиска и кодинга, когда они помогают создавать более точные или полезные изображения. Она также интегрируется с Muse Spark, позволяя двум системам совместно использовать инструменты и планировать более сложные задачи генерации медиа.

Инструмент кодинга используется в случаях, когда визуальная точность зависит от точной структуры, а не только от стиля. В ходе обучения с подкреплением Muse Image научилась писать и выполнять код, который может генерировать точные графики и QR-коды, а затем использовать эти отрендеренные результаты как референсы для создания изображений. В сочетании с Muse Spark та же схема с инструментами и генерацией может поддерживать анимированные GIF, сайты с сгенерированными изображениями и интерактивные визуальные игры. Проще говоря, Meta пытается сделать модель способной создавать визуальные ассеты, которым нужна точность, а не просто привлекательные сцены.

Поиск даёт Muse Image доступ к веб-информации и визуальным референсам. Meta говорит, что это помогает привязывать сгенерированные изображения к фактической и актуальной информации, особенно для промптов, связанных с реальными фактами, темами с большим объёмом знаний или текущими событиями. Это важно, потому что многие модели изображений плохо справляются, когда промпт зависит от деталей, которые либо появились недавно, либо легко могут быть искажены. Поиск не заменяет генерацию, но даёт модели внешний контекст до или во время процесса, что может повысить фактическую точность.

Заметная возможность — самодоработка, которая, по словам Meta, возникла в ходе обучения с подкреплением, а не была явно спроектирована. Muse Image может проверять собственный черновик и решать, как его улучшить. Иногда это означает небольшую локальную правку, если неверна одна деталь. В других случаях она может пересоздать изображение с нуля, если общая композиция не удалась, или использовать другой подход, например вызвать инструмент для улучшения фактической привязки. Meta говорит, что такое поведение поощрялось во время обучения, потому что более качественная самокоррекция давала лучшие итоговые изображения.

Meta также подчёркивает test-time compute, то есть объём обработки, который модель использует после запроса пользователя. Подобно языковым моделям, которые могут работать лучше, когда им позволяют рассуждать дольше, Muse Image, как сообщается, показывает лучшие результаты, когда использует больше шагов рассуждения, вызовов инструментов и проходов самодоработки. Meta говорит, что качество растёт вместе с общим объёмом вычислений как по текстовым токенам, используемым для рассуждения, так и по визуальным токенам, используемым для генерации. Компания также утверждает, что важно не только количество вычислений, но и то, как они расходуются: генерация множества изображений с выбором лучшего сначала помогает, но затем выходит на плато, тогда как целенаправленное рассуждение масштабируется лучше. Рассуждение и инструменты выглядят наиболее сильными в сочетании, потому что инструменты могут дать недостающие референсы или точные детали, которые одно только рассуждение предоставить не может.

Muse Image также создана для практических сценариев редактирования. Meta говорит, что она может менять ровно то, что просит пользователь, сохраняя остальную часть изображения, поддерживать согласованность на протяжении нескольких раундов редактирования и помогать в открытом брейншторминге до финального результата. Она также может собирать людей, объекты, одежду, стили и окружения из нескольких входных референсных изображений. Формат промпта может чередовать текст и изображения прямо внутри запроса, что полезно для сложных композиций, где пользователь хочет, чтобы разные части результата были взяты из разных референсов.

Meta говорит, что Muse Image занимает 2-е место на Arena в категориях text-to-image, редактирования одного изображения и редактирования нескольких изображений по Elo-рейтингам человеческих предпочтений на момент написания. Компания также показывает превью Muse Video, построенной на той же базе предобучения и поддерживающей нативное аудио. Muse Video описывается как конкурентоспособная по следованию промпту, визуальной точности и временной согласованности, хотя Meta признаёт оставшиеся пробелы в синхронизации аудио и видео, а также в физически точном быстром движении. На Arena Muse Video занимает 3-е место в text-to-video по Elo человеческих предпочтений на момент написания.

Meta позиционирует Muse как шаг к агентной генерации медиа, где модели планируют, используют инструменты, проверяют свою работу и создают изображения или видео через более итеративный процесс. Релиз также включает функцию верификации: Muse Image использует Content Seal, невидимую систему водяных знаков Meta, для изображений, созданных в приложении Meta AI и на meta.ai. Этот водяной знак должен помогать людям определять AI-сгенерированные изображения, что становится всё важнее по мере того, как сгенерированные медиа всё проще создавать и распространять через социальные платформы.

Почему это важно

  • Meta продвигает генерацию изображений к системам агентного типа, которые могут рассуждать, использовать инструменты и самостоятельно улучшать свои результаты.
  • Muse Image переносит продвинутую генерацию и редактирование напрямую в крупные потребительские платформы, включая Meta AI, Instagram и WhatsApp.
  • Предварительная версия Muse Video показывает стремление Meta конкурировать в генерации видео по текстовому описанию с поддержкой нативного аудио.

Ключевые факты

  • Muse Image уже доступна в приложении Meta AI, на meta.ai, в Instagram Stories в США и в WhatsApp в ограниченном числе стран.
  • Модель может использовать инструменты для кода и поиска, чтобы повышать точность, в том числе для графиков, QR-кодов, фактологических запросов и реальных визуальных референсов.
  • Muse Image может самостоятельно дорабатывать свои результаты и улучшаться за счет дополнительного вычисления во время тестирования, шагов рассуждения и вызовов инструментов.
  • Meta заявляет, что на момент публикации Muse Image занимает 2-е место в Arena для генерации изображений по тексту, редактирования одного изображения и редактирования нескольких изображений.
  • Muse Video находится в ранней предварительной версии, поддерживает нативное аудио и на момент публикации занимает 3-е место в Arena для генерации видео по тексту.
Читать первоисточник

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы