Назад к блогу

Генерация объясняющих видео на Opus 5.5: что стоит за реакциями сообщества

Генерация объясняющих видео на Opus 5.5: что стоит за реакциями сообщества

Anthropic выпустила Opus 5.5 — модель, которая заметно продвинулась в motion design и автономной генерации анимированных объясняющих видео: пользователи собирают целые ролики из одного промпта на чистом JavaScript, без After Effects. Разбираем, что именно демонстрируют эти примеры, как работает режим Max effort с его неочевидной ценой и почему наибольший бюджет рассуждений не гарантирует лучший результат.

Anthropic выпустила Opus 5.5 — по заявлению компании, модель работает на уровне Claude Fable 5.1 и стоит на 40% дешевле в эксплуатации, чем Opus 5. Объясняющие видео в официальном анонсе не упоминаются. Тема возникла как наблюдение сообщества: дайджест Latent Space собрал пользовательские посты и реакции, в которых Opus 5.5 описывается как модель, заметно продвинувшаяся в motion design и автономной генерации анимированных объяснений.

Что именно демонстрируют

Все примеры — это пользовательские промпты и посты, а не воспроизводимый бенчмарк. Три случая описаны подробно.

Первый: запрос на динамичное 15-секундное motion graphics видео, выполненный в режиме Max effort. Второй: промпт на 90-секундное демо motion design и sound engineering, где модель, по словам автора, сама сочинила фортепианную партитуру. Третий: автономный промпт на 45–60-секундное объясняющее видео на чистом JavaScript, запускаемое локально в Firefox, с требованием сгенерировать сценарий, ассеты, анимацию, концепцию и аудио от начала до конца. В этом workflow разрешалось использовать интернет-ресурсы и ключ OpenRouter API из .env для качественной TTS-модели, при максимальном расходе OpenRouter $10; по словам комментатора, потребовались лишь незначительные правки. Отдельно упоминается SNES-style видео-бой, целиком сгенерированный из кода — включая ассеты персонажей, анимацию и тайминг, последовательность боя и музыку, без пользовательских ассетов; конкретный промпт для него не приводится.

Режим Max effort и его цена

«Max effort» — это режим с наибольшим бюджетом рассуждений. Бюджет рассуждений — это объём вычислений, который модель тратит на обдумывание ответа перед его выдачей; режимы low, xhigh и max задают этот объём от меньшего к большему. На Terminal-Bench-Science, Opus 5.5 поднимается с 24% при low effort до 62% при xhigh, а затем падает до 59% при max. @theo рекомендует избегать режима max, потому что он навязывает минимальный бюджет рассуждений: модель обязана потратить не меньше определённого объёма вычислений, даже если задача решается быстрее, и это может ухудшить результат. То есть наибольший бюджет не гарантирует лучший результат: пик по этой метрике приходится на xhigh.

Точка отсчёта

Предыдущая модель для сравнения — Opus 5; переход с неё на Opus 5.5 описывается как особенно быстрый. По vision-оценкам, Opus 5.5 назван лучшей моделью Anthropic на тот момент: лучше Fable 5 и GPT-6 Sol, но хуже GPT-6 Astra, при примерно на 60% меньшей стоимости, чем Fable 5.1. На Terminal-Bench-Science Opus 5.5 и GPT-6 Astra опережают Fable 5.1 примерно на 20 пунктов.

Почему это выделяют отдельно

В дайджесте прямо сказано, что Opus 5.5 «took over the timeline for explainer videos» — объясняющие видео стали заметным явлением вокруг релиза. Пользователи описывают результат как полностью созданный кодом, без After Effects. Отмечают необычно сильное чувство тайминга и темпа, а выводы называют насыщенными быстрыми шутками и мелкими деталями — это указывает на связность сцен и расстановку комедийных акцентов, а не только на качество визуальной генерации.

Интерес подкреплён счётчиками реакций. Пост Stephan Livera с промптом на 15-секундное видео: 100K просмотров, 18 ответов, 17 репостов, 697 лайков. Пост klöss с промптом на 90-секундное демо: 41.9K просмотров, 19 ответов, 8 репостов, 359 лайков. Пост leo: 1.87M просмотров, 17 ответов, 194 репоста, 2.37K лайков.

Что это меняет на практике

Описаны сценарии, где модель создаёт видео целиком из кода. Автономный промпт на 45–60-секундное объясняющее видео на чистом JavaScript покрывает весь конвейер — от сценария и ассетов до анимации и аудио — и запускается локально в Firefox. Генерация SNES-style боя обходится без предоставленных пользователем ассетов: модель создаёт персонажей, тайминг, последовательность боя и музыку. В 90-секундном демо модель сочиняет и собственную фортепианную партитуру. Для разработчиков это означает, что анимированное объяснение или игровая сцена могут быть получены из одного текстового запроса с минимальной ручной доводкой — при готовности платить за токены и внешние сервисы вроде TTS.

Ограничения и открытые вопросы

Одно из видео на Reddit не удалось независимо проверить: ссылка вернула 403 Forbidden. Сравнения визуала с ранними движками и физикой воды названы качественными, а не бенчмарковыми. Один комментатор сообщил, что его собственное видео по «одному промпту» получилось посредственным. Отдельно упоминается, что демо TideWater потребовало около $1,874.40 в токенах, а один негативный отзыв сравнил демо с «crisis».

Пересечения с другими анонсами

В дайджесте нет сведений о том, как связаны по задачам Gemini 3.8 Flash и LangChain Managed Deep Agents 0.8 — они описаны в разных разделах без указания пересечений. Gemini 3.8 Flash охарактеризован метриками: 41 балл по AA Intelligence Index при 291 tok/s и контексте 1M, бесплатен в Cline; на ARC-AGI — 89.2% на v2 при $0.40 за задачу и 98.5% на v1. Managed Deep Agents 0.8 описан как набор агентных возможностей: память пользователя и агента с политиками доступа, HTTP-каналы и Parallel web search. Для контекста также приводятся Xiaomi MiMo-V2.6-Pro (под MIT, omni-modal, контекст 1M, 46 по AA index против 47 у GPT-5.6 Sol, $0.13 против $1.99 за задачу) и Grok 4.7 (16-е место в Agent Arena при $1.14 за задачу).

Источники

Похожее