Назад к блогу

GPT-6 Astra, looped-трансформеры и наблюдение за активистами: что стоит за анонсами

GPT-6 Astra, looped-трансформеры и наблюдение за активистами: что стоит за анонсами

OpenAI представила GPT-6 Astra, которая обходит GPT-5.6 практически во всех областях и показывает почти идеальный результат на ARC-AGI-3. В статье разбираем, что стоит за этим анонсом, как связаны с ним looped-трансформеры и почему Anthropic одновременно строит систему слежки за активистами.

OpenAI выпустила GPT-6 Astra — по сообщениям, с большим шумом. Модель превосходит предшественника GPT-5.6 практически во всех категориях, включая письмо, математику и программирование, и особенно сильна в задачах 3D-рендеринга и анимации. На бенчмарке ARC-AGI-3, который измеряет сочетание решения логических головоломок и обобщения, Astra достигает 99.9% против 7.8% у GPT-5.6 Sol.

Параллельно обсуждаются две другие темы: архитектура looped-трансформеров, которую связывают с Astra, и система наблюдения за активистами, которую строит Anthropic.

Что изменилось в GPT-6 Astra

Astra остаётся reasoning-моделью: она обучается с подкреплением с проверяемыми наградами (RLVR).

Этот результат подаётся в релизных материалах как один из ключевых моментов, хотя и не отражён на приведённом графике. При этом бенчмарки по математике, программированию и использованию компьютера считаются более интересными, поскольку ближе к реальному применению. После публикации статьи OpenAI описал два дополнительных изменения в harness, которые утроили производительность GPT-5.6 Sol — с 13.3% до 38.3%.

Как обучают управлению компьютером

Цикл обучения computer use устроен как повторяющийся процесс. Модель получает задачу, например «open an app xyz and do abc». Харнесс передаёт ей скриншоты интерфейса macOS. Модель предсказывает действия мышью и клавиатурой — клики, нажатия клавиш, прокрутку. Эти действия выполняются на Mac, после чего подаются новые скриншоты обновлённой среды. Шаги повторяются до успеха или неудачи.

Обратную связь дают сигналы успеха или неудачи и верификатор. Вместе с ними используется обучение с подкреплением на этапе посттренировки — это аналогично RLVR.

Mac Mini и Mac Studio используются не для обучения моделей — для этого лучше подходят GPU, — а как среда, в которой модель взаимодействует с macOS во время тренировки. Авторы сравнивают это с гуманоидными роботами: они не самые эффективные, но универсальные.

Предыстория: почему понадобился computer use

Раньше модели решали задачи в графических интерфейсах через текстовые задачи и CLI, потому что LLM — текстовые модели, и им естественно даётся написание кода, работа с API и CLI. Но многие инструменты и программы не предоставляют CLI. Вместо ожидания, пока кто-то создаст такой интерфейс, модели стали обучать работе с графическими интерфейсами. По замыслу авторов, это делает LLM более доступными для повседневных компьютерных задач вне технического мира.

Как устроен looped-трансформер

У Nanbeige4.2-3B стек из 22 transformer-блоков, и каждый из этих 22 блоков имеет собственные веса. После первого прохода скрытые состояния снова подаются через те же 22 блока: блок 1 применяется снова, затем блок 2 и так далее до блока 22. Если развернуть вычисление, получается 44 применения блоков, но вторая серия из 22 применений переиспользует веса первой: применение 23 использует веса блока 1, применение 24 — веса блока 2 и так далее.

Смысл в том, что эффективная глубина растёт с 22 до 44 применений блоков без добавления второго набора весов трансформера. Два прохода выбраны как наиболее эффективная настройка: увеличение числа циклов с 2 до 3 может повысить качество моделирования, но дополнительная вычислительная стоимость того не стоила.

Что с памятью и KV-кэшем

Looped-архитектура даёт экономию памяти под веса: модель, применяющая 22 блока дважды, имеет примерно вдвое меньше параметров блоков, чем модель с 44 отдельными блоками. Однако выигрыша в KV-кэше нет. При повторном проходе промежуточные состояния на входе блока отличаются, поэтому вычисленные ключи и значения тоже отличаются — так же, как если бы блоки были разными. Повторный стек из 22 блоков имеет такие же требования к KV-кэшу, как обычный трансформер с 44 отдельными блоками.

Попытка разделить KV-кэш между проходами уменьшала его вдвое, но модель работала хуже. По стоимости бэкпропа выигрыша тоже нет: градиенты текут назад через оба повторения общего стека, и это так же дорого, как 44 отдельных блока, — лишь оптимизатор обновляет меньше различных параметров.

В экспериментах SMELT при сопоставимом compute, параметрах и KV-кэше зацикленные модели требуют примерно на 6.8–18% меньше обучающего compute для достижения той же validation loss.

Более ранние подходы к гибкому числу циклов

В Universal Transformer (2018) один и тот же блок применяется повторно, а число шагов может быть фиксированным либо адаптивным. Адаптивность реализуется обученной функцией, которая для каждой позиции на каждом шаге выдаёт вероятность остановки; эти вероятности суммируются по последовательным циклам, и позиция перестаёт зацикливаться, когда сумма превышает порог. Максимальное число циклов ограничивает вычисления.

В Mixture-of-Recursions (2025) число проходов определяется на уровне отдельного токена небольшим обученным роутером, который работает по скрытому представлению токена с учётом контекста, поэтому одно и то же слово в разных местах может получать разное число проходов. Роутинг бывает двух видов. При expert-choice routing решение о том, кого обрабатывать дальше, принимается по ходу вычислений. При token-choice routing весь маршрут токена фиксируется заранее, до начала рекурсии.

По результатам Mixture-of-Recursions на самом маленьком масштабе лучше обычный трансформер; на больших моделях MoR догоняет и часто превосходит, особенно при меньших бюджетах обучения; при самом большом бюджете кривые близки. Равные вычислительные затраты не означают равного числа токенов: пропуская вычисления, модель может обработать больше токенов в рамках того же бюджета.

Система наблюдения Anthropic

Anthropic строит систему мониторинга активистов, включая pre-crime — попытку предсказывать инциденты до их совершения и в некоторых случаях сообщать о подозреваемых в полицию заранее. Компания отслеживает активистов рядом с руководителями и протесты возле своих физических объектов.

Для обнаружения рисков компания пользуется сторонним сервисом, который поставляет разведданные о рисках. В одном случае он дал примерно 60 минут предупреждения о переносе протеста, что позволило изменить маршрут руководителя и провести его через служебный вход отеля. Anthropic регулярно сообщает в полицию об угрозах и заявляет, что отслеживает «вызывающее беспокойство поведение» через процесс person-of-interest, чтобы рано выявлять эскалацию. Цель программы безопасности сформулирована как переход от реактивного сбора информации к проактивному, предиктивному и превентивному взаимодействию с угрозами.

Расширение разведки до национального и глобального масштаба поддерживается вакансией enterprise intelligence specialist. В обязанности входит выявлять, оценивать, отслеживать и расследовать глобальные угрозы, включая активизм, с OSINT-сбором по конкретным угрозам, действующим лицам и событиям.

Что это меняет на практике

Релизные цифры бенчмарков стоит интерпретировать с оговоркой: при обучении модель обычно разрабатывается под один основной харнесс, а другие используются меньше. Основной харнесс часто создаётся так, чтобы подходить модели и усиливать её сильные стороны, поэтому агентные оценки могут недооценивать её реальную производительность в этом основном харнессе. Чтобы понять, насколько это влияет на итоговый балл, нужно сравнить Astra на разных харнессах на одних и тех же задачах. Общий харнесс даёт сопоставимое сравнение между моделями, но не показывает, как модель работает в том харнессе, под который её оптимизировали.

Дополнительно стоит пересмотреть содержимое AGENTS.md и SKILL.md: избыточная подсказка может ограничивать новые модели и приводить к худшим решениям.

Ограничения и открытые вопросы

Использование looped-трансформеров в Astra не подтверждено официально и остаётся слухом. Цитата главного научного сотрудника OpenAI о глубине графа вычислений «within a factor of two of GPT-4» не подтверждает архитектуру явно: она может означать просто вдвое больше обычных блоков.

Скрытие цепочек рассуждений не считается следствием looped-трансформеров: OpenAI скрывает большинство рассуждений с самого начала, ещё с o1, поэтому для пользователя разницы нет. По token usage Astra не обязательно использует меньше токенов, чем предшественник Sol, но при фиксированной точности — да, меньше. Это может объясняться большей способностью модели, а не проблемой интерпретируемости.

Эксперимент Full-bandwidth transformer показал сокращение рассуждений на MATH500, которое исчезает после instruction tuning. При этом эксперимент не устанавливает, являются ли более короткие рассуждения менее достоверными, и не проверяет, даёт ли увеличение обычных блоков вместо looped-подхода аналогичный эффект на длину рассуждений.

Источники

Похожее