Назад к блогу

AstaBrief: открытая модель для генерации научных отчётов со ссылками

AstaBrief: открытая модель для генерации научных отчётов со ссылками

Allen AI выложила в открытый доступ модель AstaBrief, которая генерирует научные отчёты со ссылками за один проход, без многоэтапной обработки, и уже работает в продакшене платформы Asta. Особый интерес здесь в том, что команда сознательно отказалась от усложнения оптимизации в пользу тщательного отбора обучающих данных — и, судя по результатам, это оказалось рабочей стратегией.

Allen AI (Ai2) открыла веса и данные для обучения модели AstaBrief. Вместе с весами опубликован пример рабочего процесса, который исследователи могут адаптировать для создания отчётов из собственных PDF-файлов. Модель уже работает в продукте Asta в режиме Fast mode рядом с Thinking mode.

Обучение стартовало с Qwen3-8B и опиралось на supervised fine-tuning и direct preference optimization. Основные усилия команда сосредоточила на посттренировочных данных, оценке и обвязке для генерации отчётов.

Что именно изменилось

AstaBrief используется в Asta — агентной платформе для научной работы — как модель генерации отчётов. Она доступна в функции Asta «Generate a report» в режиме Fast mode и заменяет проприетарные модели, которые применялись для этой задачи раньше. Генерация отчётов в Asta — первое производственное применение AstaBrief.

Ключевое отличие от прежнего режима — устройство самого прохода. Thinking mode проходит дорогостоящие этапы суммирования и кластеризации фрагментов и пишет ответ по разделам. AstaBrief обучен генерировать финальный отчёт за один проход по запросу пользователя и релевантным извлечённым фрагментам, без этих промежуточных этапов и без разбивки на секции. По заявлению авторов, обойтись без потери производительности при этом оказалось возможно.

Открытые веса позволяют организациям разворачивать модель на своём оборудовании, включая работу за собственным файрволом, не полагаясь на проприетарный API для генерации отчётов. Это существенно, когда исследовательские вопросы затрагивают чувствительные или неопубликованные материалы.

Предыстория

Раньше отчёты в Asta генерировал многошаговый пайплайн ScholarQA: он извлекал релевантную литературу, организовывал материал по разделам и с помощью модели-генератора синтезировал доказательства в отчёт со ссылками. Этот же пайплайн лёг в основу функции «Generate a report».

Для SFT полные целевые отчёты генерировались именно этим пайплайном с опорой на смесь проприетарных систем: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini и GPT-4.1. После фильтрации по качеству получилось 47K пригодных примеров.

Для DPO пары строились иначе. Один отчёт на запрос брался из существующего пайплайна ScholarQA (обычно на Claude 3.5 Sonnet или 3.7 Sonnet), а конкурирующий отчёт генерировался подачей тех же извлечённых фрагментов другой модели — o3, o4-mini, DeepSeek-V3 или DeepSeek-R1. Две модели-судьи, GPT-4.1 и DeepSeek-R1, сравнивали каждую пару и выбирали победителя; сохранялись только пары, где оба судьи согласились. Согласованность судей с человеческими предпочтениями составляла 95%. После фильтрации итоговый DPO-набор составил около 6K примеров.

AstaBrief соотносится с этими решениями как новая модель: в оценках, использованных при разработке, он был сопоставим с пайплайном на Claude по ряду показателей качества ответов и цитирования.

Почему это сделали

Авторы отказались от более сложного метода оптимизации в пользу ставки на качество обучающих данных. Вместо того чтобы компенсировать шумные примеры сложной оптимизацией, значительную часть проекта потратили на то, чтобы понять, как генерировать, отбирать и фильтровать примеры, действительно демонстрирующие нужное поведение при написании отчётов.

Проблема, которую они решали, — расхождение между внешней гладкостью отчёта и его научной достоверностью. Отчёт может звучать отшлифованно и полно, но при этом уклоняться от вопроса или прикреплять цитаты к утверждениям, из которых не следует лежащее в основе доказательство. Поддержка цитатами — лишь часть научной достоверности: модель может процитировать правильное исследование и всё равно сделать более сильное утверждение, чем поддерживает само исследование. Это происходит незаметно: вывод о конкретной выборке превращается в общее утверждение о целой популяции, результат в прошедшем времени — в утверждение в настоящем, описательный вывод — в рекомендацию для клиницистов, политиков или исследователей. Каждый такой шаг расширяет видимый охват доказательств, не вводя явно ложного утверждения.

Поэтому метрики разработки в первую очередь фокусировались на релевантности, охвате и обоснованности цитатами. Более богатая оценка научных писателей, по мнению авторов, должна также проверять, сохраняют ли они охват и силу утверждений в своих источниках.

Как формировались данные

Запросы для SFT брались из реальных пользовательских запросов, поданных через систему из статьи «Synthesizing scientific literature with retrieval-augmented LMs» и ScholarQA. Собранные логи фильтровались по качеству, релевантности и приватности: удалялся трафик бета-тестеров и ботов, отбрасывались слишком короткие запросы, а отдельный проход LLM отсеивал неанглоязычные запросы, ненаучные запросы и промпты с персональной информацией. Это оставило пул из 90K исследовательских запросов.

К синтетическим отчётам применялись четыре статистических фильтра: отношение токенов вывода к вводу, релевантность цитирования, плотность цитирования и разнообразие цитирования. Плотность цитирования измерялась как доля утверждений, имеющих хотя бы одну ссылку; низкая плотность означала большие фрагменты неподкреплённого текста.

Самым сильным улучшением оказалась фильтрация отчётов с низкой плотностью цитирования. Более агрессивная фильтрация, комбинации фильтров и переборы скорости обучения значимых улучшений не дали. Это один из самых ясных уроков проекта: более сложная фильтрация не обязательно лучше. Относительно простой сигнал — последовательно ли синтетические отчёты цитируют свои утверждения — оказался полезнее нескольких более сложных комбинаций, которые пробовали.

DPO-пары строились из отдельного подмножества запросов, не использованных при генерации SFT-данных. Эти пары должны были различать два дефекта отчётов: уход от вопроса и прикрепление цитат к утверждениям, которые не подтверждаются доказательствами.

Что это меняет на практике

AstaBrief можно скачать и запускать самостоятельно. Открытые веса дают организациям возможность разворачивать модель на своей инфраструктуре, а пример рабочего процесса для создания отчётов из собственных PDF служит отправной точкой для локальной генерации. Модель задумана как открытая по весам и обладающая качествами, важными для длинного научного синтеза: качеством ответа, релевантностью, структурой и привязкой цитирования.

Переработанный конвейер, который пишет весь отчёт за один проход, а не по секциям, дал ускорение. В рамках полного пайплайна Asta Fast mode в среднем занимает 51.1 секунды на отчёт против 178.5 секунды у Thinking mode — примерно в 3.5 раза быстрее.

В отдельном человеческом исследовании на 14 вопросов три научных исследователя внесли по 4–5 вопросов и ранжировали отчёты трёх систем по общей предпочтительности, полноте, релевантности, организации и точности цитирования, при этом ничьи допускались. По общей предпочтительности победил DR-Tulu, но двое из трёх исследователей предпочли AstaBrief другим системам по метрикам точности цитирования — что, по мнению авторов, демонстрирует полезность фильтров качества SFT-данных.

Ограничения и открытые вопросы

Авторы прямо оговаривают, как читать приведённые числа: их следует воспринимать как подтверждение инженерного подхода на момент разработки, а не как утверждение о положении базовой модели относительно сегодняшнего фронтира. Обобщаться, по их словам, должны уроки по построению данных, фильтрации атрибуции и обслуживанию. Данные об использовании Fast mode в Asta описываются как обнадёживающие, но обратная связь в целом слишком скудна для сильных выводов.

Среди направлений дальнейшей работы авторы перечисляют более тонкое обучение на предпочтениях, более сильные подходы RAG-plus-RL, возможности многоходового диалога и использования множества инструментов, дополнительные научные источники данных и декомпозицию запросов. Они также заинтересованы в оценках, которые выходят за рамки проверки наличия подтверждающей цитаты у утверждения и проверяют, сохраняет ли модель доказательную базу и её охват. Это включает такие качества, как краткость и организация, а также проверку того, превращает ли модель частные находки в широкие обобщения или описательные результаты в рекомендации.

AstaBrief авторы описывают как один эксперимент в более длинной линии работ по языковым моделям для науки — от ScholarQA и DR Tulu до будущих версий Olmo. Уроки, особенно касающиеся обучающих данных, фильтрации и оценки, помогут определить, что будет создано дальше.

Источники

Похожее