Apple представила LensVLM — фреймворк инференса и рецепт пост-обучения для VLMvision-language model, модель, которая обрабатывает и изображения, и текст. Идея в том, чтобы подавать текст как отрендеренные изображения и управлять объёмом вычислений через степень сжатия, а не через длину последовательности токенов. Работа доступна как статья 2605.07019.
Что именно изменилось
LensVLM обрабатывает текст как отрендеренные изображения, обходя необходимость токенизацииразбиение текста на отдельные токены для подачи в модель в длинные последовательности токенов. Поскольку кодировщик изображенийчасть модели, преобразующая картинку в набор визуальных токенов отображает изображение фиксированного размера в фиксированное число визуальных токенов, разрешение рендеринга становится точной ручкой сжатия: чем ниже разрешение, тем сильнее сжатие при том же числе токенов.
Проблема в том, что точность быстро падает с ростом сжатия — символы уменьшаются ниже эффективного разрешения кодировщика и становятся неразличимыми. LensVLM решает это так: модель сканирует сжатые изображения, а затем выборочно расширяет только релевантные изображения до несжатой формы. Это и есть Selective Context Expansionвыборочное расширение контекста — модель разворачивает до несжатой формы лишь те части сжатого изображения, которые нужны для ответа, а не всё изображение целиком.
Анализ даёт практическое руководство по выбору инструмента: для отрендеренного текста предпочтительнее текстовое расширениевосстановление нужного фрагмента в виде текста, тогда как расширение изображения в высоком разрешениивосстановление нужного фрагмента как изображения с высоким разрешением подходит для нативных документовдокументы, изначально существующие в цифровом виде, а не полученные рендерингом текста, чьи подсказки макетавизуальные признаки расположения элементов на странице — колонки, таблицы, блоки — которые помогают понять структуру документа несут релевантную задаче информацию.
Предыстория
VLM позволяют обрабатывать текст как отрендеренные изображения — это обходит токенизацию в длинные последовательности. Но у подхода есть предел: при росте сжатия модель всё больше полагается на расширенное содержимое, а не на ненадёжное визуальное чтение. Авторы обосновывают необходимость выборочного расширения именно этим падением точности.
Почему это сделали
Причина — деградация точности при сжатии: символы становятся меньше эффективного разрешения кодировщика и перестают различаться. Вместо полного расширения всех изображений (что вернуло бы стоимость обработки к уровню полного текста) авторы предлагают расширять только релевантные фрагменты. Обучение, по утверждению авторов, делает визуальное сжатие устойчивым к выбору рендеринга.
Что это меняет на практике
Для разработчиков, работающих с документами, это означает, что можно обойтись без токенизации текста в длинные последовательности, используя разрешение рендеринга как регулятор степени сжатия. Заявленные результаты:
- LensVLM сохраняет точность, сопоставимую с точностью при подаче документа целиком, без сжатия;
- превосходит базовые подходы на основе поиска, текстового и визуального сжатияспособы уложить документ в меньшее число токенов: отбор отдельных фрагментов по запросу, сжатие самого текста и сжатие изображения документа;
- обобщается на задачи понимания мультимодальных документов и кода, причём выигрыш в точности над базовыми подходами растёт с увеличением сжатия.
Ограничения и открытые вопросы
Заявленные границы применимости — 4.3x эффективного сжатия для точности уровня полного текста и до 10.1x для превосходства над базовыми подходами. Конкретные названия датасетов и бенчмарков, размеры выборок и документов не приводятся. Других числовых значений точности, экономии токенов или скорости не указано.
По данным каталога публикаций, работу цитируют 4 моделиобученные нейросетевые модели, размещённые на платформе и ссылающиеся на эту работу и 4 Spacesинтерактивные демонстрационные приложения, размещённые на платформе; датасетов и коллекций, ссылающихся на неё, нет. Сведений о доступных весах, коде или демо вместе с публикацией на странице paper page нет.