Назад к блогу

LensVLM: как читать длинные документы через сжатые изображения

LensVLM: как читать длинные документы через сжатые изображения

Apple предложила LensVLM — подход, при котором длинные документы скармливаются модели как изображения, а степень сжатия регулируется разрешением рендеринга, а не длиной токеновой последовательности. Вместо обработки всего текста целиком система сначала просматривает сжатые версии, а затем выборочно разворачивает только релевантные фрагменты, что позволяет экономить вычисления без потери точности. Статья будет интересна тем, кто работает с длинными документами и ищет альтернативу классическому поиску и токенизации, — особенно с учётом заявленного выигрыша над базовыми методами при росте сжатия.

Apple представила LensVLM — фреймворк инференса и рецепт пост-обучения для VLM. Идея в том, чтобы подавать текст как отрендеренные изображения и управлять объёмом вычислений через степень сжатия, а не через длину последовательности токенов. Работа доступна как статья 2605.07019.

Что именно изменилось

LensVLM обрабатывает текст как отрендеренные изображения, обходя необходимость токенизации в длинные последовательности токенов. Поскольку кодировщик изображений отображает изображение фиксированного размера в фиксированное число визуальных токенов, разрешение рендеринга становится точной ручкой сжатия: чем ниже разрешение, тем сильнее сжатие при том же числе токенов.

Проблема в том, что точность быстро падает с ростом сжатия — символы уменьшаются ниже эффективного разрешения кодировщика и становятся неразличимыми. LensVLM решает это так: модель сканирует сжатые изображения, а затем выборочно расширяет только релевантные изображения до несжатой формы. Это и есть Selective Context Expansion.

Анализ даёт практическое руководство по выбору инструмента: для отрендеренного текста предпочтительнее текстовое расширение, тогда как расширение изображения в высоком разрешении подходит для нативных документов, чьи подсказки макета несут релевантную задаче информацию.

Предыстория

VLM позволяют обрабатывать текст как отрендеренные изображения — это обходит токенизацию в длинные последовательности. Но у подхода есть предел: при росте сжатия модель всё больше полагается на расширенное содержимое, а не на ненадёжное визуальное чтение. Авторы обосновывают необходимость выборочного расширения именно этим падением точности.

Почему это сделали

Причина — деградация точности при сжатии: символы становятся меньше эффективного разрешения кодировщика и перестают различаться. Вместо полного расширения всех изображений (что вернуло бы стоимость обработки к уровню полного текста) авторы предлагают расширять только релевантные фрагменты. Обучение, по утверждению авторов, делает визуальное сжатие устойчивым к выбору рендеринга.

Что это меняет на практике

Для разработчиков, работающих с документами, это означает, что можно обойтись без токенизации текста в длинные последовательности, используя разрешение рендеринга как регулятор степени сжатия. Заявленные результаты:

  • LensVLM сохраняет точность, сопоставимую с точностью при подаче документа целиком, без сжатия;
  • превосходит базовые подходы на основе поиска, текстового и визуального сжатия;
  • обобщается на задачи понимания мультимодальных документов и кода, причём выигрыш в точности над базовыми подходами растёт с увеличением сжатия.

Ограничения и открытые вопросы

Заявленные границы применимости — 4.3x эффективного сжатия для точности уровня полного текста и до 10.1x для превосходства над базовыми подходами. Конкретные названия датасетов и бенчмарков, размеры выборок и документов не приводятся. Других числовых значений точности, экономии токенов или скорости не указано.

По данным каталога публикаций, работу цитируют 4 модели и 4 Spaces; датасетов и коллекций, ссылающихся на неё, нет. Сведений о доступных весах, коде или демо вместе с публикацией на странице paper page нет.

Источники

Похожее