Назад к блогу

Falcon-Emirati: как языковая модель осваивает диалект и культурный контекст

Falcon-Emirati: как языковая модель осваивает диалект и культурный контекст

Создание языковой модели, способной понимать не просто арабский, а его живой эмиратский диалект вместе с культурным контекстом, — задача принципиально иного уровня сложности, чем обычная адаптация под язык. Falcon-Emirati-7B показывает, как специализированная модель может уловить смысл там, где буквальный перевод бессилен. Это история о том, как аутентичные данные, культурные знания и продуманный выбор масштаба модели позволяют приблизиться к тому, как говорит настоящий носитель.

Арабский — это не один язык, а семейство языков под одним названием. Современный стандартный арабский (MSA) используется в новостях и учебниках, но редко в повседневной речи. В ОАЭ повседневный разговор, юмор, переговоры и рассказывание историй происходят на эмиратском арабском — диалекте Залива со своим словарём, ритмом и культурой. Модель, знающая только MSA, может перевести каждое слово эмиратского предложения и всё равно не понять его смысла. Falcon-Emirati-7B — попытка закрыть этот разрыв: диалектно-специализированная модель поверх Falcon-H1-Arabic, нацеленная на понимание и генерацию эмиратского арабского так, как это делал бы носитель.

Отправная точка и выбор масштаба

Авторы взяли за основу Falcon-H1-Arabic — модель, которая уже широко понимала арабский, хорошо обрабатывала длинный контекст и имела некоторую диалектную подготовку. Это дало сильный старт: базовая модель уже владела языком в широком смысле, и её оставалось продвинуть именно к эмиратскому диалекту — его словарю, грамматике и культурным знаниям, которые общая арабская модель сама по себе не усваивает.

Семейство Falcon-H1-Arabic охватывает три масштаба — 3B, 7B и 34B параметров — с контекстными окнами до 128K и 256K токенов. Для диалектной адаптации выбран именно 7B-вариант: он достаточно велик, чтобы удержать нюансы, нужные для диалектной адаптации, но достаточно мал, чтобы обучение и инференс оставались практичными. 34B-модель, вероятно, дала бы немного лучшее качество, но при затратах на обучение и обслуживание, которые не имеют смысла для диалектно-специализированной чат-модели. 3B-модель не оставляет достаточного запаса для глубины культурного и языкового понимания, к которому стремились авторы.

Три измерения специализации

Цель формулируется как обучение модели диалекту, культуре и нюансу. Разница между «понимать арабский» и «понимать эмиратский диалект» принципиальна: смысл часто небуквален. Идиомы, пословицы и поэтические отсылки опираются на общий культурный контекст, а не на поверхностную лексику. Поэтому модель, знающая только MSA, может перевести каждое слово и всё равно промахнуться мимо смысла.

Данные: аутентичный эмиратский веб-корпус

Аутентичный диалектный материал собирали путём обхода и отбора контента с эмиратских сайтов и форумов, написанного носителями на диалекте, а не переведённого или транслитерированного из MSA. Именно этот источник дал эталонное употребление — то, как эмиратцы реально пишут и говорят онлайн, включая повседневные формулировки, разговорные выражения и естественное чередование эмиратского и MSA.

От перевода MSA-контента отказались, потому что такой материал не передаёт аутентичную диалектную речь. Вместо этого MSA-материал о культуре и идентичности ОАЭ использовали отдельно.

Дополнительно генерировали синтетические эмиратские данные, но не позволяли генератору импровизировать в «Gulf-ish» арабском — его ограничивали строгими правилами, глоссариями и словарями, специально построенными для эмиратской лексики и грамматики.

Данные: MSA о культуре и идентичности ОАЭ

Диалектный корпус даёт модели то, как эмиратцы реально пишут и говорят. Слой MSA-материалов об эмиратской культуре и идентичности — статьи и ссылки об обычаях, ценностях, истории и социальных нормах, включая то, как эмиратцев воспринимают и стереотипизируют, — не учит писать на диалекте, а даёт знание предмета разговора: наследие, этикет и контекст, который носитель знает сам. Это важно, потому что значение в диалекте часто небуквально и опирается на общий культурный контекст.

Диалектные данные и MSA-данные о культуре — это отдельные наборы данных, а не отдельные этапы обучения. При этом нет установленного рецепта, как смешивать диалектные данные с MSA и общим арабским и на каком этапе обучения это делать: continued pre-training, SFT или preference optimization. Авторы проводили абляции по объёму диалектных данных и стадии обучения, по балансу аутентичных и синтетических данных — чтобы модель не переобучалась на синтетические паттерны, — а также по объёму MSA-культурного контекста, необходимого, чтобы модель оставалась культурно обоснованной, а не только поверхностно беглой. На каждом шаге опирались на сочетание автоматических оценок и проверки носителями, поскольку автоматические метрики сами по себе не улавливают естественность, тон и культурное соответствие достаточно надёжно.

Оценка носителями: что именно проверяли

Носители эмиратского диалекта просматривали выходы модели напрямую, судя не только о правильности ответа, но и о том, звучит ли он правильно: естественность, тон, культурная уместность. Это то, что балл бенчмарка не покажет, но носитель улавливает сразу.

Для количественного отслеживания использовался бенчмарк Alyah — полностью нативный набор из 1 173 образцов. Falcon-Emirati-7B набрал на Alyah 84,83%, опередив все другие арабские и многоязычные модели, с которыми его сравнивали.

Почему multiple-choice accuracy недостаточно

Точность выбора ответа показывает лишь, может ли модель распознать правильный ответ среди четырёх вариантов. Она не показывает, будет ли модель сама порождать эмиратский арабский в разговоре, когда с ней просто говорят. Поэтому авторы провели вторую оценку — открытую генерацию на тех же 1 173 вопросах Alyah, которую оценивал LLM-судья. В роли такого судьи выступала Gemini 3.7 Flash: она оценивала каждый ответ по двум отдельным измерениям — правильность содержания и, независимо, пришёл ли ответ на эмиратском диалекте, а не на MSA. Оценка по диалекту выставлялась по градации, поэтому возможен частичный зачёт: ответ не обязан быть либо полностью на диалекте, либо полностью на MSA — судья может признать его лишь отчасти диалектным.

Это выявило разрыв, который multiple-choice не улавливает. На диалектной верности Falcon-Emirati-7B набрал 0.52 (частичный зачёт) против 0.05 у ALLaM, 0.03 у gemma-3-27b-it, 0.02 у Jais-2-8B-Chat и практически 0.00 у Fanar-2-27B-Instruct. На практике это означает, что другие модели часто знают правильный ответ, но по умолчанию говорят его на современном стандартном арабском, даже когда к ним обращаются на эмиратском.

Как сравнивали и что получилось

Методология. Диалектная верность измерялась на тех же 1 173 вопросах Alyah в режиме открытой генерации с Gemini 3.7 Flash в роли судьи. Судья оценивал каждый ответ по двум независимым измерениям: правильность содержания и то, пришёл ли ответ на эмиратском диалекте, а не на MSA. Сообщаются как частичный балл (оценка судьи по градации), так и более строгая версия pass/fail, плюс частота воздержаний вместо ответа: воздержанием считается случай, когда модель предпочла не отвечать, а не дать ответ на диалекте; эта метрика показывает, насколько охотно модель вообще берётся за эмиратский контент.

Результаты по Dialect fidelity (частичный балл):

МодельDialect fidelity
Falcon-Emirati-7B0.52
ALLaM0.05
gemma-3-27b-it0.03
Jais-2-8B-Chat0.02
Fanar-2-27B-Instruct~0.00

Преимущество держится во всех категориях Alyah — от повседневных приветствий до поэзии. Это говорит о том, что модель не выучила узкий трюк для нескольких типов вопросов, а по умолчанию переключилась на эмиратский регистр, когда он ожидается. Единственная категория, где конкурирующие модели выступают относительно лучше, — Greetings & Daily Expressions, потому что именно там эмиратский и MSA пересекаются сильнее всего, и обычной арабской модели легче случайно звучать правильно.

Попарное судейство. Для каждого вопроса Alyah судье показывали ответ Falcon-Emirati-7B рядом с ответом конкурирующей модели, вслепую, и просили выбрать лучший. Falcon-Emirati-7B выигрывает большинство категорий у всех трёх конкурентов, а самые широкие отрывы — в Poetry & Creative Expression и Language & Dialect.

Против Jais-2-8B-Chat разрыв наибольший в Poetry & Creative Expression (0.69 против 0.31) и Language & Dialect (0.62 против 0.38). Против Fanar-2-27B-Instruct модель побеждает в каждой категории, с максимумом в Poetry & Creative Expression (0.88 против 0.12) и Religious & Social Sensitivity (0.80 против 0.20). В Greetings & Daily Expressions Falcon-Emirati-7B немного уступает Jais-2-8B-Chat (0.46 против 0.54) и делит поровну с ALLaM-7B-Instruct-preview (0.50), но выигрывает у Fanar-2-27B-Instruct (0.70 против 0.30).

Культурное понимание. Оценка проводилась на UAE-порции бенчмарка ArabCulture-Dialogue. Использовались одни и те же 283 UAE-сценария в двух языковых вариантах — эмиратский арабский и MSA. В задании с множественным выбором модель выбирает наиболее культурно уместный ответ из трёх вариантов.

МодельArabCulture-Dialogue (UAE)
Falcon-Emirati-7B85.57%
ALLaM-7B83.39%
Jais-2-8B73.79%
Fanar-2-27B71.50%

Оговорки. Культурная точность измеряется на 283 сценариях ОАЭ в формате множественного выбора, а диалектная верность — на 1 173 вопросах Alyah в формате открытой генерации. Источники не утверждают, что эти два измерения связаны статистически. Высокая доля отказов Fanar-2-27B-Instruct вместе с низкой точностью указывает на меньшую готовность и способность работать с эмиратским контентом, а не просто на ответ в неверном регистре.

Компромиссы и ограничения

Специализация на одном диалекте даёт выигрыш в качестве, но сопряжена с компромиссами по стоимости и объёму данных. Сам диалект плохо представлен в письменных источниках: эмиратский — в основном разговорный диалект, он появляется в письменной онлайн-речи куда реже, чем MSA или даже другие диалекты Залива и Леванта, поэтому сырого текста для обучения просто меньше.

Методология оценки тоже имеет границы. Multiple-choice не показывает, будет ли модель сама говорить на диалекте, — поэтому и добавлена открытая генерация с судьёй-LLM. Диалект и культурные нюансы местами субъективны: даже носители не всегда согласятся с «правильным» ответом. Авторы рекомендуют оценивать модель под конкретный сценарий перед использованием в чувствительных, официальных или высокорисковых задачах. Модель может отражать предвзятости обучающих данных и иногда ошибаться — особенно на редких выражениях, сильно локализованных отсылках или краевых случаях, по которым было мало данных.

О переносимости подхода на другие диалекты источники ничего не утверждают.

Что из этого следует на практике

  • Точность выбора ответа не равна владению диалектом. Модель может уверенно распознавать правильный вариант среди четырёх и при этом по умолчанию отвечать на MSA. Если нужен именно диалектный регистр на выходе, оценивать надо открытую генерацию, а не только multiple-choice.
  • Диалектная верность и культурная уместность — разные оси. Их измеряют на разных наборах и в разных форматах; высокий балл по одной не гарантирует другую.
  • Культурный слой не учит говорить на диалекте. MSA-материалы о культуре дают понимание темы разговора, а не навык диалектной речи; для речи нужен аутентичный диалектный корпус.
  • Синтетику нужно ограничивать. Свободная генерация в «Gulf-ish» арабском не годится — работают только жёсткие правила, глоссарии и словари под конкретную лексику и грамматику.
  • Автоматических метрик недостаточно. Естественность, тон и культурное соответствие надёжно ловит только носитель, поэтому проверка носителями — не дополнение, а обязательный этап.
  • Приветствия — самая обманчивая категория. Там эмиратский и MSA пересекаются сильнее всего, поэтому обычная арабская модель может случайно звучать правильно, не имея диалектной подготовки.

Источники

Похожее