Арабский — это не один язык, а семейство языков под одним названием. Современный стандартный арабскийнаддиалектная письменная форма арабского, используемая в новостях, учебниках и официальных документах, но редко в повседневной речи (MSA) используется в новостях и учебниках, но редко в повседневной речи. В ОАЭ повседневный разговор, юмор, переговоры и рассказывание историй происходят на эмиратском арабском — диалекте Заливагруппа арабских диалектов стран Персидского залива, к которой относится и эмиратский арабский со своим словарём, ритмом и культурой. Модель, знающая только MSA, может перевести каждое слово эмиратского предложения и всё равно не понять его смысла. Falcon-Emirati-7B — попытка закрыть этот разрыв: диалектно-специализированная модель поверх Falcon-H1-Arabicсемейство арабских моделей на гибридной архитектуре Falcon-H1 с масштабами 3B, 7B и 34B параметров и контекстными окнами до 128K и 256K токенов, нацеленная на понимание и генерацию эмиратского арабского так, как это делал бы носитель.
Отправная точка и выбор масштаба
Авторы взяли за основу Falcon-H1-Arabic — модель, которая уже широко понимала арабский, хорошо обрабатывала длинный контекст и имела некоторую диалектную подготовку. Это дало сильный старт: базовая модель уже владела языком в широком смысле, и её оставалось продвинуть именно к эмиратскому диалекту — его словарю, грамматике и культурным знаниям, которые общая арабская модель сама по себе не усваивает.
Семейство Falcon-H1-Arabic охватывает три масштаба — 3B, 7B и 34B параметров — с контекстными окнами до 128K и 256K токенов. Для диалектной адаптации выбран именно 7B-вариант: он достаточно велик, чтобы удержать нюансы, нужные для диалектной адаптации, но достаточно мал, чтобы обучение и инференс оставались практичными. 34B-модель, вероятно, дала бы немного лучшее качество, но при затратах на обучение и обслуживание, которые не имеют смысла для диалектно-специализированной чат-модели. 3B-модель не оставляет достаточного запаса для глубины культурного и языкового понимания, к которому стремились авторы.
Три измерения специализации
Цель формулируется как обучение модели диалекту, культуре и нюансу. Разница между «понимать арабский» и «понимать эмиратский диалект» принципиальна: смысл часто небуквален. Идиомы, пословицы и поэтические отсылки опираются на общий культурный контекст, а не на поверхностную лексику. Поэтому модель, знающая только MSA, может перевести каждое слово и всё равно промахнуться мимо смысла.
Данные: аутентичный эмиратский веб-корпус
Аутентичный диалектный материал собирали путём обхода и отбора контента с эмиратских сайтов и форумов, написанного носителями на диалекте, а не переведённого или транслитерированного из MSA. Именно этот источник дал эталонное употребление — то, как эмиратцы реально пишут и говорят онлайн, включая повседневные формулировки, разговорные выражения и естественное чередование эмиратского и MSA.
От перевода MSA-контента отказались, потому что такой материал не передаёт аутентичную диалектную речь. Вместо этого MSA-материал о культуре и идентичности ОАЭ использовали отдельно.
Дополнительно генерировали синтетические эмиратские данные, но не позволяли генератору импровизировать в «Gulf-ish» арабскомприблизительном, «заливском на слух» арабском, без точного следования нормам конкретного диалекта — его ограничивали строгими правилами, глоссариями и словарями, специально построенными для эмиратской лексики и грамматики.
Данные: MSA о культуре и идентичности ОАЭ
Диалектный корпус даёт модели то, как эмиратцы реально пишут и говорят. Слой MSA-материалов об эмиратской культуре и идентичности — статьи и ссылки об обычаях, ценностях, истории и социальных нормах, включая то, как эмиратцев воспринимают и стереотипизируют, — не учит писать на диалекте, а даёт знание предмета разговора: наследие, этикет и контекст, который носитель знает сам. Это важно, потому что значение в диалекте часто небуквально и опирается на общий культурный контекст.
Диалектные данные и MSA-данные о культуре — это отдельные наборы данных, а не отдельные этапы обучения. При этом нет установленного рецепта, как смешивать диалектные данные с MSA и общим арабским и на каком этапе обучения это делать: continued pre-trainingдообучение на большом массиве текста до основного этапа настройки, SFTдообучение на примерах правильных ответов или preference optimizationнастройка на предпочтениях, где модель учат выбирать лучший из вариантов ответа. Авторы проводили абляции по объёму диалектных данных и стадии обучения, по балансу аутентичных и синтетических данных — чтобы модель не переобучалась на синтетические паттерны, — а также по объёму MSA-культурного контекста, необходимого, чтобы модель оставалась культурно обоснованной, а не только поверхностно беглой. На каждом шаге опирались на сочетание автоматических оценок и проверки носителями, поскольку автоматические метрики сами по себе не улавливают естественность, тон и культурное соответствие достаточно надёжно.
Оценка носителями: что именно проверяли
Носители эмиратского диалекта просматривали выходы модели напрямую, судя не только о правильности ответа, но и о том, звучит ли он правильно: естественность, тон, культурная уместность. Это то, что балл бенчмарка не покажет, но носитель улавливает сразу.
Для количественного отслеживания использовался бенчмарк Alyahнабор заданий с множественным выбором, собранный вручную от носителей эмиратского диалекта; охватывает категории от повседневных приветствий и этикета до образного языка, знания наследия и эмиратской поэзии — полностью нативный набор из 1 173 образцов. Falcon-Emirati-7B набрал на Alyah 84,83%, опередив все другие арабские и многоязычные модели, с которыми его сравнивали.
Почему multiple-choice accuracy недостаточно
Точность выбора ответа показывает лишь, может ли модель распознать правильный ответ среди четырёх вариантов. Она не показывает, будет ли модель сама порождать эмиратский арабский в разговоре, когда с ней просто говорят. Поэтому авторы провели вторую оценку — открытую генерацию на тех же 1 173 вопросах Alyah, которую оценивал LLM-судьяотдельная языковая модель, которая читает ответ и выносит по нему свою оценку. В роли такого судьи выступала Gemini 3.7 Flash: она оценивала каждый ответ по двум отдельным измерениям — правильность содержания и, независимо, пришёл ли ответ на эмиратском диалекте, а не на MSA. Оценка по диалекту выставлялась по градации, поэтому возможен частичный зачёт: ответ не обязан быть либо полностью на диалекте, либо полностью на MSA — судья может признать его лишь отчасти диалектным.
Это выявило разрыв, который multiple-choice не улавливает. На диалектной верности Falcon-Emirati-7B набрал 0.52 (частичный зачёт) против 0.05 у ALLaM, 0.03 у gemma-3-27b-it, 0.02 у Jais-2-8B-Chat и практически 0.00 у Fanar-2-27B-Instruct. На практике это означает, что другие модели часто знают правильный ответ, но по умолчанию говорят его на современном стандартном арабском, даже когда к ним обращаются на эмиратском.
Как сравнивали и что получилось
Методология. Диалектная верность измерялась на тех же 1 173 вопросах Alyah в режиме открытой генерации с Gemini 3.7 Flash в роли судьи. Судья оценивал каждый ответ по двум независимым измерениям: правильность содержания и то, пришёл ли ответ на эмиратском диалекте, а не на MSA. Сообщаются как частичный балл (оценка судьи по градации), так и более строгая версия pass/fail, плюс частота воздержаний вместо ответа: воздержанием считается случай, когда модель предпочла не отвечать, а не дать ответ на диалекте; эта метрика показывает, насколько охотно модель вообще берётся за эмиратский контент.
Результаты по Dialect fidelityдоля ответов, действительно пришедших на эмиратском диалекте, а не на современном стандартном арабском (частичный балл):
| Модель | Dialect fidelity |
|---|---|
| Falcon-Emirati-7B | 0.52 |
| ALLaM | 0.05 |
| gemma-3-27b-it | 0.03 |
| Jais-2-8B-Chat | 0.02 |
| Fanar-2-27B-Instruct | ~0.00 |
Преимущество держится во всех категориях Alyah — от повседневных приветствий до поэзии. Это говорит о том, что модель не выучила узкий трюк для нескольких типов вопросов, а по умолчанию переключилась на эмиратский регистр, когда он ожидается. Единственная категория, где конкурирующие модели выступают относительно лучше, — Greetings & Daily Expressions, потому что именно там эмиратский и MSA пересекаются сильнее всего, и обычной арабской модели легче случайно звучать правильно.
Попарное судейство. Для каждого вопроса Alyah судье показывали ответ Falcon-Emirati-7B рядом с ответом конкурирующей модели, вслепую, и просили выбрать лучший. Falcon-Emirati-7B выигрывает большинство категорий у всех трёх конкурентов, а самые широкие отрывы — в Poetry & Creative Expression и Language & Dialect.
Против Jais-2-8B-Chat разрыв наибольший в Poetry & Creative Expression (0.69 против 0.31) и Language & Dialect (0.62 против 0.38). Против Fanar-2-27B-Instruct модель побеждает в каждой категории, с максимумом в Poetry & Creative Expression (0.88 против 0.12) и Religious & Social Sensitivity (0.80 против 0.20). В Greetings & Daily Expressions Falcon-Emirati-7B немного уступает Jais-2-8B-Chat (0.46 против 0.54) и делит поровну с ALLaM-7B-Instruct-preview (0.50), но выигрывает у Fanar-2-27B-Instruct (0.70 против 0.30).
Культурное понимание. Оценка проводилась на UAE-порциичасти бенчмарка ArabCulture-Dialogue, собранной специально по Объединённым Арабским Эмиратам бенчмарка ArabCulture-Dialogue. Использовались одни и те же 283 UAE-сценария в двух языковых вариантах — эмиратский арабский и MSA. В задании с множественным выбором модель выбирает наиболее культурно уместный ответ из трёх вариантов.
| Модель | ArabCulture-Dialogue (UAE) |
|---|---|
| Falcon-Emirati-7B | 85.57% |
| ALLaM-7B | 83.39% |
| Jais-2-8B | 73.79% |
| Fanar-2-27B | 71.50% |
Оговорки. Культурная точность измеряется на 283 сценариях ОАЭ в формате множественного выбора, а диалектная верность — на 1 173 вопросах Alyah в формате открытой генерации. Источники не утверждают, что эти два измерения связаны статистически. Высокая доля отказов Fanar-2-27B-Instruct вместе с низкой точностью указывает на меньшую готовность и способность работать с эмиратским контентом, а не просто на ответ в неверном регистре.
Компромиссы и ограничения
Специализация на одном диалекте даёт выигрыш в качестве, но сопряжена с компромиссами по стоимости и объёму данных. Сам диалект плохо представлен в письменных источниках: эмиратский — в основном разговорный диалект, он появляется в письменной онлайн-речи куда реже, чем MSA или даже другие диалекты Залива и Леванта, поэтому сырого текста для обучения просто меньше.
Методология оценки тоже имеет границы. Multiple-choice не показывает, будет ли модель сама говорить на диалекте, — поэтому и добавлена открытая генерация с судьёй-LLM. Диалект и культурные нюансы местами субъективны: даже носители не всегда согласятся с «правильным» ответом. Авторы рекомендуют оценивать модель под конкретный сценарий перед использованием в чувствительных, официальных или высокорисковых задачах. Модель может отражать предвзятости обучающих данных и иногда ошибаться — особенно на редких выражениях, сильно локализованных отсылках или краевых случаях, по которым было мало данных.
О переносимости подхода на другие диалекты источники ничего не утверждают.
Что из этого следует на практике
- Точность выбора ответа не равна владению диалектом. Модель может уверенно распознавать правильный вариант среди четырёх и при этом по умолчанию отвечать на MSA. Если нужен именно диалектный регистр на выходе, оценивать надо открытую генерацию, а не только multiple-choice.
- Диалектная верность и культурная уместность — разные оси. Их измеряют на разных наборах и в разных форматах; высокий балл по одной не гарантирует другую.
- Культурный слой не учит говорить на диалекте. MSA-материалы о культуре дают понимание темы разговора, а не навык диалектной речи; для речи нужен аутентичный диалектный корпус.
- Синтетику нужно ограничивать. Свободная генерация в «Gulf-ish» арабском не годится — работают только жёсткие правила, глоссарии и словари под конкретную лексику и грамматику.
- Автоматических метрик недостаточно. Естественность, тон и культурное соответствие надёжно ловит только носитель, поэтому проверка носителями — не дополнение, а обязательный этап.
- Приветствия — самая обманчивая категория. Там эмиратский и MSA пересекаются сильнее всего, поэтому обычная арабская модель может случайно звучать правильно, не имея диалектной подготовки.