英文原标题:Falcon-Emirati: When an LLM Learns the Dialect, the Culture, and the Nuance

本文为英文原文的机器翻译摘要,原文见:Hugging Face Blog ↗

  • Falcon-Emirati-7B 是构建在 Falcon-H1-Arabic 之上的方言专用模型,旨在理解和生成阿联酋阿拉伯语,包括词汇、语气和文化背景。
  • Falcon-H1-Arabic 采用 Falcon-H1 混合架构,结合 Mamba 状态空间模型和 Transformer 注意力,提供线性时间效率和长距离依赖精度,支持 3B、7B、34B 参数规模和高达 128K/256K 令牌的上下文窗口。
  • 方言适应面临挑战:阿联酋方言多为口语,书面数据少;含义常非字面;缺乏标准配方。团队通过试错确定数据混合、训练阶段和监督策略。
  • 数据管道包括三个来源:真实的阿联酋方言网络数据、关于阿联酋文化和身份的 MSA 数据、以及受词汇表和风格规则约束的合成数据。
  • 评估结合母语者手动评估和自动基准 Alyah,Alyah 包含 1,173 个样本,涵盖问候、礼仪、比喻语言、遗产知识和诗歌等类别。

关键数据

  • Falcon-Emirati-7B 在 Alyah 基准上得分 84.83%。
  • Alyah 基准包含 1,173 个样本。
  • Falcon-H1-Arabic 支持 3B、7B、34B 参数规模和高达 128K/256K 令牌的上下文窗口。

为什么值得看:Falcon-Emirati-7B 展示了如何通过方言专用化让 LLM 掌握阿联酋阿拉伯语及其文化细微差别,为方言适应提供了实验性方法和评估基准。

站内导航