2026年8月2日,CCF YOCSEF兰州在西北民族大学文津楼802举办“不被遗忘的声音:多民族语言与大模型的交汇之路”技术论坛。论坛由CCF YOCSEF兰州AC副主席徐世鹏(甘肃政法大学)和CCF YOCSEF兰州AC委员索郎王青(西北民族大学)担任执行主席,特邀来自北京大学、中国科学技术大学、哈尔滨工业大学、内蒙古大学、新疆师范大学、西藏民族大学等多位高校与科研院所的专家学者,以及CCF YOCSEF哈尔滨和昆明的AC委员,同YOCSEF兰州AC委员以及兰内高校青年教师和科技工作者一起开展了跨学科、跨地域的交流讨论。论坛围绕低资源语言能力增强、多民族语言大模型训练范式、文化与安全对齐、全流程评测及规模化应用等问题展开交流,旨在探索语言传承、文化保护与智能应用协同发展的可行路径。
当前大模型技术持续革新,全面重塑知识生产、传播与应用模式。相较于汉语、英语等高资源语言,我国多民族语言普遍存在数字语料存量有限、分布不均、适配技术工具匮乏、文化语义难以精准表达等现实短板,数字化、智能化发展进程相对滞后。本次论坛以“不被遗忘的声音”为核心切入点,搭建学界与产业界跨界交流平台,旨在通过观点碰撞与技术研讨,持续提升多民族语言在数字空间的表达能力、服务能力与传承能力,为多语言人工智能领域创新发展贡献新思路与新方案。
图1 论坛背景介绍
论坛伊始,西北民族大学人工智能学院、中国民族信息技术研究院马宁书记致欢迎辞。他表示,语言是文化的基因和民族记忆的重要载体,多民族语言在大模型时代既面临数字资源匮乏和技术支撑不足的现实压力,也蕴含着大量具有独特价值的文化知识。推动多民族语言搭上大模型发展的快车,不仅是技术创新问题,也是文化传承与社会责任问题。他期待与会嘉宾直面困难、充分思辨,在观点碰撞中凝聚共识,探索更加开放、包容、安全可信的多语言人工智能发展路径。随后,执行主席徐世鹏介绍了CCF YOCSEF“承担社会责任、提升成员能力”的宗旨,以及责任、激情、引领、平等的文化,鼓励与会者直呼其名、不盲从、不惧权威,围绕议题充分表达观点。
图2 马宁书记致辞
【引导发言】
图3 冯岩松作引导发言
本次论坛邀请四位领域专家作引导发言,围绕低资源民族语言大模型关键技术、研究成果与落地实践分享前沿进展。北京大学王选计算机研究所副教授冯岩松以“大模型低资源语言能力增强技术”为题作引导发言。他表示,低资源语言普遍存在预训练语料、指令数据、推理数据稀缺等问题,依托传统机器翻译扩量数据,易产生语义偏差、丢失民族文化特征。针对极小资源场景下的模型适配难题,其团队通过注入词典语法规则、引入少量真实语言样本、结构化语言规则伪代码化等方式,有效提升模型对小众语言知识的学习效率。针对不同低资源语言模型能力不均衡、任务表现偏弱的问题,团队结合语言特性、任务类型与模型规模开展增益优化,搭配动态语言切换、监督微调与强化学习机制,引导模型精准完成多场景推理输出。他强调,低资源语言研究不能只追求模型指标,更要注重模型与民族语言、文化知识的适配交互规律。
图4 徐童作引导发言
中国科学技术大学计算机科学与技术学院教授徐童以“面向复杂场景的多步链式推理”为题作引导发言,从可解释性、推理效率、智能体训练三方面分享大模型推理优化技术。针对大模型思维链推理证据不足、可追溯性差等痛点,团队将推理过程与视觉证据归因结合,通过逐层求精奖励机制,显著提升复杂推理的可信度。针对多模型协同存在的编解码冗余、缓存开销过大等问题,其团队采用共享中间表征与在线重计算方案,复用KV Cache资源,有效降低推理延迟与存储成本。同时,针对智能体机械模仿、理解能力不足的问题,研究通过设置训练“信息鸿沟”,倒逼模型主动识别缺失信息、发起人机交互,并建立多维度模型评价体系。该训练机制可有效提升小参数模型的复杂任务性能,为低资源语言大模型的工具调用与多步推理提供了成熟技术范式。
图5 诺明花作引导发言
内蒙古大学计算机学院、人工智能学院诺明花教授以“蒙古文智能信息处理关键技术研究与应用”为题作引导发言,系统介绍了团队四十余年的科研积淀与产业化成果。团队深耕蒙古文数字化与智能化研究,搭建完成总量约6TB的多模态蒙古文数据资源库,补齐了领域核心数据短板,实现蒙古文语音识别合成、多语种互译、文字校正、OCR识别、古籍检索等全链条技术突破。依托核心技术成果,团队落地建设蒙古文AI云平台、古籍资源库、蒙医药知识库、双语虚拟数字人等多款应用产品,自研“奥云”蒙古文大模型已广泛应用于智能问答、文本生成、双语翻译等场景。她指出,多民族语言智能技术发展需紧密结合文化整理、公共服务与产业需求,依托科研合作推动民族语言智能技术与文化成果对外传播。
图6 李亚超作引导发言
西北民族大学人工智能学院、中国民族信息技术研究院教授李亚超以“多语言翻译大模型实践”为题作引导发言,分享了多民族语言翻译模型的研发与落地经验。他指出,通用大模型在藏语、维语、蒙古语等低资源语言场景中,普遍存在长文本翻译失真、专业术语错译、上下文连贯性不足等问题。为此,团队整合多领域双语资料与术语词典,构建多层次高质量平行语料库,弥补低资源语言数据短板。针对长文本翻译不稳定的问题,创新采用多维度指令混合训练方式,有效提升模型适配性。在模型训练策略上,团队对比不同微调方案优劣,提出分层参数训练思路,在模型性能与算力成本间实现平衡,同时优化后训练奖励机制,重点提升民族语言专业场景的翻译精度与应用可靠性。
图7 为四位引导嘉宾颁发感谢牌
【思辨环节】
引导发言结束后,论坛进入思辨环节。与会专家学者围绕多民族语言大模型技术挑战、训练范式选择、全流程评测与规模化演进三大议题展开深入交流,也延伸到文化传承、国家安全、产业应用和可持续机制,充分体现了CCF YOCSEF“思其本质、辨其真伪”的思辨文化。
1.构建多民族语言大模型面临的主要技术挑战
与会嘉宾一致认为,高质量数据供给不足是民族语言大模型研发的核心瓶颈之一。哈尔滨工业大学冯驰骋总结行业痛点:少数民族语言普遍存在语料体量小、场景单一、方言差异大、标注标准碎片化等问题,现有资源集中于政务、新闻通用文本,民俗、科技、文化等细分场景语料稀缺。机器翻译扩充数据易带入外源语言偏差,无法贴合本土语义与文化特质。他认为需加快古籍、出版物、非遗及行业资料数字化建设,搭建统一可复用的数据标注体系,夯实研发基础。
多语言输出一致性与民族文化独特性的平衡,是本次思辨重点共识。现场明确:通用事实内容可实现多语言输出统一,但民族历史、民俗文化等特色内容,不可用通用模型单一视角替代本土特质。新疆师范大学艾孜尔古丽·玉素甫表示,民族语言智能的核心是文化语境与价值边界理解,而非简单翻译生成,需规避机械转换带来的文化误读。因此,文化对齐、价值对齐与内容安全需贯穿研发全流程,依托多学科专家审核,守住文化与安全底线。
通用大模型适配性不足的问题受到集中关注。兰州大学郑炜豪指出,现有模型分词、编码机制适配中英等高资源语言,无法适配维语、哈语等黏着语形变特征,也难以适配藏语自由语序与长距离语义特性,易出现分词错乱、推理低效等问题。嘉宾们建议,需针对各语种语法特性定制专属分词、编码模块,同时攻克多语言训练引发的模型“遗忘”问题,兼顾语种适配能力与模型稳定性。
论坛聚焦模型落地与长效发展展开讨论。兰州交通大学张斌提出,当前多数民族语言模型止步实验室研究,缺失真实用户场景与数据闭环,难以持续迭代。兰州大学付钰补充,文旅、政务、双语教育等场景刚需明确,但行业依赖政策扶持、市场化机制不足,迭代动力有限。她强调,该领域承载文化传承、公共服务与国家安全价值,不能以短期商业效益简单评判。
YOCSEF昆明副主席李英、内蒙古大学诺明花等嘉宾认为低资源语言训练易出现能力制衡问题,新增语种知识易挤压模型通用能力,民间轻量化便民需求也难以被精准覆盖。论坛最终共识:民族语言大模型研发需技术创新与场景落地并行,依托真实应用积累本土语料、形成数据飞轮,实现技术、文化、应用协同可持续发展。
2.多民族语言大模型应选择通用大模型微调,还是从头预训练
与会专家除了从“微调”和“从零预训练”二元对立观点表述之外,出现的一种比较普遍的观点就是:需要结合低资源语种特性、算力短板与落地实际,形成分层、分场景、分阶段的差异化技术迭代。唐元琨指出,地方团队算力、语料、人力资源有限,完全从零预训练不具备普适落地条件,现阶段必须依托通用大模型基座开展增量预训练与指令微调,是性价比最高、落地性最强的研发路径。通用模型具备成熟的跨语言迁移能力,能够快速适配民族语言基础任务、大幅降低研发门槛。常文文补充,通用模型跨语种迁移存在能力不均问题,高资源语言能力溢出、民族低资源语言短板突出,单纯全局微调易破坏模型通用能力,需采用局部微调+领域增量预训练的混合范式。对此兰州理工大学张明虎也表示,民族语言语料体量有限,从零全量预训练算力成本高昂、落地难度大,不具备普适推广价值。
同时与会嘉宾明确,单一微调存在明显能力上限,无法适配复杂研发场景。西北民族大学李冠宇结合藏语语音研究实操指出,针对小众语种特殊文字体系、古籍解析、多模态处理、深层文化推理等任务,纯微调难以突破通用模型的原生架构局限,容易出现语义偏差、文化理解缺失等问题。徐童提出增量预训练+任务微调+专家小模型协同的混合研发方案,通过专属词表扩充、领域预训练补齐基础语言能力,依托专项专家模型赋能特色复杂场景。同时技术路线需贴合部署场景灵活取舍,李英认为,云端服务可依托高性能大模型拓展能力,而翻译终端、嵌入式设备等对实时性、隐私、算力敏感的场景,轻量化微调、模型蒸馏与量化压缩是最优适配方案。
冯岩松结合通用模型迭代规律提出,民族语言模型研发切忌盲目跟风头部大模型内卷通用能力,低资源语种的核心攻关重点在于场景适配与文化适配,而非参数规模堆叠。针对行业同质化内卷的现状,兰州大学付钰、内蒙古大学诺明花等嘉宾提出,地方科研团队无需对标头部厂商做通用能力迭代,应聚焦本土高质量语料建设、语种语法适配、特色文化融入、专属评测体系搭建与垂直场景落地,打造不可替代的差异化核心优势。民族语言大模型研发摒弃单一技术路线,采取分层差异化迭代策略,以通用模型微调、增量预训练保障快速落地,复杂场景搭配专家模型协同赋能,终端场景依托轻量化技术适配部署,深耕民族语言特色,构建可持续、差异化的研发体系。
3.多民族语言大模型的全流程评测、规模化部署与可持续演进路径
针对民族语言模型评测标准单一、贴合度低、落地失真等痛点,嘉宾们摒弃通用量化逻辑,提出分层阶梯式评测体系。冯岩松率先提出民族语言评测不能照搬通用模型指标体系,必须贴合语种特性与文化属性。随后新疆师范大学艾孜尔古丽·玉素甫细化构建三层评测框架:基础层校验拼写、形态、语音、翻译等通用语言能力;场景层聚焦政务、教育、文旅、非遗传播等真实落地任务;安全文化层重点考核民族术语、文化语境、价值边界与内容合规能力。大家强调,评测不能依赖单一BLEU指标,需综合长文本理解、篇章一致性与真实用户体验。
现场大力倡导动态评测机制,解决固定测试集刷榜失真问题。哈尔滨工业大学冯驰骋、中国科学技术大学徐童指出,公开固定数据集易被数据污染、定向拟合,榜单成绩无法反映真实能力。论坛建议搭建持续迭代的内部测试库与动态抽题机制,结合自动化指标、专家评审、用户反馈多维评价,实现模型长效校验。针对民族文化类开放问题,模型需呈现多元文化视角,避免单一输出消解本土文化多样性。
围绕长效可持续发展,论坛形成政产学研用协同闭环共识。艾金勇和李亚超认为政府负责顶层设计与规范统筹,高校科研团队主攻语料归集与技术攻关,企业承担工程化落地与场景推广,用户与文化专家参与数据审核、内容优化。同时需培育“AI+民族文化+行业应用”复合型人才,以真实场景驱动数据迭代与模型优化,推动民族语言智能技术合规长效发展。
图8 思辨环节嘉宾发言
【论坛总结】
经过三个议题的充分研讨,本次论坛凝练形成多项结果:第一,高质量、多元化、规范化语料资源短缺是多民族语言大模型研发的核心瓶颈,语料体系建设需与语言标准构建、文化知识挖掘、安全治理规范同步推进;第二,通用大模型可为低资源语言智能化提供基础能力支撑,但各民族语言在文字系统、语法结构、方言体系与文化知识层面存在显著差异,无法套用统一技术方案,需依托持续预训练、任务微调、专家模型协同、模型压缩等多元技术融合攻关;第三,模型应用价值需通过真实场景落地与动态评测体系综合检验,在合规框架下构建完整的数据反馈与迭代闭环;第四,多民族语言智能化发展兼具学术研究、产业落地、文化传承与公共服务多重属性,是一项重要的社会工作,需要政府、高校、科研院所、企业及语言社区多方协同、长期推进。
在思辨的最后执行主席徐世鹏和索郎王青进行了小结,多民族语言大模型建设面临资源储备、技术攻关、市场落地、治理规范等多重挑战,但相关研究与应用工作具有重要价值,必须持续深耕推进。模型研发与落地应用需严守文化适配、内容安全与合规底线,更要坚持场景赋能、落地为要,依托专业评测、规模化部署与用户真实反馈构建良性迭代闭环,推动模型能力、语言资源体系与应用服务水平协同提升、共同发展。
图9 为特邀嘉宾颁发感谢牌
论坛最后,CCF YOCSEF兰州老主席、西北民族大学人工智能学院林强院长对本次论坛进行了点评和总结。他指出,本次论坛引导报告立意有高度、思辨讨论有锐度,各与会嘉宾观点坦诚交流、充分交锋,生动彰显了CCF YOCSEF平等、理性、敢于质疑的核心文化。论坛精准聚焦多民族语言数据稀缺、模型适配不足、场景落地困难等行业关键问题,不仅为西北民族大学相关领域科研工作提供了全新思路与研究视角,也为青年教师和研究生深耕民族语言智能研究带来了积极的精神鼓舞。他希望全体与会人员将YOCSEF的思辨精神带入自己的学习和工作中,将本次论坛的思辨成果与研究启发带回实验室与课堂,在后续科研与教学实践中持续传承思辨精神、主动担当学科发展与文化传承的社会责任。
图10 林强院长作总结点评
本次论坛以“不被遗忘的声音”为核心主题,在前沿技术探索与民族文化责任之间搭建了深度对话桥梁。推动多民族语言迈入智能化、大模型时代,既需要长期深耕精细化的语料资源归集与行业标准建设,也需要立足民族语言特性开展针对性技术创新,更需要构建可持续的应用生态与治理体系。本次论坛的举办,有效汇聚了多民族语言数字化与智能化发展的行业共识,为助力少数民族语言文化在人工智能时代被看见、被理解、被传承,推动多语言智能生态高质量发展提供了有力支撑。
图11 与会人员合影
撰写:索郎王青
初审:徐世鹏、常文文
终审:CCF YOCSEF兰州主席会议成员














