摩尔线程开源音频吞并大模子MooER：基于国产全功能GPU教师和推理

发布日期：2024-08-25 13:19 点击次数：156

　　摩尔线程AI团队在该职责中开源了推理代码和5000小时数据教师的模子。

IT之家 8 月 23 日音信，摩尔线程开源了音频吞并大模子 —MooER（摩耳），是业界首个基于国产全功能 GPU 进行教师和推理的大型开源语音模子。

基于摩尔线程夸娥（KUAE）智算平台，MooER 大模子用 38 小时完成了 5000 小时音频数据和伪标签的教师。

MooER 不仅扶持中语和英文的语音识别，还具备中译英的语音翻译智力。在 Covost2 中译英测试辘集，MooER-5K 赢得了 25.2 的 BLEU 分数，投资理财接近工业级后果。

摩尔线程 AI 团队在该职责中开源了推理代码和 5000 小时数据教师的模子，并策划进一步开源教师代码和基于 8 万小时数据教师的模子。

MooER 的模子结构包括 Encoder、Adapter 和 Decoder（Large Language Model，LLM）三个部分，具体的模子参数限度如下：