我要投稿

腾讯开源Hunyuan-Large，3890亿参数，全球最大开源MoE模型

发布日期：2024-11-05 16:57:19 浏览次数： 1929

作者：猜想笔记

微信搜一搜，关注“猜想笔记”

模型技术优势介绍

高质量合成数据：通过使用合成数据增强训练，Hunyuan-Large 可以学习更丰富的表示，处理长上下文输入，并更好地推广到看不见的数据。

KV 缓存压缩：利用分组查询注意（GQA）和跨层注意（CLA）策略显著减少 KV 缓存的内存使用量和计算开销，提高推理吞吐量。

专家特定的学习率缩放：为不同的专家设置不同的学习率，以确保每个子模型有效地从数据中学习并有助于整体性能。

长上下文处理能力：预训练模型支持高达256K的文本序列，Instruct模型支持高达128K，显著增强了处理长上下文任务的能力。
广泛的基准测试：在多种语言和任务上进行大量实验，验证Hunyuan-Large的实用有效性和安全性。

基准评估

与具有相似激活参数大小的 Dense 和 MoE 竞争对手相比， Hunyuan-Large 预训练模型取得了最佳整体性能。

对于 MMLU、MMLU-Pro 和 CMMLU 等聚合基准，Hunyuan-Large 始终取得最佳性能，证实了其在聚合任务上的综合能力。

Hunyuan-Large 在常识理解和推理以及经典 NLP 任务（例如 QA 和阅读理解任务，例如 CommonsenseQA、PIQA 和 TriviaQA）中也表现出色。

对于数学能力，Hunyuan-Large 在 GSM8K 和 MATH 数学数据集上的表现优于所有基线，并且在中文 CMATH 上也获得了最佳结果。Hunyuan-Large 在所有中文任务（例如 CMMLU、C-Eval）中取得了整体最佳性能。

与具有类似激活参数的 LLM 相比，Hunyuan-Large-Instruct在大多数类型的任务上都实现了持续改进，表明了后训练的有效性。

深入研究不同类别基准测试中的模型性能，instruct 模型在 MMLU 和 MATH 数据集上取得了最佳性能。

值得注意的是，在 MMLU 数据集上，模型表现出显着的改进，比 LLama3.1-405B 模型高出 2.6%。

这种增强不仅仅是微不足道的，而是表明 Hunyuan-Large-Instruct 在广泛的语言理解任务中具有出色的理解和推理能力。该模型在 MATH 数据集上的表现进一步凸显了其实力，它比 LLama3.1-405B 明显高出 3.6%。

值得注意的是，这种准确度的飞跃仅通过 520 亿个激活参数就实现了，凸显了模型的效率。

PS：腾讯还开源了一个3D生成大模型。

END.

【重磅】一键接入扣子、Dify，FastGPT等开发平台

企业内部AI 先行者已通过扣子、Dify 等智能体开发平台积极探索 "人 + AI" 的效率革新。这些应用大多局限于小范围应用，基于此，我们打造一款开箱即用的 AI 门户-53AI Hub，让企业实现从 "场景级效率优化" 到 "企业级生产力重构" 的跨越....

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费场景POC验证，效果验证后签署服务协议。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2025-05-27

Dify工具插件开发和智能体开发全流程实战

2025-05-26

太猛了，字节把GPT-4o级图像模型开源了！

2025-05-26

MinerU：高精度纸媒文档解析与数据提取一站式解决方案

2025-05-26

顶级开发者默默换掉了基础大模型

了解更多

了解更多

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

大家都在问

蚂蚁集团开源antv的MCP服务：AI智能体与数据可视化的桥梁如何搭建？

2025-05-26

拆解OpenAI最大对手的杀手锏：为什么会是MCP？

2025-05-25

从基础大模型到场景适配，企业如何做好商业化最后一公里？

2025-05-23

AI 开源框架：Dify、Zylon、AutoGPT、Flowise、LangChain、React-Flow怎么选？

2025-05-17

刚刚，OpenAI丢出最强编程智能体Codex！倒反天罡——新上线功能竟是微软Copilotb鼻祖？

2025-05-17

刚刚，OpenAI发布自主编码代理Codex，程序员的工作将被彻底颠覆？

2025-05-17

告别谷歌！阿里开源ZeroSearch大模型搜索成本直降88%，性能竟超原版？

2025-05-16

事实证明千问qwen3小模型才是企业的生产力，他究竟能做什么呢？

2025-05-14

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI 知识管理开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB

应聘简历请发送至： ceo@53ai.com

联系我们

售前咨询

预约演示

微信扫码

添加专属顾问

回到顶部