News brief
正文
今日,北京智源人工智能研究院正式宣布开源其最新研发的百亿级高质量中文指令微调数据集。该数据集总规模达到120亿Token,包含超过800万条精心构建的指令与回复对,是目前国内规模最大、质量最高的开源中文微调数据集之一。据技术负责人介绍,该数据集在构建过程中采用了严格的数据飞轮机制,结合了自动化清洗、多模型交叉验证以及人类专家抽检。数据集内容广泛覆盖了代码生成、数学推理、长文本摘要、角色扮演及多轮复杂对话等20多个垂直领域。在基准测试中,使用该数据集微调的7B参数开源模型,在中文评测榜单上的成绩平均提升了8.5个百分点,尤其在逻辑推理和代码生成任务上表现优异。该数据集采用Apache 2.0许可证完全免费开放,支持学术研究与商业应用。智源研究院院长表示,高质量数据是决定大模型能力上限的关键因素,此次开源旨在打破数据壁垒,降低国内中小企业的研发门槛,共同繁荣中文大模型开源生态。