盘古大模型 PANGULARGEMODELS-数据集发布场景介绍:数据发布介绍
数据发布介绍
ModelArts Studio大模型开发平台提供的数据发布功能涵盖数据评估和数据发布操作,旨在通过数据质量评估,确保数据满足大模型训练的多样性、平衡性和代表性需求,促进数据的高效流通和应用。
数据发布不仅包括将数据发布为适合使用的格式,还要求根据任务需求评估数据集效果,确保数据集在规模、质量和内容上符合模型训练的标准。
- 数据评估
平台预置了多种数据类型的基础评估标准,包括NLP、视频和图片数据,用户可根据需求选择预置标准或自定义评估标准,从而精确优化数据质量,确保数据满足高标准,提升模型性能。
- 数据发布
数据发布是将数据集发布为特定格式的“发布数据集”,用于后续模型训练等操作。支持的发布格式为标准格式、盘古格式(适用于训练盘古大模型时)。目前,仅文本类和图片类数据集支持发布为“盘古格式”。
通过这些功能,平台能够帮助用户科学管理和发布数据集,确保数据集质量符合大模型训练的需求,从而提高后续模型训练的效果。