(资料图片)
本报上海8月15日电(记者沈文敏)近日,上海人工智能实验室宣布联合语料数据联盟成员单位,共同开源发布“书生·万卷”1.0多模态预训练语料。
“书生·万卷”1.0集合了语料数据联盟成员丰富的内容积累与上海人工智能实验室的数据处理能力等优势,将为学术界及产业界提供高质量大模型多模态预训练语料。本次开源的数据总量超过2TB,具备多元融合、精细处理、价值对齐、易用高效等四大特征。
本次开源的“书生·万卷”1.0包含文本、图文、视频三部分数据集。其中文本数据来自网页、百科、书籍、专利、教材、考题等,数据总量超过5亿个文档,数据大小超过1TB,覆盖科技、文学、媒体、教育、法律等多个领域;图文数据主要来自公开网页,经处理后形成图文交错文档,总量超过2200万个,数据大小超过140GB(不含图片),覆盖新闻事件、人物、自然景观、社会生活等多个领域;视频数据主要来自中央广播电视总台和上海文广集团,包含新闻、影视等多种类型的节目影像,总计视频文件数超过1000个,数据大小超过900GB,内容覆盖军事、文艺、体育、自然、知识、影像艺术等方面。
《 人民日报 》( 2023年08月16日 12 版)
关键词:
相关的文章>>
热门搜索:
资讯
更多图说健康
更多疏风解毒胶囊的作用与功效是什么?疏风解毒胶囊可以起到解毒利咽...
艾叶的功效与作用有哪些?1、散寒止痛艾叶为菊科蒿属植物艾的叶...
治疗白发的偏方有哪些?1 桑白皮30克,五倍子15克,青葙子60...
紫癜性肾炎是什么病?所谓的紫癜性肾炎,就是由于患者对于某些东...
维生素ad是什么?维生素AD是指维生素A和D的混合制剂,是两种脂溶...
乙肝小三阳严重吗?乙肝小三阳有些比较严重,也有些不太严重的,...
常见疾病
更多体育健身
更多证券时报网讯,云南能投8月14日在交易所互动平台中披露,截至8...
新华社客户端浙江频道8月16日电(孔令杭、叶磊)“小朋友们,你...
近日,“自己拍的照片被视觉中国告侵权”登上热搜。2019年,视...
红网时刻新闻记者任晔李兵实习生胡晫媛长沙报道编者按:湘商,...
大众网见习记者吴雪莹通讯员魏忠国史金玉济宁报道近年来,邹城...
《夺宝奇兵5:命运转盘》已于8月15日宣布,其数字版将于8月29日...