OpenDataLab
第一遍,按「它是什么」切
OpenDataLab 的首页是一栏数据集列表,最上面先给一行筛选项。
筛选行的头一格是全部,后面依次跟着计算机视觉、自然语言处理、多模态、通用机器学习、音频识别、其他。
每一格后面都缀着一个计数,数字都很大,格与格之间的差距一眼看得出来。计算机视觉与自然语言处理两格最大,其他几格明显小。
这一遍切法问的是:这批数据拍的是图,还是写的字,还是几样混在一起。
分类轴用的是数据本身的模态,跟拿它干什么没有关系。
第二遍,按「拿来干嘛」切
往下一段,轴换了
列表再往下,另有一组分区,共三段,每段两行字。
头一段的上一行写着预训练,下一行写着启动大模型。第二段的上一行写着微调,下一行写着优化大模型。第三段的上一行写着评测,下一行写着评价大模型。
三段的上一行是动作,下一行是这句动作要达到的目的。两组词一一对应,字数也压得差不多。
同一批货,两条路
上面那遍按模态分,下面那遍按用途分。同一批数据集,被这两套轴切了两次。
按模态分,回答的是「这是什么」。按用途分,回答的是「我能拿它做什么」。两种问法对应两种来意:一种是来找素材的,一种是来找工具的。
多数数据站只留一套轴,通常就是模态那套。多留一套,等于承认有一部分人进来时想的是任务,不是数据类型。
同一批,切两遍
头一遍按模态
视觉、语言、多模态。
第二遍按用途
预训练、微调、评测。
专题推荐
另起一栏,共七项。
每条带体量
体积写在名字旁边。
两套入口
同一批货,两条路。
总计数在最上
一排分类,各有计数。
专题推荐另起一栏
两套轴之间,还夹着一栏专题推荐,横向排开七项。
七项分别是语料联盟、独家开源、优质数据、多语言语料、研究合作、标准化、可视化数据。每一项下面挂一句短说明。
这七项既不是模态,也不是用途,属于第三种切法:按供应方式和合作方式来分。
一页之内容纳了三套分类轴,彼此不打架,各占一段版面。第一段讲是什么,第二段讲怎么来的,第三段讲能干嘛。
每个条目都带着体量
列表里的每一条数据集,除了名字与一句说明,旁边还并排摆着几格信息。
头一格是体积,单位用大写字母表示。后面跟着两格计数,再往后缀着一条日期。
体积是这一栏里最硬的一项。其他几格是别人的动作留下的痕迹,体积是这批数据本身的分量。
把体积摆在这么靠前的位置,说明它假设来的人先关心「能不能装下」,再关心别的。
页面最上方还有一条横幅,指向一个更大的科学知识数据集合。横幅之下的主体,才是那个数据集列表。
一页三套轴,一条横幅压在最上面。
一句话总结
OpenDataLab 的首页把同一批数据集切了两遍。头一遍是筛选行,按计算机视觉、自然语言处理、多模态等模态分,每格缀着计数;再往下一段换成用途轴,按预训练、微调、评测三段排开,每段上一行是动作,下一行是要达到的目的。两遍之间还夹着一栏专题推荐,共七项,走的是供应与合作方式的第三种切法。列表里每条数据集都并排标着体积、两格计数与一条日期。本站为条目陈列,不写金额,不提供任何资料文件。
要看那两套分类轴怎么并排,从官网进去。







