自由 开放 发现 分享 专业 助力
注册

认知网精选 · 认知

FlagEval

四类对象,四个维度
一条流程摆在下面。
flageval.baai.ac.cn

一句话定位

FlagEval 是一套大模型评测体系与开放平台。页面把它自己写成天秤。

首页先讲对象与维度,再把一条流程摆出来。

四类对象,四个场景,一条流程。

顶部那一行

前四项

首页、排行榜、大模型角斗场与具身评测依次排开。一项看结果,一项比着看,一项专测具身。

后几项

评测介绍、新闻、评测控制台与登录注册收在右侧。一处讲怎么做,一处讲近况,一处给要发起评测的人。

首页四个词

页头把定位压成四个词:科学、公正、权威与开放。四词并排,不排先后。

四大评测领域

头一块是大语言模型,下面挂着八项能力:简单理解、数学能力、代码能力、知识运用、推理能力、任务解决、指令遵循,以及安全与价值观。

第二块是多模态大模型,分成视觉语言模型、文生图与文生视频三项。第三块是计算机视觉,按深度估计、图像分类、图像检索、语义分割与小样本分类分开。

第四块是语音语言大模型,按语音感知、音频感知、语音生成与口语理解分成四类。四块各占一大片。

六项能力

排行榜

顶部一格,看结果的地方。

角斗场

顶部一格,让两个模型比着看。

多模态评测

按视觉语言、文生图与文生视频分。

计算机视觉

按几类视觉任务分开评。

语音评测

按感知与生成分成四类。

评测流程

从数据到榜单的一条线。

语言模型那八项能力

八项能力各配一句解释:简单理解是对信息的分析与概括;数学能力是按定理做符号运算;代码能力是写、读与改程序。

知识运用看的是用常识与专业知识答问;推理能力看的是结合常识与逻辑做判断;任务解决看的是在具体任务里调动资源把事情做完。

后面两项对着人:指令遵循看的是能不能照具体要求回答;安全与价值观看的是内容是否安全、是否带有歧视。八项一排,从读懂排到守规矩。

一条评测流程摆在页面下方

流程从左边起:公开数据集与自建数据集,接着是预训练模型、微调模型、推理服务与监控,再往后是自动评测与人工评测两条并排。

两条评测之后是校验,末尾落在排行榜上。整条线从左到右排开,每一步一格。

合作那一栏

页面末尾另排一栏讲合作团队与共建数据集,配一处填写入口。

页面里没有的东西

首页没有标价表,也没有产品售卖入口。版面落在四大领域与一条流程上。

页脚排着开源项目、开放模型、开放数据、技术教程与社区几处,末尾是隐私与开源协议。

首页不直接摆名次,结果都在排行榜那一格里。页面上也不点评具体模型。

一句话总结

FlagEval 是一套大模型评测体系与开放平台,页面把它自己写成天秤,页头把定位压成科学、公正、权威与开放四个词。顶部导航从首页、排行榜、大模型角斗场一路排到评测控制台与登录注册。首页把评测分成四块:大语言模型的八项能力、多模态大模型、计算机视觉与语音语言大模型。页面下方另摆一条评测流程,从公开数据集与自建数据集,经预训练与微调,一路排到校验与排行榜。本站为条目陈列,不写金额,不提供任何资料文件。

想看看那条流程是怎么排的,从官网进去。

前往 flageval.baai.ac.cn

回顶部

Copyright © 2021-2026 陕ICP备2021016533号-1法律条款