FlagEval
一句话定位
FlagEval 是一套大模型评测体系与开放平台。页面把它自己写成天秤。
首页先讲对象与维度,再把一条流程摆出来。
四类对象,四个场景,一条流程。
顶部那一行
前四项
首页、排行榜、大模型角斗场与具身评测依次排开。一项看结果,一项比着看,一项专测具身。
后几项
评测介绍、新闻、评测控制台与登录注册收在右侧。一处讲怎么做,一处讲近况,一处给要发起评测的人。
首页四个词
页头把定位压成四个词:科学、公正、权威与开放。四词并排,不排先后。
四大评测领域
头一块是大语言模型,下面挂着八项能力:简单理解、数学能力、代码能力、知识运用、推理能力、任务解决、指令遵循,以及安全与价值观。
第二块是多模态大模型,分成视觉语言模型、文生图与文生视频三项。第三块是计算机视觉,按深度估计、图像分类、图像检索、语义分割与小样本分类分开。
第四块是语音语言大模型,按语音感知、音频感知、语音生成与口语理解分成四类。四块各占一大片。
六项能力
排行榜
顶部一格,看结果的地方。
角斗场
顶部一格,让两个模型比着看。
多模态评测
按视觉语言、文生图与文生视频分。
计算机视觉
按几类视觉任务分开评。
语音评测
按感知与生成分成四类。
评测流程
从数据到榜单的一条线。
语言模型那八项能力
八项能力各配一句解释:简单理解是对信息的分析与概括;数学能力是按定理做符号运算;代码能力是写、读与改程序。
知识运用看的是用常识与专业知识答问;推理能力看的是结合常识与逻辑做判断;任务解决看的是在具体任务里调动资源把事情做完。
后面两项对着人:指令遵循看的是能不能照具体要求回答;安全与价值观看的是内容是否安全、是否带有歧视。八项一排,从读懂排到守规矩。
一条评测流程摆在页面下方
流程从左边起:公开数据集与自建数据集,接着是预训练模型、微调模型、推理服务与监控,再往后是自动评测与人工评测两条并排。
两条评测之后是校验,末尾落在排行榜上。整条线从左到右排开,每一步一格。
合作那一栏
页面末尾另排一栏讲合作团队与共建数据集,配一处填写入口。
页面里没有的东西
首页没有标价表,也没有产品售卖入口。版面落在四大领域与一条流程上。
页脚排着开源项目、开放模型、开放数据、技术教程与社区几处,末尾是隐私与开源协议。
首页不直接摆名次,结果都在排行榜那一格里。页面上也不点评具体模型。
一句话总结
FlagEval 是一套大模型评测体系与开放平台,页面把它自己写成天秤,页头把定位压成科学、公正、权威与开放四个词。顶部导航从首页、排行榜、大模型角斗场一路排到评测控制台与登录注册。首页把评测分成四块:大语言模型的八项能力、多模态大模型、计算机视觉与语音语言大模型。页面下方另摆一条评测流程,从公开数据集与自建数据集,经预训练与微调,一路排到校验与排行榜。本站为条目陈列,不写金额,不提供任何资料文件。
想看看那条流程是怎么排的,从官网进去。







