Stanford HELM
榜单顶上先分五格
这个评测站的榜单页,顶上排着五格:能力、榜单、模型、场景、预测。最右边另挂一格,通向源码仓。
五格不是同一种东西。榜单是结果,模型是被测对象,场景是题目,预测是每一道题的回答,能力是这四样围绕的那件事。
把「预测」单独列成一格,是五格里最特别的一处。多数榜单只给分数,不给每条回答。
五格并排,大小一致。一个评测站把它认为要交代的五件事都摆在了一行上。
页首另有一行小字,写着这套榜单的版本号。分数会变,版本号跟着变。
它把提示词也公开了
不只是公开分数
说明段里有一句话写得非常具体:这套榜单提供完整到提示词一级的透明度。
提示词是评测里最容易被藏起来的一层。同一个模型,换一种问法,分数可能差出很多。问的是哪一句,恰恰是读分数时最需要知道、又最难拿到的东西。
多数榜单告诉你「得了多少分」,不告诉你「问的是什么」。这一套把问的是什么也摆出来。
题目是挑过的
另一段说明交代了场景的来源:这不是随手抓来的一堆题,是一组经过挑选的场景,用来衡量模型在不同方面的能力。
挑过这两个字很重要。它意味着出题的人对「该考什么」有一个判断,并且把这个判断摆在明处,而不是用规模盖过去。
场景一栏单独成页,说明每一道题的来源与考察点。题目本身也成了一个可以单独查看的对象。
提示词这一层
榜单一栏一栏分
能力、场景、模型。
提示词公开
问的是什么也写出来。
结果可重跑
用同一套框架自己跑。
场景先挑好
一组挑过的场景。
预测单独成栏
每条回答都留着。
框架公开
跑法写在文档里。
结果可以自己重跑一遍
那句说明的后半截是:结果可以用同一套框架完整复现。
复现这两个字,把评测从一次性的结论变成了一道可以验算的题。你不必相信那份分数,你可以自己跑一遍看对不对。
要让别人能重跑,光有题目不够,还得把跑法也交出去。所以源码仓那一格挂在了最右边。
多数榜单的分数是一份报告,读过就算。这里的分数是一份可以复核的记录。
提示词公开、场景公开、框架公开、每条回答单独成栏。四件事合起来,才撑得起复现这两个字。少一件,复现就断了。
同一套做法,用在好几个榜上
页面里提到,这套做法并非只此一份,同一个站上别的榜单也是同样的规矩。
也就是说,提示词公开与结果可复现不是某一个榜的特色,是整套体系的门槛。新开的榜也要照这个来。
分层上看,这个站把事情拆成了几层:最上面是能力,往下是榜单,再往下是模型与场景,最底下是每一条预测。
顶上五格的顺序,正好是这个层级从上到下的顺序。导航本身就是一张结构图。
看分数的人只读第一层,做评测的人要翻到最下面那一层。两层都摆着,谁也不挡谁。
一句话总结
这个评测站的榜单页顶上排着五格:能力、榜单、模型、场景、预测,最右另挂一格通向源码仓。说明段里写明两件事:提供完整到提示词一级的透明度,以及结果可以用同一套框架完整复现。题目不是随手抓的,是一组经过挑选的场景,单独成页说明来源与考察点。每条回答也单独成栏。站上别的榜单沿用同一套规矩,提示词公开与可复现是门槛而非特色。本站为条目陈列,不写金额,不提供任何资料文件。
要看那五格是怎么排的,从官网进去。







