Data Colada
一句话定位
它是一家由三位行为科学教授合写的博客,题目只有一个:证据。
它把自己的范围收得很窄:只谈研究结论是怎么被算出来的,以及算得站不站得住。
它把同一份数据反过来再算一遍
它常做的一件事,是把已经发表的研究拿回来,用原始数据重跑一遍。
它关心的不是结论好不好听,而是从数据走到结论的那几步有没有滑过去。
换一种分组、换一种检验、去掉一个异常点,结论还在不在,它都写出来。
它先造工具,再用工具
写文章之外,它自己做了几样东西。
有一样是用来判断一批研究有没有被挑着报的统计工具,方法公开在站上,谁都能用。
有一样是预注册平台,让研究者在动手之前先把方案挂出来。
还有一样是存放研究数据与代码的空间,用来接替那些停掉的旧平台。
它复核时通常看哪几处
- 数据本身。表里的数字和正文里的数字,对不对得上。
- 分析路径。同一批数据换个同样合理的做法,结论会不会翻。
- 报告的完整度。一共有多少种分析被做出来,其中几种被写进了论文。
- 文件的痕迹。原始表格里留没留下不该留下的编辑信息。
一条可疑结论被翻出来的顺序
它的做法不神秘,也不快:先被同一个题目里的矛盾绊住,再回去找数据。
先撞上一个说不通的点
某个数字或某张图与其它部分对不上,让人停下来。
再去找原始数据
向作者、期刊或公开仓库要那份数据本身。
然后用工具重跑
按公开的方法重新算一遍,看结论在什么条件下才成立。
最后把过程写出来
连自己的做法一并交代,让读者能照着复算。
它很少直接给出「造假」两个字,更多时候是把复算过程摊开,让读者自己判断。
它怎么写文章
文章按顺序编号,一路写到第一百多篇,每篇署明是谁执笔。
语气直白:先讲发生了什么,再讲怎么查的,最后讲还有哪部分没弄明白。
它也写方法本身,一段代码怎么写、一个检验为什么在这里不适用,都写。
它不下判决,它摆出过程
它不掌握处分权,也不向任何机构报送结论。
它做的是把可复算的过程公开,让「这个结论站不站得住」变成一件可以讨论的事。
这条边界它守得很清楚:说证据,不说人。
一句话总结
它做的事说起来只有一件:把一份已经发表的研究拿回来,用原始数据重新算一遍,再把过程写出来。它不判谁对谁错,它让「这个结论是怎么来的」这件事,可以被别人照着复算。
想看它怎么把一份研究拆开重算,可以从这里进。







