01取论文
每天把十个分类的新论文收齐
用大语言模型替代人类被试,这个方向的论文分散得厉害。它可能出现在计算语言学下面, 也可能挂在经济学或者社会物理学底下。只盯一两个分类会漏,所以订阅范围放宽到十个。
每天取回三百八十条左右,去掉重复的还有二百八十篇上下。 取的是标题、摘要、作者、分类和发布日期。这一步不做任何判断,只负责收齐。
02筛论文
先粗后精,两轮筛到十几篇
关键词过滤在这里不管用。多智能体协作、机器人仿真、角色扮演聊天机器人, 这三类在字面上跟目标高度重合,研究设计却完全是另一回事,是最容易认错的地方。 所以两轮筛选都交给能读懂研究设计的模型,而不是靠词表匹配。
-
粗筛二百八十篇筛到几十篇
快速过一遍当天全部论文,只判断沾不沾边,明显无关的剔掉。 这一轮刻意放宽,宁可多留几篇也不误杀。
-
精判逐篇打分并给出理由
留下来的逐篇细看,对照准则判定相关程度,同时给出中文标题、命中了哪几条准则、 四十字以内的判定理由和几个标签。判定结果分成高度相关、相关和不相关三种, 前两种进网页,不相关的直接丢掉。
-
深读进网页的都读一遍原文
凡是进了网页的论文都会回头读原文,整理成六个方面的中文摘要,分别是研究问题、 仿真设计、人类基准、主要发现、可靠性讨论,以及跟本方向的关系。
03什么算相关
四类准则决定一篇论文的去留
A 类决定是否相关,B 类决定分数高低,C 类直接排除,D 类划出需要人工看一眼的边界。 打分和理由都对照这份准则给出,所以每条判定都能回头核对。
- A1把 LLM 当人类被试的替代品,复现或预测调查回答、实验行为、态度分布、决策模式
- A2评估这类仿真的可靠性、偏差与外部效度
- A3用 LLM agent 群体模拟社会经济政治过程,并与真实人类数据对照
- A4提出方法论规范、报告标准或验证框架
- A5生成合成样本,用于社会科学的数据增强或预调研
- B1有真实人类数据作对照基准,这是区分严肃研究与演示的关键
- B2涉及经济学实验、行为博弈、政策评估
- B3讨论识别策略、因果推断与统计推断的有效性
- B4批判性视角,指出仿真失效的条件
- C1纯多智能体系统研究,不涉及人类行为对照
- C2机器人、自动驾驶、游戏中的仿真环境
- C3角色扮演对话与人格化聊天,无实验或测量目的
- C4纯能力评测刷分,不以人类为参照系
- C5用人类数据训练或对齐模型,方向相反
- D1LLM 做标注员替代人工标注,是替代人类劳动但不是仿真被试
- D2给 LLM 做人格问卷,测的是模型不是人群
- D3社会模拟但无人类数据对照,属于纯理论演示
| 档位 | 什么样的论文 | 去向 |
|---|---|---|
| 高度相关 | 直接把大语言模型当人类被试用,通常还有真实人类数据作对照 | 进网页,红色标示 |
| 相关 | 方法或结论可迁移,或者属于需要自己扫一眼再判断的边界情形 | 进网页,灰色标示 |
| 不相关 | 命中排除项,或者跟人类行为对照无关 | 不进网页 |
04怎么看结果
为扫读设计
这个页面每天打开一次,每次停留可能不到一分钟。版面上的安排都围绕一件事, 让人尽快判断哪几篇值得点开。
档位靠颜色
每张卡片左侧一道色条,红的是高度相关,灰的是相关。 眼睛沿着左边一列往下扫就能定位重点,不必逐条读标题。
判定理由不折叠
四十字以内的理由默认就显示。它比标题更能说明这篇论文跟你的关系, 藏起来就失去了意义。完整的六方面深读才需要展开。
准则编号可以点
卡片上的 A1、B4 这类编号既是判定证据,也是筛选入口。点一下就只看命中同一条准则的论文, 用来回答最近有多少篇带真实人类对照这类问题。
只分两档,不给分数
判定时内部是打分的,但页面上不显示。精确到个位的分数会让人误以为它很准, 实际上相邻两分之间的差别经不起推敲。两档加颜色,足够决定先读哪几篇。
05做不到什么
这个站不能替你做什么
判定由模型给出,会出错
评分和理由都来自大语言模型。它会漏掉措辞特别的相关论文, 也会把边界情形放进待定区。待定区的存在就是承认这一点,那里的东西需要人自己看。
arXiv 上的是预印本,未经同行评审。分数高只代表跟本方向相关,不代表研究质量可靠。
这不是系统综述。订阅范围是十个分类的日更,没有回溯全部历史文献, 也不覆盖期刊论文和会议论文集。它解决的是每天跟进的问题,不是文献调研的问题。