LLM 人类仿真研究追踪 arXiv 持续筛选

How It Works

这个站怎么挑论文

每天从 arXiv 的三百多条更新里挑出真正相关的十几篇。 整件事分三步,取论文、筛论文、把结果摆出来。这一页说清楚每一步在做什么判断。

01取论文

每天把十个分类的新论文收齐

用大语言模型替代人类被试,这个方向的论文分散得厉害。它可能出现在计算语言学下面, 也可能挂在经济学或者社会物理学底下。只盯一两个分类会漏,所以订阅范围放宽到十个。

每天取回三百八十条左右,去掉重复的还有二百八十篇上下。 取的是标题、摘要、作者、分类和发布日期。这一步不做任何判断,只负责收齐。

02筛论文

先粗后精,两轮筛到十几篇

关键词过滤在这里不管用。多智能体协作、机器人仿真、角色扮演聊天机器人, 这三类在字面上跟目标高度重合,研究设计却完全是另一回事,是最容易认错的地方。 所以两轮筛选都交给能读懂研究设计的模型,而不是靠词表匹配。

  1. 粗筛二百八十篇筛到几十篇

    快速过一遍当天全部论文,只判断沾不沾边,明显无关的剔掉。 这一轮刻意放宽,宁可多留几篇也不误杀。

  2. 精判逐篇打分并给出理由

    留下来的逐篇细看,对照准则判定相关程度,同时给出中文标题、命中了哪几条准则、 四十字以内的判定理由和几个标签。判定结果分成高度相关、相关和不相关三种, 前两种进网页,不相关的直接丢掉。

  3. 深读进网页的都读一遍原文

    凡是进了网页的论文都会回头读原文,整理成六个方面的中文摘要,分别是研究问题、 仿真设计、人类基准、主要发现、可靠性讨论,以及跟本方向的关系。

03什么算相关

四类准则决定一篇论文的去留

A 类决定是否相关,B 类决定分数高低,C 类直接排除,D 类划出需要人工看一眼的边界。 打分和理由都对照这份准则给出,所以每条判定都能回头核对。

A核心判据,命中任意一条即高度相关
  • A1把 LLM 当人类被试的替代品,复现或预测调查回答、实验行为、态度分布、决策模式
  • A2评估这类仿真的可靠性、偏差与外部效度
  • A3用 LLM agent 群体模拟社会经济政治过程,并与真实人类数据对照
  • A4提出方法论规范、报告标准或验证框架
  • A5生成合成样本,用于社会科学的数据增强或预调研
B加分项,在 A 类基础上抬高分数
  • B1有真实人类数据作对照基准,这是区分严肃研究与演示的关键
  • B2涉及经济学实验、行为博弈、政策评估
  • B3讨论识别策略、因果推断与统计推断的有效性
  • B4批判性视角,指出仿真失效的条件
C排除项,命中即判不相关
  • C1纯多智能体系统研究,不涉及人类行为对照
  • C2机器人、自动驾驶、游戏中的仿真环境
  • C3角色扮演对话与人格化聊天,无实验或测量目的
  • C4纯能力评测刷分,不以人类为参照系
  • C5用人类数据训练或对齐模型,方向相反
D边界情形,判 5 到 6 分进待定区
  • D1LLM 做标注员替代人工标注,是替代人类劳动但不是仿真被试
  • D2给 LLM 做人格问卷,测的是模型不是人群
  • D3社会模拟但无人类数据对照,属于纯理论演示
档位什么样的论文去向
高度相关直接把大语言模型当人类被试用,通常还有真实人类数据作对照进网页,红色标示
相关方法或结论可迁移,或者属于需要自己扫一眼再判断的边界情形进网页,灰色标示
不相关命中排除项,或者跟人类行为对照无关不进网页

04怎么看结果

为扫读设计

这个页面每天打开一次,每次停留可能不到一分钟。版面上的安排都围绕一件事, 让人尽快判断哪几篇值得点开。

档位靠颜色

每张卡片左侧一道色条,红的是高度相关,灰的是相关。 眼睛沿着左边一列往下扫就能定位重点,不必逐条读标题。

判定理由不折叠

四十字以内的理由默认就显示。它比标题更能说明这篇论文跟你的关系, 藏起来就失去了意义。完整的六方面深读才需要展开。

准则编号可以点

卡片上的 A1、B4 这类编号既是判定证据,也是筛选入口。点一下就只看命中同一条准则的论文, 用来回答最近有多少篇带真实人类对照这类问题。

只分两档,不给分数

判定时内部是打分的,但页面上不显示。精确到个位的分数会让人误以为它很准, 实际上相邻两分之间的差别经不起推敲。两档加颜色,足够决定先读哪几篇。

05做不到什么

这个站不能替你做什么

判定由模型给出,会出错

评分和理由都来自大语言模型。它会漏掉措辞特别的相关论文, 也会把边界情形放进待定区。待定区的存在就是承认这一点,那里的东西需要人自己看。

arXiv 上的是预印本,未经同行评审。分数高只代表跟本方向相关,不代表研究质量可靠。

这不是系统综述。订阅范围是十个分类的日更,没有回溯全部历史文献, 也不覆盖期刊论文和会议论文集。它解决的是每天跟进的问题,不是文献调研的问题。