arXiv 每日追踪 · LLM 人类仿真研究 · 数据更新于 2026-09-29 13:00 · 回到网站
本站每天自动抓 arXiv 十个分类的新论文,用大模型逐篇判定与研究方向的相关性, 再给高分论文生成结构化中文总结。这里把全部结果开放成一组静态 JSON 文件, 直接取用,不需要密钥,也没有调用次数限制。
每天 13:00(UTC+8)自动更新,arXiv 周末不公告,周六周日无新增
所有地址以 https://arxiv.lingnan.top/api/v1/ 开头。先读 meta.json,
里面有完整的端点清单、字段说明和当前统计,其余地址都能从它发现。
curl -s https://arxiv.lingnan.top/api/v1/meta.json
# Python:拉全量判定结果,转成 DataFrame
import pandas as pd, requests
d = requests.get("https://arxiv.lingnan.top/api/v1/papers.json", timeout=60).json()
df = pd.json_normalize(d["papers"])
print(df.query("bucket == 'selected'")[["id", "date", "score", "zh_title"]])
# 某一周的切片。每周发布时取这个
r = requests.get("https://arxiv.lingnan.top/api/v1/weeks/2026-W40.json", timeout=60).json()
for p in r["papers"]:
if p["bucket"] == "selected":
print(p["score"], p["zh_title"] or p["title"])
print(" ", (p.get("summary") or {}).get("findings", ""))
浏览器里跨域取也可以,响应带 Access-Control-Allow-Origin: *。
表格工具直接读 papers.csv,UTF-8 BOM,Excel 能认。
| 地址 | 说明 |
|---|---|
meta.json | 本文件:统计、字段说明、端点清单 |
papers.json | 判定层全量,2794 篇,含评分与总结 |
papers.min.json | 判定层精简,去掉摘要与作者,索引用 |
selected.json | 入选(≥8 分),380 篇 |
summaries.json | 有结构化中文总结的,766 篇 |
latest.json | 最近 14 天 |
weeks/index.json | 周切片目录 |
weeks/{YYYY-Www}.json | 某个 ISO 周,如 weeks/2026-W38.json |
months/index.json | 月切片目录(含未判定论文) |
months/{YYYY-MM}.json | 某个月全部论文的索引,不含摘要,完整记录去 papers/{id}.json 取 |
papers/{arxiv_id}.json | 单篇,如 papers/2608.07367.json |
papers.csv | 判定层表格,Excel 和 pandas 直接读 |
rubric.json | 评分准则编号与含义 |
runs.json | 最近 30 次抓取运行记录,用来确认数据新不新 |
| 字段 | 含义 |
|---|---|
id | arXiv 编号,不含版本号,如 2608.07367 |
version | 当前收录的版本号,整数。出过修订版的会大于 1 |
title | 英文标题 |
zh_title | 中文标题,模型翻译。未进入精判的为空串 |
abstract | arXiv 原文摘要。低分论文的摘要会被定期清理,可能为空串 |
authors | 作者列表 |
categories | arXiv 分类列表,首个为主分类 |
primary_category | 主分类 |
announce_type | arXiv 公告类型:new | cross | replace | replace-cross |
date | 排序日期:出过修订版取修订日,否则取首次收录日 |
first_seen | 首次收录日,永不改动 |
revised_at | 最近一次修订公告日,没出过修订版为 null |
abs_url | arXiv 摘要页链接 |
pdf_url | arXiv PDF 链接。本站不转存全文,请从 arxiv.org 取 |
source_feed | 从哪个分类的订阅进来 |
score | 相关性评分 0-10,整数。null 表示未判定或判定失败 |
bucket | 分档:selected(>=8) | pending(>=7) | other | failed | unscored |
rubric_hits | 命中的评分准则编号,含义见 /api/v1/rubric.json |
tags | 中文主题标签,最多 3 个 |
reason | 判定理由,40 字内 |
model | 打分所用模型 |
scored_at | 打分时间,ISO8601 本地时间(UTC+8) |
error | 判定失败时的错误信息,正常为 null |
has_summary | 是否有结构化中文总结 |
summary | 结构化中文总结,见 summary_fields。没深读过为 null |
summary 是模型读完全文写的结构化中文总结,只有进入深读的论文才有,
用 has_summary 判断有没有。
| 字段 | 含义 |
|---|---|
question | 研究问题,一句话 |
design | 仿真设计:用什么模型扮演什么人群,怎么施加处理,测什么结果变量 |
baseline | 人类基准:对照的真实人类数据,没有则写「无对照」 |
findings | 主要发现,两句 |
reliability | 可靠性:论文自承的失效条件与局限 |
relevance | 与本站关注方向的相关性 |
inspiration | 方法迁移的启发,不是每篇都有 |
generated_at | 总结生成日期 |
rank | 当日深读排序 |
字段只增不减。要删字段或改含义会换成 /api/v2/,v1 保留。
每天 13:00 之后文件整体重写,正好在那一刻读可能拿到前一天的版本,
看 meta.json 的 generated_at 就知道数据时点,
runs.json 里有最近 30 次运行记录。
论文元数据与摘要版权归 arXiv 及原作者,本站按 arXiv API 条款转发,全文请从 arxiv.org 获取。评分、中文标题与结构化总结由本站用大模型生成,可自由引用,注明来源即可,不保证准确。