数据端口

arXiv 每日追踪 · LLM 人类仿真研究 · 数据更新于 2026-09-29 13:00 · 回到网站

本站每天自动抓 arXiv 十个分类的新论文,用大模型逐篇判定与研究方向的相关性, 再给高分论文生成结构化中文总结。这里把全部结果开放成一组静态 JSON 文件, 直接取用,不需要密钥,也没有调用次数限制。

每天 13:00(UTC+8)自动更新,arXiv 周末不公告,周六周日无新增

怎么取

所有地址以 https://arxiv.lingnan.top/api/v1/ 开头。先读 meta.json, 里面有完整的端点清单、字段说明和当前统计,其余地址都能从它发现。

curl -s https://arxiv.lingnan.top/api/v1/meta.json
# Python:拉全量判定结果,转成 DataFrame
import pandas as pd, requests
d = requests.get("https://arxiv.lingnan.top/api/v1/papers.json", timeout=60).json()
df = pd.json_normalize(d["papers"])
print(df.query("bucket == 'selected'")[["id", "date", "score", "zh_title"]])
# 某一周的切片。每周发布时取这个
r = requests.get("https://arxiv.lingnan.top/api/v1/weeks/2026-W40.json", timeout=60).json()
for p in r["papers"]:
    if p["bucket"] == "selected":
        print(p["score"], p["zh_title"] or p["title"])
        print("   ", (p.get("summary") or {}).get("findings", ""))

浏览器里跨域取也可以,响应带 Access-Control-Allow-Origin: *。 表格工具直接读 papers.csv,UTF-8 BOM,Excel 能认。

端点

地址说明
meta.json本文件:统计、字段说明、端点清单
papers.json判定层全量,2794 篇,含评分与总结
papers.min.json判定层精简,去掉摘要与作者,索引用
selected.json入选(≥8 分),380 篇
summaries.json有结构化中文总结的,766 篇
latest.json最近 14 天
weeks/index.json周切片目录
weeks/{YYYY-Www}.json某个 ISO 周,如 weeks/2026-W38.json
months/index.json月切片目录(含未判定论文)
months/{YYYY-MM}.json某个月全部论文的索引,不含摘要,完整记录去 papers/{id}.json 取
papers/{arxiv_id}.json单篇,如 papers/2608.07367.json
papers.csv判定层表格,Excel 和 pandas 直接读
rubric.json评分准则编号与含义
runs.json最近 30 次抓取运行记录,用来确认数据新不新
judged = 进过大模型精判的论文,带评分和总结;目录层 months/ 另含粗筛阶段刷掉的全部论文,只有基本信息

论文字段

字段含义
idarXiv 编号,不含版本号,如 2608.07367
version当前收录的版本号,整数。出过修订版的会大于 1
title英文标题
zh_title中文标题,模型翻译。未进入精判的为空串
abstractarXiv 原文摘要。低分论文的摘要会被定期清理,可能为空串
authors作者列表
categoriesarXiv 分类列表,首个为主分类
primary_category主分类
announce_typearXiv 公告类型:new | cross | replace | replace-cross
date排序日期:出过修订版取修订日,否则取首次收录日
first_seen首次收录日,永不改动
revised_at最近一次修订公告日,没出过修订版为 null
abs_urlarXiv 摘要页链接
pdf_urlarXiv PDF 链接。本站不转存全文,请从 arxiv.org 取
source_feed从哪个分类的订阅进来
score相关性评分 0-10,整数。null 表示未判定或判定失败
bucket分档:selected(>=8) | pending(>=7) | other | failed | unscored
rubric_hits命中的评分准则编号,含义见 /api/v1/rubric.json
tags中文主题标签,最多 3 个
reason判定理由,40 字内
model打分所用模型
scored_at打分时间,ISO8601 本地时间(UTC+8)
error判定失败时的错误信息,正常为 null
has_summary是否有结构化中文总结
summary结构化中文总结,见 summary_fields。没深读过为 null

总结字段

summary 是模型读完全文写的结构化中文总结,只有进入深读的论文才有, 用 has_summary 判断有没有。

字段含义
question研究问题,一句话
design仿真设计:用什么模型扮演什么人群,怎么施加处理,测什么结果变量
baseline人类基准:对照的真实人类数据,没有则写「无对照」
findings主要发现,两句
reliability可靠性:论文自承的失效条件与局限
relevance与本站关注方向的相关性
inspiration方法迁移的启发,不是每篇都有
generated_at总结生成日期
rank当日深读排序

稳定性与引用

字段只增不减。要删字段或改含义会换成 /api/v2/,v1 保留。 每天 13:00 之后文件整体重写,正好在那一刻读可能拿到前一天的版本, 看 meta.json 的 generated_at 就知道数据时点, runs.json 里有最近 30 次运行记录。

论文元数据与摘要版权归 arXiv 及原作者,本站按 arXiv API 条款转发,全文请从 arxiv.org 获取。评分、中文标题与结构化总结由本站用大模型生成,可自由引用,注明来源即可,不保证准确。