knowsci 2602 科研数据集发布:四个顶会究竟有多少水文?
想弄清一个方向最近在研究什么,通常要从搜论文开始。
先用几个关键词筛出几十篇,再逐篇看摘要、方法和实验。等到终于理出一点头绪,新的问题又来了:大家都在用哪些基线?常见的评测集是什么?某个结果究竟在哪些条件下成立?
答案往往藏在正文、表格和附录里。读十篇还能靠耐心,面对几千篇论文,靠人一篇篇翻就不太现实了。
上个月,我们发布了 2023 年 AI 顶会论文数据集,用自研的文档解析工具 Knowhere,把 ACL、CVPR、ICLR、NeurIPS 的 7000 多篇论文整理成了结构化数据。不少读者觉得这种研究方法很新奇,在后台问:2024 年的什么时候发?
现在,2024 年版也整理好了,共 9817 篇,已经在 Hugging Face 开放下载:
9817 篇,里面都有些什么?
这次收录的论文来自四场 AI 顶会:
-
NeurIPS 2024:3960 篇
-
CVPR 2024:2692 篇
-
ICLR 2024:2251 篇
-
ACL 2024:914 篇
机器学习、计算机视觉、自然语言处理,过去一年几个最活跃的 AI 研究方向,基本都在这里了。
|
论文类型 |
数量 |
重点整理的内容 |
|
方法与流程 |
7257 |
方法名称、核心机制、对比基线、关键结果 |
|
模型架构 |
1282 |
模型名称、架构类型、参数规模、训练及评测数据集 |
|
理论与分析 |
1087 |
分析对象、理论工具、主要发现、适用限制 |
|
Agent 系统 |
191 |
使用的环境和工具、规划方式、评测基准、关键结果 |
按核心贡献拆开看,分布并不均匀。7257 篇属于方法与流程类,差不多每四篇里有三篇——提出一种新方法,再拿实验和已有方案比一比,还是我们熟悉的老路子。剩下的论文里,1282 篇是模型架构论文,关心模型怎么搭、参数多大、用什么数据训练和评测;1087 篇是理论分析,看的是分析对象、用了什么理论工具、结论在什么条件下成立。
单独归到 Agent 系统的只有 191 篇,数量不多,但挑出来看很有意思:这些系统接入了什么工具、怎么做规划、拿什么评测,放在一起看一遍,比在几千个标题里搜"Agent"管用得多。当然,191 篇不代表 2024 年只有这么多论文碰了 Agent——分类看的是论文最主要的贡献,一篇论文哪怕用了 Agent,只要核心贡献是别的,还是会被分进别的类别。
这份数据集并不是一份只有标题和摘要的目录。每篇论文都整理了研究领域、具体任务、核心问题、主要创新、方法、基线和实验结果,算下来一共 24 个字段。翻下来还能看到几个挺实在的数字:大约 92% 的记录找到了第一作者单位,接近四成论文给出了代码地址,想找方便复现的工作,可以先从这批筛起。
数据里还留着论文的原文片段和对应的章节位置。看到一个实验结果,可以顺着位置查一下它是写在主实验、消融实验,还是附录里,不用只信一句脱离上下文的总结了。

这些字段是自动化流程提取出来的,没有逐篇人工核对。为了方便判断哪些记录靠谱,我们给每条数据配了一个完整度分数:平均 0.906,8642 篇不低于 0.8,占了 88%。这个分数说的是字段填得有多全,不是内容对不对——真要引用什么结论,最好还是顺着章节位置回原文看一眼。
类似这样的细节,数据里还有不少,感兴趣的话可以自己去 Hugging Face 页面翻一翻,说不定会发现更有意思的东西。
数据集暂时没有单独区分主会、Findings 和 Workshop,2023、2024 两版口径也不完全一样,篇数不适合直接拿来算会议增幅。它更适合帮你看清楚一年里大家都在研究什么。
近万篇论文,是怎么变成这份数据的?
做这份数据集,收集论文反而不是最麻烦的。真正费工夫的,是先把 9817 份 PDF 处理明白。
论文在人眼里看着规整,交给程序却很容易乱套。双栏正文容易左右串行,跨页表格会被拦腰切开,图片和图注也不一定挨在一起。正文里刚提到“见附录 C”,相关的实验设置可能已经隔了十几页。要是直接转成纯文本,字或许都识别出来了,原来的关系却丢得差不多了。
所以,我们没有把摘要抓下来交给大模型统一总结,而是从 PDF 的内容和结构开始处理。
第一步是解析 PDF。我们用自研的开源文档解析工具 Knowhere,识别论文里的文字、表格、公式和版面,把正文整理成带有章节路径的内容片段。这里的 chunk 不是按固定字数随手切开的一段文字,它会同时记录自己来自哪一节。
接着,Knowhere 会重建整篇论文的章节树,生成 doc_nav.json。从一级标题到下面的子章节,每个节点都有自己的标题、路径、层级、摘要和片段数量。这样,程序或 Agent 可以先看论文的整体结构,再进入相关章节,不必每次从头读到尾。
有了整理好的原文和章节导航,我们再让 LLM 判断论文属于模型架构、方法流程、理论分析还是 Agent 系统,并按类型提取不同信息。Agent 论文重点找环境、工具、规划方式和评测基准;理论论文则关注分析对象、理论工具、主要结论和适用边界。不同类型用不同的模板,比给所有论文生成一段泛泛的摘要更实用。
最后,我们把通用信息、分类后的专属字段、原文片段和章节树装回同一条记录,再导出成 JSONL 和 Parquet。Hugging Face 数据中的 chunks 和 hierarchy,就是 Knowhere 解析后保留下来的内容。
整个过程可以简单概括为:
解析 PDF → 重建结构 → 分类并提取字段 → 组装数据
这样做出来的不是“9817 份论文摘要合集”,而是一批可以筛选和比较、也能顺着章节路径回到原文核对的研究材料。
这批顶会论文,也算是给 Knowhere 出了一道不小的难题。公式、表格、复杂排版和附录引用都很常见,许多平时碰不到的解析问题,在近万份文档里很容易冒出来。跑完这批论文,也让我们更清楚地看到还有哪些细节值得继续打磨。
Knowhere 目前采用 Apache 2.0 协议开源,也提供 API。除了 PDF,它还可以处理 Word、PPT、图片等常见格式,并输出适合 AI Agent 和 RAG 使用的结构化 chunks 与 JSON。如果你手里也有一批论文、报告或其他复杂文档,欢迎拿去试试。
这份数据具体可以怎么用?
对 AI 研发者来说,这个数据集就是一批可以直接筛选和比较的研究材料。你可以先筛选、再比较,最后才决定哪些值得打开细读,甚至可以直接喂给 Research Agent 帮你做梳理工作,加快论文产出进度。
比如你正在找下一个实验方向,那么你可以先选定任务,再把相关论文的核心问题、主要创新、基线和关键指标摆在一起看。哪些问题已经被反复研究,哪些假设还没有充分验证,以及哪些方法只在少数数据集上成立,一对比看得清清楚楚。沿着这些缺口继续追,就有机会找到值得验证的新问题。
你也可以把这批数据直接交给 Research Agent。让它先梳理某个方向的技术路线,归纳不同论文共同依赖的假设,寻找尚未覆盖的场景或相互矛盾的结论,再据此整理 research gap,提出下一步可验证的实验方向。因为数据里保留了原文片段和章节位置,Agent 给出的判断还能继续回到论文中核对,而不是只剩一段没有出处的总结。
做技术选型时,也可以先找出使用同一评测集的论文,再核对模型规模、基线和实验条件。论文里都说自己效果好,但如果训练资源、数据和评价指标不一样,数字放在一起并没有多少意义。数据集能先帮你把比较范围理顺,最后再回到原文确认。
平时要写报告、做分享,这份数据也能派上用场。一个概念最近是不是真的热,大家是在反复讨论同一个问题,还是已经分出了几条不同的技术路线,都可以从论文里找依据。
这份数据不会代替人读论文。它更像一层前置索引:先从近万篇里找出真正相关的几十篇,再把时间留给值得精读和验证的内容。
下一站,具身智能
做完 2023 和 2024 两份通用顶会论文数据集,我们接下来准备继续啃一块更难整理的内容:具身智能。
下个月,我们会发布一份具身智能论文数据集。
数据会覆盖 CoRL、ICRA、IROS、RSS 等机器人领域的重要会议。除了核心问题、方法和实验结果,还会继续往下拆动作空间、观测空间、传感器配置、真实机器人平台,以及 sim-to-real 方法。
这些信息经常藏在实验设置和附录里,却恰恰决定了一项工作能不能被看懂、比较和复现。
具体收录了多少篇、数据长什么样,还请先期待一下吧~
相关链接
-
2023 年 AI 顶会论文数据集 🤗:https://huggingface.co/datasets/JensCS/top-ml-conference-papers-2023
-
2024 年 AI 顶会论文数据集 🤗:https://huggingface.co/datasets/JensCS/top-ml-conference-papers-2024
-
Knowhere 开源项目:https://github.com/Ontos-AI/knowhere
更多推荐



所有评论(0)