论文题目:Deep Academic Survey: Stateful Agentic Closed-Loop Paradigm for Academic Survey Automation 作者:Zhikai Xu、Zhucun Xue、Teng Hu、Yabiao Wang、Yong Liu、Jiangning Zhang 机构:浙江大学、上海交通大学
论文链接:https://arxiv.org/abs/2608.18034 代码:https://github.com/ZhikaiXu24/DAS 数据:https://huggingface.co/datasets/ZhikaiXu24/DAS-2M 项目主页:https://zhikaixu24.github.io/projects/DAS/
高质量学术综述不是简单的“多篇论文摘要拼接”。它需要持续追踪文献、理解每篇论文的方法与证据、形成稳定的主题分类体系,并在段落层面做到论点、引用、图表和最终稿件之间的一致。随着论文规模快速增长,人工撰写综述越来越耗时,而通用深度研究系统和早期自动综述系统虽然能完成检索与长文生成,却很难把“文献理解、知识组织、证据写作、审稿修复、终稿组装”放进同一个可追踪、可回滚、可验证的状态空间。 这篇论文提出的 DAS(Deep Academic Survey)正是为这一问题设计的。它把综述生成看成一个有状态的智能体闭环过程:先构建可复用的 DAS-2M 文献元数据湖,再围绕用户主题进行候选论文发现、候选驱动的分类体系规划、反向论文到章节路由、分层论点与引用规划,最后通过语义审查和确定性校验只重启受影响的写作状态,从而实现局部修复而不是整篇重写。 论文同时提出 DAS-Bench 与 DAS-Eval:前者包含 30 个综述主题,后者从学术引用质量、分类综合质量、层级论述质量和稿件组装可靠性四个方面设置 16 项评价标准。在所有 30 个主题上,DAS 总分达到 4.34,超过最强系统基线 Naive RAG 的 4.03;盲评专家也在 27/30 个主题上更偏好 DAS 而非 Naive RAG,在 19/21 个共享计算机科学主题上更偏好 DAS 而非 AutoSurvey。
学术综述是理解新领域、组织研究脉络、跟踪最新进展的重要入口。但论文增长速度越快,综述写作越难依赖纯人工方式维持:作者不仅要覆盖足够多的文献,还要判断文献之间的主题边界、方法谱系、证据强弱和引用关系,并将这些判断压缩成连贯的章节结构。 论文将“面向发表的综述生成”定义为一种更严格的任务:生成结果应具备完整结构、可追踪的文献支持、跨分类体系、章节和段落的组织一致性、合理集成的图表元素,以及最终稿件工件之间的一致性。这一定义比常见长文问答或报告生成更接近真实论文写作流程。 作者指出,现有系统主要分为两类。第一类是通用深度研究系统,例如 OpenAI Deep Research、Gemini Deep Research 等,它们擅长广泛检索和带引用的长报告生成,但目标通常是研究助手,而不是学术综述写作。其问题在于报告式组织较强、学术分类结构较弱,引用可能混入网页来源或与具体论点对齐不足,且缺少面向论文稿件的图表、公式和参考文献组装机制。 第二类是自动综述生成系统,例如 AutoSurvey、SurveyForge、LiRA、InteractiveSurvey 等。它们更接近论文综述任务,但多数系统仍缺少可持续更新的文献状态,分类结构往往在单次任务中临时构造,论文到章节的归属关系不够稳定,写作阶段也难以保证每个段落都由明确论点和引用支撑。更重要的是,一旦审查阶段发现问题,系统通常缺少局部回滚和定向修复机制。 DAS 的核心判断是:综述生成不应只被建模为“检索后生成”,而应被建模为“围绕共享状态不断推进、审查与修复的闭环写作过程”。因此,它显式维护文献状态、组织状态、写作状态和终稿状态,让不同智能体在同一状态空间中协作。
深度研究系统通常以用户问题为入口,自动拆解查询、检索资料、综合信息并生成长篇报告。它们显著提高了开放域研究效率,也能为用户提供带引用的背景材料。但在学术综述场景中,通用深度研究仍存在几个结构性不足。 首先,它们生成的文本更接近面向读者的报告,而不是面向学术共同体的综述论文。综述论文需要明确的问题域边界、分类体系、代表性方法、方法之间的关系和证据密度,而报告式输出可能只按照主题顺序铺陈信息。其次,引用质量难以稳定满足学术规范:有些引用来自非学术网页,有些引用只支持背景事实而不能支撑具体技术论点。最后,这类系统通常不负责生成完整论文工件,包括图表、参考文献格式、层级标题和最终排版一致性。
自动综述生成系统更关注学术论文集合上的结构化写作。它们通常包含检索、聚类、章节规划、摘要融合和草稿生成等步骤,比通用研究助手更贴近综述写作。但作者认为,这一方向还没有充分解决“状态”问题。 在传统流程中,论文解析、主题分类和章节写作经常是相对松散的流水线。上游检索出的论文是否被充分理解、某篇论文应支撑哪个章节、某个段落的核心论点需要哪些引用、审查发现问题后应该重写哪一部分,这些信息往往没有被显式保存为可复用状态。DAS 将这些中间产物都转化为可审查和可更新的结构化状态,使系统能够像人类作者一样“带着稿件状态写作”,而不是每次都从文本上下文里重新猜测。
给定一个综述主题,系统需要生成一篇面向发表的学术综述。论文将这一过程抽象为多个状态的协同演化:文献状态记录候选论文及其结构化表示,组织状态记录分类体系和论文到章节的路由关系,写作状态记录段落计划、论点、引用和草稿,终稿状态记录最终章节、图表、参考文献和稿件工件。 这种定义的价值在于把综述生成从“生成一段长文本”提升为“生成一组一致的学术工件”。换言之,系统不仅要写出看似通顺的内容,还要知道每个章节为什么存在、每篇论文为什么被放在这里、每个段落由哪些证据支撑,以及最终输出是否满足学术稿件的基本格式约束。
DAS 的方法由四个关键环节组成:持续演化的文献元数据湖、候选驱动的分类与路由、分层规划与起草、范围化审查与终稿组装。四个环节不是一次性串联,而是通过共享状态形成闭环。当前一阶段的结构被后续阶段发现问题时,系统可以回到受影响的局部状态进行修复。
DAS 的第一步是把论文解析和主题写作分离。系统预先构建 DAS-2M 文献元数据湖,对约 200 万篇论文进行结构化解析,覆盖题名、摘要、正文、图表、方法、数据集、实验结果、局限等面向综述写作有用的字段。论文来源主要来自 arXiv,时间覆盖 2020 年 1 月至 2026 年 6 月;实验中还使用过滤后的约 153 万篇论文资源。 这一设计避免了每次用户提出综述主题时都重新从原始 PDF 中抽取信息。更重要的是,元数据湖不仅保存普通检索字段,还保存“综述导向”的论文表示,例如方法类别、实验设置、结果与局限。这使得后续系统可以围绕“文献如何支撑综述结构”进行推理,而不是只基于标题和摘要做粗粒度匹配。
在用户给定主题后,DAS 先通过混合查询发现候选论文。查询规划器会生成词法查询和语义查询,结合索引从元数据湖中召回候选集合。随后,系统不是直接进入写作,而是先构建候选驱动的分类体系。 候选驱动意味着分类结构来自候选论文本身,而不是完全由模型凭经验预设。分类规划器会围绕候选论文组织章节节点,形成可用于写作的 taxonomy。随后,论文路由器执行反向论文到章节的映射:每篇论文被判断应支撑哪些章节或子章节,形成路由关系表。这样,章节不是空泛标题,论文也不是无结构堆放,而是建立了“章节需要哪些证据、论文支持哪些位置”的双向约束。 这一机制尤其适合综述写作。很多综述失败并不是因为模型不会概括单篇论文,而是因为章节体系与候选文献之间不匹配:某些主题缺少证据,某些重要论文被放错位置,某些章节之间边界重叠。DAS 用候选论文来约束分类,并用路由表来约束引用位置,从源头降低这类结构错误。
有了分类体系和路由关系后,DAS 进入分层规划与起草。系统先进行段落级计划,再为每个段落生成写作点和论点计划,明确该段落应表达什么、需要比较哪些方法、引用哪些论文、如何承接上下文。随后段落起草器根据这些计划生成文本。 这种层级写作方式解决了长文生成中的一个典型问题:模型容易在篇章层面看起来完整,但在段落层面缺少明确论点和证据。DAS 要求段落从计划、论点到引用逐层展开,使引用不仅是段尾装饰,而是与具体论点绑定。对于综述来说,这比单纯提高语言流畅度更重要,因为读者需要知道某个判断来自哪些论文、哪些证据和哪些方法对比。
DAS 的闭环能力体现在语义审查阶段。系统会检查生成内容是否存在结构、引用、论点、图表或稿件一致性问题。与整篇重写不同,DAS 根据问题范围选择修复粒度:有些问题只需要直接编辑某个段落,有些需要重写某个段落计划,有些则需要回到章节层面重新规划。 修复后,系统再次进入评估与确定性校验,直到相关节点通过检查。最终,终稿组装器负责整合章节、内容自适应表格与图形、参考文献和可编译稿件。论文特别强调,综述生成的最后一公里不是“写完正文”而是“生成可靠稿件”,包括参考文献完整性、图表一致性和布局可用性。
论文提出 DAS-Bench,包含 30 个综述主题,其中 21 个为核心计算机科学主题,另外 9 个来自非计算机科学领域,用于测试跨学科泛化。与之配套的 DAS-Eval 包含 16 个标准,归纳为四大维度。 第一是学术引用质量,关注引用是否支持论点、归因是否准确、多引用是否形成综合判断、覆盖是否均衡。第二是分类综合质量,关注主题覆盖、边界划分、组织结构和洞察性。第三是层级论述质量,关注章节、段落和局部论证之间是否对齐,文本是否递进而非堆砌。第四是稿件组装可靠性,关注参考文献、视觉元素、布局、编译和最终工件完整性。
论文将 DAS 与三类系统比较:通用研究系统,包括 Codex、GPT Deep Research、Gemini Deep Research;简单检索增强基线 Naive RAG;以及自动综述生成系统,包括 AutoSurvey、SurveyForge、LiRA、InteractiveSurvey 等。部分系统由于时间限制或运行限制未能在全部设置中完整完成,例如 SurveyX 超过 12 小时限制。 评价采用 1 到 5 分制,并分别报告四大维度的组平均分和总平均分。作者还补充了盲评专家评估与跨评审稳健性实验,用于检验自动评估排序是否与人类偏好一致。
在 30 个主题的系统级结果中,DAS 在四大维度上都取得最高系统得分,总平均分为 4.34。作为对比,最强竞争系统 Naive RAG 的总平均分为 4.03,Gemini Deep Research 为 3.92,InteractiveSurvey 为 3.81,SurveyForge 为 3.78,AutoSurvey 为 3.73。结果表明,强检索增强可以带来较高的局部信息质量,但若缺少显式分类、路由、写作状态和闭环修复,整体稿件仍难以达到 DAS 的一致性。
从质性对比看,DAS 的输出更像真正的综述论文:它能够形成较清晰的多层分类,围绕不同方法或技术路线组织引用,并生成与内容适配的分类图、时间线、层级图和比较表。通用深度研究系统往往更像长报告,自动综述系统虽然具备部分论文结构,但在段落级论点、细粒度引用和稿件级一致性方面仍不稳定。
消融实验显示,DAS 的多个模块共同影响最终质量。去掉文献元数据湖、论文路由、确定性验证或语义审查都会削弱系统在不同维度上的表现。值得注意的是,部分单项消融在总分上可能出现很小波动,这说明自动评价存在细粒度噪声,也说明不同模块对四类指标的影响并非完全线性。但从整体趋势看,显式文献状态、路由关系、验证与审查是稳定生成高质量综述的关键。
修复策略实验进一步说明了“范围化闭环”的价值。若只做直接编辑,修复通过率为 58.42%;只做段落重规划为 53.69%;只做章节重规划为 45.13%,且章节重规划消耗更多 tokens。完整 DAS 的修复通过率达到 74.59%,平均额外消耗约 0.79M tokens,在修复效果和计算开销之间取得更好平衡。
论文还分析了不同主干模型对 DAS 的影响。更强模型会进一步提升系统上限,例如 GPT-5.5 在 5 个分层主题上比默认配置提升约 0.16 总分;较小模型会降低整体分数,但仍保留部分分类综合能力。这说明 DAS 的收益并不完全来自单一大模型能力,而来自可复用元数据、显式组织状态、路由约束和闭环修复流程。换言之,框架本身提供了结构化增益,更强模型则进一步提高各环节执行质量。
盲评专家结果与自动评估大体一致。专家在 27/30 个主题上更偏好 DAS 而不是 Naive RAG,在 19/21 个共享计算机科学主题上更偏好 DAS 而不是 AutoSurvey;在 21 个计算机科学主题中,DAS 有 18 个主题排名第一。论文还报告,专家在 72 个成对比较中有 63 个形成一致判断,说明偏好并非偶然。 跨评审稳健性实验使用另一评审模型进行复核,排序仍保持 DAS 优于 Naive RAG、Naive RAG 优于 AutoSurvey 的趋势。在非计算机科学子集上,两种评审也都将 DAS 排在 Naive RAG 之前。这一点很重要,因为综述生成系统如果只在熟悉领域有效,很难成为通用学术基础设施;DAS 在跨学科主题上保持优势,说明有状态范式具有一定可迁移性。
这篇论文的核心贡献不只是提出一个新的自动综述系统,而是重新定义了学术综述自动化的系统范式。DAS 把综述生成从“检索增强长文生成”推进到“有状态智能体闭环写作”:论文理解、分类组织、引用路由、段落论点、语义审查和稿件组装都被显式状态化,并能在发现问题后局部回滚和修复。 从结果看,DAS 在 DAS-Bench 上超越通用深度研究系统、简单 RAG 和已有自动综述生成系统,并在人类盲评中获得明显偏好。更值得关注的是,它给未来学术写作智能体提供了一个清晰方向:真正可靠的学术生成系统不能只依赖更长上下文和更强生成模型,还需要可维护的文献记忆、证据可追踪的组织结构、段落级论证规划,以及面向最终稿件的闭环验证。 当然,DAS 也提出了新的问题。元数据湖的更新成本、跨领域论文解析质量、自动评价与专家评价的细粒度偏差、生成综述的原创性边界和学术伦理,都需要后续研究持续完善。但作为一个系统框架,DAS 明确展示了学术综述自动化从“会写”走向“会组织、会引用、会审查、会修复”的可能路径。