多模态设计任务正在从“生成一张图”变成“长期生产一个可编辑、可验证、可复用的传播制品”。把一篇论文转成海报、幻灯片、网页或视频,并不只是抽取摘要再排版,而是要在源文献证据、视觉密度、阅读路径、渲染可靠性和用户偏好之间反复权衡。 这篇论文提出 AutoDesign,将人类对设计质量的偏好转化为一个可持续优化的生产系统。它不更新底层大模型参数,而是优化模型外部的 DesignHarness:也就是围绕固定模型运行的上下文管理、工具规范、执行环境、调度策略、评测反馈等系统组件。 作者以“论文转学术海报”为实例,构建 PosterBench 评测协议,覆盖 100 篇论文主赛道和 10 篇论文的受控子集。结果显示,AutoDesign 在主赛道获得 78.32 分,比闭源商业系统 Claude Design 高 7.45 分;在 7 组受控模型与代码智能体组合中,加入学习得到的 DesignHarness 后,平均分从 54.99 提升到 67.39,增益达 12.4 分。 图1:AutoDesign 的优化轨迹与 DesignHarness 带来的性能增益。左侧展示海报质量随元 harness 迭代持续提升,右侧显示在多组代码智能体与模型配置中均能带来 5.0 到 19.6 分增益。
论文题目:AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design 作者:Yaxin Luo、Haobin Jiang、Jialv Zou、Xu Huang、Wenhao Yan、Haodong Li、Zhengrong Yue、Jing Li、Xiaofu Chen、Xiaohan Zhao、Jiacheng Liu、Jiacheng Cui、Zhiqiang Shen、Xiaotong Li 机构:美团、穆罕默德·本·扎耶德人工智能大学、华中科技大学、北京大学、清华大学、香港中文大学、上海交通大学 论文链接:https://arxiv.org/abs/2608.13560 项目网站:https://autodesign.designanything.ai/ 代码仓库:https://github.com/Yaxin9Luo/AutoDesign
论文从一个现实问题出发:人类沟通常常需要把论文、报告、图表、代码和数据等多模态来源,整理成海报、幻灯片、网页或视频等面向读者的传播制品。这类任务需要抽取证据、理解结构、规划中间步骤、渲染输出并根据反馈反复修正,天然属于长程智能体任务。 现有多模态设计系统通常能接收反馈并修改当前输出,但这些反馈往往是一次性的。一次海报生成中的失败、修复和偏好,难以沉淀为下一次任务可复用的系统能力。作者认为,关键问题不是再生成一个更好的单个制品,而是如何把多模态证据、布局约束、渲染诊断和人类偏好转化为长期可复用的设计先验。 AutoDesign 的答案是元 harness 优化。普通 DesignHarness 负责把输入源转成输出制品;Meta-Harness 则负责观察多个任务上的生成轨迹和评测结果,定位反复出现的问题,并修改 DesignHarness 的一个功能组件。这样,系统把局部失败转化为生产系统本身的改进。
论文首先定义 DesignHarness。它是固定模型外部的系统,给定多模态源、目标媒介和用户约束,生成一个面向人类的制品。这个 harness 并不等同于模型权重,而是包括上下文与记忆、工具与规格、执行运行时、调度编排、评测与反馈五类功能组件。 这种划分的意义在于明确“可被优化的系统部件”。上下文与记忆负责源材料、提示、技能、资产和状态;工具与规格负责版式、字体、出处和可编辑制品规范;执行运行时负责渲染、验证和导出;调度编排负责预算、候选选择、回退和最终化;评测与反馈负责规则校验、模型批评和局部修复信号。 随后论文定义 Meta-Harness。它不是直接生成海报,而是改进 DesignHarness 的实现。优化目标是让 harness 在任务分布上生成更高质量的制品。在整个过程中,底层模型参数保持固定,优化发生在模型周围的操作系统、工具链和反馈环路上。
AutoDesign 由两个嵌套循环组成。内环在固定 DesignHarness 下工作:设计器生成或修改当前制品,批评器检查其质量并给出反馈,设计器再根据反馈修复。这个循环只改当前海报或网页,不改变 harness 本身。 外环则跨任务改进 harness。每一轮包括四步:在训练任务上 rollout,使用评测器打分,根据轨迹和分数提出一个组件更新,再通过接受门控决定是否替换当前 harness。更新被限制在五类功能组件中的一个组件内,以便把性能变化归因到单一干预,而不是一堆同时发生的修改。 图2:AutoDesign 总体框架。内环生成并修复制品,外环基于轨迹、评分和优化记录提出 bounded update,并通过训练集增益与开发集保持的接受门控控制更新。 接受门控是防止过拟合的关键。候选 harness 只有在训练集表现提升,并且开发集表现不下降时才会被接受。开发集结果只用于门控,不暴露给提出更新的优化器。若更新被拒绝,系统保留当前 harness,同时把失败记录写入优化历史,为下一轮提供上下文。 AutoDesign 还支持人在环指导。当外环陷入局部平台期时,人可以用自然语言提供方向性建议;当评测器遗漏系统性偏差时,人也可以指导评测器实现的调整。但人并不直接编辑 harness,而是提供观察和高层方向。
经过元优化后,论文得到 DesignHarness。它的目标不是输出一张不可修改的图片,而是生成可编辑、可渲染、可验证的 HTML 制品,并可进一步导出为海报、幻灯片、视频或网页。 图3:DesignHarness 流程。系统先摄取论文元数据、结构、视觉材料和关键引文,再由设计器生成可编辑代码,经过规则验证器和视觉批评模型反馈后,最终选出最佳有效版本。 第一步是论文摄取。系统抽取元数据、章节结构、关键证据、图表和来源位置,形成带出处的上下文。每个被用于海报的文字主张和视觉元素都要能追溯回原论文位置,方便后续一致性检查和局部修复。 第二步是制品生成与修订。设计器作为代码智能体,在当前制品、前一轮反馈和源文献上下文条件下生成下一个候选版本。因为制品保持为 HTML 文件,修改可以局部完成,而不必每次从头再生成整张海报。 第三步是验证与最终化。规则验证器检查缺失资源、出处断链、严重溢出、重叠、排版约束和数值一致性等硬问题;视觉批评模型从设计契约、布局、可读性和美学等角度检查渲染预览。若候选通过阻塞检查,系统进入最终化;若不通过,诊断反馈会回到设计器继续修复。论文设定最多 12 次 refinement attempts,并保留回退机制以选择可交付候选。
为了评测论文转海报系统,作者提出 PosterBench。主赛道包含 100 篇论文,覆盖人工智能与机器学习、生物医学与健康、气候与地球环境、经济与政策、物理与天文五个学科;PosterBench-mini 是共享的 10 篇论文子集,用于快速测试和受控消融。 PosterBench 的评分不是只看美观,而是七个维度联合评估:忠实性、覆盖度、密度、视觉证据、布局、可读性和美学。协议同时使用可追踪的规则算法、OCR、空间审计、数值校验和基于评分规约的视觉语言模型判断。它还设置受保护门控,例如渲染完整性问题会限制最终得分。 图4:PosterBench 评测协议。它结合空间审计、OCR、数值校验、渲染完整性检查和视觉语言模型评分,从源文献一致性、信息密度、布局可读性与审美质量等维度评估海报。 主赛道结果显示,AutoDesign 使用 Claude Code 与 Claude 4.8 配置时得分 78.32,超过 Claude Design 7.45 分,超过 OpenDesign 8.87 分。在 PosterBench-mini 上,AutoDesign 使用 Codex 得分 81.46,高于原生 Codex 基线 75.87;使用 Claude Code 得分 74.56,高于对应独立基线 69.55。
论文最重要的消融,是固定底层模型和代码智能体,只比较是否接入优化后的 DesignHarness。结果显示,在 7 组完成的配置中,DesignHarness 都能提升 PosterBench Score,增益范围为 5.01 到 19.56 分。 平均来看,加入 DesignHarness 后,分数从 54.99 提升到 67.39,提升 12.40 分。这说明性能提升并不只来自更强模型,而来自围绕模型运行的设计系统:更好的源材料组织、局部修复、验证门控、可编辑制品规范和反馈循环。 论文还分析了成本与性能权衡。更强模型通常分数更高但成本更高,而 LongCat-2.0 在 DesignHarness 支持下能以约 0.27 美元每张海报的成本达到 55.13 分。作者用这一点说明,优化 harness 可能让中等模型获得更可用的专业设计能力。
自动评测之外,作者招募 11 名志愿评审,对 AutoDesign、Claude Code、OpenDesign 和 Claude Design 在 100 篇论文上的输出做系统盲评。每次评审只看到同一篇论文的两张匿名海报,选择左图、右图、近似相等或跳过。 图5:系统盲评结果。AutoDesign 在 Bradley-Terry 偏好估计中最高,并在与 Claude Code、OpenDesign、Claude Design 的两两比较中取得更高偏好比例。 评审共提交 936 个响应,其中 933 个有效排序判断和 3 个跳过。AutoDesign 的 Bradley-Terry 偏好估计为 64.0%,高于 Claude Code、OpenDesign 和 Claude Design。按两两结果看,AutoDesign 对 Claude Code 的调整后偏好为 61.3%,对 OpenDesign 为 63.1%,对 Claude Design 为 67.6%。 作者还检查了 PosterBench 与人类偏好的关系。海报级 PosterBench 分数与人类偏好呈正相关,相关系数为 0.34。更重要的是,当两张海报的 PosterBench 分差至少 20 分时,人类选择自动评测偏好海报的比例升至 74.4%。这说明 PosterBench 不只是给系统排名,也能在较大分差场景下提供有信息量的比较信号。
论文还展示了一个定性轨迹:同一张海报经过五个保留尝试逐步改进。最初版本存在分析区被裁切的问题,后续尝试通过重新分配行空间、调整标题、扩大视觉证据,最终在第 9 次尝试中被批评器接受。 这一案例说明 AutoDesign 想要的不是“整张重来”,而是局部诊断、局部修复和保留有效内容。对学术海报这类高密度制品而言,保留已正确的源文献内容、图表和布局结构非常重要,否则每次重生成都会引入新的不一致和排版风险。
当前 AutoDesign 主要验证在论文转海报任务上,但作者认为这一模式不限于单一媒介。论文展示了 DesignHarness 生成幻灯片、网页和会议视频的初步能力,并提出更长期的方向:将论文、图表、代码、结构化数据和人类反馈整合为多模态输入,再输出适配不同传播场景的多格式制品。 图6:未来多模态输入与多格式输出方向。系统可整合论文文档、图表、代码数据和人类反馈,经证据、规划、构建、验证和设计系统环节,生成海报、幻灯片、网页和会议视频。 不过,扩展到新媒介并不只是增加导出格式。每种媒介都需要自己的源输出数据、评测器、渲染与验证门控,以及适配传播场景的目标函数。否则,系统可能在未被验证的目标上过拟合,甚至奖励黑客式地迎合移动评测器。 作者特别指出,未来仍需解决更好的组件选择和评测器演化问题。系统应基于失败归因、不确定性、预期改进和组件交互来选择下一步更新;任何自适应评测器都必须版本化,并由冻结参考任务、对抗探针和周期性人工审计约束。
论文将 AutoDesign 放在三条脉络中。第一是多模态输出生成,包括论文转海报、论文转幻灯片、论文转网页和论文转视频等系统。已有工作探索了布局数据、源文献覆盖、图文对齐、专门智能体和视觉修复,但运行时反馈通常仍局限于固定生产流程内部。 第二是反馈驱动的输出修订和经验保留。Self-Refine 用反馈修改当前回答,Reflexion、Voyager、ExpeL 等方法保留反思、技能或任务经验。这些机制能跨尝试保存信息,但未必更新反复生成输出的 harness 本身。 第三是 harness、程序和工作流层面的持久改进。TextGrad、DSPy、GEPA 优化组件或声明式管线;STOP、GPTSwarm、ADAS、AFlow 搜索代码或图表示的工作流;Meta-Harness、HarnessX、Self-Harness 等研究系统级 harness 的可组合、可搜索和可归因更新。AutoDesign 则把这一方向具体化到学术设计场景,并强调独立开发集门控和系统盲评。
AutoDesign 的核心价值,是把一次设计中的反复失败转化为后续任务可复用的系统改进。它聚合生成轨迹、源文献证据、渲染诊断、评测反馈和参考海报,一次只更新 DesignHarness 的一个组件,同时保持底层模型权重固定。 在论文转海报任务上,AutoDesign 不仅提出了可执行的 DesignHarness,也给出了 PosterBench 这一较完整的评测协议。实验显示,它在主赛道达到 78.32 分,超过 Claude Design 7.45 分;在人类系统盲评中,也获得最高的 Bradley-Terry 偏好估计。 更大的启示是:长程智能体能力不一定只来自更大模型,也可以来自模型外部生产系统的持续优化。对于需要证据可追踪、输出可编辑、渲染可验证的专业多模态设计任务,harness 可能会成为与模型同等重要的能力载体。