新闻 · Hugging Face Blog
英文原标题:Open-sourcing AstaBrief, the fast report-generation model in Asta
本文为英文原文的机器翻译摘要,原文见:Hugging Face Blog ↗
Ai2 开源了 AstaBrief 8B 模型,用于快速生成带引用的科学报告。该模型基于 Qwen3-8B,通过监督微调和直接偏好优化训练,在 Asta 平台中作为 Fast 模式提供,生成速度比 Claude 驱动的 Thinking 模式快约 3.5 倍,并同时开源了模型权重和训练数据。
背景与动机
语言模型已能帮助研究人员搜索文献、综合证据和处理复杂问题,但科学工作对模型有特殊要求:答案需基于证据、不能悄悄扩大研究结论、且研究人员需能验证最终输出。在 Ai2 的 agentic 平台 Asta 中,科学家常提供大量上下文和约束,并将生成的报告视为可重复使用的研究工件。
Ai2 希望帮助科学家更快生成带引用的报告,并让模型可下载自行运行。为此,他们测试了一个专门为科学报告生成训练的小型开源模型,看其能否在减少生成时间和服务成本的同时,匹配所用专有模型的报告质量。
- 科学工作对模型的要求:基于证据、不扩大结论、可验证输出。
- Asta 用户常提供大量上下文和约束,并将报告作为研究工件重复使用。
- 目标:用小型开源模型匹配专有模型质量,同时降低生成时间与成本。
AstaBrief 8B 模型介绍
AstaBrief 8B 能将研究问题和检索到的文献摘录转化为带引用的报告。它已在 Asta 的 Generate a report 功能中作为 Fast 模式提供,与 Claude 驱动的 Thinking 模式并列,同时模型和训练数据均已开源,供他人研究、复现和构建。
开发 AstaBrief 需要数万条真实研究查询、以引用为中心的过滤、偏好数据,以及重新设计的报告生成流程——一次性生成完整报告,而非逐节编写。结果是报告生成时间比所追踪的专有模型减少了近一个数量级:在整个 Asta 流程中,Fast 模式平均每份报告 51.1 秒,而 Thinking 模式为 178.5 秒,约快 3.5 倍。
- AstaBrief 8B 将研究问题和文献摘录转化为带引用的报告。
- 已在 Asta 中作为 Fast 模式上线,与 Claude 驱动的 Thinking 模式并列。
- 模型权重和训练数据均已开源。
- Fast 模式平均 51.1 秒/报告,Thinking 模式 178.5 秒/报告,约快 3.5 倍。
开源意义与本地部署
开放权重让机构能在自己的基础设施上运行 AstaBrief,这对于研究问题涉及敏感或未发表工作的情况是必要的。除了模型权重,Ai2 还发布了一个示例工作流,研究人员可调整它从自己的 PDF 生成报告,为本地报告生成提供起点。
这些效率提升使 AstaBrief 成为更广泛目标的有用测试案例:构建能适应科学工作特定需求的开源语言模型。
- 开放权重支持机构在自有基础设施上运行,适合敏感或未发表研究。
- 发布示例工作流,可从自有 PDF 生成报告。
- AstaBrief 是构建适应科学需求的开源模型的测试案例。
训练方法
AstaBrief 的目标是构建一个开源权重模型,具备长篇科学综合最重要的品质:答案质量、相关性、结构和引用基础。团队从 Qwen3-8B 出发,将大部分精力集中在后训练数据、评估和报告生成脚手架。
近期工作(如 DR Tulu)表明,基于强化学习的方法可以改善开源权重模型的长篇报告生成,尤其是在训练循环中加入评判模型时。但 Ai2 最终选择了更简单的方案:监督微调(SFT)和直接偏好优化(DPO)。RL 训练可能不稳定且昂贵,他们想看看用更便宜、更易管理、更易调试和迭代的设置能将报告生成质量推到多远。
这使得训练数据的质量尤为重要。团队没有依赖更复杂的优化方法来补偿噪声示例,而是花大量时间研究如何生成、选择和过滤真正展示所需报告写作行为的示例。
为了提速,AstaBrief 被训练为在给定用户查询和相关检索片段后直接一次性生成最终报告,绕过了 Claude 驱动的 Thinking 模式使用的昂贵片段摘要和聚类阶段,也不逐节写出答案。有趣的是,他们发现这样做可以不牺牲性能。
- 基于 Qwen3-8B,重点在后训练数据、评估和报告生成脚手架。
- 选择 SFT + DPO 而非 RL,因 RL 不稳定且昂贵。
- 强调训练数据质量,而非复杂优化方法。
- 一次性生成完整报告,绕过摘要和聚类阶段,不牺牲性能。
SFT 训练数据收集
训练流程始于通过 ScholarQA 框架(现支撑 Asta 的 Generate a report 功能)提交的真实用户查询。团队希望 AstaBrief 从真实科学家的真实查询中学习,而非仅用合成提示或基准任务。
分析显示,科学家对语言模型的提问方式与通用聊天机器人或传统搜索工具的用户不同:专家研究人员常提供大量上下文、多重约束和概念间关系,而非简短的关键词式提示。近期的 Asta 用户研究还发现,研究人员希望 AI 参与工作的方式存在差异——有些乐于用模型进行构思或实验,另一些则偏好其在综合、文献监测或模式发现中扮演更窄的角色。但共同点是希望更清晰的来源可追溯性、更了解模型在做什么,以及对其使用上下文的更大控制权。
团队对收集的用户日志进行了质量、相关性和隐私过滤:去除 beta 测试者和机器人流量,丢弃过短的查询,并使用基于 LLM 的过滤剔除非英语查询、非科学请求和含个人信息的提示。最终留下 9 万条研究型查询。
对于 SFT,他们使用 Asta 报告生成背后的多步 ScholarQA 流程从过滤后的查询生成完整报告目标输出。该流程检索相关文献、将材料组织成章节,并使用后端报告生成模型将证据综合为带引用的报告。他们混合使用了多种专有系统:Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 和 GPT-4.1。经过质量过滤后,得到 4.7 万个可用训练示例。
- 使用真实用户查询,而非仅合成提示。
- 科学家提问常带大量上下文、多重约束和概念关系。
- 用户希望更清晰的来源追溯、模型行为可见性和上下文控制。
- 过滤后得到 9 万条研究型查询。
- 用 ScholarQA 流程生成目标报告,混合使用 Claude 3.5/3.7 Sonnet、o3、o4-mini、GPT-4.1,最终 4.7 万训练示例。
DPO 数据创建
DPO 需要不同类型的训练数据:不是每个查询一个目标报告,而是需要成对的报告,其中一个优于另一个。团队构建了这些配对(原文在此处截断)。
- DPO 需要成对的偏好报告,而非单一目标报告。
- 团队构建了这些配对(原文截断,后续内容未提供)。
