【KDD 2024】Xinyu:面向中文评论生成的端到端大模型系统|从媒体内容生产自动化视角

摘要

本文解读 KDD 2024 论文《Xinyu: An Efficient LLM-based System for Commentary Generation》(Xinyu:面向中文评论生成的高效大模型系统)。该论文提出面向新闻评论的端到端大模型写作系统 Xinyu,通过融合五步生成流水线逐步监督微调(SFT)论点排序模型 + 证据库检索增强生成(RAG),把评论写作从平均 4 小时压缩到 20 分钟,其特别之处在于用「流程解构」与「外部证据」同时满足评论的结构严谨与论据充分。实验表明 Xinyu 以 13B 参数在五维评价中拿到 Overall 7.93,超越 GPT-4(7.78)等全部基线,且人工实测效率提升 12 倍而质量不降,为媒体内容生产的 AI 辅助写作提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目内容
标题(英文)Xinyu: An Efficient LLM-based System for Commentary Generation
标题(中文)Xinyu:面向中文评论生成的端到端大模型系统
作者Yiquan Wu, Bo Tang, Chenyang Xi, Yu Yu, Pengyu Wang, Yifei Liu, Kun Kuang, Haiying Deng, Zhiyu Li, Feiyu Xiong, Jie Hu, Peng Cheng, Zhonghao Wang, Yi Wang, Yi Luo, Mingchuan Yang
机构浙江大学 · 上海高等算法研究院 · 媒体融合生产技术与系统国家重点实验室 · 中国电信研究院
会议KDD 2024(30th ACM SIGKDD,巴塞罗那)
arXiv2408.11609
官方页面ACM DOI: 10.1145/3637528.3671537

背景与动机

为什么评论生成比普通文本生成更难? 评论是一种「观点+证据」型文章,要为读者提供对事件的深度理解。一篇合格的时评有两个层次的要求:基本要求是结构完整(总-分结构)且内容自洽(论据必须支撑论点);进阶要求是论点具体新颖、论据真实且有说服力——而 LLM 最容易犯的幻觉,恰恰会编造不存在的论据。

现有工作为什么不够? 直接让大模型一次性生成评论,结构容易松散、论据无法溯源;传统的自动评估指标如 ROUGE、BLEU 只衡量与参考文本的相似度,而评论内容高度多样,相似度指标无法全面评估质量。在评论生成方向,过去的工作多为短文本(用户评论、代码注释),缺少面向完整时评的系统;领域大模型(医疗、法律、教育等)主要做知识注入,没有把「写作流程」本身工程化。

RAG 写作系统的历史脉络也印证了这一思路:2020 年 Lewis 等人确立检索增强生成(RAG)范式,2022–2023 年 InstructGPT 与 LIMA 奠定 SFT/RLHF 对齐技术,2024 年 Xinyu 首次把「流程解构 + 证据库 RAG」组合成评论写作系统,此后 GraphRAG 等全局检索与智能体写作系统相继兴起。Xinyu 站在这条脉络上,完成了从通用检索生成到垂直媒体生产的技术迁移。

研究主线:从问题到结论

Mermaid 图 1

图 5:Xinyu 研究主线(Mermaid 流程图)——从评论写作的高时耗痛点出发,经流程解构、排序模型与证据库 RAG,最终用五维评测闭环验证 12 倍提速与质量不降。

基准/方法设计

Xinyu 的核心设计思想是把「一篇式生成」解构成「可训练、可干预的流水线」:结构由分解天然保证,质量由专项组件保障。系统划分为五步主线组件两个辅助组件

组件作用关键设计
Peg 生成用搜索引擎抓取事件要点,凝练成写作锚点取检索结果前 3 条,LLM 压缩成信息密度高的 peg
主论点生成生成候选主论点按 10 个方向生成:科技/财经/社会/政治/文艺/生活/环境/体育/教育/科学
支撑论点生成围绕主论点展开多角度论证支持并行/递进/对比三种结构,数量自适应
证据生成从证据库检索并改写论据RAG 检索 + 标注出处编号,缓解幻觉
成文生成标题与结尾并组装全文整合前面所有输出
论点排序模型评估主论点新颖性与客观性BERT 打分 + 成对损失,24 万对点赞偏序训练
证据数据库提供可追溯的实时论据20 万事件 + 11 万书籍知识,ElasticSearch 检索

Xinyu 评论生成任务示意图:评论员工作流与评论结构

图 1:评论生成任务示意——左侧是评论员工作流(论点挖掘、证据检索、文章润色),Xinyu 加速中间步骤;右侧是一篇评论的标准结构:标题、主论点、支撑论点与证据、结尾。

分类全景

Mermaid 图 2

图 6:Xinyu 系统组件分类(Mermaid 流程图)——主线五步组件保证基本要求(结构严谨、逻辑自洽),辅助组件保证进阶要求(论点新颖、论据充分)。

方法细节

逐步解构 + 逐步 SFT。 每一步都有专属提示策略与 SFT 数据:Peg 生成以「事件详情→peg」构造训练样本;主论点生成以「peg+方向→主论点」训练;支撑论点生成以「事件+主论点+结构→支撑论点」训练;证据生成以「主论点+支撑论点+检索资料→带编号论据」训练;成文以「前文→标题/结尾」训练。40 万条 SFT 数据覆盖全部步骤。

Xinyu 整体框架图:五步生成流程与辅助组件

图 2:Xinyu 整体框架——上方五步生成流程逐步衔接,下方论点排序模型与证据数据库为步骤 2 与步骤 4 提供质量保障。

论点排序模型。 主观的「论点新颖性」没有统一标准,论文把它转化为两两比较问题:BERT 打分器配合成对损失 $L(x)=\sum\Phi(f(x_a)-f(x_b))$,其中 $f(x)$ 是论点打分,$\Phi$ 是非线性变换。训练数据用知乎文章点赞数构造偏序,共 24 万对——点赞数近似反映新颖性与客观性,替代昂贵的人工标注。

证据数据库与 RAG。 事件知识通过每日抓取网站热榜标题,由 LLM 完成四件事:概括事件、判定方向(科技/财经等 10 类)、抽取六要素(时间/地点/人物/起因/经过/结果)、按六要素成段描述;书籍知识来自法律、财经等经典著作的合法分块。数据库规模为 20 万事件 + 11 万书籍,检索用 ElasticSearch,相似度阈值取 0.6,且事件数据每日更新保证时效性。

训练配置(附录 B)。 基座 LLaMA2-13B 扩充 2.8 万中文 token,用 500B 中英 token 继续预训练 20 天(128 张 A800 80G);SFT 40 万条数据混合各步骤专项数据与 BelleGroup 通用中文数据集,8 张 A800 训练 2 天,框架为 Megatron-DeepSpeed。

实验设计与结果

评测协议。 测试集选自人民日报「三评」栏目的 41 篇真实评论,覆盖经济、民生、科技、文化、体育等主题。论文提出五维评价体系:结构(层次清晰、谋篇布局)、逻辑(内容自洽、论证合理)、论点(立意新鲜、导向正确)、论据(针对性、合适性)、语言(流畅、深刻、生动),各维度 1–10 分,Overall 取平均,由 GPT-4 按提示词打分;基线模型与 Xinyu 都只输入事件详情以保证公平。

GPT-4 打分可信度(附录 A)。 用 30 篇随机评论对比 GPT-4 与人工打分,各维度 Pearson 相关系数全部超过 0.6:

维度结构逻辑论点论据语言
Pearson 相关系数0.660.690.730.660.64

主实验结果(GPT-4 评分)。 Xinyu(基于微调 LLaMA2-13B)以 Overall 7.93 超过包括 GPT-4 在内的全部基线

方法Overall结构逻辑论点论据语言
GPT-47.788.058.40*8.056.028.38*
GLM-47.728.11*8.358.08*5.828.24
ERNIE-47.718.058.358.035.738.38*
GPT-3.5-Turbo7.708.008.088.006.398.05
Baichuan2-Turbo7.658.11*8.288.065.638.17
Qwen-72B7.377.907.887.875.287.90
Xinyu (LLaMA2-13B)7.93*8.008.208.007.41*8.05

表示全部基线中最高分。)Xinyu 的优势集中在论据维度(7.41 vs 最强基线 6.39)*——这正是排序模型与证据库的功劳。

人工 vs Xinyu 辅助写作对比图

图 3:人工 vs Xinyu 辅助——写作耗时从 4 小时以上降至 20 分钟,质量评分与纯人工相当。

框架消融(附录 D)。 套用 Xinyu 框架后,GPT-4 达到 8.30 全场最高,Baichuan2-Turbo 到 7.91,Qwen-72B 从 7.37 升到 7.82;而 20B 以下的 Baichuan2-13B 只有 6.31、Qwen-14B 只有 6.22——框架对小模型是负增益,反证 SFT 是让 13B 模型发挥框架价值的关键

RAG 消融与时效性(附录 E)。 去掉 RAG 时论据 5.60、时效 8.85;加事件库后论据 7.14、时效 9.10;事件+书籍双库达到论据 7.41、时效 9.30(人工判定,Kappa 超过 0.78):

配置论据时效性
w/o RAG5.608.85
w/ 事件库7.149.10
w/ 事件 + 书籍库7.419.30

SFT 数据分布图

图 4:SFT 数据分布——各生成步骤都有充足的专项数据配比,这是逐步训练有效性的基础。

结果对比总结

Mermaid 图 3

图 7:结果对比总结(Mermaid 流程图)——质量与效率双胜:13B 参数在五维评测上全面领先,论据维度优势来自证据库 RAG,框架增益来自流程解构与逐步 SFT。

关键发现

  • 小模型打赢大模型:Xinyu 以 13B 参数拿到 Overall 7.93,超过 GPT-4(7.78)、GLM-4(7.72)、ERNIE-4(7.71)等全部基线,主要靠论据维度 7.41 的显著优势。
  • RAG 是论据质量的核心:去掉 RAG 论据仅 5.60,加事件库升至 7.14,加书籍库再到 7.41;时效性从 8.85 升到 9.30。
  • 框架对模型有放大效应:Qwen-72B 套框架后 Overall 从 7.37 升至 7.82(+0.45);GPT-4 套框架达 8.30,但 20B 以下模型套框架反而下降,说明分步生成能力需要 SFT 注入。
  • 弱监督信号可行:24 万对知乎点赞偏序训练的排序模型上线后,所有维度指标提升(Overall 7.85→7.93),验证了「用平台点赞替代人工标注」的有效性。
  • 真实场景 12 倍提速:10 个真实案例中,评论员写作时间从 4 小时以上降至 20 分钟,质量评分与纯人工持平。
  • 评价体系可复现:五维 GPT-4 打分与人工 Pearson 相关 0.64–0.73,为评论生成提供了首个可自动复现的评估协议。
  • Oral 信号拆解(附录 C):用 ResearchStudio-Idea 框架审视,Xinyu 命中三个创新模式——P11 分解并委托求解器(五步流水线交给专项模型与检索器)、P4 隔离变量诊断测量(逐组件消融)、P7 自造训练信号(知乎点赞偏序替代人工标注),属于可复用基础设施型贡献,社区可在此之上继续构建。

局限性

  • 检索精度:证据召回仍可能命中与论点相关性不足的资料,需要更强的查询-文档语义对齐。
  • 对齐手段单一:目前以 SFT 为主,尚未引入 RLHF 对齐写作风格与用户偏好。
  • 时效性评估受限:GPT-4 训练截止日期导致时效性只能靠人工判定(Kappa 0.78+)。
  • 中文场景限定:系统与证据库面向中文评论,跨语言迁移未验证。
  • 叙事措辞层面(附录 F 分析):论文摘要存在 "a comprehensive of evaluation metric" 语法笔误,表注中 "Arug." 为不规范缩写——不影响结论,但属于可读性瑕疵。

常见问题(FAQ)

Xinyu 与直接用 GPT-4 写评论有什么区别?

Xinyu 把生成解构成五步流水线并逐步 SFT,再用论点排序与证据库 RAG 兜底质量;直接让 GPT-4 一篇生成,结构容易松散,论据可能编造。实验上 Xinyu 的 Overall 7.93 超过 GPT-4 的 7.78,论据维度 7.41 显著领先。

证据库里的知识从哪里来?

两部分:事件知识来自每日抓取的热榜文章标题,由 LLM 概括事件、判定方向、抽取六要素并成段描述(20 万条,每日更新);书籍知识来自法律、财经等经典著作的合法分块(11 万条)。检索用 ElasticSearch,相似度阈值 0.6。

论点排序模型为什么用知乎点赞?

论点的「新颖性」没有客观标准,论文用知乎文章点赞数构造文本对的偏序——高赞观点通常更新颖、更客观——训练 24 万对数据让 BERT 打分器学会两两比较,避免昂贵的人工标注。

4 小时到 20 分钟是怎么测的?

随机选取 10 个真实案例,让有新闻背景的评论员分别纯手工写作和使用 Xinyu 辅助写作,对比耗时与质量评分。结果平均耗时从 4 小时以上降至 20 分钟,质量评分与纯人工相当。

这套系统能迁移到英文或其他文体吗?

论文只验证了中文评论场景,跨语言迁移未做实验。不过流程解构、排序与 RAG 的设计与语言无关,迁移的主要成本在于重建对应语言的证据库与 SFT 数据。

GPT-4 当裁判可靠吗?

论文用 30 篇评论对比 GPT-4 与人工打分,五个维度的 Pearson 相关系数在 0.64 到 0.73 之间,全部超过 0.6,证明 GPT-4 作为自动评估器胜任该任务;只有时效性维度因模型知识截止由人工判定。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

代码转载自:https://pan.quark.cn/s/a4b39357ea24 ### React与Ant Design在蚂蚁金服的应用 在互联网技术快速进步的环境下,蚂蚁金服在前端技术领域持续进行技术探索与实践,其中React框架和Ant Design设计系统的应用尤为突出。以下将详细阐述相关内容。 #### React技术栈的实施 React是由Facebook开发的一个用于构建用户界面的JavaScript库,其特点在于采用声明式UI和组件化理念,使得开发者能够构建出交互性强、性能高的用户界面。蚂蚁金服之所以选择React作为其前端技术的主要框架之一,主要是因为其具备以下优势: 1. **组件化开发**:React提倡将UI划分为独立的、可复用的组件,这显著提高了代码的可维护性和可扩展性。 2. **虚拟DOM**:React利用虚拟DOM机制对真实DOM进行操作,有效减少了不必要的DOM操作,从而提升了应用的性能。 3. **单向数据流**:React通过单向数据绑定,简化了复杂应用的数据管理问题,使得状态更新更加可预测。 4. **丰富的生态系统**:围绕React构建的生态系统非常完善,涵盖了构建、测试、部署和监控的各个方面。 #### Ant Design设计规范 Ant Design是一套企业级的UI设计语言和React实现,旨在帮助开发人员构建具有优质用户体验的Web应用程序。在蚂蚁金服的应用中,Ant Design主要体现在以下方面: 1. **统一的视觉设计**:Ant Design提供了统一的UI组件和设计规范,确保了前端产品的一致性,同时降低了设计成本。 2. **易用性和可访问性**:其设计遵循易用性和可访问性原则,使产品的使...
打开链接下载源码: https://pan.quark.cn/s/e9cbd96a9d95 CEF3,即Chromium Embedded Framework 3,是一个源自Google Chrome浏览器开源项目Chromium的框架。该框架使得开发者能够将Chrome的渲染引擎集成进他们的应用程序中,用以展示和操作Web内容。CEF3的最新版本为3.2623.1401.gb90a3be,显示其已经经历了多次迭代和改进,旨在提供更优的性能表现和更高的兼容性水平。在当前提供的压缩包中,囊括了CEF3针对Windows系统的32位和64位不同架构的版本。这种多版本支持确保了开发者的应用能够适应多样的系统配置,无论是32位还是64位的操作系统都可以顺利执行。此外,此版本的CEF3明确声明其支持MP3和MP4这两种音频视频格式以及Flash技术。这表明利用CEF3,开发者可以在他们的应用中无缝嵌入多媒体元素,包括音频文件的播放和在线视频的展示。 `macros.cmake`作为CMake构建系统的一部分,包含了用于简化和规范构建流程的宏指令。`cefclient.gyp`和`cef_paths.gypi`则是CEF的构建配置文档,它们负责定义项目的整体架构和依赖关系,通常用于构建CEF的示范客户端程序`cefclient`。`cef_paths2.gypi`或许是一个额外的路径处理配置文件,主要处理跨平台环境下的路径问题。 `README.txt`和`LICENSE.txt`分别提供了项目的基础信息和授权条款,开发者在使用时应仔细研读以符合正确的使用规范。`CMakeLists.txt`是CMake构建系统的核心配置文件,它负责指导CMake如何进行源代码的编译和链接操作...
源码直接下载地址: https://pan.quark.cn/s/801515af9bab 天融信数据库审计网络审计系统-日志外发配置手册详述了天融信数据库审计网络审计系统在审计日志、系统日志以及报警日志方面的syslog、SNMP和邮件外发功能。本手册将系统性地阐述如何对天融信数据库审计网络审计系统的日志外发功能进行配置,涵盖了SYSLOG外发配置、SNMP外发配置以及邮件外发配置等多个方面的具体内容。 知识点一:天融信数据库审计网络审计系统的日志外发功能 天融信数据库审计网络审计系统具备日志外发功能,能够将审计日志、系统日志和报警日志传输至第三方日志管理服务器。此类功能有助于管理员更为高效地实施日志监控与管理,进而增强系统的安全防护能力和运行稳定性。 知识点二:SYSLOG外发配置 SYSLOG外发配置是天融信数据库审计网络审计系统日志外发的一种具体实现方式。借助SYSLOG外发插件,审计日志、系统日志和报警日志得以发送至第三方日志管理服务器。SYSLOG外发配置的流程包含启用SYSLOG外发插件、修改SYSLOG外发插件的订阅关系、设定SYSLOG外发插件参数以及执行SYSLOG外发测试等多个环节。 知识点三:SNMP外发配置 SNMP外发配置是天融信数据库审计网络审计系统日志外发的另一种实现方式。借助SNMP外发插件,审计日志、系统日志和报警日志同样可以发送至第三方日志管理服务器。SNMP外发配置的步骤包括启用SNMP外发插件、调整SNMP外发插件的订阅关系、配置SNMP外发插件参数以及进行SNMP外发测试等关键步骤。 知识点四:邮件外发配置 邮件外发配置是天融信数据库审计网络审计系统日志外发的一种实现方式。通过邮件外...
内容概要:本文提出了一种基于瞬态三角哈里斯鹰算法(TTHHO)的多无人机协同集群三维路径规划方法,旨在实现复杂环境中无人机群的高效避障与路径优化。该方法以最小化综合成本为目标函数,综合考虑路径长度、飞行高度变化、外部威胁程度以及飞行转角等因素,构建多维度优化模型。通过引入瞬态三角策略增强哈里斯鹰优化算法的局部搜索能力和收敛速度,有效解决了传统智能算法易陷入局部最优、搜索效率低的问题。在Matlab平台上实现了完整的仿真系统,验证了TTHHO算法在多无人机协同路径规划中的优越性,表现出更强的全局寻优能力、更高的路径安全性与更低的能耗成本。; 适合人群:具备一定优化算法基础和Matlab编程能力,从事无人机路径规划、智能优化或自动化相关研究的科研人员及研究生;适用于对群体智能算法改进与工程应用感兴趣的高年级本科生和工程技术人员。; 使用场景及目标:①应用于复杂三维空间下的多无人机任务执行场景,如灾害救援、军事侦察、协同巡检等;②目标是提升无人机集群在动态障碍环境中的自主决策与协同避障能力,实现安全、高效、低耗的飞行路径规划;③为智能优化算法在实际工程问题中的改进与落地提供参考案例。; 阅读建议:建议结合Matlab代码进行仿真实践,重点关注目标函数设计、约束条件处理及算法改进机制的实现细节,深入理解TTHHO算法相较于传统优化算法的优势所在,并可通过调整环境参数与权重系数进一步开展对比实验与性能分析。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

白拾ShiroX

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值