十年磨一剑!《Python文本挖掘和知识发现》重磅上市:从文本挖掘到大模型,探索知识发现新范式

《Python文本挖掘和知识发现:大模型时代的新挑战与探索》重磅上市! 本书由长期深耕人工智能、文本挖掘、知识图谱与网络安全等领域的一线教师和科研人员联合编写,凝聚团队十余年的AI研究、教学与实践积累,由北京航空航天大学出版社正式出版。全书围绕“如何从海量文本中挖掘有价值的信息、如何构建高质量特征与智能模型、如何将大模型应用于真实业务场景”三大核心问题展开,系统融汇文本表示、词法句法语义分析、文本分类与聚类、情感分析、主题挖掘、知识图谱、智能问答、大语言模型、RAG与GraphRAG等内容,力求打通从文本数据处理、语义理解到知识发现与智能服务的完整技术链路。

十年磨一剑,从传统文本挖掘一路走到大模型时代,我们想写的并不是一本简单罗列算法和代码的工具书,而是一部帮助读者建立完整文本智能知识体系的实战教材。 无论你是刚刚接触Python、自然语言处理和人工智能的初学者,还是正在开展文本分析、知识图谱、数字人文、情报分析、网络安全和大模型研究的高校师生、科研人员与开发者,都可以沿着本书“起始—基础—高阶”的学习路径,从零开始理解文本、分析文本、挖掘文本,并最终把散落在海量文本中的信息转化为可组织、可关联、可计算、可利用的知识。我们更希望通过这本书回答一个大模型时代绕不开的问题:当ChatGPT、DeepSeek等大模型已经能够阅读、总结甚至生成文本,我们为什么还需要学习文本挖掘与知识发现?

  • 近700页内容、200个实战案例、17个章节,从撰写到见刊历经6年
  • 云南大学一位老教授感叹“现在年轻科研人很难做到这么深耕一门技术呀!”

在这里插入图片描述


🎁 新书上市福利:评论点赞最高的3位读者赠书

在正式介绍本书之前,先给一直关注和支持我们的读者送上一份小福利。

欢迎大家在评论区留言,说说你与Python、文本挖掘、知识图谱或大模型的故事,也可以谈谈你最希望从这本书中学到什么,或者与本书作者的故事。活动结束后(公众号截止9月5日晚),我们将从评论区中选取点赞数最高的3位读者,每人赠送《Python文本挖掘和知识发现:大模型时代的新挑战与探索》一本

希望这3本书能够真正送到热爱技术、热爱学习、愿意动手实践的朋友手中。一本技术书最好的价值,不只是被摆在书架上,而是能够真正变成代码、实验、论文、项目,以及解决现实问题的能力。

京东和当当网搜索“Python文本挖掘和知识发现” 或者 搜索作者名字“杨秀璋”即可购买。具体地址如下:

  • https://item.jd.com/15421864.html

在这里插入图片描述


十年磨一剑:为什么我们还要在大模型时代写一本“文本挖掘”?

过去十余年,人工智能领域发生了翻天覆地的变化。

从早期依赖统计特征的文本分析,到机器学习;从Word2Vec等词嵌入技术,到CNN、RNN、Transformer和BERT;再到今天以ChatGPT、DeepSeek等为代表的大语言模型,机器处理文本的能力已经发生质的飞跃。

于是,一个很自然的问题出现了:

既然大模型已经这么强,为什么还要学习文本挖掘?

这也是我们在构思本书时反复思考的问题。

今天,人类生产的信息依然大量以非结构化文本存在,包括学术论文、新闻报道、政策文件、社交媒体、历史文献、网络评论、企业报告和网络威胁情报等。这些文本规模庞大、结构复杂、语义丰富,其中蕴含着大量有价值的信息和知识。

但“文本存在”并不意味着“知识已经被发现”。

真正的科研与工程应用,仍然需要回答:如何清洗和组织海量语料?如何理解文本语义?如何识别人名、机构、地点、事件等实体?如何发现实体之间的关系?如何从文本中提取主题并分析其演化?又如何把零散信息进一步组织成知识,并支撑检索、问答和智能决策?

因此,大模型并没有让文本挖掘失去价值,反而推动文本挖掘进入了新的阶段。

本书《前言》中用一条非常清晰的技术路线概括了这一过程:

数据 → 信息 → 知识

在这里插入图片描述

文本挖掘与知识发现的核心,就是推动非结构化文本逐步向结构化信息和知识转化;而随着大模型、RAG和GraphRAG等技术的发展,文本挖掘也正在从传统的“模式发现”,进一步走向“知识生成与智能服务”。

这正是我们在大模型时代重新系统梳理文本挖掘与知识发现的原因。


一、大模型不是终点,而是文本挖掘与知识发现的新起点

大语言模型拥有强大的语言理解和生成能力,但真正进入科研和专业场景之后,仍然会遇到领域知识不足、知识更新不及时、结果难以验证以及模型幻觉等问题。

这也是为什么今天的大模型应用越来越重视外部知识。

RAG通过“先检索,再生成”的方式,让模型在回答问题前先访问外部知识库;GraphRAG则进一步把知识图谱中的实体、关系和图结构引入检索与生成过程,让模型不仅能够找到相关文本片段,还能够理解知识之间的关联。

在这里插入图片描述

但这里又出现了一些更基础的问题:

高质量知识库从哪里来?领域实体如何识别?实体关系如何抽取?文本如何清洗和组织?知识图谱如何构建?这些问题最终仍然离不开文本挖掘与知识发现。

因此,本书并没有把传统文本挖掘与大模型割裂开来,而是试图呈现一条连续的技术演化路径:

  • 传统文本分析 → 机器学习 → 深度学习 → 语义理解 → 知识发现 → 知识图谱 → 大语言模型 → RAG/GraphRAG → 智能服务

在这里插入图片描述

本书《前言》中也明确提出,大语言模型能够显著提升语义表征与跨任务泛化能力,而RAG、GraphRAG等技术则可以通过融合外部知识资源和结构化约束,进一步增强复杂知识场景中的领域适配能力、语义理解深度和结果可解释性。

所以,这本书真正想讨论的并不是“传统方法和大模型谁更重要”,而是:

如何把传统文本挖掘、深度学习、知识图谱与大模型重新连接起来,形成完整的知识发现技术体系。

下图详细展示了传统文本挖掘与大模型时代文本挖掘的差异。

请添加图片描述


二、从0到1:一条贯通“文本—信息—知识—智能”的学习路线

很多初学者最大的困惑,并不是某个算法学不会,而是知识太碎

今天学中文分词,明天学TF-IDF;接着学文本分类、BERT和命名实体识别;后来又接触知识图谱、RAG和大模型。每项技术似乎都学过,但真正面对一个科研课题或工程项目时,却不知道应该从哪里开始,也不知道这些技术之间有什么关系。

因此,本书没有按照“算法百科全书”的方式组织内容,而是按照“起始—基础—高阶”三个层次搭建完整学习路径。

请添加图片描述

  • 起始篇重点解决“基础从哪里来”。内容包括Python编程、常用数据分析工具、机器学习、深度学习、概率模型、信息论以及词嵌入和文本表示等。读者不仅要知道算法怎么调用,还要理解文本为什么能够转化为向量、分类模型为什么能够区分文本、注意力机制解决了什么问题,以及Transformer为什么会成为今天大语言模型的重要基础。

请添加图片描述

  • 基础篇进一步解决“机器如何逐步理解文本”。全书从中文分词、词性标注、命名实体识别等词法分析入手,再进入句法结构、依存关系和语义分析,最后延伸到文本分类、文本聚类和情感分析等典型任务,形成从“词”到“句”,再到“语义”和“应用任务”的完整路径。

请添加图片描述

  • 高阶篇则重点回答“如何从文本中进一步发现和利用知识”。内容涵盖主题挖掘、主题演化、智能问答、知识图谱、机器翻译以及古文字图像数字化处理等,并进一步把文本分析延伸到多模态信息处理与复杂知识服务场景。

请添加图片描述

因此,这本书最终希望帮助读者建立的不是若干孤立技能,而是一张完整的技术地图:

文本处理 → 文本表示 → 文本理解 → 文本挖掘 → 知识发现 → 知识组织 → 智能应用


三、从“文本挖掘”到“发现知识”:本书真正想训练的核心能力

传统文本分析往往关注词频、分类、相似度等问题,但知识发现更进一步。例如,面对数万篇论文,我们不仅想知道哪些词出现频率最高,更希望知道:

哪些研究主题正在兴起?哪些主题正在衰退?不同技术方向之间如何发生交叉?一个研究领域十年来经历了怎样的演变?

面对新闻和政策文本,我们不仅想统计关键词,更希望识别其中的人物、机构、地点和事件,并进一步发现它们之间的关系。

请添加图片描述

面对网络安全威胁情报,我们不仅需要判断文本属于什么类型,还需要识别攻击组织、恶意软件、漏洞、攻击技术和基础设施,并将这些零散信息组织成结构化知识。

这就是从“文本挖掘”走向“发现知识”的过程。

在这里插入图片描述

因此,本书不仅介绍文本分类、聚类、情感分析等基础任务,也重点进入主题挖掘、主题演化、知识图谱和智能问答等更高层次内容。其核心目的,就是帮助读者理解:

文本挖掘的终点,不是获得一个统计结果,而是逐步形成可以被组织、关联、检索、利用和推理的知识。

在这里插入图片描述

当文本中的实体和关系能够被识别、组织并形成知识网络之后,这些知识就能够进一步服务于搜索、问答、推理以及大模型知识增强。这也正契合本书中提出的“从文本处理到知识服务”的整体技术路径。下图展示了本书中GraphRAG抽取威胁情报实体与关系的效果图。

请添加图片描述


四、理论、代码与案例并重:不只“看懂”,更要真正“做出来”

一本技术书最容易出现两个极端。

  • 一种是理论很多,读完觉得“懂了”,真正打开电脑却不知道从哪里开始;另一种是代码很多,只能照着运行,却不知道代码为什么这样写,也无法迁移到自己的问题中。

本书希望在两者之间找到平衡。

因此,全书强调“理论 + 方法 + 实践”的结合。一方面系统解释核心概念和关键原理,另一方面使用Python实现典型算法,并结合实际案例帮助读者理解技术如何落地。

在这里插入图片描述

在这里插入图片描述

本书兼顾基础理论与方法实践,既系统讲解核心概念与关键原理,又深入解析典型方法与应用案例,并进一步拓展至信息抽取、知识图谱构建和多模态分析等前沿应用场景。

我们更希望读者通过本书完成三个层面的能力提升:

  • 第一层是“看懂”——理解文本挖掘与知识发现的原理;

  • 第二层是“做出”——能够利用Python实现典型算法和案例;

  • 第三层是“用好”——能够把这些方法迁移到自己的论文、课题、毕业设计、项目和大模型应用中。

真正有价值的技术学习,从来不只是会调用一个函数,而是能够判断什么时候该用、为什么这样用,以及出了问题应该如何调整。

在这里插入图片描述


五、五大核心亮点:为什么这本书值得关注?

从封底可以看到,我们最终把本书特色凝练为五个关键词。

第一,十年AI实践团队倾力打造。 本书不是临时追逐大模型热点,而是作者团队长期从事人工智能、文本挖掘、知识图谱、网络安全、科研教学和项目实践之后形成的一次系统总结。

第二,零基础友好入门。 从Python、基础理论和常用工具讲起,再逐步深入机器学习、深度学习、文本挖掘、知识发现和大模型应用,尽可能降低跨专业读者进入该领域的门槛。

第三,理论与实践双驱动。 不仅告诉你“是什么”,更强调“为什么”和“怎么做”,通过Python、案例和完整技术路线帮助读者真正理解并实现相关方法。

第四,大模型时代全新视角。 在系统梳理传统文本挖掘方法的同时,引入大语言模型、RAG、GraphRAG等技术,让经典方法与前沿技术形成连贯的知识体系。

第五,系统性与可迁移性并重。 本书并不局限于某一种数据或某一个应用,而是希望读者掌握一套可以迁移到科研、教学、工程和交叉学科中的文本智能分析方法。

在这里插入图片描述

这些特点最终指向一个共同目标:

让读者获得系统能力,而不是碎片知识。


六、哪些人适合阅读这本书?

本书首先适合正在学习Python、自然语言处理、文本挖掘和人工智能的初学者。如果你已经掌握了一些Python基础,但不知道下一步如何进入NLP、知识图谱和大模型应用,本书可以作为一条较为完整的学习路径。

请添加图片描述

请添加图片描述

对于本科生、研究生和高校教师,本书可以作为课程学习、毕业设计、科研训练和论文研究的参考。书中的分类、聚类、情感分析、主题挖掘、实体识别、知识图谱等内容,都可以进一步延伸为具体研究课题。

在这里插入图片描述

对于科研人员,本书的方法能够应用于学术论文、政策文本、新闻资讯、网络评论和历史文献等大量非结构化文本,为语料处理、实验设计、知识抽取和知识组织提供方法支持。

在这里插入图片描述

对于工程开发人员,则可以沿着“文本处理—模型构建—知识图谱—智能问答—大模型知识增强”的路径,进一步开发文本分类系统、知识图谱系统、领域问答系统和大模型应用。

请添加图片描述

此外,图书情报、数字人文、管理科学、网络安全等交叉领域的研究者同样适合阅读。文本挖掘最重要的价值之一,就是它具有很强的方法迁移能力——同一种技术既可以分析论文,也可以分析历史文献;既可以处理用户评论,也可以处理威胁情报。

只要你的研究对象中存在大量文本,这本书中的方法就可能具有价值。


七、一本书出版不是结束,而是持续生长的开始

人工智能技术变化很快,一本技术书不应该在出版的那一刻停止更新。

因此,作者团队将在GitHub持续维护本书配套资源,包括案例数据集、实验代码以及后续技术补遗等内容,方便读者在学习过程中进行复现和拓展。

本书还有一个非常重要的观点:

文本挖掘与知识发现技术的核心价值,在于辅助理解、提升效率,而不是代替人的研究与思考。

我们希望读者最终完成的,也不是简单地从“不会使用AI”变成“会调用AI”,而是进一步从“技术使用者”走向“技术驾驭者”,包括对大模型、智能体等新兴技术的应用。

这也是为什么本书一方面介绍大模型,另一方面仍然坚持系统讲解Python、机器学习、深度学习、文本挖掘和知识发现基本原理。

请添加图片描述

因为工具会变化,模型会更新,但对数据、文本、知识和方法的理解不会轻易过时。


写在最后:真正稀缺的,是从文本中发现知识的能力

回到最开始的问题:

大模型已经这么强,我们为什么还要学习文本挖掘?

因为大模型可以帮助我们阅读文本,却不会自动替我们建立可靠的研究体系;可以生成答案,却不能保证每个答案都准确可信;可以理解语言,却仍然需要高质量数据、领域知识和结构化知识支撑专业应用。

从文本中找到信息,是第一步。

从信息中识别关系,是第二步。

从关系中形成知识,是第三步。

而让这些知识进一步支撑检索、推理、问答和决策,才是我们走向智能服务与智慧社会的重要一步。

请添加图片描述

这也是《Python文本挖掘和知识发现:大模型时代的新挑战与探索》希望与读者一起完成的一条路线:

从数据到信息,从信息到知识;
从文本理解到知识生成,从数据分析到智能决策;
从经典文本挖掘走向大模型时代的知识发现。

十年磨一剑,一朝汇聚成书。

希望这本书能够成为初学者进入文本智能世界的一块踏板,也能够成为科研人员开展文本分析与知识发现的一本案头参考,更希望它能够帮助正在学习大模型的读者补上“数据、文本与知识”这一层真正重要的基本功。

《Python文本挖掘和知识发现:大模型时代的新挑战与探索》,希望大家多多支持!

也期待未来某一天,你能够利用书中的某个方法完成一篇论文、一个毕业设计、一项科研课题,或者真正解决一个现实中的文本分析问题。

那可能才是一本技术书最好的归宿。

在这里插入图片描述


新书信息

  • 书名:《Python文本挖掘和知识发现:大模型时代的新挑战与探索》
  • 出版社:北京航空航天大学出版社
  • 作者:杨秀璋、武帅、党超辉、杜瑞祺、徐香香
  • 关键词:Python、文本挖掘、自然语言处理、机器学习、深度学习、文本分类、文本聚类、情感分析、主题挖掘、知识图谱、智能问答、大语言模型、RAG、GraphRAG

本书配套案例、代码与后续技术补遗将在GitHub持续更新。

最后再次提醒赠书活动:评论区点赞数最高的3位读者,各赠送本书1本。

欢迎大家留言:你最希望利用Python、文本挖掘或大模型解决什么问题?

转眼,已经分享了15年技术博客,本书亦是自己15年分享的总结。也欢迎大家在评论区写下与我相识的故事,或者这些年阅读的感受。写文不易,写书更难,一路走来,感谢太多人的支持,也帮助了一些人,不忘初心,唯有感恩!

一本书的出版,从来不是一个人的独行,而是一群志同道合者共同探索、持续打磨的结果。十年磨一剑,从Python编程、机器学习、文本挖掘与知识图谱,到大语言模型、RAG、GraphRAG与智能体,技术不断演进,但我们始终相信,真正重要的不是追逐热点,而是在实践中沉淀方法、在研究中发现知识
诚挚感谢创作团队成员一路同行,感谢北京航空航天大学出版社及编辑老师的辛勤付出,感谢各高校、科研团队、行业专家、开源社区和广大读者长期以来的支持与帮助。未来,文本挖掘与知识发现将进一步从“模式发现”走向“知识生成与智能服务”。愿本书不仅帮助读者掌握技术,更能启发大家理解技术、驾驭技术,让人类智慧与机器智能彼此赋能,在大模型时代共同探索更加广阔的知识世界。

(By:Eastmount 2026-08-29 周六写于贵阳 http://blog.csdn.net/eastmount )

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

Eastmount

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值