baidu分词算法分析之一

Google浏览器添加搜索引擎的详细教程 通过本文的介绍,相信用户已经掌握了在谷歌浏览器中添加和管理搜索引擎的方法。通过添加自己喜欢或经常使用的搜索引擎,用户可以更加方便地进行在线搜索,快速访问所需的信息。同时,定期检查和更新已添加的搜索引擎信息,也有助于保持搜索的准确性和高效性。希望本文能为用户提供实用的帮助和指导! 阅读详情
查询处理以及分词技术

随着搜索经济的崛起,人们开始越加关注全球各大搜索引擎的性能、技术和日流量。作为企业,会根据搜索引擎的知名度以及日流量来选择是否要投放广告等;作为普通网民,会根据搜索引擎的性能和技术来选择自己喜欢的引擎查找资料;作为技术人员,会把有代表性的搜索引擎作为研究对象. 搜索引擎经济的崛起,又一次向人们证明了网络所蕴藏的巨大商机。网络离开了搜索将只剩下空洞杂乱的数据,以及大量等待去费力挖掘的金矿。

但是,如何设计一个高效的搜索引擎?我们可以以百度所采取的技术手段来探讨如何设计一个实用的搜索引擎.搜索引擎涉及到许多技术点,比如查询处理,排序算法,页面抓取算法,CACHE机制,ANTI-SPAM等等.这些技术细节,作为商业公司的搜索引擎服务提供商比如百度,GOOGLE等是不会公之于众的.我们可以将现有的搜索引擎看作一个黑盒,通过向黑盒提交输入,判断黑盒返回的输出大致判断黑盒里面不为人知的技术细节.

查询处理与分词是一个中文搜索引擎必不可少的工作,而百度作为一个典型的中文搜索引擎一直强调其”中文处理”方面具有其它搜索引擎所不具有的关键技术和优势.那么我们就来看看百度到底采用了哪些所谓的核心技术.

我们分两个部分来讲述:查询处理/中文分词.

一. 查询处理

用户向搜索引擎提交查询,搜索引擎一般在接受到用户查询后要做一些处理,然后在索引数据库里面提取相关的信息.那么百度在接受到用户查询后做了些什么工作呢?

1. 假设用户提交了不只一个查询串,比如”信息检索 理论 工具”.那么搜索引擎首先做的是根据分隔符比如空格,标点符号,将查询串分割成若干子查询串,比如上面的查询就会被解析为:<信息检索,理论,工具>三个子字符串;这个道理简单,我们接着往下看.

2. 假设提交的查询有重复的内容,搜索引擎怎么处理呢?比如查询”理论 工具 理论”,百度是将重复的字符串当作只出现过一次,也就是处理成等价的”理论 工具”,而GOOGLE显然是没有进行归并,而是将重复查询子串的权重增大进行处理.那么是如何得出这个结论的呢?我们可以将”理论 工具”提交给百度,返回341,000篇文档,大致看看第一页的返回内容.OK.继续,我们提交查询”理论 工具 理论”,在看看返回结果,仍然是那么多返回文档,当然这个不能说明太多问题,那看看第一页返回结果的排序,看出来了吗?顺序完全没有变化,而GOOGLE则排序有些变动,这说明百度是将重复的查询归并成一个处理的,而且字符串之间的先后出现顺序基本不予考虑(GOOGLE是考虑了这个顺序关系的).

3. 假设提交的中文查询包含英文单词,搜索引擎是怎么处理的?比如查询”电影BT下载”,百度的方法是将中文字符串中的英文当作一个整体保留,并以此为断点将中文切分开,这样上述的查询就切为<电影,BT,下载>,不论中间的英文是否一个字典里能查到的单词也好,还是随机的字符也好,都会当作一个整体来对待.至于为什么,你用查询” 电影dfdfdf下载”看看结果就知道了.当然如果查询中包含数字,也是如此办理.

到目前为止,一切很简单,也很清楚,百度怎么处理用户查询的呢?归纳如下:首先根据分割符号将查询分开,然后看看是否有重复的字符串,如果有,就抛弃多余的,只保留一个,接着判断是否有英文或者数字,如果有的话,把英文或者数字当作一个整体保留并把前后的中文切开.

接着该干什么呢?该考虑分词的问题了.

二. 中文分词

首先,讲讲百度的分词时机或者条件问题,是否是个中文字符串百度就拿来切一下呢?非也,要想被百度的分词程序荣幸的切割一下也是要讲条件的,哪能是个字符串就切割啊?你当百度是卖锯条的么?

那么什么样的字符串才满足被切割的条件呢?简单说来,如果字符串只包含小于等于3个中文字符的话,那就保留不动,当字符串长度大于4个中文字符的时候,百度的分词程序才出马大干快上,把这个字符串肢解掉.

怎么证明呢?我们向百度提交”电影下载”,看看返回结果中标为红字的地方,不难看出来,查询已经被切割成<电影,下载>两个单词了,说明分词程序已经开工了,如果是比4个中文字符更长的字符串,那分词程序就更不客气了,一定大卸八块而后快.我们来看看三个字符的情况,提交查询”当然择”,看起来这个查询不伦不类,那是因为我希望看到这个字符串被切分为<当然,择>,返回结果365篇相关页面,翻到最后一页,发现标红的关键字都是”当然择”连续出现的情况,好像没有切分,但是还不确定,那么再提交人工分好的查询”当然 择”看看,返回结果1,090,000篇,基本上可以确定没有进行分词了,当然另外一种解释是:对于三个字符先切分,然后将切分后的结果当作一个短语查询,这样看到的效果和没有切分是相似的.但是我倾向于判断百度对于少于3个字符的串没有切分,奥卡姆不是说了么”如无必要,勿增实体”,干吗做无用功呢.那么如果没有切分,会有一个随之而来的问题,怎么从索引库里面提取未切分的字符串呢?这牵扯到索引的问题,我觉得百度应该采取了两套索引机制,一种是按照单词索引,一种是按照N-GRAM索引,至于索引的具体问题,以后在详细论述.

下面我们看看百度是采取的何种分词算法,现在分词算法已经算是比较成熟了,有简单的有复杂的,比如正向最大匹配,反向最大匹配,双向最大匹配,语言模型方法,最短路径算法等等,有兴趣的可以用GOOGLE去搜索一下以增加理解.这里就不展开说了.但是要记住一点的是:判断一个分词系统好不好,关键看两点,一个是消除歧义能力;一个是词典未登录词的识别比如人名,地名,机构名等.

那么百度用的是什么方法?我的判断是用双向最大匹配算法.至于怎么推理得出的,让我们一步步来看.当然,这里首先有个假设,百度不会采取比较复杂的算法,因为考虑到速度问题.

我们提交一个查询”毛泽东北京华烟云”,又一个不知所云的查询,尽管不知所云但是自有它的道理,我想看看百度的分词是如何消歧以及是否有词典未登录词的识别的功能,如果是正向最大匹配算法的话,那么输出应该是:”毛泽东/北京/华/烟云”,如果是反向最大匹配算法的话,那么输出应该是:”毛/泽/东北/京华烟云”,我们看看百度的分词结果:”毛泽东/北/京华烟云”,一个很奇怪的输出,跟我们的期望相差较多,但是从中我们可以获得如下信息:百度分词可以识别人名,也可以识别”京华烟云”,这说明有词典未登录词的识别的功能,我们可以假设分词过程分为两个阶段:第一阶段,先查找一个特殊词典,这个词典包含一些人名,部分地名以及一些普通词典没有的新词,这样首先将”毛泽东”解析出来,剩下了字符串”北京华烟云”,而”北/京华烟云”,可以看作是反向最大匹配的分词结果.这样基本说得通.为了证明这一点,我们提交查询”发毛泽东北”,我们期望两种分词结果,一个是正向最大匹配<发毛,泽,东北>,一个是上述假设的结果<发,毛泽东,北>,事实上百度输出是第二种情况,这样基本能确定百度分词采取了至少两个词典,一个是普通词典,一个是专用词典(人名等).而且是专用词典先切分,然后将剩余的片断交由普通词典来切分.

继续测验,提交查询”古巴比伦理”,如果是正向最大匹配,那么结果应该是<古巴比伦,理>,如果是反向最大匹配,那么结果应该是<古巴,比,伦理>,事实上百度的分词结果是<古巴比伦,理>,从这个例子看,好像用了正向最大匹配算法;此外还有一些例子表明好像是使用正向最大匹配的;但是且慢,我们看这个查询”北京华烟云”,正向最大匹配期望的结果是<北京,华,烟云>,而反向最大匹配期望的结果是<北,京华烟云>,事实上百度输出的是后者,这说明可能采用的反向最大匹配;从这点我们可以猜测百度采用的是双向最大匹配分词算法,如果正向和反向匹配分词结果一致当然好办,直接输出即可;但是如果两者不一致,正向匹配一种结果,反向匹配一种结果,此时该如何是好呢?从上面两个例子看,在这种情况下,百度采取最短路径方法,也就是切分的片断越少越好,比如<古巴,比,伦理>和<古巴比伦,理>相比选择后者,<北京,华,烟云>和<北,京华烟云>相比选择后者.还有类似的一些例子,这样基本可以解释这些输出结果.

但是仍然遗留的问题是:如果正向反向分词不一致,而且最短路径也相同,那怎么办?输出正向的还是反向的结果?我们再来看一个例子.提交查询”遥远古古巴比伦”,这个查询被百度切分为<遥远,古古,巴比伦>,说明词典里面有”巴比伦”,但是是否有”古巴比伦”这个词汇不确定,此时看不出是正向切分还是反向切分得出的结果,换查询为”遥远古巴比伦”,此时被切分为”遥远/古巴比伦”,这说明词典里面有”古巴比伦”这个词汇,这说明了”遥远古古巴比伦”是正向最大匹配的结果.那为什么”遥远古古巴比伦”不会被反向切分为”遥/远古/古巴比伦”呢,百度的可能选择是这种情况下选择单字少的那组切分结果.

当然还可以继续追问:如果切分后单字也一样多,那怎么办?最后看一个例子,查询”王强大小:”,百度将其切分为”王/强大/小”,是正向切分的结果,如果是反向的会被切分为”王/强/大小”,这说明有歧义而且单字也相同则选择正向切分结果.

OK,看到这里可能头已经有些晕了,最后总结一下百度的分词算法,当然里面还是有猜测的成分,算法如下:

首先查询专用词典(人名,部分地名等),将专有名称切出,剩下的部分采取双向分词策略,如果两者切分结果相同,说明没有歧义,直接输出分词结果.如果不一致,则输出最短路径的那个结果,如果长度相同,则选择单字词少的那一组切分结果.如果单字也相同,则选择正向分词结果..

百度一直宣传自己在中文处理方面的优势,从上面看,分词算法并无特殊之处,消歧效果并不理想,即使百度采取比上述分词算法复杂些的算法也难以说成是优势,如果说百度有优势的话,唯一的优势就是那个很大的专用词典,这个专用词典登录了人名(比如大长今),称谓(比如老太太),部分地名(比如阿联酋等),估计百度采用学术界公布的比较新的命名实体识别算法从语料库里面不断识别出词典未登录词,逐渐扩充这个专门词典.如果这就是优势的话,那么这个优势能够保持多久就是个很明显的问题.
 
如何构建一个大型搜索引擎——百度如何抓取海量数据并为用户找到信息? 作者:禅与计算机程序设计艺术 1.简介 搜索引擎是互联网的一个重要组成部分,它作为信息检索入口承载着互联网上海量的可用信息。百度是一个著名的搜索引擎,拥有超过9亿用户、超过7亿流量、超过150万网页被索引,是中国最大的中文搜索引擎。从2005年百度的诞生到今日,百度已经成为互联网最活跃的门户网站之一,以 阅读详情

相关推荐

Windows Docker Desktop部署MaxKB详细教程

MaxKB(Max Knowledge Base)是一款基于大语言模型(LLM)和检索增强生成(RAG)技术的开源知识库问答系统,旨在帮助企业、教育机构及研究组织高效管理知识并提供智能问答服务。

猿小白的博客 1315

手动写一个搜索引擎(超详细)

搜索引擎是现代设备中被广泛利用的一种系统软件,诸如百度、谷歌、搜索、bing等,或者抖音、快手、b站、小红书,甚至软件应用市场,Windows(操作系统)中的各类提供搜索功能的背后都有搜索引擎的影子。

weixin_61567666的博客 1万+

RT-DETR 模型剪枝优化:结构化剪枝对 R18/R50 性能的影响

本文提出分层结构化剪枝策略R18:参数量减少 42%(28M→16.2M),推理速度提升 35%(15→20.3 FPS@Jetson Nano),mAP@0.5 仅降 1.2%;R50:参数量减少 55%(170M→76.5M),推理速度提升 48%(42→62.2 FPS@T4),mAP@0.5 仅降 2.1%。核心价值:为 RT-DETR 提供“精度-效率-部署”平衡的轻量化方案,推动其在边缘设备、工业质检等场景的大规模落地。部署建议。

走向CTO的路上... 414

搜索引擎设计与实现的完整教程

本文还有配套的精品资源,点击获取 简介:搜索引擎作为互联网技术的核心,通过信息检索、自然语言处理、数据存储、分布式计算和用户交互等关键技术从海量数据中快速准确地检索信息。本教程集成了源码、数据库SQL、理论文献和视频教程,详细介绍了搜索引擎的关键组成部分:网络爬虫、预处理、索引构建、查询处理和结果排序。学习者将获得对搜索引擎全面深入的理解,并能够掌握其实际开发技能。 ...

weixin_28793831的博客 2450

修改eclipse 格式化行长度

修改eclipse 格式化行长度   window->preferences->java->code style->formatter->edit->line wrapping->maximum line width 修改后保存就可以了.

超越的博客 2130

如何修改eclipse 格式化行长度

如何修改eclipse 格式化行长度 修改 格式化 每行的长度  window->preferences->java->code style->formatter->edit->line wrapping->maximum line width 修改后保存就可以了.

六道对穿肠的学习之旅 856

eclipse 格式化行长度修改

修改 格式化 每行的长度 window->preferences->java->code style->formatter->edit->line wrapping->maximum line width 修改后保存就可以了.

crongd的博客 328

修改Eclipse中格式化时默认行长度

eclipse 默认设置的换行长度, 格式化代码后,经常换行,非常难看。 1.Java代码 打开Eclipse的Window菜单,然后 Preferences->Java->Code Style->Formatter->Edit ->Line Wrapping->Maximum line width:默认80 加个0,改成800就行了。(注意改Pro...

weixin_34268610的博客 96

修改Eclipse格式化代默认长度

eclipse 默认设置的换行长度, 格式化代码后,经常换行,非常难看。   1.Java代码打开Eclipse的Window菜单,然后 Preferences-&gt;Java-&gt;Code Style-&gt;Formatter-&gt;Edit -&gt;Line Wrapping-&gt;Maximum line width:默认80 改成200就行了。   2.CSS...

千里之行,始于足下 127

eclipse操作方面的一些小笔记

1、修改字体样式和颜色: window -> preferences -> general -> appearance -> colors and fonts -> 然后在右边的编辑区 -> 选择 java editor text fonts 项 -> 点“change”按钮即可进行相关设置 2、大括号换行显示: Window -> Preferences -> Java -> Code S

BI 863

Eclipse格式化代码默认长度

eclipse 默认设置的换行长度, 格式化代码后,同一个方法里面参数也经常被,换行,非常难看。 方法/步骤 1.Java代码打开Eclipse的Window菜单,然后 Preferences-&gt;Java-&gt;Code Style-&gt;Formatter-&gt;Edit -&gt;Line Wrapping-&gt;Maximum line width:默认80 加个0,改成20...

weixin_41899778的博客 675

java格式化指定长度_关于java:Eclipse:设置自动格式化的最大行长度?

我正在用Java工作。如果我在EclipseHelios中点击ctrl+shift+f,它将自动格式化我的代码。在某一点上,它包裹着线。我想增加最大行长度。我该怎么做?注:从Eclipse Mars 4.5 M1开始(2014年8月),Eclipse中的默认行长度为120(而不是80)。看看我的答案。在首选项Java>代码风格>格式化程序中,编辑配置文件。"换行"选项卡下是"线条宽度"...

weixin_39634884的博客 505

设置Eclipse格式化代码时的自动折行行数

preferences->Java->Code Style->Formatter->Edit->Line Wrapping, Maximun line width属性可以设置行数大于多少时自动折行。

小码的世界 1516

Eclipse中格式化JS代码,HTML代码,JAVA代码

一、格式化JS代码 1. Windows -> Preferences -> JavaScript -> Code Style -> Formatter -> New.. 2.创建新的模板: 3. 设置参数: 二、格式化HTML代码 步骤: 在左侧快捷 “搜索” 框里面输入 html 。 点击选中左侧editor。 lin...

weixin_41807943的博客 6034

Llama2-7B/13B chat模型(下载地址).txt

•Llama2-7B官网版本•Llama2-7B-Chat官网版本•Llama2-13B官网版本•Llama2-13B-Chat官网版本•Llama2-7B Huggingface版本•Llama2-7B-Chat Huggingface版本根据提供的文件信息,我们可以了解到关于Llama2-7B与Llama2-13B两种不同规模的大模型及其对应的聊天版本。以下将详细介绍这些模型的特点、应用场景以及如何获取它们。### Llama2-7B与Llama2-13B简介#### 1. **模型概述** - **Llama2**:这是一个由Meta公司推出的人工智能语言模型系列,旨在通过更高效的学习算法和更大的训练数据集来提高模型的性能。 - **7B与13B**:这里的数字表示模型参数量的规模。7B代表该模型拥有大约70亿个参数,而13B则代表大约130亿个参数。通常情况下,模型参数越多,其理解和生成文本的能力越强。#### 2. **模型特点** - **高效性**:Llama2系列模型采用了先进的算法和技术,能够在保证高质量输出的同时,降低计算资

上一篇: 索尼爱立信手机摇杆失灵的维修方法
下一篇: 搜索引擎的系统架构
kingwkb
博客等级 码龄22年 66粉丝 69原创
评论 8
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值