Hbase Indexer索引器的配置

Matplotlib字体警告终结者:为什么总提示DejaVu Sans?5种场景解决方案大全 本文深入解析Matplotlib中常见的DejaVu Sans字体警告问题,并提供5种典型场景的完整解决方案。从理解字体系统的三层架构和缓存机制,到解决中文显示、远程服务部署、TeX渲染、缓存优化及生产环境配置等实际问题,帮助开发者彻底摆脱字体警告困扰,实现稳定可靠的数据可视化。 阅读详情

索引器配置

 

最基本的索引器配置只需要表名和单个字段。但是,可以在索引器配置文件中使用许多配置设置来自定义行为。

<indexer table="mytable">

  <field name="fieldname" value="columnfamily:qualifier" type="string"/>

</indexer>

全局索引器属性

以下是可以在索引器配置中的顶级<indexer>元素上设置的属性列表。

table属性指定索引器要索引的HBase表的名称。它是索引器元素中唯一的必需属性

映射型

 

mapping-type属性有两个可能的值:row或column。此属性指定是要执行基于行的索引还是基于列的索引。

基于行的索引将单个HBase行中的所有数据视为Solr中单个文档的输入。这种索引将用于HBase表,该表在每行中包含一个单独的实体,例如包含用户的表

基于列的索引将每个HBase单元视为Solr中单个文档的输入。该方法可以用于例如消息传送平台中,其中单个用户的消息全部存储在单个行中,每个消息存储在单独的单元中。

默认的映射类型值是row。

读行

read-row属性有两个可能的值:dynamic或never。只有在使用基于行的索引时,此属性才有用它指定索引器是否应重新读取HBase中的数据以执行索引

设置为“dynamic”时,如果在HBase中执行对行的部分更新,则索引器将从行中读取必要的数据。在动态模式下,如果行更新中包含执行索引所需的所有数据,则不会重新读取该行。

如果此属性设置为never,则索引器将永远不会重新读取行。

默认设置为“动态”。

映射器

mapper属性允许用户指定一个自定义映射器类,该类将从HBase Result对象创建Solr文档。mapper类必须实现该com.ngdata.hbaseindexer.parse.ResultToSolrMapper接口。

默认情况下,使用内置com.ngdata.hbaseindexer.parse.DefaultResultToSolrMapper。

独特琴键格式化

 

unique-key-formatter属性指定用于将HBase行键(以及列族和列限定符)格式化为文本的类的名称。Solr中需要索引这些信息的文本表示,因为Solr中的所有数据都是文本的,但行键,列族和列限定符是字节数组。

unique-key-formatter类必须实现该com.ngdata.hbaseindexer.uniquekey.UniqueKeyFormatter接口。此属性的默认值为com.ngdata.hbaseindexer.uniquekey.StringUniqueKeyFormatter。

StringUniqueKey格式化程序只是将行键和其他字节数组视为字符串。如果您的行键,列族或限定符不能简单地用作字符串,请考虑使用com.ngdata.hbaseindexer.uniquekey.HexUniqueKeyFormatter。

唯一键字段

此属性指定Solr中使用的文档标识符字段的名称。该字段的默认值为“id”。

行场

row-field属性指定用于存储HBase行键的Solr字段的名称。

此字段仅在执行基于列的索引时很重要。为了使索引器能够从索引中删除单行的所有文档,它需要能够在Solr中找到该行的所有文档。在索引器定义中填充此属性时,它的值将用作Solr中用于存储编码行键的字段的名称。

默认情况下,此属性为空,表示行键未存储在Solr中。这样做的结果是删除HBase中的完整行或完整列族不会删除Solr中的索引文档。

列家族场

column-family-field指定用于存储HBase列系列名称的Solr字段的名称。默认情况下,此属性为空,因此列族名称不会保存在Solr中。

表名,字段

table-name-field指定Solr字段的名称,该字段用于存储存储记录的HBase表的名称

默认情况下,此属性为空,因此除非在索引器配置中显式设置此设置,否则不会存储HBase表的名称。

 

索引器定义中的元素

可以在索引器配置中使用三种类型的元素:<field>,<extract>和<param>。

<field>

field元素定义要在Solr中索引的单个字段,以及从HBase获取和解释其内容的位置。索引器配置中通常会列出一个或多个字段 - 每个字段用于存储每个Solr字段。

field属性有四个属性,如下所示。

 

名称

 

name属性指定用于存储数据的Solr字段的名称。应在Solr模式中定义具有匹配名称的字段。name属性是必需的。

 

 

value属性指定要从HBase中使用的数据,以填充Solr中的字段。它采用列族名称和限定符的形式,用冒号分隔。

限定符部分可以以星号结尾,星号被解释为通配符。在这种情况下,将使用所有匹配的列族和限定符表达式。

 

以下是有效值属性的示例:

mycolumnfamily:myqualifier

mycolumnfamily:我*

mycolumnfamily:*

 

资源

source属性确定HBase KeyValue的哪个部分将用作索引内容。

 

它有两个可能的值:值和限定符。

指定值时(默认情况下是这种情况),单元格值将用作索引的输入。

指定限定符时,列限定符将用作索引的输入。

 

类型

type属性定义HBase中内容的数据类型。

因为所有数据都作为字节数组存储在HBase中,但Solr中的所有内容都被索引为文本,因此需要一种从字节数组转换为实际数据类型的方法。

此字段的值可以是HBase Bytes类支持的任何数据类型之一:int,long,string,boolean,float,double,short或bigdecimal。

 

<PARAM>

       

<param>元素定义了一个键值对,它将提供给实现该com.ngdata.hbaseindexer.Configurable接口的自定义类。

 

<param>元素也可以嵌套在<field>元素中。

 

该元素有两个属性:name和value。两者都是强制性的

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

从零到一:Python+Playwright 实现动态网站全量数据采集实战(附反爬对抗与性能优化) 在动手之前,先明确武优势: 2. 项目结构规划 为了代码可维护性,我们采用模块化结构: 三、核心实战:构建动态采集 第一步:初始化“隐身”浏览 普通启动容易被检测,我们需要注入一段 JS 脚本来抹除自动化特征。 第二步:处理无限滚动与动态加载 这是动态网站的核心难点。我们需要模拟人类滚动,并等待新数据加载完成。 第三步:登录态保持与复用 避免每次运行都重新登录。我们将 Cookie 保存到本地,下次直接加载。 第四步:主流程编排 将上述模块串联起来,并加入异常重试机制。 四、进阶优化:性能与反爬 阅读详情

相关推荐

HBase-RowKey与索引设计(高清)

HBase-RowKey与索引设计(高清) HBase-RowKey与索引设计(高清)HBase-RowKey与索引设计(高清)

大数据总结【第四章:Hbase

简答题 1. HBase简介 HBase是一个高可靠、高性能、面向列、可伸缩的分布式数据库,是谷歌BigTable的开源实现,主要用来存储非结构化和半结构化的松散数据。HBase的目标是处理非常庞大的表,可以通过水平扩展的方式,利用廉价计算机集群处理由超过10亿行数据和数百万列元素组成的数据表 2. HBase 和传统关系数据库的区别 区别 传统关系数据库 HBase 数据类型 关系模型 数据模型 数据操作 插入、删除、更新、查询、多表连接 插入、查询、删除、清空,无法实现表与表之间关联

计忆芳华的博客 1万+

hbase-indexer

hbase-indexer, 便于通过solr将hbase中的数据变动建立索引

Lily HBase Indexer使用整理

关于Key-Value Indexer组件 CDH5.3.2中的Key-Value Indexer使用的是Lily HBase NRT Indexer服务,Lily HBase Indexer是一款灵活的、可扩展的、高容错的、事务性的,并且近实时的处理HBase索引数据的分布式服务软件。它是NGDATA公司开发的Lily系统的一部分,已开放源代码。Lily HBase Indexer使

小码农的专栏 1万+

使用cdh的hbase-indexer工具的两个问题

在使用hbase实现点查询业务中,经常要用到二级索引的方式,而 hbase over solr 是一种比较灵活,性能较高的方案。 cdh平台提供了hbase-indexer工具可以实现将hbase的数据同步到solr中的方式,下面说一下实际使用的过程中遇到的两个问题。 问题一 之前在设置类型之后需要使用hbase-indexer的官方类型int将hbase中的byte转换成solr中的整数型...

Sir_yuan的博客 1065

基于CDH的solr+Key-Value Store Indexer+hbase二级索引框架构建(一)

转载请注明出处!!!    背景 公司用户画像构建,数据规模2千万+,维度120+,需要针对所有维度提供便利的查询索引,从数据性质上来看,并没有分词的必要,所以本次并没有配置ik中文分词 环境准备(cdh) hbase集群 Key-Value Store Indexer集群 solr集群 zk集群 一:配置solr,创建collection  1、将安装目录下的配置文件copy到...

yzh865318761的博客 2050

高级MySQL

MySQL 索引 1.什么是索引? 一般的应用系统,读写比例在10:1左右,而且插入操作和一般的更新操作很少出现性能问题,在生产环境中,我们遇到最多的,也是最容易出问题的,还是一些复杂的查询操作,因此对查询语句的优化显然是重中之重。说起加速查询,就不得不提到索引了。 2.为什么要有索引呢? 索引在MySQL中也叫做“键”,是存储引擎用于快速找到记录的一种数据结构。索引对于良好的性能 非常关键,尤其是当表中的数据量越来越大时,索引对于性能的影响愈发重要。 索引优化应该是对查询性能优化最有效的手段了。索引

qq_46351339的博客 594

创建hbase-indexer add-indexer出现SEP subscription ID:null以及0 running processes和0 failed processes

今天遇见一个问题,就是CDH创建hbase-indexer add-indexer的问题。 前提摘要:之前创建成功过Lily实时,后来某些原因hbase-indexer服务组件被删了,导致出现这种问题 解决方案: 先检查自己创建实时索引语句 给HBase表开启复制功能 # 为索引监控HBase表变化提供支持 # 参数1:$1--> tableNam...

你怎么还在用 ThinkPad 啊? 400

CDH6 高版本hbase+solr实现二级索引

之前的环境是单独下载的CDH组件包搭建的集群,但是因为hadoop版本过低导致漏洞无法修复,重新搭建高版本集群环境。 新集群环境: 主要组件:hadoop,hbase,zookeeper,Key-Value Store Indexer 1.创建hbase表: hbase shell create 'users', { NAME => 'info', REPLICATION...

分享大数据、java相关的技术 447

无法为属性或索引赋值_使用Lily HBase NRT IndexerHBase构建二级索引

使用CDH提供的 Cloudera Search创建二级索引:近实时索引常使用Apache Flume或Apache Kafka来不断的摄取并索引数据。Lily HBase NRT Indexer既可以用在近实时索引又可用在批索引。Lily HBase NRT Indexer服务是灵活的、可扩展的、容错的、具有事物性、近实时的系统,解决更新HBase数据的时候,同步更新索引数据。可以使用它为HBa...

weixin_39660922的博客 505

hbase solr 插件_使用Solr+Hbase-solr(Hbase-indexer)配置实现HBase二级索引

前言:因为项目需要,试着搭建了一下HBase二级索引的环境,网上看了一些教程,无一不坑,索性整理一份比较完整的。本文适当的精简和绕过了一些“老司机一看就知道”的内容,适合刚接触这一领域但是有一定Linux和Hadoop基础的读者,不适合完全初学者。环境约束:OS:CentOS6.7-x86_64JDK:jdk1.7.0_109hadoop-2.6.0+cdh5.4.1hbase-solr-1.5+...

weixin_39800112的博客 329

Hbase-二级索引 Hbase+Hbase-indexer+solr (CDH)

最近一段时间工作涉及到hbase sql查询和可视化展示的工作,hbase作为列存储,数据单一为二进制数组,本身就不擅长sql查询;而且有hive来作为补充作为sql查询和存储,但是皮皮虾需要低延迟的sql及复杂sql的查询(根据值查找数据的情况),这就要用到hbase的二级索引。这里的二级索引方式采用的Hbase+Hbase-indexer+solr,还有Phoenix等方式。 ...

分享大数据、java相关的技术 883

创建二级索引_使用Lily HBase NRT IndexerHBase构建二级索引

使用CDH提供的 Cloudera Search创建二级索引:近实时索引常使用Apache Flume或Apache Kafka来不断的摄取并索引数据。Lily HBase NRT Indexer既可以用在近实时索引又可用在批索引。Lily HBase NRT Indexer服务是灵活的、可扩展的、容错的、具有事物性、近实时的系统,解决更新HBase数据的时候,同步更新索引数据。可以使用它为HBa...

weixin_35890512的博客 411

Hbase

Hbase基础介绍

sinat_37138973的博客 2225

hbase索引的两种方式

在二级索引的实现技术上一般有几个方案: 1.      表索引 使用单独的hbase表存储索引数据,业务表的索引列值做为索引表的rowkey,业务表的rowkey做为索引表的qualifier或value。 问题:对数据更新性能影响较大;无法保证一致性;Client查询需要2次RPC(先索引表再数据表)。 2.      列索引 与业务表使用相同表,使用单独列族存储索引,用户数据列值做为

好记性不如烂博客 2万+

HBase Indexer 整合 Solr

Lily HBase Indexer提供了快速、简单的HBase的内容检索方案,它可以帮助你在Solr中建立HBase的数据索引,从而通过Solr进行数据检索。由于索引过程是异步的,所以并不影响HBase的写负载,同时借助 SolrCloud 可实现分布式索引。 该项目起源于多年研究HBase索引方案的平台Lily。 Lily HBase Indexer工作机制独立安装 要求:复

简简单单,平平淡淡 1386

深入理解HBase Indexer

HBase Indexer全名为Lily Hbase Indexer,是NGDATA公司为了将lily子系统里面相关HBase数据存储到Solr而开发的一个软件。NGDATA公司将源代码开源并托管在Github上,通过以下Github地址访问Hbase-Indexer项目主页及代码: https://github.com/NGDATA/hbase-indexer

CrazyPig的技术博客 1万+

(数据权威)地级市能源消耗数据(原始数据+计算过程+结果)

今天给大家分享一份地级市能源消耗数据测算方法:使用电、石油、天然气进行测算,主要数据包括:全社会用电量万千瓦时人工煤气和天然气供气总量万立方米(市辖区)、液化石油气供气总量吨市辖区、电折标准煤系数(0.1229千克标准煤/千瓦小时=1.229吨标准煤/万千瓦小时)、天然气折标准煤系数(1.33千克标准煤/立方米=13.3吨标准煤/万立方米)、液化石油气折标准煤系数(1.7143千克标准煤/千克=1.7143吨标准煤/吨)。数据来源:中国城市统计年鉴、各省市统计年鉴和地级市统计公报!其中2020年及以后城市统计年鉴不再公布社会用电量,所以从地级市统计公报去挨个扒,我按着全市的口径找的,20和21年四个直辖市数据来源于中国统计年鉴,别的地级市数据来自各省、地级市年鉴和统计局公报。

上一篇: Solr的软提交与硬提交
下一篇: Hbase-indexer常用命令
Rita楠神
博客等级 码龄8年 27粉丝 61原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值