WhaleDI自助建模实践与探索

数仓建模自助分析实战 自助分析 今天老板说了一句话,我第下了我高昂的头颅,陷入了深思,老板说我看到报表上的数据已经很多了,但是有时候我想看一个指标还是没有,我像自己操作一下看起来也不抬灵活和方便。 各方的心声 业务人员 Excel很熟悉了,但是处理数据或者制作图表还是太麻烦了,经常需要等各处的数据汇总后才能开始干活,也就是说他们必须等到我们的数据出来,他们在我们做的数据的基础上,开展进一步的数据分析 报表数据很多,但是有时候还是不能覆盖,例如我今天有个临时想法我想验证一下。 分析人员 无穷无尽的报表开发需求、 人手不够、无 阅读详情

1 AI应用爆发式增长,但“建模”之路仍旧挑战重重

在过去的十年里,深度学习等技术的出现,让AI迎来了蓬勃发展的第三次浪潮。目前AI能力已经在银行、商超、小额支付、城市轨道交通等各行业得到了广泛的应用,例如人脸识别、图像识别、证件类文字提取等。但随着更多创新的智能化应用的爆发式增长,如智慧社区的高空抛物,智慧小区的电瓶车入电梯,餐饮行业中的明厨亮灶等,针对各行各业的越来越复杂的应用场景,如何去解决AI方面的专业人才不足、算法开发成本高、训练周期长、建模效率低以及投入产出结果不可控等问题就成了AI赋能应用落地的难题。

面对AI建模的挑战与困难,自助建模应运而生,它是帮助用户实现AI应用的低门槛、零代码的模型开发工具。业务人员无需专业的开发基础和编码能力,只需上传数据集,通过自助建模界面引导和简单操作即可完成模型训练和部署,数小时便可轻松获得AI模型。

2 自助建模如何赋能应用?

OCR是近年比较火热的领域。像身份证识别、车牌识别等都需要运用到OCR技术,而像身份证识别的场景又非常多。比如,如支付宝、微信、小程序应用里的身份认证功能,上传的身份证图片经过识别后,无需人工干预就可将身份信息提取出来完成认证,十分方便。那么我们的AI又是如何在这种具体业务场景中提供匹配的能力呢?其中要经过什么样的流程,才能最终赋能应用?对于开发者来说,通过对具体案例流程的了解,就能够快速的掌握开发所需要的能力,从而实现自主创新开发。下面,我们就以“为身份证国徽面OCR识别进行AI建模”这个场景为例,与大家一同展开探究。

建模流程

自助建模不同于高代码建模方式,它的业务目标是提供流程化操作界面,满足用户从上传文件、数据标注到自动化建模和模型部署在一个可视化配置页面中完成,从而大大减少建模难度和提高建模效率。

  • 以身份证国徽面OCR识别为例,来详细介绍自助建模的流程:
  • 业务人员提供身份证国徽面OCR识别需求说明;
  • 业务人员上传少量身份证国徽面样本并进行标注;
  • 业务人员通过界面化引导与操作进行自动化训练与模型部署流程,可即时体验效果;
  • 业务人员对身份证国徽面OCR识别的能力验收和试用。

在整个自助建模流程中,业务人员可完成建模的全流程操作,无需算法工程师直接参与,也无需进行代码编写,则可完成身份证国徽面OCR识别场景的建模,经过模型部署后,则可完成对上层应用赋能。

工欲善其事,必先利其器,所以开始自助建模之前我们还是要选择一个合适的建模工具,人在江湖走怎么能没有一个响亮的名号和趁手的武器呢,WhaleDI自助建模就是我们要介绍的工具。那么有些朋友可能会好奇了,我们自助建模工具到底有何"超强技能"来支撑业务应用?以OCR识别的场景举例:

核心功能一:样本数据生成器,解决样本数量问题

在实际生产中,样本数据对建模非常重要,由于业务局限与样本数据安全问题,很难搜集到业务场景所需的样本数据,若基于少量的样本数据进行模型训练,生成的模型效果会比较差,往往达不到生产的要求。

构建自动预处理的样本生成器,通过少量的样本数据,进行标注。基于已标注数据,将标注区内容抹除,生成数据模板,再基于此模板生成大量模拟样本,从而快速扩展样本集规模,满足实际情况所用样本集。

如图1,从业务中搜集到的样本集,整理其中不同字段文本的业务规则,包括机关名称字段、时间期限字段,并进行样本标注。

如图2,对样本数据去除标注区域文字得到模板样本,再从对应的文本语料库中生成文本图片,再进行样本的颜色、亮度、对比度、文字大小、形状等进行调节,合成到模板样本中,从而生成样本。

如图3,大规模生成业务生产中所需样本,解决样本不足的问题。

核心功能二:内置不同场景预训练模型功能,提升模型效果

为实现建模全流程自动化,降低技术门槛,提升建模效率,让完全不懂代码的用户也可进行训练建模,减少对算法技术不懂的恐惧,工具中内置预训练模型,如:图像检测、OCR识别、图像分类、文本分类等,用户可以根据使用场景进行选择。

当使用OCR识别场景时,在实际生产过程中,由于拍摄时,角度不一定都是正面的,会存在90°,180°,270°等旋转角度的情况,导致建模的时候,无法识别,建模的准确率降低。为了解决这一个问题,内置预训练模型则会进行校正图片的方向,最终会输出正方向的图片进行处理。

针对检测内容区域,会存在目标文字截断的情况,同时,对文字识别需要编写大量的规则分类,很难覆盖生产中能遇到真实场景,且模型较为复杂不具备性能优势,模型效果较差。而内置预训练模型,则会在进行文字检测后生成结果时,便进行文字分类,只检测图片区域中的关键文字内容,从而降低检测干扰以及文字截断的情况,提高文本检测的性能。

针对文字识别,通用文字识别字典覆盖汉字不够完全,遇到生僻字、变形字、扭曲字等情况,识别准确率较低,而内置预训练模型,进行数据增强提升:

(1)识别字典,构建出涵盖汉字、字母、数字、符号等多种类型的文字字符,同时,能覆盖出现频次较高的生僻字或词。

(2)基于百万级别数据进行优化文字识别模型,提高模型准确率,增强识别效果。

核心功能三:生成模型评估详情,提供可视化样本分析功能

在训练得到模型之后,整个建模过程还不能算结束,往往还需要对模型进行评估。一般很难一次性得到满意的模型,我们需要反复的进行样本数据的分析,参数调整,不断重复迭代训练生成模型。根据封装的模型评估脚本,可以针对测试集生成模型的指标,如准确率、精确率、召回率、F1值等。但模型指标,只能知道模型的效果,当我们根据模型指标发现效果不好时,怎样通过样本分析提高模型效果?

我们进行标注时,会通过标签来标记标注的内容,当模型识别出结果后,会根据标签也生成一个结果,通过两者进行比对,则能知道识别的内容是否准确,同时筛选出该负样本数据。如下图:

若筛选出负样本后,则可对样本数据进行判断,标注区域是否有问题。常见问题如:标注区域是否覆盖住标注内容等。若发现是识别的不准,可以选择更换模型语料库,然后再次对负样本进行标注检查,生成模板,生成样本数据,进行迭代训练输出模型。

核心功能四:模型迭代流程化,解决建模效率低问题

基于训练后的模型效果,若不满意,可返回上传样本集步骤,优化完善样本集、自动化参数组合调优,再次进行模型训练,即可训练出新模型版本,从而完成流程化迭代,保障模型效果最佳性并持续可优化。我们这种流程化的自助建模工具,可以简化用户的操作,用户只需通过步骤指导进行迭代训练模型即可。极大地减少了使用难度,有效提高用户建模效率,满足AI快速落地的场景应用。

3 自助建模为什么能支撑AI快速落地场景应用?

智能应用场景落地困难,在开篇提及的一系列问题以及挑战,其本质在于AI建模规模化、流程化、模块化、工具化能力不足。如果能简化智能应用的建模开发周期,面向样本数据、算法脚本、模型等内容形成便捷易用的工具体系,使工具标准化、统一化,实现模型算法的可构建、可复用、可迭代,方可确保支撑AI快速落地场景应用。

自助建模就是流程化、模块化、工具化的自动化建模工具,它把算法建模的难点全部进行预置与封装,如,具备内置的预训练模型算法、已封装的高级参数设置等。整个流程可由业务人员自助完成,可依托少量样本数据,便能快速高效进行建模。可通过流程化的模型迭代,进行自动化建模调优,保障模型效果。其特征以及作用如下:

(1)建模业务化:业务人员、无编程能力的小白,也能快速上手,无需耗费大量时间进行编码与调参优化即可自助完成AI建模,大大降低了技术门槛及开发成本。

(2)标注自助化:自助上传样本集文件、进行少量样本数据标注,则自动模拟生成生产所需样本数据,极大的提高了样本标注的人力与时间成本。

(3)训练自动化:对标注好的样本集,进行自动化模型训练与部署,缩短建模周期时长以及提升建模效率。

(4)迭代流程化:业务发生变化或模型老化效果跟不上时,可通过更新样本集,经过流程化界面进行标注、自动化训练即可完成模型的迭代更新。通过模型流程化迭代,可快速进行迭代更新应用场景所需的模型,以支撑快速落地的AI场景应用。

自助企业数据建模-介绍篇 自助企业数据建模旨在解决一个核心:个人如何使用EXCEL处理一个亿企业数据 立即下载

相关推荐

STM32C5开发LSM6DSV16X(1)-轮询获取陀螺仪数据

STM32C5开发LSM6DSV16X(1)----轮询获取陀螺仪数据 CSDN文字教程:https://blog.csdn.net/qq_24312945/article/details/163827517 B站教学视频:https://www.bilibili.com/video/BV1uR3A6pE3t/ LSM6DSV16X采用系统级封装,包含一个3D数字加速度计和一个3D数字陀螺仪(采用三核芯架构,通过专用的配置、处理和滤波功能在3个独立通道上处理加速度数据、角速度数据)。 LSM6DSV16X在高性能模式下以0.65 mA的电流提供强劲性能,并且具有始终开启功能的同时提供低功耗特性,可为消费者提供优越的运动体验。 LSM6DSV16X为OIS、EIS和运动处理而内嵌先进的专用功能(如有限状态机和MLC(具有面向物联网应用的可导出AI功能))和数据过滤特性。 LSM6DSV16X内嵌的Qvar(电荷变化检测)支持用户界面功能:单击、双击、三击、长按、左/右 - 右/左滑动。 LSM6DSV16X内嵌模拟集线器,能够连接外部模拟输入并将其转换为数字信号进行处理。

未来技术方向——“乐高式”可组装式开发能力

近3年,Gartner在主要的战略技术趋势中都提到组装式技术。那到底什么是可组装能力?如何具备才能具备可组装能力?可组装是否就是模块化、微服务?可组装架构是否就是微服务架构?今天一起来聊一聊。

whalecloud的博客 6514

政府科技管理部门如何优化科技创新服务体系?.docx

政府科技管理部门如何优化科技创新服务体系?

基于 KONOS 编写一个部门级的前端框架

现在对于前端框架的定义越来越广泛了,在前端工程化中的某一个环节的特定方案,都可泛称为一个前端框架。konos 是一个插件化的前端框架基座,如果你对 umi 有所了解的话,可以把它当作一个没有任何功能的 umi core 基座。

whalecloud的博客 2550

提效 24.3%,看 OA 预算管理系统的低代码开发实践

本文阐述了这套系统的开发流程和具体实践步骤。

whalecloud的博客 4131

WhaleDI数据治理利器之“低成本数据质量管理”

数据这个词很活跃,人人耳熟能详。它相对比较清楚的释义为:数据是指对客观事件进行记录并可以鉴别的符号,是对客观事物的性质、状态以及相互关系等进行记载的物理符号或这些物理符号的组合。在运营商行业中,所涉及到的相关IT数据,通常包括支撑系统中的资产数据、订单数据、归档业务信息数据、客户数据等等,这些数据产生贯穿了业务支撑的全过程,所包含的信息极其丰富。数据的信息记录作用确定了它在查询、统计、分析等方面都会在不同的时期里发挥作用,其不仅仅面向所有者提供信息,通常会根据协议约定覆盖整个企业的业务生产,甚至外部。

whalecloud的博客 2829

鲸品堂|WhaleDI消息队列稳定性提升实践

大量实践应用

whalecloud的博客 2094

浩鲸科技帆软达成战略合作,重磅推出数据中台联合解决方案

随着数字经济的蓬勃发展,加强外部合作和交流,互相借鉴先进的技术和理念,实现资源共享、优势产品互补等,是软件服务商推动创新的重要路径之一。在这一背景下,帆软软件浩鲸科技的战略合作水到渠成。 10月12日,浩鲸科技副总裁罗剑锋一行来到帆软总部参观,并出席战略合作交流会。双方代表分享了未来发展战略,找寻双方合作的契合点,将在联合方案打造、产品渠道赋能、市场品牌合作等领域展开深度合作。 浩鲸科技是一家全球领先的数字化技术和服务的提供商,成立于2003年,迄今已为全球80多个国家和地区的电信运营商、公共服务部门及

帆软商业智能技术 642

数据建模工具存在的价值

数据建模平台系统是一站式全链路数据生命周期管家,帮助各个行业用户管理数据资产并挖掘价值。平台提供多源异构的数据采集模块、实时/离线计算框架,简洁易用的开发环境和平台接口,为政府机构、企业、科研机构、第三方软件服务商等客户,提供大数据管理、开发和计算的能力。让客户最大化的发现分析行业内部核心业务数据价值,挖掘现有业务和应用系统的潜在商机,培育完好的业务创新产业链,实现数据应用的完整闭环,帮助客户实现商业价值。......

ccddtomato的专栏 4543

好用的数据建模工具,探索中完善

数据建模平台是一站式全链路数据生命周期管家,帮助各个行业用户管理数据资产并挖掘价值。平台提供多源异构的数据采集模块、实时/离线计算框架,简洁易用的开发环境和平台接口,为政府机构、企业、科研机构、第三方软件服务商等客户,提供大数据管理、开发和计算的能力。让客户最大化的发现分析行业内部核心业务数据价值,挖掘现有业务和应用系统的潜在商机,培育完好的业务创新产业链,实现数据应用的完整闭环,帮助客户实现商业价值。...

ccddtomato的专栏 6286

有了BI自助分析,就不需要建模吗?

比如从产品角度分析销售收入占比,从时间角度看销售收入的趋势,在这个描述中,产品和时间就是分析的维度,销售收入就是被看的、被分析的数据,就是度量Measure,我们有的时候也叫KPI或者指标。不管什么样的模型都可以理解为一种预设,比如像一张大宽表,它的维度和指标在大宽表中就是固定的,只是维度列多一些,指标多一些,给了用户更多的一种组合维度和指标的可能,并不是说就没有模型的概念。在BI自助分析过程中,会首先选择分析的维度,再选择相应的度量或者指标,通过拖拉拽的方式就实现了可视化,数据就出来了。

派可数据的博客 338

国央企创新负责人如何实现技术成果的精准对接快速落地?.docx

国央企创新负责人如何实现技术成果的精准对接快速落地?

液压弯管机.rar

液压弯管机.rar

高校如何低成本实现技术成果转化?.docx

科易网基于40亿+科创知识图谱数据库,深度探索AI技术在技术转移、成果转化、技术经纪、知识产权、产业创新、科技招商等垂直领域的多样化应用场景,研究科技创新领域的AI+数智化解决方案,推动科技创新产业创新智能化发展。

Keil单片机开发入门项目win-WCS-WaitNextStep.c

Keil单片机开发入门项目win_WCS_WaitNextStep.c

印刷机.rar

印刷机.rar

国有企业如何构建数据驱动的科技创新服务体系?.docx

科易网基于40亿+科创知识图谱数据库,深度探索AI技术在技术转移、成果转化、技术经纪、知识产权、产业创新、科技招商等垂直领域的多样化应用场景,研究科技创新领域的AI+数智化解决方案,推动科技创新产业创新智能化发展。

人工智能基于Ollama的本地大模型部署调优:全平台适配、量化优化、参数调优企业级私有化落地技术指南

内容概要:本文系统讲解了Ollama本地大模型部署调优的全链路技术体系,涵盖全平台环境搭建、GGUF量化原理、模型选型管理、核心参数调优、API服务开发、性能优化、企业级高可用部署及故障排查等内容。深入剖析Ollama架构原理底层理论,结合实操指导实现从个人使用到企业私有化落地的全流程实践,尤其聚焦量化压缩、硬件适配、参数精细化调控安全运维等关键环节,打造标准化、工业化级别的本地大模型部署指南。; 适合人群:具备一定AI基础,从事AI研发、运维或技术管理,工作1-5年的工程师、架构师及企业技术决策者,尤其适用于需在内网、私有化环境中部署大模型的技术人员。; 使用场景及目标:①在政企内网、科研机构、金融风控等场景实现数据安全可控的大模型私有化部署;②通过量化优化参数调优提升本地模型推理速度输出质量;③对接RAG知识库、开发API服务,构建企业级智能问答业务集成系统;④实现高可用、可监控、可运维的集群化AI服务架构。; 阅读建议:学习过程中应结合实际硬件环境动手实践,重点关注量化选择、参数配置性能瓶颈优化章节,并参照避坑手册规避常见误区,建议按章节顺序系统学习,最终通过第九章综合项目完成完整落地验证。

上一篇: 资源不准下的网络故障定位探索
下一篇: 从oracle到mysql模型转换的自动化实现
鲸品堂
博客等级 码龄5年 773粉丝 127原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值