2020年 我对数据行业的思考 | 特邀专栏

疫情之下,半年已过。2020年,似乎过的特别快,也特别难,各行各业。今天我想回首这半年下来对数据这个行业的一些观点,我看到了一些趋势的变化:数据行业的重心从“获取存储”迁移到“开放共享”;数据应该从“越用越贬值”变成“越用越值钱”;数据已经变成一个企业的资产和负债;数据人才缺口会越来越大……
本文叙述的故事较长,娓娓道来,几个关键词汇参考下图。
 

乘风破浪的数据行业


数据中心是新基建的重点
我一定要先聊下数据中心(IDC),因为今年有几个比较重要的事件:

  • 阿里巴巴

4月20日,阿里云宣布,未来3年再投2000亿,用于云操作系统、服务器、芯片、网络等重大核心技术研发攻坚和面向未来的数据中心建设。

  • 英伟达

5月14日,英伟达在GTC2020上推出安培架构,并宣布首款基于安培架构、用于数据中心的GPU——NVIDIA A100已经投产并交付。英伟达抢占数据中心市场的目的十分明显:先是收购全球领先的数据中心和存储系统高性能互联解决方案供应商——Mellanox,后又推出针对数据中心市场的芯片。

  • 腾讯

5月26日,腾讯云与智慧产业事业群总裁汤道生公开宣布,未来五年将投入5000亿元在新基建,包括云计算、人工智能、区块链、大型数据中心、物联网、5G网络、音视频通讯、网络安全、量子计算等都将是腾讯重点投入的领域。其中,在数据中心方面,腾讯将在全国新建多个百万级服务器规模的大型数据中心。

为什么阿里和腾讯巨资投入IDC市场,一份来自赛迪顾问的数据显示,2019年中国数据中心数量大约有7.4万个,约占全球数据中心总量的23%,数据中心机架规模达到227万架,在用IDC数据中心数量2213个。2019年,超大型、大型数据中心数量占比达到12.7%,规划在建数据中心320个,超大型、大型数据中心数量占比达到36.1%。这一数据与美国相比仍有较大差距,美国超大型数据中心已占有到全球总量的40%。

国内搞IDC的一个非常有意思的现象,互联网巨头+传统企业联合打造,比如杭钢股份和天猫、马钢股份和腾讯等等,因为传统企业具备足够的场地、电力、冷凝、安全等软硬件基础设施,最重要的是这些传统企业都面临着业务转型需求,一拍即合。

数据中心已经是一个古老的词汇,但是未来一定会是持续发酵的战场,5G与物联网、车联网、工业互联网等会给互联网带来十倍乃至百倍的数据增量,直接倒逼存储芯片和数据中心的供不应求。

数据中台从粗放式到精细化的进化

做过技术的同学应该都听过“数据中台”的概念,不过也是最近几年。往往我们听到更多的是后台和前台。企业为什么流行中台了呢?中台和后台有什么区别呢?


简单讲,数据后台负责管理数据,数据中台负责运营数据。数据中台最核心的是OneData体系。这个体系实质上是一个数据管理体系,包括全局数据仓库规划、数据规范定义、数据建模研发、数据连接萃取、数据运维监控、数据资产管理工具等。数据仓库是为企业所有级别的决策制定过程,提供所有类型数据支持的战略集合,出于分析性报告和决策支持目的而创建。


企业要发展、要提效、要降低成本,数字化运营是必经之路。数据中台产生的业务决策替代了大部分的前台业务“know how”,也就是我们常常说的数据模型,然后演变成数据服务,这个“know how”与“data service”最终形成了企业的数据资产。VC市场常常会对一个有数据沉淀的公司估值那么高,很大的因素不仅仅是它有吸附数据的基因,更多地是看中数据产生的价值。


没有数据中台的适合,前后端的耦合性高,人才不够专业,你可以想象一下一个精通数据出库技术的工程师,如何训练出一个最好的营销投放模型,那是一件度么不容易的事情。数据驱动业务,也就是我们在实际工作中的精细化运营,更需要的是对业务有数据分析能力的分析师,数据中台可以为量化决策提供最好的支持。

(图来源:中国数字中台行业研究报告:2018年规模为22.2亿)


数据行业的本质应该是赋能


服务于数据行业的格局每年都会发生微妙的变化,但是在大的视图上,大概就分为三个主赛道:大数据技术、大数据服务、大数据应用。我说的变化,体现在赛道上。比如这两年出现的数据安全赛道就出现了升级(过去十年的数据安全重在防御,未来十年的数据安全还在流通)。因为数据安全,很多游走在合规边缘的数据公司会被淘汰,比如最早出现问题的数据堂等。


大数据技术,从2003年Google GFS论文发表至今,已经相当的成熟与稳定,国内更多的所谓的大数据技术更多在采集与存储、挖掘上,比如某盾起家于设备指纹,通过设备指纹SDK抓取手机设备的信息;某信立则做了一个爬虫,抓取用户的运营商数据。我想说的是,更多的所谓的大数据技术范畴的公司,并非真正给大数据本身的技术带来进步。改变行业的技术可以看如下主线:


大数据服务,这个竞争尤其激烈,有人说:“只要你有一点运营商的关系,你就可以成为运营商大数据的代理商”,难道不是吗?某某聚合,就是一家聚合了三大运营商的数据。实质上,大数据服务的这类公司,并没有创造新的服务,只不过是做了一些便捷。我觉得未来的大数据服务商,更多地是应该赋能数据源、赋能行业机构甲方,它的核心能力应该定位在分析建模的能力。

大数据应用,国家战略已经打开了一扇窗,鼓励数据开放流通应用。随处可见,各行各业似乎脱离了大数据,一切的效率都满足不了需求。假设没有大数据,我们如何来识别疫情防控阶段的人流与去向,疫情期间的二维码就是大数据应用在疾病防控上影响最广的案例,运营商通过分析个人手机的LBS数据,绘制出个人的出行地址,并给出是否出现在高位风险地区的红码报警提示。如果脱离的大数据,显然这样的高效率社会秩序的治理是无法实现的。

数据重在运营,存储不是目的

数据如果只是存储,不进行运营,高额的存储成本如果没有提升业务的效能,那只会变成企业的负债。


数据存储一定不是目的,如果数据只到存储阶段,那只会增加额外的成本。这些年,国内数据中心目前处于“重建设轻运营”的状态。甚至是企业内部的微型数据中心,缺乏数据分析能力的团队更多地“为存而存”,更多地技术停滞在服务器和存储硬盘的投入、在做数据的抓取或者录入、在做结构化和非结构化数据库的管理和升级。企业机构在选择如何存储的技术上,从关系型到非关系型、从本地到云等维度都进行了技术升级。简单地来说,过去企业完成了存储方式的技术升级,同时完成了数据库安全的管理。


除了量化运营的互联网企业,更多的业务运营还停留在经验模式。我看到过一些公司,试图加持大数据的概念,完成了数据的存储,但实际业务比如营销似乎并没有将数据的价值发挥到及格。

要完成数据存储到数据运营的推进,核心是人才,包括具有数据业务经验的业务经理、数据分析师等。数据仓库工程师的职责是按业务经理的需求把底层数据往上做表,做成支持业务的可视化工具(比如漏斗、曲线),数据分析师需要将业务投射到数据上,通过一些统计算法、机器学习、深度学习等工具得到一些量化指标,这些量化指标将成为决策业务的一种依据之一。比如,电商平台通过用户画像得到用户兴趣偏好,系统自动推荐兴趣度更大的商品;通过行为数据分析得到用户习惯的消费时段,系统自动发放营销卡券等。当然在今天,掌握核心精细化运营能力的互联网企业已经做的很好,但是我想说的是,偌大中国、万千企业,有更多的企业并非像这些优秀的互联网企业这样做的美妙与高效。

面向业务的数据人才难求

互联网对IT人才的需求不断在升级,从最早会C++就可以混口饭吃,到今天,企业对IT工作者的要求在不断上升。数据行业,倒退十年,你只需要会把数据接入到mysql,然后会写SQL进行增删改查,可以很舒适地完成所在企业的业务,并且得到主管的点赞;倒退五年,我们发现,需要开始熟练掌握hadoop生态,因为企业数据的增长导致关系型数据库很难满足查询需求,比如一个具有亿级别的APP用户行为日志;时至今日,即使工程师在处理数据本身的技术上再牛逼,也很难做到部门经理等管理职位,因为企业更注重的是管理者对数据的运用、对业务的成果。


交叉学,包括对数据存储技术的精通、对数据计算的精通、对数据分析技术的精通、对业务场景数据建模的精通、对数据安全的考虑。这很难一开始从高校毕业生上发现,三年五年具有企业项目经验的工程师会具有绝对优势。


因为更多的企业将数据基础的技术与平台采用云或者SAAS平台的方式,对数据平台工程师的刚性已经缓解,如何基于数据平台的数据进行业务升级与优化,这可能是BOSS们最想要的。


我比较倾向说这样的角色叫“数据业务架构师”,他解决一个企业“业务+数据”的漂亮升级。这种人才画像,要求不低,简而言之,行业稀缺的原因是:懂数据的不识业务、懂业务的不识数据。

数据是AI三要素之一

人工智能 = 数据 + 算法 + 算力。

  • 数据,从“软件输出”到“软件输入”

数据成为人工智能的一个输入,从人工智能的角度来讲,软件范式从“确定——>函数——>数据”变成“数据——>函数——>预测”,AI完成了一个大规模历史数据来推导决策函数的过程。数据一定是人工智能加持各行各业的必须要素。


人工智能并非必须得到数据本身,目标是数据内在的知识和价值。还是拿信贷风控来举例,放贷机构的本意并不是要得到用户各种维度的数据,在意的是这些数据联合训练建模后得到的信用评估。这就是一个典型的人工智能赋能于金融的业务场景。


人工智能在过去很长一段时间并未对数据做很好的保护,今天看因为数据安全问题,导致很多本来已经看似很智能的业务遇到了瓶颈。如何在既保证数据安全的前提下,又能最大程度地把数据利用起来,成为人工智能面临的最大难题之一。

  • 算法,从“数据集中式”到“数据分布式”

“数据——>函数——>预测”的推导过程,一定逃不出大家熟知的算法。从古老的统计,到借助于机器学习,再到深度学习,这些算法都在试图对大规模的样本进行按业务场景的分类、拟合。预测与判断在机器替代人脑上最重要的事件,无人驾驶汽车需要预测向左还是向右行驶,智能空调需要判断是不是要自动开启空调给客厅降温,银行风控决策系统需要判断借款人员是否会按时还款,能给出预测和判断的原因是通过一些统计学范畴的算法,对已经存在的实际数据进行大规模的训练,得到预测模型。


算法的拟合效果(我们叫训练效果与测试效果)是否表现优异,和数据有极大关系,和算法选型上也有关联。比如银行风控就比较适合用LR算法,强调业务的归因和可解释性;营销就更适合树类算法,对更大数据量和特征规模的处理表现出优势。


在AI里面,机器学习和深度学习算法已经渐渐成熟,但是这些成熟更多地表现在“数据集中式”的训练过程。因为数据孤岛导致的小数据割据,分布式算法必将成为未来解决人工智能的核心技术之一。

  • 算力,从“面向数据”到“面向算法”

云计算,近几年的行业规模增长表现突出,中小微企业将计算资源采用租赁的形式,以更廉价、更快捷、更稳定的方式获取。微软在PC时代,鲍尔默“坚持以windows为中心”,(认知囚牢),后来纳德拉将PC端转移到云服务,最终拯救了微软。放眼世界,亚马逊成为云计算的帝国;回看十年,阿里云历经艰难终见曙光,王坚博士荣升为院士。云计算在世界与中国都表现出非常好的成长态势。


人工智能终将用算法对数据进行计算,这个过程需要更快的运算能力和更廉价的硬件成本。过去云计算大多面向企业、面向数据,未来的云计算将面向算法、面向场景,作为一家营销机构,可以直接在云计算平台以最高效廉价的方式得到预测结果,我称之为“智能云”,这是算力与算法的深度融合。

数据主权必须是用户


数据的主权,我想这里省略掉,因为我怕说错话,然后本文被404。


但是,我觉得有一句话一定不会有错,数据最应该是“取之于民,用之于民”的社会生产要素。

如果是涉及到用户个人的数据,这个数据的主权必须是用户本人的。
拥有用户个人数据的企业,应该需要得到用户的授权,才可以有“拥有权”、“使用权”。拥有可能代表企业能存储,使用可能代表企业可以分析数据,反刍给用户,给用户带来更好的体验。


除了法律法规对数据的使用约束,数据确权更需要技术来加持,区块链技术也许是确权不二之选,数据从出生到消亡的整个生命周期,被谁使用、产生的价值网络,都必须有一个不可篡改的去中心化账本,这个账本明细是日后东窗事发的陈堂证供!

隐私保护与数据使用的两难

都说过去十年,是移动互联网带来的“互联网2.0”时代,的确,“移动”给人们的生活方式带来巨大的变革:手机成为比爱人更重要的伴侣,我们已经习惯“身无分文”地去马路边扫二维码买烤红薯,习惯随手拍下一段视频分享在自己的社交圈,习惯在缺钱的时候填写简单的身份信息就能获取一笔贷款,习惯不去报停买份地图而只听林志玲嗲嗲的导航语音……


人们生活质量提升这一切发生的太美妙,但是,似乎这十年,伴随着移动互联网的科技将人们的衣服一件件地脱掉,脱的一览无余,没有任何隐私可言。似乎你每天的一举一动已经不是秘密,你每天去哪里呆着,手机会记录下来;你浏览了什么商品,打开邮箱都会收到这个商品的广告;你在百度查了一下贷款,保证你的抖音、网易新闻给你推贷款产品;在赤裸裸一点,你和税住过什么酒店 …… 我们几乎已经是透明的存在了。


唯一让你我兴奋的一点是,世界在这个事情上是相对公平的:无论贫贱,在移动互联网上裸奔的待遇,几乎人人平等。有人说手机绑架了人们的生活,从前慢;我说手机也脱光了你我的衣服,在裸奔。这种现象已经成为一个时代的特征之一,过往十年,历历在目。

这是一个现象,社会与科技进步的同时,用户的隐私问题被逐渐放大,直到今天,用户隐私已经成为一个法律问题、一个社会问题、一个人文问题。


谈一个最近比较有影响力的事件,中信银行池子事件。要知道,在中国,银行应该是一个最具有公信力的机构。老百姓一定会在未来某日开始担心把这一辈子的积蓄存在一个把用户的数据肆意贩卖给机构的银行,这种事件是极其恶劣且具有社会负面效应的。

科技本应美好,无奈让人无处藏身、裸奔多年。该帮人们穿上去了,穿上去,你依旧风采动人,这好比,我们都会觉得苏琪是一个好演员,因为她穿上去了。

数据安全将从“面向防御”扩大到“面向流通”


过去,大部分数据安全科技领域的科技公司,都着重解决企业数据的存储安全、入侵防御,这是必要的。由于金融科技的暴力发展,在数据流通使用过程中出现了极其恶劣的用户隐私泄露问题,行业开始重点关注数据流通环节的安全问题。

面向数据流通,核心技术是隐私计算(安全计算),它解决了企业与企业之间数据流通的安全问题。隐私计算,指在保护数据本身不对外泄露的前提下实现数据分析技术的一类信息技术,主要分为可信硬件和密码学两大领域。

  • 可信硬件

指可信执行环境,核心思想是构建硬件安全环境,数据仅在该安全区域内进行计算。可信硬件以Intel-SGX、ARM-TrustZone、Ucloud-安全屋等为代表。

  • 密码学技术

密码学技术目前以多方安全计算为代表。多方安全计算,针对无可信第三方的情况下,安全协同计算,多个参与实体各自持有秘密输入,各方希望共同完成对某函数的计算,而要求每个参与实体除计算结果外均不能得到其他参与实体的任何输入信息。

数据安全本已经是一个千亿市场,扩大到数据流通安全,可以把空间想象的更大一点:所有数据源要输出,需要用安全计算的技术;所有金融机构要使用数据,需要用安全计算的技术。而就这一个点上,再衍生出一个千亿市场,难道是梦吗?

一种设备数据的理想国


这是一段”夜半小夜曲“:基本上的APP都会让用户授权抓取地理位置、安装列表、通讯录等,不同的APP鱼龙混杂,存在更多的APP其实并不是为了让用户体验升级。比如地图软件APP,需要用户授权地理位置才可以实时导航,这是“取之于民用之于民”;再比如一个天气软件,让你授权地理位置的同时,也偷偷摸摸让你授权安装列表,这就有点遐想空间了。


天马行空想一想,设备授权抓取的口子,应该全部由手机厂商来统一做,开发者只能基于手机厂商的个人钱包来做数据应用,这个钱包可以用区块链技术来完成。
 



这个方式也许是很理想国的,但是会从根本上更好地治理手机设备数据的滥用。用户可以通过手机主动打开或者关闭抓取数据的权限,主动授权设备厂商与APP的数据,被APP使用后,可以得到数据的租金(只要你愿意被使用,你的电子钱包就在增值)。APP抓取用户数据被手机厂商从设备上切断,抓取数据的动作完全有手机厂商支配,成为一个开发者的安全计算平台,APP要使用数据,必须遵循手机厂商的标准化接口或者方式。标准与监管可以缩小到为数不多的手机厂商。


写这个故事,是为了表达一个意思:数据业务只要你敢想象,存在无限的商业空间机会,创新与试错很重要(更多前沿资讯请关注微信号“hellompc”)。


小结
如果你在数据这个行业,好好干吧,前方高能,待你乘风破浪。


 

相关推荐

联邦学习工程实践中的三大难题

“实践是检验真理的唯一标准”,联邦学习谈概念的文章已经很多,今天我们来从实践中聊几个实事求是的问题。联邦学习领域已有众多论文支撑,但在实践中,因为涉及到多学科的交叉,真正能落地应用的平台,少之又少。所以你可以看到已经有三四十家做联邦学习的公司,但是仅有七八家是能真正亮相产品。这应该是一个比较正常的现象,因为联邦学习工程落地所面临的挑战远远比理论复杂。1)断点训练断点训练,是指联邦学习过程中“训练可暂停”,如果发生多方之间的网络异常造成超时,待网络恢复正常后,联邦学习模型可从上次的断点开始继续训练

hellompc的博客 4386

隐私计算项目评估的“偏见”

如何评估一个项目是不是值得投资,这件事情可能VC最有专业性,本文站在一线工作者的角度,阐述目前隐私计算项目的深浅。(有些东西,一定是老百姓口中说出来的可能更贴近现实)做硬件的拼技术荷兰ASML公司是全球最大的光刻机制造商,也是全球唯一可以提供EUV光刻机的厂商,在全球高端光刻机市场处于垄断地位。简单讲,硬件厂商如果要做成功,核心是技术和工艺,我们国家出现不了Intel、ARM、英伟达这样的企业,原因之一就是技术与工艺的落后。做软件,我觉得不太一样,软件的可复制性比较强。为了说明问题需要,我这里把

hellompc的博客 1296

“联邦学习”和他的朋友们

最近,我们所从事的行业领域“联邦学习”异常火热,“上云用数赋智”、“数据成为生产要素之一”、“新基建之一的大数据”……我有时候给同行和非同行讲述各行各业都需要用到我们这个技术,来保证企业生产提效过程中使用数据的安全,过程中,他们都被我感动和调动起来了,然后反过来给我提了很多可以应用的场景和潜力,说这个市场未来真的很刚需、很大,最后我也被我自己感动了。“联邦学习”和他的朋友们事实上,我和...

hellompc的博客 1430

运营及其他功能组件

运营功能组件包括:a) 服务目录:提供联邦学习系统的所有服务列表;b) 策略管理:提供联邦学习服务的定义、更新和访问策略及对策略的管理;c) 异常和问题管理:提供事故和问题报告的捕获能力,并通过分析管理报告;d) 服务交付管理:提供服务交付的管理功能,如交付的功能接口、SLA 等。系统安全功能组件系统安全功能组件主要为联邦学习各功能组件层、层间交互以及各参与方交互提供保密性...

hellompc的博客 824

联邦学习的过程

联邦学习的过程分为自治和联合两部分。自治的部分:首先,两个或两个以上的的参与方们在各自终端安装初始化的模型,每个参与方拥有相同的模型,之后参与方们可以使用当地的数据训练模型。由于参与方们拥有不同的数据,最终终端所训练的模型也拥有不同的模型参数。联合的部分:不同的模型参数将同时上传到云端,云端将完成模型参数的聚合与更新,并且将更新好的参数返回到参与方的终端,各个终端开始下一次的迭代。以上的程...

hellompc的博客 7884

什么是联邦学习

今天来学习下最近比较博眼球的联邦学习。应该有很多人听过但是始终都没懂啥是联邦学习。很多同学应该也从网上搜集一些相关资料来学习,大概知道联邦学习的作用主要是用来解决数据孤岛,那他又是如何来解决数据孤岛问题的?本系列专栏将从多维度介绍联邦学习,包括背景、概念、技术原理等。联邦学习的概念联邦机器学习(Federated machine learning/Federated Learning),又...

hellompc的博客 5104

隐私计算S2赛季-谁是真正的王者

去年至今,隐私计算大约经历了如火如荼的一年。身为局中人,看穿居中事,道尽居中话,为的无非是让更多的来了解这个比较细分的AI领域。秋天本是硕果累累的丰收季,隐私计算这个行业算是金秋吗?一喜一悲一喜为百花齐放。我所知道在布(挂)局(钩)隐私计算技术的国内科技公司,大约三十来家,国外除了大厂,创业公司为数不多。这是可喜的,因为任何新领域,必须有尽可能多的布道者、参与者、使用者,这对新技术的传播和教育具有多点开花的作用。所以,你可以看到去年谈隐私计算,无人知晓;今年谈及,无人不知。这就是非常积极的行业信号反

hellompc的博客 982

一篇可能被联邦学习同行封杀的文章

我很喜欢巴菲特的一句话“当别人疯狂时我恐惧,当别人恐惧时我疯狂”,用于今天的隐私计算这个行业,非常合适。因为,“百花齐放”、五花八门、鱼龙混杂的隐私计算行业初期,确实让我对这个领域有一些担忧。本文我试图从隐私计算软件是否是开源和自主研发的角度来叙述当下的问题。安全已是国家战略作为程序员,我无条件支持开源,因为这是推动技术发展、普惠码农最廉价的方式,没有之一。放到安全计算这个领域,因为它的技术前沿性、未知性,将平台开源无疑是推动这一技术往前发展的有效方式。但是,火热的隐私计算领域让我陷入深深的思考——

hellompc的博客 3225

疯狂的联邦学习!研究员年薪百万?

码农不容易我这十几年一直在学习,停都停不下来!因为互联网技术发展真的造化弄人:上学那会儿,老师说C++有前途,因为大多数的企业都用它来写服务器程序;过了两年突然原来这个世界是Java的,遂挑灯恶补Spring。然而,技术永远在诞生新的“概念”(就要玩死码农),hadoop又出来糟蹋我们的青春了(所以真正爱学习的程序员哪有时间去蹦迪),“大数据”吞噬了我们的“小时间”。就在最近,很多人又开始慌了...

hellompc的博客 1475

联邦学习 群雄逐鹿:微众fate与富数fmpc的最新版本实战性能对比

摘要: 最近一直在研究跟联邦学习相关的东西,现在的参考资料也越来越多,热度也十分火热。百度、阿里、腾讯、富数、清华、微众银行、平安科技等多家机构都在不同场景中进行战略布局。这其中主要解决的场景问题,笔者总结如下·个人隐私保护以互联网营销、互联网信贷为例,依赖大量的用户第三方数据补充用户画像、拉新、提升用户活跃度、提高大数据风控能力,然而随着互联网金融数据监管时代的来临,对个人隐私保护,...

hellompc的博客 1933

从数据开放共享角度解读中央文件:《关于构建更加完善的要素市场化配置体制机制的意见》

近日,中共中央国务院发布《关于构建更加完善的要素市场化配置体制机制的意见》,对推进要素市场化配置改革进行总体部署,明确了要素市场制度建设的方向和重点改革任务。将 “ 数据 ”与土地、劳动力、资本、技术等传统要素并列为要素之一,其中重点强调了做好数据开放共享的同时,加强数据资源整合和安全保护。生产要素,是经济学中的一个基本范畴,主要指的是进行社会生产经营活动时所需要的各种社会资源,是维系国民经...

hellompc的博客 1815

以武会友,两大主流联邦学习产品体验

如今,AI技术在几乎每个行业中都展现出了自己的优势,无人驾驶汽车,医疗保健,互联网金融等已经深入我们的生活。然而随着大数据和AI技术的逐渐成熟,各机构和组织对数据安全和用户隐私的妥协意识也日益增强,对数据隐私和安全的重视已成为全球性的重要问题。同时欧盟于2018年5月25日发布实施了《通用数据保护条例》 [GDPR], 旨在保护用户的个人隐私和数据安全,中国和美国也正在制定类似的隐私和安全法案。受...

hellompc的博客 2547

隐私计算和联邦学习发展的举措

建立大数据隐私计算和联邦学习生态联盟联邦学习的新商业模式需要一个商业联盟,联盟包含有 N 个实体,加入联盟的实体,可以像朋友圈一样能够利用各自的数据联合建立模型。联邦数据联盟鼓励各方参与,联盟成员一方面进行垂直领域的合作,另一方面,联盟有明确的在不同场景下的激励机制和权益分享,可以使用区块链技术建立一个让参与各方都满意的一个共识机制来估计大家的贡献,以此奖励对联盟有作用的机构。在生态联盟里...

hellompc的博客 2460

Linux 系列之常用命令记录整理

Linux一些命令可以在开发或调试过程中起到很好的帮助作用,有些可以帮助了解或优化我们的程序,有些可以帮我们定位疑难问题。本篇博客将介绍工作中常用的linux命令,记得收藏,博客不定时更新 命令 功能说明 线上查询及帮助命令 (2 个) man 查看命令帮助,命令的词典,更复杂的还有 info,但不常用...

hellompc的博客 357

功能视图的组成

功能视图是构建联邦学习系统所需功能的技术中立的视图。功能视图描述了支持联邦学习活动所必需功能的分布,定义了功能之间的依赖关系。功能视图涵盖的联邦学习内容如图,包括:功能组件、功能层、跨层功能。功能组件是参与某一活动所需的、能实现的功能构件,联邦学习系统能力由一组已实现的功能组件定义。功能层是一组提供类似功能或服务于共同目标的功能组件的集合。跨层功能提供跨越多个功能层次能力的功能组件。联邦学...

hellompc的博客 3480

服务层组件

用户服务组件用户服务组件支持联邦学习服务用户访问和使用服务,包括:a) 用户界面:提供联邦学习服务客户与服务进行交互的功能,如命令行界面、图形用户接口和API等;b) 任务提交:提供将联邦学习服务客户的需求(如建模、预测等)提交到联邦学习网络中的功能;c) 导入/导出工具:提供将数据、模型等导入/导出联邦学习网络的功能;d) 数据发布与发现:联邦学习的参与方可以发布本方的数据供...

hellompc的博客 684

算法层组件

样本对齐组件样本对齐组件通常用于纵向联邦学习,要求应包括:a) 各方在不公开各自数据的前提下确认数据源的重叠样本;b) 不暴露非重叠样本。特征对齐组件特征对齐组件通常用于横向联邦学习,要求应包括:a) 各方在不公开各自数据的前提下确认数据源的重叠特征属性;b) 不暴露非重叠特征属性。联合特征工程组件联合特征工程的功能应包括:a) 联合特征使用方案;b) 联合...

hellompc的博客 922

算子层组件

聚合算子聚合算子应根据聚合策略、加密方式进行定制。常见的联邦学习聚合算子定制方法是以随机数为基础,结合多方安全计算协议进行变化。激活函数激活函数应包括但不限于:a) 传统机器学习的激活函数,如 sigmoid、softmax、tanh、softsign 等;b) 联邦学习的联合激活函数,如基于半同态加密的泰勒展开 sigmoid、基于秘密共享的 ReLU等。正则化处理器...

hellompc的博客 648

基础架构层组件

计算组件计算组件包括:a) 支持任务在单机上执行,宜支持分布式任务执行;b) 应具备明确的任务元信息管理方案,确保联邦学习活动正常运行;c) 宜具备一定容错性,如任务的失败与恢复功能;d) 应提供 API 具备联邦学习算法开发能力。存储组件存储组件功能包括:a) 宜支持 Key-Value 存储;b) 支持其他存储系统到存储组件的数据导入与导出;c) 支持数...

hellompc的博客 788

用户视图与功能视图之间关系

联邦学习角色和活动与功能组件之间的逻辑映射关系可用于:a) 明确信息流或其他类型互操作的程度;b) 确保指定的质量,如安全或服务水平等。联邦学习角色、组件与活动 用户 参与方 协调方 服务层 使用联邦学习服务 发现数据元信息 发现服务能力 提...

hellompc的博客 2054

隐私与安全

联邦学习的根本目标是为了保障数据信息安全,但是在不同的场景,不同的主体对于隐私和数据安全的要求或者定义不相同。因此在联邦学习中,参与方们在进行隐私保护下的机器学习之前需要定义数据安全的概念,达成共识。在联邦学习中,我们有以下4个假设:1. 所有参与方们都是诚实但好奇的。所有的参与方们会遵循联邦学习的数据保密规则,但同时他们也会利用所得到的所有信息去推测其他参与方的数据信息。2. 在参与...

hellompc的博客 1710

区块链产业生态发展情况-美国区块链产业生态发展

美国政府一直在关注区块链技术的发展,无论是在联邦政府层面还是州政府层面都有相关的研究进展。2018年,美国国会、商务部国家标准与技术研究院(NIST)等部门先后发布了多份区块链报告,在认可区块链技术潜力的同时,也指出了在监管等方面的挑战。在美国的《2018年国防授权法案》中,要求国防部长牵头对区块链技术进行安全评估。美国参众两院委员会于2019年7月份发起了Facebook提出的加密货币libra...

hellompc的博客 1781

区块链产业生态发展情况-欧盟区块链产业生态发展

欧盟对区块链技术的应用持积极的态度。早在2018年4月,22个欧盟国家签署了建立欧洲区块链联盟的协议,该联盟的目标是成为交流区块链技术和监管经验等专业知识的平台,为启动欧盟范围内的区块链技术应用做好准备。欧盟数字经济和社会委员玛丽娅·加布里尔认为,未来所有公共服务都会用到区块链技术,这种技术能够更好地保护个人数据和创造新的商业机会和公共服务。欧盟议会则认为欧盟有机会成为区块链的领军者。在201...

hellompc的博客 860

区块链产业生态发展情况-亚洲区块链产业生态发展

亚洲的主要国家对区块链技术的应用持积极的态度,一些国家将区块链技术与数字货币作为不同的事物进行监管。韩国对区块链技术的发展较为积极。在2018年,韩国科技与通信部发布《区块链技术发展策略》,计划在2022年前筹集2300亿韩元(约合14亿人民币)的资金,旨在培养一万名区块链人才和一百家公司。目前,包括三星集团在内的韩国大型集团已经在区块链领域展开布局。日本开始严格监管数字货币交易,并继续关...

hellompc的博客 448

区块链产业生态发展情况-中国区块链产业生态发展

2019以来中国区块链产业处于蓬勃发展期,从中央到地方有关区块链发展的指导意见和扶持政策不断发布。据不完全统计,今年上半年全国共有超过23个省市发布了112条涉及区块链的政策信息,多省市把区块链纳入发展数字经济的规划中,大力推进区块链应用落地,与实体经济融合,同时也对打着区块链旗号进行非法活动的犯罪行为进行监管。产业界不断推进区块链落地应用,在金融、保险、食品安全、供应链管理、航运信息、慈善公...

hellompc的博客 2892

区块链产业协同生态发展

产业生态发展迅速,产业链分布广泛随着区块链技术的不断深入,区块链产业基础越来越好,理论技术研究和区块链底层平台水平处于较高层次,众多的应用场景为区块链技术的应用提供了良好的基础。在政府的引导和支持下,产业生态发展迅速。从产业链分布来看,涵盖了理论技术研究、区块链底层基础设施、技术服务、区块链应用以及产业周边等整条产业链环节。,极其丰富的应用场景为区块链快速落地提供了良好基础。在理论技术研究...

hellompc的博客 1246

L多样化

为了解决同质性攻击和背景知识攻击所带来的隐私泄露,Machanavajjhala等人提出了L-多样性(l-diversity)模型。简单来说,就是在公开的数据中,每一个等价类里的敏感属性必须具有多样性,即L-多样性保证每一个等价类里,敏感属性至少有L个不同的取值,通过这样L-多样性使得攻击者最多只能以1/L的概率确认某个体的敏感信息,从而保证用户的隐私信息不能通过背景知识,同质知识等方法推断出来。...

hellompc的博客 5803

K匿名算法

在大数据的时代,很多机构需要面向公众或研究者发布其收集的数据,例如医疗数据,地区政务数据等。这些数据中往往包含了个人用户或企业用户的隐私数据,这要求发布机构在发布前对数据进行脱敏处理。K匿名算法是比较通用的一种数据脱敏方法。举例来说,如下图是两张表,一张是用户的会员注册信息表,一张是对外发布的医疗信息表。第二张医疗信息表中,虽然已经把用户姓名,身份证号等个人关联信息抹去,但如果直接...

hellompc的博客 1万+

差分隐私

差分隐私(Differential Privacy)是Dwork[3] 在2006年针对数据库的隐私泄露问题提出的一种新的隐私定义。主要是通过使用随机噪声来确保,查询请求公开可见信息的结果,并不会泄露个体的隐私信息,即提供一种当从统计数据库查询时,最大化数据查询的准确性,同时最大限度减少识别其记录的机会,简单来说,就是保留统计学特征的前提下去除个体特征以保护用户隐私。差分隐私基本原理如下图:当...

hellompc的博客 1万+

安全沙箱/安全屋

安全屋主要是通过物理方式对数据的所有权和使用权进行分离,通常使用中心化和分布式相结合的混合架构,即各个数据提供方按照主控平台的接入规范统一接入平台,而所有管理权限由主控平台统一提供,各个参与的数据源方提供数据区的维护能力,通过这种方式来确保数据的整个流通过程安全可控的一种技术方案。目前市场的应用案例包括有UCloud的安全屋产品,如下图所示:其中,集中式的主控区功能包括:统一的数据...

hellompc的博客 2675
上一篇: 联邦学习工程实践中的三大难题
下一篇: 隐私计算S2赛季-谁是真正的王者
hellompc
hellompc 企业官方账号 企业官方账号
博客等级 码龄7年 335粉丝 41原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值