访韩家炜教授记录(部分)

数据仓库与数据挖掘的OLAP技术----韩家教授的《数据挖掘概念与技术》学习笔记 数据仓库与数据挖掘的OLAP技术 1.数据仓库 Ø 概念:数据仓库是一个面向主题的、集成的、随时间而变化的、不容易丢失的数据集合,支持管理部门的决策过程. Ø 关键特征: v 面向主题:围绕一些主题;关注决策者的数据建模与分析,而不是集中于组织机构的日常操作和事务处理(这是数据库的任务)。排除对于决策无用的数据,提供特定主题的简明视图。 v 数据集成:由异种数据源(关系数据库,一般文件, 阅读详情

我之前了解了一下,龙星计划今年是第四届了是吧?是2002年开始第一届的吧?
对,对

您第一年的时候就会来讲学了是吗?
对,第一年我是在北大,也是和这个安排差不多,在北大讲了一个星期的课,但是那次时间比较紧张一些,没有机会去其他地方,因为当时紧接着就有一个国际会议,在北大讲完差不多就去参加会议了。

那您是不是每一年都回来讲学了呢?
也没有,我好几年没有回来过了,这是第二次。

这个龙星计划好像是您和赵伟教授和李明教授三个人发起的吧?
也不是,主要是赵伟发起的,当时我们几个在一起说好了,有6、7个教授,咱们牵个头。赵伟当时是副校长,主要是负责research,负责科研的副校长,当时咱们几个在一起,赵伟就说要想加强交流可以设立一个program,让在美国大学的一些教授,把一些研究生的课程搬到中国来讲,这就是龙星计划被提出来的原因。

噢,是为了把美国的一些研究生课程引入到中国来,那您觉得现在中国和美国在研究生的研究领域内,在研究前沿或超前性上,是不是美国稍微要领先一些呢?
对,美国的科研力量都在大学,它不像中国有中科院、研究所,美国的研究所都在大学,所以这是他的主要研究力量。所以有很多研究生的课比较接近前沿的,所以一般美国学校里的有些研究生的水平可以达到很好。

您这一次讲课据说是把研究生16周的课程浓缩到一个星期来讲,您觉得我们这边的研究生能够消化吗?
我觉得能够接受,因为我出过一本书,这本书也有翻译版,这些听课的同学多多少少学过一点,而且很多是外地来的同学,他们一般都看过,我所讲的很多是书上的内容还有一些前沿的内容。我觉得他们大部分同学消化的挺好的。

那您自己感觉怎么样呢,您这一个星期都排满了讲学阿,讲课阿,一定感觉很累吧?
还好,我这次讲一个星期的课,因为很多同学是从外地过来的,我觉得如果讲两个星期太松了,也可能耽误这些外地同学的自己的功课或其他什么事情。所以我就安排差不多一天从早讲到晚,大概五六个小时吧。

对阿,您一整天都在讲,我自己也去听过一次课,您正好在讲聚类,聚类分析,不过很可惜我是本科生课程安排不如研究生那么活,所以很多时候都没有办法来听。那您觉得如果一个本科生来听这门课的话,会不会觉得有点困难呢?
我觉得还可以,我教这门课吧,也不光是研究生在念,这么课差不多是第一年的研究生和最后一年级的本科生交叉着在念,所以在美国其实最后一年的本科生也可以选这门课,研究生也可以选这门课。所以我觉得本科生听这门课也不是很难的。而且我还建议把这么课“下放”到本科生去教,因为它用的数学知识等,也不是非常深的,所以本科生也可以学。

您的这本书其实我也看过第一章和第二章,每次我去图书馆想借着看都已经被借光了,只能在馆内看那本不能被借出去那一本。我当时是再跟着陈红教授作项目,她研究数据仓库,她建议我去读您的这本书,我当时负责的是实体化视图那一部分,感觉看您的书很容易懂,思路很清晰,一下就懂了。
他笑

那您觉得本科生做项目怎么样?
其实呢,很多本科生都想做项目,但是老师可能就没那么多精力,因为在美国那些比较好的大学,博士生是重点,老师带很多博士生,所以可能就没那么多辅导本科生,所以本科生教育就比较标准化,做作业、project等,除了个别一两个可能特别突出的本科生老师比较感兴趣以外,一般都没那么多精力。而且本科生有些基础课也没有学完,所以老师对本科生的指导就比较泛一点,所以老师就做一点比较general的,比较原则的,真正做研究就少一点。真正有本科生很想做的,我们可以推荐他和PhD研究生组成一个小组,一块儿做。

呵呵,我就是这样一个非常想做的学生,和他们研究生在一起做。
这样的学生一般都是比较杰出的学生。

那您觉得本科生参与项目对他个人的提升有什么好处?您觉得本科生的研究深入程度能够到多少呢?
我觉得本科生和研究生没有绝对的界限,比如做一个数学题吧,其实高一的学生和高二高三的学生,差别也不是那么大,有的高一学生也可以做得比高三的还好,就是这个道理。

本科生除了项目以外平常也就是上上课做做作业,那您觉得作为本科生,应该怎样学习来提高自己呢?
其实本科生要是想做一些研究可以自己去上一些研究生的课,要多上,但不要太泛,假如你一下子铺开去,学10几门课,你可能也学不到什么东西,倒不如把本科课程学好,如果对一门课感兴趣,就对这一门一直研究上去,说不定就能从课上表现出来,或许还会比研究生还强。

也就是精力是有限的,应该专攻一门了。
对阿,要想成为专家,就是要钻研一点,其实专家呢和平常人区别也不是很大对不对?他也就是专在一点,铺开了看,专家考试的时候也许还不如一般人呢!(笑)

数据库是一门很有趣的课阿,尤其是在人大以数据库见长,有这么多好老师,非常容易激起我对数据库的兴趣。
是啊,数据库真的很有趣,你的环境也挺好的(笑)

那您现在的研究方向是什么呢?
我主要还是在数据挖掘上,不过现在也在逐渐拓宽了,因为学生兴趣也挺广泛,也不应该让他们集中在一点上,可能一个人研究一门课程,那我的十几个研究生也就研究了十几门课程。

您的数据挖掘还是注重于理论吗?
我专注的是算法,因为数据挖掘呢算法是一个主要的方向,其他理论的部分呢有时也做一些,不过更多的还是注重与应用。

实际应用,我看您的书上也提到了关于数据挖掘的应用,有金融方面、生物信息学等,那您关注的应用有哪些呢?
我主要关注的一个是生物信息学,像蛋白质、DNA分子结构非常复杂,我现在在研究network和图方面。另一个应用的方面就是web上的挖掘。

我感觉您和我感兴趣的好像阿!我也对生物信息学很感兴趣,因为我自己想去英国留学,所以也查过英国那边的专业,不过似乎英国研究生物信息学的并不多,在这一方面美国是不是要更多一些?
我认为美国总的来说学校比较多,研究也比较活跃,美国研究生物信息的也很多,几乎每个系都有研究生物信息学的。

Web的挖掘现在也很热门,似乎现在网络之争就是搜索引擎之争。
对,对,搜索引擎就是从不同的角度看了,有人是从web的page角度,有人把page进一步细分成block,object这样也很好。

我刚才说到出国留学的事情,您以前是79年开始就在美国留学了,是吧?您觉得在国外学习怎么样呢?
我觉得在国外学习挺好的,不但可以接触世界各国的研究生,思路可以更加开阔一点,而且还可以增广见识。我觉得你出去留学很不错的。

网上都说您在国外读书的时候被誉为明星学生,……
没有没有,(笑)我没有觉得特别出色的,比我出色的外国学生挺多的。

您当时就是学的数据挖掘方面吗?
不,我是学的数据库方面的,当时还没有数据挖掘呢。

噢,对,您是这一科目的创始人呢。
呵呵,创始人说不上,做研究比较早罢了。

您说您现在关注的是算法,好像现在很多人工智能里的算法被引入到数据挖掘中,比如神经网络阿,遗传算法阿。
对,不但有人工智能中的算法,还有很多比如统计学阿,等等,其实很多算法、data structure都能在数据挖掘中用到。

您在计算行业研究了很多年了,那您觉得在未来哪些科目可能是热门呢?
生物信息、Web,Mining等都是这样,我觉得判断一个东西是否热门就看它未来是不是有用,就比如生物信息学,现在有很多的data,其中大部分还是待分析的,那么就知道肯定有用,这就需要一些新的算法出现,所以你要找到很多新的生长点新的方向并不需要特别大的天才,就是大家讨论,哪些部分现在有什么需要,将来长期发展来看用处比较大。

嗯,非常谢谢您今天这么忙还抽空出来接受采访。
呵呵,没什么。

fp-growth算法详解与实现 fp-growth算法详解与实现一、摘要二、绪论三、算法介绍四、算法实现五、总结 一、摘要   本文讲解fp-growth算法的原理,梳理了fp-growth算法的实现流程,并使用Java实现fp-growth算法,通过面向对象的思想使算法更加结构化,并使其更加通俗易懂。 二、绪论   在之前的博客中我们详细介绍了Apriori算法的实现(要是不知道,可以自行百度或看我之前的博客),但大家应该可以发现,Apriori算法在求得频繁项集的时候会对数据集进行多次扫描,很大程度上降低算法执行的效率。实际上Apri 阅读详情

相关推荐

韩家数据挖掘概念与技术(第二版)中英文+课后习题答案中英文合集

韩家数据挖掘概念与技术(第二版)中英文+课后习题答案中英文合集 习题解答:英文版有全部习题答案,中文版答案不全。 一站购齐.

韩家

韩家      韩家现为美国伊利诺伊大学计算机系正教授。韩教授于2003年获选美国计算机协会院士(ACM Fellow)(Citation: “For contributions in knowledge discovery and data mining”, 汉译: “对知识发现和数据挖掘做出贡献”)。   韩教授1978毕业于中国科学技术大学计算机科学系,同年

junecauzhang的专栏 3427

5篇韩家经典论文(数据挖掘

这是几篇比较经典的论文,全英的,希望对大伙有所帮助

【2020年高被引学者】 韩家 伊利诺伊大学香槟分校

【2020年高被引学者】韩家,伊利诺伊大学香槟分校计算机科学系教授,IEEE Fellow,ACM Fellow,美国信息网络学术研究中心主任。研究方向包括数据挖掘,信息网络分析,数据库系统和数据仓库。曾担任KDD、SDM和ICDM等国际知名会议的程序委员会主席,创办了ACM TKDD学报并任主编。 2020年发表论文:64 发表论文:1324 论文引用数:195800 关注作者及了解论文情况:https://www.aminer.cn/profile/jiawei-han/53f42f36dabfaed

AI_Conf的博客 513

重磅 | 数据挖掘之父韩家:文本语料库的数据挖掘(附视频+PPT下载)

授权转载自公众号数据派THU微信ID:DatapiTHU近期,美国伊利诺伊大学厄巴纳香槟分校计算机科学Abel Bliss教授韩家在清华大学FIT楼多功能厅进行了关于文本语料库数据挖掘的主题分享。 嘉宾简介:韩家,美国伊利诺伊大学香槟分校计算机系教授,IEEE和ACM院士,美国信息网络学术研究中心主任。曾担任KDD、SDM和ICDM等国际知名会议的程序委员会主席,创办了ACM TKDD学报并任

大数据文摘 1498

韩家老师的实验室和家里作客 — 旅美散记之二

中国数据库界的老朋友 韩家教授国际数据挖掘界的知名学者,是中国数据库学人的老朋友。记得大约是1998年(1999?)年暑假,复旦大学主办过一次数据挖掘讨论班,得到了IBM的资助,请来的主讲人是陆宏钧老师和韩家老师,他们的生动讲演为参会的师生启开了数据挖掘之旅。如果说,在那以前,中国的数据挖掘研究还只是之火,那么,在那以后,就逐渐开始了燎原之势。 记得那时候,裴健还是北大的博士生,在讨论班

xiaolu的专栏 1559

(一)数据挖掘概念与技术——韩家

第三版 25页  数据挖掘又称知识发现(KDD:Knowledge Discovery in Database),即“从数据中挖掘知识”。   丰富的数据以及对强有力的数据分析工具的需求,这种情况被描述为“数据丰富,但信息匮乏”。数据挖掘可以看作信息技术自然进化的结果。数据库和数据管理产业在一些关键功能的开发上不断发展: 数据收集和数据库创建 数据管理(包括数据存储和检索、数据库事务处理) 高级数

lanhui的博客 4万+

郑州大学 计算机 排名,郑州大学网上信息

近日,Guide2Research网站公布了2020年世界顶尖1000名计算机科学家排名。郑州大学共有2位校友进入榜单,78级校友韩家位居华人科学家之首,综合排名世界第3;77级校友张宏江位居中国大陆科学家之首,综合排名世界第36。韩家,郑州大学计算机科学系78级校友,美国伊利诺伊大学香槟分校计算机系教授,IEEE和ACM会士,曾担任KDD、SDM和ICDM等国际知名会议的程序委员会主席,创办...

weixin_42510140的博客 343

标题:基于地域文化的园本课程开发实践探索——以青岛市红岛韩家民俗村“渔盐文化”课程为例

研究采用经验总结法与案例研究法,通过系统收集过程性资料、开展教师能力追踪与幼儿发展评估,提炼出“文化故事导入—多感官体验—艺术创意表达”的典型教学流程、“普查-评估-转化”三部曲资源开发模式以及“活动共办、资源共用、成果共享”的家校社协同机制。1.教师发展案例:以典型教师为例,通过“前测-中期-后测”的能力数据追踪(如渔盐文化知识问卷、教学设计评分等),结合关键成长节点的措施分析,呈现其从“文化认知空白”到“课程设计能手”的完整成长轨迹。3.转化:将文化资源转化为幼儿可感知、可操作、可表达的课程活动。

吕坤阳 141

频繁模式挖掘-FP-Growth

算法简介 FP-Growth是频繁模式挖掘的一种算法,由韩家等在2000年提出,算法通过建立一棵频繁项集树来实现频繁项集的搜索,同时能实现事务的压缩,相比Apriori能减少数据的扫描次数。 算法逻辑 1、扫描数据,统计项目(item)在数据集中出现的频数,例如苹果出现(被购买)了4次、牛奶出现(被购买)了5次等 2、再次扫描数据,构建频繁树(FP-Tree),并生成头表。将每条事物中的项目按照步骤1中的频数由高到底排列后,依次放到树中,并用头表记录每个项目在树中的位置 3、依据头表...

sccdpxz2的博客 1084

韩家论文

Web包含了丰富和动态的超链接信息, 以及Web页面的访问和数据挖掘提供了丰富的资源. Web挖掘就是从Web文档和Web活动中抽取感兴趣的潜在的有用模式和隐藏的信息.

FP_growth算法

原文出处:http://blog.sina.com.cn/s/blog_6e85bf420100ogp8.html FP_growth算法韩家老师在2000年提出的关联分析算法,该算法和Apriori算法最大的不同有两点:第一,不产生候选集,第二,只需要两次遍历数据库,大大提高了效率,用31646条测试记录,最小支持度是2%,用Apriori算法要半个小时但是用FP_growth算法只要

whhit111的专栏 919

java fp-growth 算法包_java实现fp-growth算法

本文参考韩家数据挖掘-概念与技术》一书第六章,前提条件要理解 apriori算法。另外一篇写得较好的文章在此推荐:0.实验数据集:user2items.csvI1,I2,I5I2,I4I2,I3I1,I2,I4I1,I3I2,I3I1,I3I1,I2,I3,I5I1,I2,I31.算法原理构造FPTree1、首先读取数据库中所有种类的项和这些项的支持度计数。存入到itTotal链表中。2、将i...

weixin_35796461的博客 255

两个实体相同属性快速映射_知识图谱论文阅读笔记(三)实体链接 翻译 韩家老师的实体链接综述...

多读书, 多看报,多吃零食, 多睡觉.论文: Entity Linking with a Knowledge Base: Issues, Techniques, and Solutions摘要将Web数据与知识库连接起来的大量潜在应用程序导致了实体链接研究的增加。实体链接是将文本中提到的实体与其知识库中相应的实体链接起来的任务。潜在的应用包括信息提取、信息检索和知识库填充。但是,由于名称的变化和...

weixin_39962341的博客 888

推荐系统:关联规则(3) —— FP-Growth 算法

()http://www.guwendong.cn/post/2008/fpgrowth_algorithm.html在 1994 年 Rakesh Agrawal 提出了 Apriori 算法之后,关联规则挖掘技术的可用性得到了很大的提高。而且因为关联规则挖掘与生俱来的商业意义,使得它迅速成为了一个非常热门的研究领域,新的算法也不断地涌现出来。这其中,实用性比较强的一个算法,是由韩家教授提...

qingfengxia2013的专栏 312

数据挖掘概念与技术(韩家伟)阅读笔记1

1.什么是数据挖掘 指从大量数据中提取或“挖掘”知识。 2.数据挖掘与知识发现 知识发现的迭代序列包括:数据清理,数据集成,数据选择,数据变换,数据挖掘,模式评估,知识表示。在实际使用过程中,数据挖掘可代替知识发现一次使用。 3.数据存储库 (1)关系数据库。表的汇集,每个表都有唯一的名字。每个表包含一组属性,存放大量的元祖,每个元祖代表一个对象,被唯一...

weixin_30933531的博客 165

2024苹果学者名单公布,华人占一半!宾大博士生曾和Jim Fan搞出英伟达最火机器人...

新智元报道编辑:桃子好困【新智元导读】2024年苹果学者名单开奖了!全球21位学者入选名单中,11位华人博士成功入选。其中包括师从陈丹琦、韩家教授的博士生。一年一度的「苹果学者」最新名单公布了!刚刚,苹果机器学习研究中心(Apple Machine Learning Research)发布了2024年在人工智能/机器学习领域获得博士生奖学金的「苹果学者」名单。值得一提的是,今年共有21...

fengdu78的博客 933
上一篇: [转]程序设计中的感悟
下一篇: [转]大学生应该学习哪些电子知识
dzeng81
博客等级 码龄23年 117粉丝 436原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值