Mahout0.9—Hadoop2.20—协同过滤算法

Intellij IDEA Cannot resolve symbol XXX 问题解决办法汇总 maven项目遇到这类问题基本上是两方面的原因,类对应的依赖没有加载进来、编译器自身的缓存问题。 解决第一类:1、检查项目的pom文件,是否必要的依赖都写清楚了; 2、是否使用自己的私有库, release Private  Repository http://xxxxxx release PrivateRepository http://xxxxxxx 阅读详情

1. Mahout0.9—Hadoop2.20—协同过滤算法

1.1. 基于物品的协同过滤推荐函数

Mahout支持推荐函数,通过mahout –-help 查看:


函数1:itemsimilarity: : Compute the item-item-similarities for item-based collaborative filtering
itemsimilarity是计算物品相似度矩阵;如果只需要相似矩阵,可用此函数。

函数2:recommenditembased: : Compute recommendations using item-based collaborative filtering
recommenditembased是计算物品相似度矩阵,并根据相似矩阵和用户数据进行推荐结果计算;recommenditembased的计算过程包括itemsimilarity;

1) itemsimilarity参数
通过mahout  itemsimilarity –-help 查看:
--input (-i) input, 设置数据输入路径
--output (-o) output ,设置结果输出路径
--similarityClassname (-s) ,设置相似度计算函数:
SIMILARITY_COOCCURRENCE,同现相似度
SIMILARITY_LOGLIKELIHOOD,  对数似然相似度
SIMILARITY_TANIMOTO_COEFFICIENT
SIMILARITY_CITY_BLOCK,  曼哈顿距离相似度
SIMILARITY_COSINE,  余弦相似度
SIMILARITY_PEARSON_CORRELATION,皮尔森相似度
SIMILARITY_EUCLIDEAN_DISTANCE, 欧氏距离相似度
具体函数定义参照:http://blog.fens.me/mahout-recommend-engine/
--maxSimilaritiesPerItem (-m), 物品最大相似物品数量,默认是100; 
--maxPrefs (-mppu) ,最大评分,默认是: 500 
--minPrefsPerUser (-mp) ,最小评分,默认是1
--booleanData , false评分 true 0、1
--threshold (-tr) ,相似度过滤     
--randomSeed ,抽样 
--tempDir tempDir ,临时目录 

2) recommenditembased参数
通过mahout  recommenditembased–-help 查看:
--input (-i) input, 设置数据输入路径
--output (-o) output ,设置结果输出路径
--similarityClassname (-s) ,设置相似度计算函数
--numRecommendations (-n) ,每个用户推荐数量,默认10
--usersFile,计算用户推荐结果的用户数据
-- itemsFile,推荐结果只包含该物品列表;
--maxSimilaritiesPerItem (-m), 物品最大相似物品数量,默认是100; 
--maxPrefs (-mppu) ,最大评分,默认是: 500 
--minPrefsPerUser (-mp) ,最小评分,默认是1
--booleanData , false评分 true 0、1
--threshold (-tr) ,相似度过滤     
--filterFile (-f) ,过滤用户推荐物品
--randomSeed ,抽样 
--tempDir tempDir ,临时目录 

1.2. 基于物品的协同过滤推荐

#上传数据
sudo hadoop fs  -put  ./item.txt  /testdata/ input

sudo hadoop fs  -put  ./user.txt  /testdata/ output


# 1、itemsimilarity 相似矩阵计算,只计算相似矩阵

sudo mahout itemsimilarity -i /testdata/ input /item.txt -o /testdata/ output -s SIMILARITY_COOCCURRENCE --tempDir /testdata/temp


# 2、itemsimilarity 输出相似矩阵,推荐结果
sudo mahout recommenditembased -i /testdata/ input /item.txt -o /testdata/ output  --usersFile /testdata/userfile/user.txt -s SIMILARITY_COOCCURRENCE  -n 20  --tempDir /testdata/temp

转载请注明出处:

http://blog.csdn.net/sunbow0/article/details/41962125

Mahout0.9Hadoop2.20—FPG关联规则算法 1. Mahout0.9Hadoop2.20—FPG关联规则算法 1.1. FPG函数 目前Mahout0.9 无fpg函数,0.9之前版本有,但是在0.9中可以找到fpg的jar包; mahout org.apache.mahout.fpm.pfpgrowth.FPGrowthDriver 等价于 fpg; 1) fpg参数(mahout org.apache.mahout.fpm.p 阅读详情

相关推荐

Mahout0.9 ——hadoop2.2.0编译与安装

1. Mahout0.9 ——hadoop2.2.0编译与安装 1.1. 基础准备 1) JDK安装 2) Maven安装 见《1、基础准备(JDK、Maven、服务器配置)》。 1.2. 下载Mahout源码 Mahout官方下载地址: http://archive.apache.org/dist/mahout/   可以直接下载官方已经编译好的包,mahout

Spark MLlib 机器学习 3102

基于Mahout分布式协同过滤推荐算法分析与实现.pdf

#资源达人分享计划#

Hadoop分布式集群环境下Mahout安装和运行K-means、协同过滤实例

Hadoop1.2.1分布式集群环境下安装Mahout0.9框架   友情提醒:大家最好通读一遍过后,在理解的基础上按照步骤一步一步设置,因为后面的会对前面的有所启示。 注意:mahout运行对于环境要求很严格,JDK:jdk-7u55-linux-x64.tar,MAVEN:apache-maven-3.2.1-bin.tar,MAHOUT:mahout-distribution-0.9

自我学习、提升的专栏 3806

机器学习:Mahout协同过滤算法

1、推荐系统 1.1、什么是推荐系统 为了解决信息过载和用户无明确需求的问题,找到用户感兴趣的物品,才有了个性化推荐系统。 1.2、推荐系统业务流程 推荐系统广泛存在于各类网站中,作为一个应用为用户提供个性化的推荐。它需要一些用户的历史数据,一般由三个部分组成:基础数据、推荐算法系统、前台展示。 基础数据包括很多维度,包括用户的访问、浏览、下单、收藏,用户的历史订单信息,评...

yang_shibiao的博客 5756

基于Mahout实现协同过滤推荐算法的电影推荐系统

1 Mahout介绍 Apache Mahout 是 Apache Software Foundation(ASF) 旗下的一个开源项目,提供一些可扩展的机器学习领域经典算法的实现,旨在帮助开发人员更加方便快捷地创建智能应用程序。经典算法包括聚类、分类、协同过滤、进化编程等等,并且,在 Mahout 中还加入了对Apache Hadoop的支持,使这些算法可以更高效的运行在云计算环境中。 ...

bystc的博客 3万+

Cannot resolve symbol 解决方案汇总(6种解决方案)

Cannot resolve symbol 解决方案汇总(6种解决方案)

qq_40698086的博客 22万+

hadoop2.2+mahout0.9实战

版本:hadoop2.2.0mahout0.9。使用mahout的org.apache.mahout.cf.taste.hadoop.item.RecommenderJob进行测试。首先说明下,如果使用官网提供的下载hadoop2.2.0以及mahout0.9进行调用mahout的相关算法会报错。一般报错如下:java.lang.IncompatibleClassChangeError: Fou

fansy1990的专栏 1万+

Hadoop 实现协同过滤算法(1)

最近一直在研究《Mahout in Action》,今天才算是把第一部分看完。在Chapter 6中有一个例子,是实现协同过滤进行推荐的例子,不过书上的是针对布尔值的输入数据,在mahout的安装目录里面也有这个算法的详细源码,但是毕竟是源码,读起来有点晦涩,所以就参考了书上的例子编写了(书上的例子思路比较清楚)不仅仅是布尔值的输入数据的代码; 下面就详细说下思路及代码: 输入数据: 第一列

fansy1990的专栏 8801

基于mahout协同过滤算法实现

基于mahout协同过滤,个性化推荐算法实现。源码是java,可单机运行

基于用户的协同过滤算法Mahout实现

该资源是在Eclipse平台里,使用Mahout库的API,实现基于用户的协同过滤算法,从而进行商品推荐。 软件环境是:win7 64位 +Eclipse4.4 + jdk1.6, 用到了7个.jar包, 分别为:commons-logging-1.2.jar, commons-math3-3.5.jar,guava-18.0.jar,mahout-core-0.9.jar, mahout-math-0.9.jar,slf4j-api-1.6.1.jar,slf4j-jcl-1.6.1.jar。

Mahout推荐算法API详解

前言 用Mahout来构建推荐系统,是一件既简单又困难的事情。简单是因为Mahout完整地封装了“协同过滤算法,并实现了并行化,提供非常简单的API接口;困难是因为我们不了解算法细节,很难去根据业务的场景进行算法配置和调优。 本文将深入算法API去解释Mahout推荐算法底层的一些事。 目录 Mahout推荐算法介绍 算法评判标准:召回率与准确率 Recommender.java的A

zhoubl668的专栏:远帆,梦之帆! 7万+

Centos6.5 + Hadoop2.2.0 + Mahout安装(Maven & 发布版安装)

Mahout 简介  Mahout 是 Apache Software Foundation(ASF) 旗下的一个开源项目,提供一些可扩展的机器学习领域经典算法的实现,旨在帮助开发人员更加方便快捷地创建智能应用程序。Apache Mahout项目已经发展到了它的第三个年头,目前已经有了三个公共发行版本。Mahout包含许多实现,包括聚类、分类、推荐过滤、频繁子项挖掘。此外,通过使用 Apache H

Zephyr's Blog 2114

利用Mahout实现在Hadoop上运行K-Means算法

K-Means算法是基于分划分的最基本的聚类算法,是学习机器学习、数据挖掘等技术的最基本的 知识,所以掌握其运行原理是很重要的。     转载请注明出处: http://hanlaiming.freetzi.com/?p=144     一、介绍Mahout     Mahout是Apache下的开源机器学习软件包,目前实现的机器学习算法主要包含有协同过滤/推荐引擎,聚类和分类三

summerhai 2940

Mahout介绍和简单应用

Mahout学习(主要学习内容是Mahout中推荐部分的ItemCF、UserCF、Hadoop集群部署运行) 1.Mahout是什么? Mahout是一个算法库,集成了很多算法。 Apache Mahout 是 Apache Software Foundation(ASF)旗下的一个开源项目,提供一些可扩展的机器学习领域经典算法的实现,旨在帮助开发人员更加方便快捷地创建智能应用程序。 Mah...

Null的博客 5074

hadoop2.5.2 mahout0.10.1 测试文本分类器

hadoop2.5.2 mahout0.10.0 文本分词 http://my.oschina.net/u/1047640/blog/262468 mmseg4j-solr-2.2.0.jar,mmseg4j-core-1.9.1.jar,mmseg4j-analysis-1.9.1.jar http://download.csdn.net/detail/lu

Landebug的博客 5823

hadoopmahout kmeans算法研究(2

KMeans算法和简单命令使用(2)   接上篇:hadoopmahout-kmeans算法研究(1)   如果对本文档有任何建议或者认为有错误的地方欢迎联系本人 大家一起进步啊 红色的字体:重点和注意事项 蓝色的字体:出现的问题和解决/未解决 绿色的字体:个人建议 数据输入格式 测试数据         每个数据和数据之间用空格分开,数据都是double型的  ...

张大彪的专栏 9705

hadoop(十三) - mahout安装与使用

. mahout简介: Mahout 是一个很强大的数据挖掘工具,是一个分布式机器学习算法的集合,包括:被称为Taste的分布式协同过滤的实现、分类、聚类等。Mahout最大的优点就是基于hadoop实现,把很多以前运行于单机上的算法,转化为了MapReduce模式,这样大大提升了算法可处理的数据量和处理性能。 以下为在mahout实现的机器学习算法算法

技术人生 6768
上一篇: Mahout0.9 ——hadoop2.2.0编译与安装
下一篇: Mahout0.9—Hadoop2.20—FPG关联规则算法
sunbow0
博客等级 码龄12年 989粉丝 54原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值