在Hadoop分布式集群环境下Mahout安装和运行K-means、协同过滤实例

Mahout分布式程序开发 基于物品的协同过滤ItemCF 前言 MahoutHadoop家族中一员,从血缘就继承了Hadoop程序的特点,支持HDFS访问MapReduce分布式算法。随着Mahout的发展,从0.7版本开始,Mahout做了重大的升级。移除了部分算法的单机内存计算,只支持基于Hadoop的MapReduce平行计算。目录 mahout开发环境介绍 Mahout基于Hadoop分布式计算环境介绍 用Mahout实现协同过滤Item 阅读详情

在Hadoop分布式集群环境下Mahout安装和运行Kmean、协同过滤实例

 

友情提醒:大家最好通读一遍过后,在理解的基础上按照步骤一步一步设置,因为后面的会对前面的有所启示。

注意:mahout运行对于环境要求很严格,JDK:jdk-7u55-linux-x64.tar,MAVEN:apache-maven-3.2.1-bin.tar,MAHOUT:mahout-distribution-0.9-tar.gz,HADOOP:hadoop-1.2.1.tar.gz (mahout0.9 依赖于hadoop1.0以上的版本,否则运行起来会出现各种报错!!!)

一、前提条件

Hadoop1.2.1分布式集群环境搭建成功,并且Hadoop集群服务器正常运行。

二、所需环境和软件

1. Hadoop分布式集群环境:

见《在VMware下安装Ubuntu并部署Hadoop1.2.1分布式环境》。

2.  Maven3.2.1  apache-maven-3.2.1-bin.tar.gz下载地址:http://maven.apache.org/

3. Mahout0.9框架: mahout-distribution-0.9.tar.gz

4. 测试数据(自行下载,并另存为 synthetic_control.data.txt 格式):

http://archive.ics.uci.edu/ml/databases/synthetic_control/synthetic_control.data

三、安装Mahout和Maven

1. 拷贝下载下来的mahout-distribution-0.9.tar.gz包,和apache-maven-3.2.1-bin.tar.gz到Hadoop集群的masters机器的桌面上。

2. 解压mahout-distribution-0.9.tar.gz包,解压有二种方法。

方法一:分别使用命令 tar -zxvf mahout-distribution-0.9.tar.gz和tar -zxvf apache-maven-3.2.1-bin.tar.gz

       

3. 移动生成的mahout-distribution-0.9和maven-3.2.1文件夹到mahout(新建一个mahout文件夹,使用指令:mkdir mahout)下,。

sudo mv mahout-distribution-0.9 mahout

sudo  mvmaven-3.2.1    maven    (名字太长了,把它改成mahout

单机环境及分布式环境下K-Means聚类算法运行实例   单机环境下的K-Means聚类算法运行实例 参考书籍《Mahout in Action》:要资源的可以找我~(中英文都有) 在eclipse平台上实现K-Means实例 代码如下: package kmeans; import java.io.File; import java.io.IOException; import java.util.ArrayList; import ... 阅读详情

相关推荐

Mahout原理与代码实例讲解

Mahout原理与代码实例讲解 关键词: Mahout是Apache开源项目下的一个机器学习库,专注于提供分布式环境下海量数据的机器学习算法。它主要面向大数据处理需求,提供了一系列用于推荐系统、聚类、分类、关联规则挖掘等任务的算法。本文旨在深入剖析Mahout的核心原理、算法实现以及具体代码实例

AI天才研究院 793

基于Hadoop-Mahout分布式课程推荐算法.pdf

#资源达人分享计划#

Hadoop机器学习实战:Mahout算法库应用指南

随着企业级数据规模突破PB级别,传统单机版机器学习框架在扩展性容错性上面临严峻挑战。Apache Mahout作为Hadoop生态中首个分布式机器学习库,提供了基于MapReduce的可扩展算法实现,成为处理大规模数据集的重要工具。本文将从技术原理、算法实现、实战案例三个维度,全面解析Mahout在推荐系统、聚类分析、分类预测等核心场景的应用方法,覆盖从环境搭建到性能优化的全流程。技术原理:解析Mahout架构设计与核心算法分布式实现逻辑数学基础。

欢迎来到我的CSDN空间!这里聚焦AI大模型应用实战,分享前沿技术、实战案例与开发经验。 977

基于kmeans聚类的协同过滤推荐算法(包含聚类结果、推荐结果、MAE值)

1、解压下载的CollaborativeFilteringBasedUserKmeans压缩文件 2、操作系统中需装java jdk1.7或者以上版本 3、点击start.bat,在运行过程中,会输出聚类结果,然后输出用户id进行推荐,mae值

Spark高级认证

一、K-Means聚类算法 1、K-Means聚类算法介绍 1、算法接受参数k ;然后将事先输入的n个数据对象划分为k个聚类以便使得所获得的聚类满足∶同一聚类中的对象相似度较高;而不同聚类中的对象相似度较小。 2、算法思想:以空间中k个点为中心进行聚类,对最靠近他们的对象归类。通过迭代的方法,逐次更新各聚类中心的值,直至得到最好的聚类结果 2、K-Means聚类算法步骤 1、先从元素集合A中随机取k个元素,作为k个子集各自的重心。 2、分别计算剩下的元素到k个子集重心的距离,根据距离将这些元素分别划归到最近

源源源的博客 575

基于KMeans聚类的协同过滤推荐算法推荐原理、过程、代码实现 Canopy聚类算法 KMeans+Canopy聚类算法 聚类算法程序实现 KMEans聚类算法代码java

基于KMeans聚类的协同过滤推荐算法可运用于基于用户基于项目的协同过滤推荐算法中,作为降低数据稀疏度提高推荐准确率的方法之一,一个协同过滤推荐过程可实现多次KMeans聚类。 一、基于KMeans聚类的协同过滤推荐算法推荐原理 KMeans聚类算法是聚类算法中最基础最常用、最重要的聚类算法。KMeans聚类算法首先需要确定N个初始中心点,初始中心点的选择对聚类结果影响很大,常用的初始中心点的...

linge511873822的博客 5886

大数据专业-基于协同过滤算法的个性化推荐系统

毕业设计-基于协同过滤算法的个性化推荐系统:大数据时代下互联网的应用使人们的生活更 加便捷与智能化。 但随之而来的“信息过载”问题 亟需解决,此时推荐系统应运而生。 协同过滤作为个性化推荐系统中应用较为广泛的一种算 法,因经常面临数据稀疏性算法扩展性问题,近 年来备受关注。 因此,协同过滤算法的优化成为了 国内外学者的研究热点。 针对数据稀疏性问题,一些学者通过降维的方法来缓解稀疏性,提出了基于矩阵分解的迭代最小二乘加权正 则化协同过滤算法,对传统矩阵分解模型加入正则 化约束以防止过拟合; 还 有一些学者

Hai_Lang_IT的博客 4761

基于用户评分Kmeans聚类的协同过滤推荐算法实现(附源代码)

基于用户评分Kmeans聚类的协同过滤推荐算法实现 一:基于用户评分Kmeans聚类的协同过滤推荐算法实现步骤 1、构建用户-电影评分矩阵: public Object readFile(String fileName){ List<String> user = new ArrayList<String>(); double[][] weigh...

linge511873822的博客 8196

Hadoop1.2.1分布式集群环境安装Mahout0.9框架

Hadoop1.2.1分布式集群环境安装Mahout0.9框架   友情提醒:大家最好通读一遍过后,在理解的基础上按照步骤一步一步设置,因为后面的会对前面的有所启示。 一、前提条件 Hadoop1.2.1分布式集群环境搭建成功,并且Hadoop集群服务器正常运行。 二、所需环境软件 1. Hadoop分布式集群环境: 见《在VMware下安装Ub

摩西YF拉比 404

Mahout学习之Mahout简介、安装、配置、入门程序测试

标签: mahout 学习 mahout | 发表时间:2014-04-27 10:56 | 作者:wl101yjx 分享到: 出处:http://blog.csdn.net 一、Mahout简介 查了Mahout的中文意思——驭象的人,再看看Mahout的logo,好吧,想小黄象happy地玩耍,得顺便陪陪这位驭象人耍耍了... 附logo: (就是他,骑在象头上的

自我学习、提升的专栏 841

Hadoop 2.6.0+Hbase1.12+mahout0.9 集群搭建

Hadoop 2.6.0+Hbase1.12+mahout0.9 集群搭建,自己写的,可以根据实际情况搭建伪分布式或者完全分布式

基于类别偏好Canopy-K-means协同过滤推荐系统算法

协作过滤算法(CF)在推荐系统中难以处理数据的稀疏性可伸缩性问题。本文提出了基于类别偏好Canopy-K-means协同过滤算法(CPCKCF),设计了用户项类别偏好比率(UICPR)的定义,并用来计算UICPR矩阵。将Canopy算法作为CPCKCF的前置算法,并将输出作为K-means算法的输入,其结果用于用户数据进行聚类并找到最近的用户以获得预测得分,使用MovieLens数据集进行的实验结果表明,与传统的基于用户的协作过滤算法相比,所提出的CPCKCF算法将计算效率推荐精度提高了2.81%。

mahout中k-means例子的运行

首先简单说明下,mahout下处理的文件必须是SequenceFile格式的,所以需要把txtfile转换成sequenceFile。SequenceFile是hadoop中的一个类,允许我们向文件中写入二进制的键值对,具体介绍请看eyjian写的http://www.hadoopor.com/viewthread.php?tid=144&highlight=sequencefile

西二旗小码农 2809

Mahout K-means clustering 入门

Mahout下处理的文件必须是SequenceFile格式的,所以需要把txtfile转换成sequenceFile。SequenceFile是Hadoop中的一个类,允许我们向文件中写入二进制的键值对。       Mahout中提供了一种将指定文件下的文件转换成sequenceFile的方式。(You may find Tika (http://lucene.apache.org/tika)...

The Best or Nothing! 220
上一篇: Python3 入门教程 简单但比较不错
下一篇: 39个让你受益的HTML5教程
十三月下
博客等级 码龄12年 10粉丝 10原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值