大数据
文章平均质量分 93
大数据
飞Link
大数据厨艺工程师,一个文艺的程序员
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
【大数据】SparkSQL常用操作
本文介绍了SparkSQL常用操作,包括查询语法(基本查询、选择特定列、多表连接)、数据过滤与排序(WHERE、ORDER BY、LIMIT)、聚合操作(GROUP BY、HAVING、聚合函数)、去重操作(DISTINCT)、连接操作(INNER/LEFT/RIGHT/FULL JOIN)、子查询与联合查询以及窗口函数等。文章还提供了SQL优化技巧,帮助提升查询性能。SparkSQL作为Spark处理结构化数据的重要模块,支持丰富的SQL语法,适用于大数据环境下的高效数据处理需求。原创 2026-01-13 15:08:47 · 1481 阅读 · 0 评论 -
【Hadoop】HDFS 使用教程:从核心原理到工程实战的完整指南
本文全面介绍了Hadoop分布式文件系统(HDFS)的核心概念与工程实践。内容涵盖HDFS架构原理、环境配置、常用命令操作、文件读写流程,以及日志存储分析等实战案例。重点讲解了HDFS适合处理大文件顺序读写的特性,提供了副本管理、回收站设置等高级技巧,并总结了常见错误排查方法。文章强调HDFS在大数据体系中的基础地位,同时指出其不适合小文件和随机访问场景的局限性,为开发者提供了从理论到实践的完整指导。原创 2026-01-12 11:10:42 · 2214 阅读 · 0 评论 -
【Sqoop】Sqoop 使用教程:从原理到实战的完整指南
本文介绍了Apache Sqoop工具的使用教程,涵盖从原理到实战的完整指南。Sqoop主要用于关系型数据库与Hadoop生态系统之间的数据交换,适合批处理场景而非实时同步。文章详细讲解了Sqoop的架构原理、安装配置、常用命令(包括导入导出操作)、项目实战案例(MySQL与Hive数据同步)以及高级使用技巧。同时提供了常见错误排查思路和实际工作经验总结,最后给出最佳实践示例。本文可作为离线数仓建设中数据同步的实用参考手册,帮助读者掌握Sqoop在数据处理中的应用方法。原创 2026-01-12 11:08:02 · 1420 阅读 · 0 评论
分享