主题
大数据
8 篇文章
-
Kafka快速入门
Apache Kafka 分布式消息发布订阅系统入门。核心概念(Topic、Producer、Consumer、Broker)、日志分区设计、消费者组、容错机制、实操演示。
-
大数据生态技术体系概览:Hadoop、Hive、Spark 的关系与对标
大数据技术生态的全景解读。从存储(HDFS)、计算(MapReduce/Spark/Tez)、查询(Hive/Impala)、学习(Mahout)多角度讲解技术栈及演进路线。
-
基于 Spark 的文本情感分析
基于 Spark 构建的文本情感分析系统实现。从数据预处理、特征提取、模型训练到分类预测的完整流程,使用 Naïve Bayes 和 SVM 算法。
-
MongoDB + Spark: 完整的大数据解决方案
MongoDB 与 Spark 的完整大数据解决方案。包括 Spark 生态系统架构、MongoDB vs HDFS 对比、Spark-MongoDB 连接器、实时运价系统案例。
-
SQL语句中JOIN ON和WHERE用法的区别和联系
详细说明SQL中JOIN ON和WHERE条件的执行顺序差异,及其对LEFT JOIN和INNER JOIN查询效率的影响。
-
SQL中Left Join、Right Join、Inner Join、Full Join的区别
对SQL中四种JOIN操作的类型和执行结果进行对比说明,通过建表示例演示各种JOIN的差异。
-
工厂任务错误的处理方法记录
在数据处理工厂中遇到的常见问题和解决方法记录,涉及空值过滤、粘贴操作陷阱、LEFT JOIN条件使用和任务重跑等问题。
-
hive查询任务出现no reduce operator错误解决办法
解决Hive在执行简单查询时出现"no reduce operator"错误,通过设置fetch任务转换参数来解决问题。