上一页 1 ··· 4 5 6 7 8
摘要: 文章目录背景介绍文章翻译Abstract 摘要Keywords 关键词INTRODUCTION 简介RELATED WORK 相关工作DATA PREPROCESSING AND INITIAL ANALYTICS 数据预处理与初始分析DETECTION R... 阅读全文
posted @ 2019-02-17 20:09 LestatZ 阅读(1150) 评论(0) 推荐(0)
摘要: 文章目录环境准备主要工具/软件Git 安装IntelliJ IDEA 下载及 Scala 插件安装sbt 安装基本步骤获取git目录在IDEA中构建sparkIDEA中查看代码环境准备主要工具/软件gitIntellij IDEA & Scala Plugi... 阅读全文
posted @ 2019-02-17 18:22 LestatZ 阅读(689) 评论(0) 推荐(0)
摘要: 文章目录 问题描述 原因分析 解决方法 文章目录 问题描述 原因分析 解决方法 问题描述 原因分析 解决方法 问题描述 原因分析 解决方法 问题描述 项目中需要利用Pig MongoLoader将MongoDB里面的数据每日增量备份到hive的外部分区表中,但是在检查hdfs文件发现分区文件夹下产生 阅读全文
posted @ 2019-02-16 22:08 LestatZ 阅读(258) 评论(0) 推荐(0)
摘要: 一开始使用yarn-client模式提交作业时一切正常,但换成cluster模式下 使用sparksql方法执行hive查询语句时,却出现了如下的OOM问题: 出现这个错误原主要原因是太多的类或者太大的类都被加载到永久代,导致存储器中永久代的内存耗尽。而我们这里主要是因为SparkSql在获取Hiv 阅读全文
posted @ 2019-02-16 21:03 LestatZ 阅读(1621) 评论(0) 推荐(0)
摘要: 简介Teradata数据库 (以下简称TD) 为存储和处理XML数据提供以下支持:XML数据类型,允许用户以紧密二进制形式存储XML内容,用来保留XML文档的信息集支持常见XML操作,如解析,验证,转换(XSLT)和查询(XPath和XQuery)等和方法用... 阅读全文
posted @ 2019-02-16 12:11 LestatZ 阅读(337) 评论(0) 推荐(0)
摘要: 文章目录问题概述主要思路NotesUse external python packageRPM packageUsing rpm2cpio (Recommended)Test python package using `export PYTHONPATH`B... 阅读全文
posted @ 2019-02-16 12:09 LestatZ 阅读(733) 评论(2) 推荐(0)
摘要: 工作上需要研究Teradata CLOB类型,因为去看了官方文档,自己做了点笔记如下:Teradata数据压缩概况本章描述了几种数据压缩选项,它能够帮助你减少磁盘空间的使用,在某种情况下,还可以提高I/O性能。多值压缩(MVC)算法压缩(ALC)行压缩行标题... 阅读全文
posted @ 2019-02-16 11:59 LestatZ 阅读(481) 评论(0) 推荐(0)
摘要: 因工作需要需要且身边没有windows系统的笔记本,无奈只好在mac上利用虚拟机安装一个win7系统作为临时过渡。我使用的虚拟机软件是Parallels Desktop(以下简称PD)PD提供三种不同网络模式供用户选择:共享网络(推荐)桥接网络Host-On... 阅读全文
posted @ 2019-02-16 11:39 LestatZ 阅读(933) 评论(0) 推荐(0)
上一页 1 ··· 4 5 6 7 8