-
pyhive 连接 Hive 时错误
所属栏目:[大数据] 日期:2020-12-25 热度:178
一、User: xx is not allowed to impersonate xxx' 解决办法:修改 core-site.xml 文件,加入下面的内容后重启 hadoop 。 property namehadoop.proxyuser.xx.hosts/name value*/value/propertyproperty namehadoop.proxyuser.xx.groups/name value*/value/pr[详细]
-
分布式基础通信协议:paxos、totem 和 gossip(转载)
所属栏目:[大数据] 日期:2020-12-25 热度:84
背景: 在分布式中,最难解决的一个问题就是多个节点间数据同步问题。为了解决这样的问题,涌现出了各种奇思妙想。只有在解决了如何进行信息同步的基础之上才衍生出形形色色的应用。这里开始介绍几种分布式通信协议。 简单即有效——totem协议: totem协议也[详细]
-
Hive 导入 parquet 格式数据
所属栏目:[大数据] 日期:2020-12-25 热度:200
Hive 导入 parquet 数据步骤如下: 查看 parquet 文件的格式 构造建表语句 倒入数据 一、查看 parquet 内容和结构 下载地址 社区工具 GitHub 地址 命令 查看结构: java -jar parquet-tools-1.6.0rc3-SNAPSHOT.jar schema -d activity.201711171437.0.parque[详细]
-
Presto 常用配置及操作
所属栏目:[大数据] 日期:2020-12-25 热度:187
一、介绍 Presto是一个开源的分布式SQL查询引擎,适用于交互式分析查询,数据量支持GB到PB字节。 Presto的设计和编写完全是为了解决像Facebook这样规模的商业数据仓库的交互式分析和处理速度的问题。 推荐阅读 Presto实现原理和美团的使用实践 二、安装 2.1[详细]
-
大数据的技术生态概述(转载)
所属栏目:[大数据] 日期:2020-12-25 热度:173
如何用形象的比喻描述大数据的技术生态?Hadoop、Hive、Spark 之间是什么关系? 大数据本身是个很宽泛的概念,Hadoop生态圈(或者泛生态圈)基本上都是为了处理超过单机尺度的数据处理而诞生的。你可以把它比作一个厨房所以需要的各种工具。锅碗瓢盆,各有各[详细]
-
九种常见的数据分析模型
所属栏目:[大数据] 日期:2020-12-25 热度:131
1. 漏斗分析模型 漏斗分析是一套流程式数据分析,它能够科学反映用户行为状态以及从起点到终点各阶段用户转化率情况的重要分析模型。 运营人员可以通过观察不同属性的用户群体(如新注册用户与老客户、不同渠道来源的客户)各环节转化率,各流程步骤转化率的[详细]
-
大数据领域常用技术栈
所属栏目:[大数据] 日期:2020-12-25 热度:71
提起大数据,不得不提由IBM提出的关于大数据的5V特点:Volume(大量)、Velocity(高速)、Variety(多样)、Value(低价值密度)、Veracity(真实性),而对于大数据领域的从业人员的日常工作也与这5V密切相关。大数据技术在过去的几十年中取得非常迅速的发[详细]
-
Databricks说的Lakehouse是什么?
所属栏目:[大数据] 日期:2020-12-25 热度:188
? 在过去的几年里,Lakehouse作为一种新的数据管理范式,已独立出现在Databricks的许多用户和应用案例中。在这篇文章中,我们将阐述这种新范式以及它相对于之前方案的优势。 数据仓库在决策支持和商业智能应用方面有着悠久的历史。自20世纪80年代末问世以来[详细]
-
[编程题]数字翻转(大数加法)
所属栏目:[大数据] 日期:2020-12-25 热度:76
对于一个整数X,定义操作rev(X)为将X按数位翻转过来,并且去除掉前导0。例如: 如果 X = 123,则rev(X) = 321; 如果 X = 100,则rev(X) = 1. 现在给出整数x和y,要求rev(rev(x) + rev(y))为多少?? 输入描述: 输入为一行,x、y(1 ≤ x、y ≤ 1000),以空格隔开[详细]
-
[bigdata-036] mit-scheme试用
所属栏目:[大数据] 日期:2020-12-25 热度:102
1. 安装Mit-scheme apt-get install mit-scheme 2. 写一个hello wold代码, hi.scm (begin (display "Hello,World!") (newline)) 3. 在命令行执行 scheme,进入交互界面,然后输入命令 (load 'hi.scm') 将执行这个文件,然后输出 "Hello,World!" 4. scheme语[详细]
-
[bigdata-037] docker hue 用SQL获取数据以及可视化
所属栏目:[大数据] 日期:2020-12-25 热度:65
1. hue官网 https://github.com/cloudera/hue http://gethue.com/ 2. hue的功能 有py2+django开发,提供Hive,Impala,MySQL,Oracle,PostgreSQL,Spark SQL,Solr SQL,Phoenix...等SQL数据获取和页面展示 3. 用docker 安装hue docker pull gethue/hue 4. hue ima[详细]
-
[bigdata-037]apache hue 用SQL获取数据以及可视化
所属栏目:[大数据] 日期:2020-12-25 热度:68
1. hue官网 https://github.com/cloudera/hue http://gethue.com/ 2. hue的功能 有py2+django开发,提供Hive,Impala,MySQL,Oracle,PostgreSQL,Spark SQL,Solr SQL,Phoenix...等SQL数据获取和页面展示 3. 用docker 安装hue docker pull gethue/hue 4. hue ima[详细]
-
[bigdata-038] tushare 金融数据 安装使用
所属栏目:[大数据] 日期:2020-12-25 热度:113
1. 安装 pip install tushare 2. 获取股票的基本面 #!/usr/bin/env python3#!-*- coding:utf-8 -*-import tushare as ts#显示基本信息res = ts.get_stock_basics()print(res)print(type(res)) res是的类型是pandas.core.frame.DataFrame,3114? x 22 的矩阵[详细]
-
3.21.1、BI之SSIS之数据流转换(渐变维度-混合模式)
所属栏目:[大数据] 日期:2020-12-25 热度:106
BI之SSIS之数据流转换(渐变维度-混合模式) ? ? 1??????????3.21中介绍了普通模式的渐变维度,即通过时间标志来对维度属性值的变化进行记录,这种方式可以很直观的看到变化的时间点,但是在使用时却比较麻烦,因为你需要通过时间字段去判断 ? 2??????????这[详细]
-
[bigdata-039] pysql+pymongo+py3把数据从sql 导入 到mongo的通
所属栏目:[大数据] 日期:2020-12-25 热度:173
#!/usr/bin/env python3#! coding:utf-8 -*-import pymysqlimport pymongodef trans_data_from_mysql_to_mongo(source_param,target_param,trans_type,where_clause,ignore_columns=[]): # 创建mysql连接 mysql_conn = pymysql.connect(host=source_param['d[详细]
-
使用机器学习和大数据预测心脏病
所属栏目:[大数据] 日期:2020-12-25 热度:107
编者按: 现在公众号有置顶功能了,大家把微信更新到最新版本,点开“大数据实验室”公众号。点“ 置顶公众号 ”键,就可以置顶了,这样。不管我们什么时候更新,您都能容易找到。 大数据和机器学习的组合是一项革命性的技术,如果以恰当的方式使用它,它可[详细]
-
[bigdata-040] cloudera manager web服务故障处理
所属栏目:[大数据] 日期:2020-12-25 热度:136
1. cloudera manager的web服务挂了 2. 根据文档进行重启 https://www.cloudera.com/documentation/enterprise/5-4-x/topics/cm_ag_server.html sudo service cloudera-scm-server start 无效,在10.14.x.x:7180上没有服务 lsof -i:7180上能看到端口占用。 检[详细]
-
HDU 2054 大数比较
所属栏目:[大数据] 日期:2020-12-25 热度:96
题目传送门:http://acm.hdu.edu.cn/showproblem.php?pid=2054 ???? ?? A这个水题也没有什么意思,主要巩固前面Java大数类和一些方法的学习。 ??? ?? 题目如果直接用Java.Biginteger.equals()方法的话会WA,在API说明里面,对于2.00,和2.0值相等,标度不等[详细]
-
文思海辉与达梦完成产品兼容互认证
所属栏目:[大数据] 日期:2020-12-18 热度:110
继文思海辉与国产IT厂商南大通用、数腾软件完成产品兼容互认证,近日,文思海辉又与武汉达梦数据库股份有限公司(以下简称:达梦公司)完成产品兼容性互认证。[详细]
-
净利润同比下滑超60%,少了小米后华米科技能否独立“行走”?
所属栏目:[大数据] 日期:2020-12-18 热度:157
北京时间11月23日美股盘前,华米科技发布了2020财年第三季度的财务报告。在财报发布后,华米科技当天盘前股价累计下跌7.6%。在23日美股三大股指集体收涨情况下,[详细]
-
奏响5G“主旋律”,MWC将于明年2月重返上海
所属栏目:[大数据] 日期:2020-12-18 热度:178
如果没有因为疫情而停办,2021年将是MWC世界移动通信大会落地上海的第十年。按计划,它将在明年的6月份举办。但由于疫情的影响,2020年的MWC上海展没能如期举行,或许也因为如此,明年的大会比原计划来得更早一些。 据主办方GSMA近日宣布,2021年MWC上海展[详细]
-
戴尔全新产品搭载新一代NVIDIA高性能显卡
所属栏目:[大数据] 日期:2020-12-18 热度:198
历经数次迭代升级,戴尔于近日推出多款重磅新品。搭载新一代NVIDIA GeForce RTX 3070显卡的全新ALIENWARE Aurora游戏台式机、戴尔XPS设计旗舰台式机、G5智能电竞台式机,以更加强悍的性能、令人惊叹的视觉效果及极致的细节功能,为游戏爱好者打造了栩栩如[详细]
-
字节跳动Byte Camp冬令营报名启动,高质量赛题带你线下备战ICPC!
所属栏目:[大数据] 日期:2020-12-18 热度:132
12月7日,字节跳动 Byte Camp 冬令营宣布回归,开启第三期训练营报名。 Byte Camp 冬令营是针对ACM国际大学生程序设计竞赛(ICPC),面向全球顶尖高校在校生举办的国际顶级训练营,旨在提高 ICPC 参赛者竞赛实力,并为所有计算机精英提供国际性的技术交流[详细]
-
第十届吴文俊人工智能科学技术奖名单出炉 云天励飞荣获一等奖
所属栏目:[大数据] 日期:2020-12-18 热度:181
日前,2020年度第十届吴文俊人工智能科学技术奖获奖名单正式出炉,云天励飞荣获吴文俊人工智能专项奖芯片项目一等奖。 吴文俊人工智能科学技术奖被誉为中国智能科学技术最高奖,是人工智能领域的最高荣誉象征。 值得一提的是,这是云天励飞第二次斩获吴文[详细]
-
持续赋能人工智能产业生态 英特尔AI百佳创新激励计划硕果累累
所属栏目:[大数据] 日期:2020-12-18 热度:190
当前,人工智能市场快速发展,又调查数据显示,全球人工智能市场的规模2020年超过1500亿美金,并且未来几年保持17%的年增长率。而在中国,人工智能成为我国产业升级和经济转型的一个主要动力,计划到2025年核心产业规模超过4000亿,带动相关的产业规模超过[详细]
