-
[bigdata-048] git使用 上
所属栏目:[大数据] 日期:2020-12-25 热度:170
0. 主要参考 http://www.liaoxuefeng.com 1. git是分布式版本管理器,每个人的电脑都是一个完整的版本库。你修改了文件A,你同事修改了文件A,你们可以将各自的修改推给对方,可以互相看到对方的修改。 2. 创建版本库repository ? 2.1 在一个合适的地方,创[详细]
-
商业智能BI和报表的区别?
所属栏目:[大数据] 日期:2020-12-25 热度:88
报表是数据展示工具,商业智能BI是数据分析工具。 报表工具是一类报表制作工具和数据展示工具,用于制作各类数据报表、图形报表。或者制作特定格式的电子发票联、流程单、收据等等。 商业智能的重点在于商业数据的分析,集成了数据统计、数据展示、数据分析[详细]
-
大数运算(大数加法and大数乘法)
所属栏目:[大数据] 日期:2020-12-25 热度:110
大数模板 -- 万进制 为基础的 模板 #include algorithm#include stdlib.h#include cstring#include iostream#include stdio.h#define ll long long#define MAXN 10000#define DELD 4using namespace std;int a[MAXN];int b[MAXN];struct Bignum{ int len; in[详细]
-
如何打造高性能大数据分析平台
所属栏目:[大数据] 日期:2020-12-25 热度:127
原文:Building High Performance Big Data Analytics Systems 作者:Rohit Dhall 译者:袁璞,圣特尔?E店宝大数据架构师,关注高性能或可用架构、大数据技术、机器学习。 转自:CSDN 导读 大数据分析系统作为一个关键性的系统在各个公司迅速崛起,但是这种[详细]
-
nyoj517 最小公倍数 (大数)
所属栏目:[大数据] 日期:2020-12-25 热度:111
描述 为什么1小时有60分钟,而不是100分钟呢?这是历史上的习惯导致。 但也并非纯粹的偶然:60是个优秀的数字,它的因子比较多。 事实上,它是1至6的每个数字的倍数。即1,2,3,4,5,6都是可以除尽60。 我们希望寻找到能除尽1至n的的每个数字的最小整数m. 输入[详细]
-
撇开技术,初识实时数据处理
所属栏目:[大数据] 日期:2020-12-25 热度:84
hello!艾瑞巴蒂! 今天俺给大家换换心情,撇开技术,聊聊实时数据处理的前世今生。 曾经有那么几年的光阴,整个业界(大数据)言必称Hadoop,撩个妹不懂点Hadoop都被人看不起。 当然,hadoop在海量数据处理上绝对是毫无争辩的霸主: 比如 百度用户短时间对[详细]
-
BigData学习4_内部攻击实验数据集浅析
所属栏目:[大数据] 日期:2020-12-25 热度:133
杨光+吴钰 摘要:获取用户行为数据集是内部威胁研究的前提和基础,该文深度调研了当今公开的内部威胁实验数据集,通过分析KDD99、SEA、WUIL以及CERT-IT四种主流的数据集,提出上述数据集的优缺点,并指出未来数据集构建的研究方向。 关键词:内部威胁;网络[详细]
-
情人节福利!那些“浪(zhuang)漫(bi)”的程序员情书
所属栏目:[大数据] 日期:2020-12-25 热度:189
情人节到来,小编为大家准备了几篇只有程序员才看得懂的情书。小编祝天下有情人终成眷属! 情书正文 ?do?{?a++;?b++;}?while(a??b); 我和你原本就是两个世界的人,一直都在不停的向前走。 直到有一天在某一刻相遇,我们才在彼此的世界里相拥, 然后追寻着各[详细]
-
内衣大数据分析:透过女生内衣的需求变化,看年轻人的情趣生活
所属栏目:[大数据] 日期:2020-12-25 热度:103
报道大数据企业: 大数据产品、大数据方案、 ? 大数据人物 分享大数据干货: 大数据书籍、大数据报告、 大数据视频 本文系大数据人精选自网络。 欢迎更多优质原创文章投稿给大数据人:admin@bigdata.ren 小编微信:data985 End. 版权声明 : 由“大数据人”[详细]
-
[bigdata-041] python3+re 正则表达式 手机号微信号qq号
所属栏目:[大数据] 日期:2020-12-25 热度:64
import reREGEX_PHONE = re.compile(r'1d{10}',re.IGNORECASE)REGEX_QQ = re.compile(r'[1-9]d{4,10}',re.IGNORECASE)REGEX_WX1 = re.compile(u'微信[w,-]{1,20}'.encode('utf8'),re.IGNORECASE)#正则手机号码def get_all_phone_num(s1): global REGEX_PH[详细]
-
数据挖掘:手把手教你做文本挖掘
所属栏目:[大数据] 日期:2020-12-24 热度:106
1 文本挖掘定义 文本挖掘指的是从文本数据中获取有价值的信息和知识,它是数据挖掘中的一种方法。文本挖掘中最重要最基本的应用是实现文本的分类和聚类,前者是有监督的挖掘算法,后者是无监督的挖掘算法。 ? 2 文本挖掘步骤 1)读取数据库或本地外部文本文[详细]
-
蓝桥杯-区间k大数查询
所属栏目:[大数据] 日期:2020-12-24 热度:140
从题目上看,用int类型数据就够了,没必要考虑long这些~~ 在题目中,直接用了Collection工具类中的sort方法,是从小到大排序,据了解,Java自带的排序算法应该是优化过的快速排序,算法可靠。 package 区间k大数查询 ; import java .util .ArrayList ; impor[详细]
-
数据挖掘中的模式发现(五)挖掘多样频繁模式
所属栏目:[大数据] 日期:2020-12-24 热度:55
挖掘多层次的关联规则(Mining Multi-Level Associations) 定义 项经常形成层次。 如图所示 那么我们可以根据项的细化分类得到更多有趣的模式,发现更多细节的特性。 Level-reduced min-support 使用的是Level-reduced min-support方法来设置最低支持度,即,[详细]
-
关于评论话题挖掘的研究及其实现代码(一)LDA
所属栏目:[大数据] 日期:2020-12-24 热度:162
引言 在 2016年中,我们参加了一个由厦门信研院举办的大数据比赛。当时,我们拿到的题目为影迷关注点分析。数据是来自于微博与豆瓣的影迷评论数据,其数据量达600多万条评论数据,分别对应于2000多部不同的电影。我们的想法是将影迷关注点分析尽量往评论话题[详细]
-
数据挖掘中的模式发现(六)挖掘序列模式
所属栏目:[大数据] 日期:2020-12-24 热度:142
序列模式挖掘 序列模式挖掘(sequence pattern mining)是数据挖掘的内容之一,指挖掘相对时间或其他模式出现频率高的模式,典型的应用还是限于离散型的序列。。 其涉及在数据示例之间找到统计上相关的模式,其中数据值以序列被递送。通常假设这些值是离散的,[详细]
-
关于评论话题挖掘的研究及其实现代码(二)词图切分
所属栏目:[大数据] 日期:2020-12-24 热度:109
引言 在上一篇的博客谈到使用LDA的方法挖掘影迷关注点可谓是无功而返。后来我思考了许久,决定将原来的向量空间模型转变为词语网(WordNet),然后通过社区检测算法来把网络划分不同的社区,从而确定为不同的话题。 社区检测算法 现实世界中的许多系统都可以[详细]
-
《MySQL必知必会》学习笔记五(数据处理函数)------掌握部分
所属栏目:[大数据] 日期:2020-12-24 热度:176
MySQL必知必会知识预览 第一章——了解SQL 第二章——MySQL简介 第三章——使用MySQL 第四章——检索数据 第五章——排序检索数据 第六章——过滤数据 第七章——数据过滤 第八章——用通配符进行过滤 第九章——用正则表达式进行搜索 第十章——创建计算字[详细]
-
数据挖掘 : 手把手教你做文本挖掘
所属栏目:[大数据] 日期:2020-12-24 热度:136
文本挖掘定义 文本挖掘指的是从文本数据中获取有价值的信息和知识,它是数据挖掘中的一种方法。文本挖掘中最重要最基本的应用是实现文本的分类和聚类,前者是有监督的挖掘算法,后者是无监督的挖掘算法。 ? 2 文本挖掘步骤 1)读取数据库或本地外部文本文件[详细]
-
[BZOJ1670][Usaco2006 Oct]Building the Moat护城河的挖掘(凸包
所属栏目:[大数据] 日期:2020-12-24 热度:169
题目描述 传送门 题解 凸包裸题。 代码 #includealgorithm #includeiostream #includecstring #includecstdio #includecmath using namespace std ; #define N 5005 const double eps= 1e-9 ; int dcmp( double x){ if (x=epsx=-eps) return 0 ; return (x 0[详细]
-
N的阶乘(大数阶乘算法)
所属栏目:[大数据] 日期:2020-12-24 热度:175
Problem Link:点击打开链接 题目描述 ?输入一个正整数N,输出N的阶乘。? 输入描述: 正整数N(0=N=1000) 输出描述: ?输入可能包括多组数据,对于每一组输入数据,输出N的阶乘 输入例子: 4515 输出例子: 241201307674368000 AC code: #includeiostream#includ[详细]
-
2017年商业智能 BI 发展趋势分析
所属栏目:[大数据] 日期:2020-12-24 热度:123
转载自公众号:天善智能(ID:tianshansoft) 作者:吕品,天善智能联合创始人运营总监? 导读 本文主要涉及到以下四个方面的内容: 1. 传统 BI 和新型 BI 的分水岭(2013年) 2. 新型 BI 的高速发展期和传统BI的衰退(2013年-2016年) 3. 传统 BI 巨头下滑期[详细]
-
a+b(大数加法)
所属栏目:[大数据] 日期:2020-12-24 热度:53
Problem Link:点击打开链接 题目描述 实现一个加法器,使其能够输出a+b的值。? 输入描述: 输入包括两个数a和b,其中a和b的位数不超过1000位。 输出描述: 可能有多组测试数据,对于每组数据,输出a+b的值。 输入例子: 2 610000000000000000000 1000000000000[详细]
-
流式大数据处理的三种框架:Storm,Spark和Samza
所属栏目:[大数据] 日期:2020-12-24 热度:67
许多分布式计算系统都可以实时或接近实时地处理大数据流。本文将对三种Apache框架分别进行简单介绍,然后尝试快速、高度概述其异同。 Apache Storm 在 Storm 中,先要设计一个用于实时计算的图状结构,我们称之为拓扑(topology)。这个拓扑将会被提交给集群[详细]
-
AI眼中的历史:用人工智能挖掘旧报纸里的英国现代史
所属栏目:[大数据] 日期:2020-12-24 热度:158
大数据文摘作品,转载要求见文末 本文作者|Martha Henriques 编译团队 |Sophie,刘晓莉 ▼ 微信后台(不是评论区)回复关键词“ 历史 ”,获取PDF原文报告。 试问,哪位历史学家有时间阅读跨越一个多世纪英国历史的数千万份报纸?没人可以。所以,计算机科学[详细]
-
BZOJ3110: [Zjoi2013]K大数查询
所属栏目:[大数据] 日期:2020-12-24 热度:155
Description 有N个位置,M个操作。操作有两种,每次操作如果是1 a b c的形式表示在第a个位置到第b个位置,每个位置加入一个数c 如果是2 a b c形式,表示询问从第a个位置到第b个位置,第C大的数是多少。 Input 第一行N,M 接下来M行,每行形如1 a b c或2 a b[详细]