酷科技-免费素材_软件_模板_源码下载_建站资源_源码论坛

 找回密码
 立即注册

QQ登录

只需一步,快速开始

返回列表 发新帖 SEO优化此页关键词描述信息
查看: 403|回复: 0

写给新人的数据库入门指南

[复制链接]

29

主题

29

帖子

873

酷币

中级会员

Rank: 3Rank: 3

酷币
873
此文是《10周入门数据分析》系列的第5篇。
想了解学习路线,可以先行阅读“10周计划”
公中号上已更新到第11篇,详情可见文末。
上周更新了两篇Excel学习,有读者反映写得不够实操。这里解释下,文字真的很难将每一步细化,不然真的要出一本书。文章更多是一个引路,告诉我们为什么要学这个,主要学什么,怎么学?深入的操作,还需我们业余加餐啊,已经尽量给我们留了材料了。
也有人提议,出个视频,很好!很赞!明年计划下。即使没有时间,我也会推荐一些我认为OK的视频让我们学习。
年底了,近几个晚上都在苦熬年终报告,各位写好了么?
好了,回到正文,本篇讲数据库知识:
经常有刚从事数据分析的职场萌新,问我做数据分析工作要学些什么,需要怎样规划学习路径。我会告诉他:如果你Excel还用的不溜的话,就先学学Excel,当你用Excel处理和分析一些小数据集没有问题的那时候(具体表现就是说:常用函数公式信手拈来,数据透视表,挑选,排序,图表绘制操作熟练),你就去学习SQL语言,然后用BI去分析去熟悉业务。然后到了必须阶段,你可以上手R或是Python。后面如果你能更进一步,可以去了解一些Spark等大数据框架。
为什么要学习Excel?
最先Excel是我们最常用的数据分析和处理工具,Excel的功能非常丰富,基本可以涵盖我们在之后在其它软件(SQL、BI、Python、R)中要学到的那些功能。
有的人很有可能会问,既然Excel这么强大,为什么还要学其它的工具?这也是是因为Excel是通过菜单的形式来开展操作的,很难实现自动化和功能复用,当然你也可以通过VBA来实现,用VBA也就是说编程了,不过是因为VBA这些语言学会了基本只能在office软件中采用,学习的投入成本和产出收益不成比例,不推荐学习,这也是客观原因之一;另外就是说Excel在处理比较大的数据集的那时候,性能很差,而且经常崩溃。(虽说Excel2013及以上版本宣称可以容纳100+万条记录,但几万条数据就开始卡顿了)。
为什么Excel学完要学SQL?
客观原因是绝大多数数据分析岗都有SQL技能的规定。企业里面为了保证数据的安全性和管理的方便,数据都是统一存放在数据库中,从数据库中提取和查询数据需要采用SQL语言,甚至有的公司就是说用SQL语言来做数据分析。
另外一个原因就是说即使你先学了其它的工具,比方R,Python,甚至Spark等大数据框架,你会发现最后你还是得学习SQL。如果你先学习SQL,那麼很多概念你都能在学习R,Python,Spark等更加复杂的工具之前弄清楚。对后面的学习会有帮助。这就好比建房子,都是先打地基,然后一层一层的盖。
SQL语言的学习排在Excel之后,其它工具之前,还有一个很至关重要的原因就是说,SQL可以在必须程度上帮Excel解决大数据集的问题,同时架起一个通往其它工具的桥梁。
关于数据库和SQL的学习,也是分为两篇,第一篇讲数据库以及表的概念。第二篇是SQL语句的掌握和数据库的操作。
一、数据库基础知识
先谈一下我对数据库的理解。数据库顾名思义就是说数据的集合,是由一张张数据表组成的。
放在物理实体上,是一堆写在磁盘上的文件,文件中有数据。这些最基础的数据组成了表(table),我们把它想象成一张Excel的sheet,如下图:

hzjqmwxz4yh.jpg

hzjqmwxz4yh.jpg

每一张表都有一个唯一标识,即主键,也就是说ID。ID是数据库中至关重要的概念,叫做唯一标识符/主键,用来表示数据的唯一性。就相当于我们的身份证,是唯一的,有了身份证,就知道数据在哪了。
ID通常没有业务含义,就是说一种唯一标识,每张表只能有一个主键,且主键通常是整数,主键一旦设立,值通常不允许修改。
数据库是表的集合。一个数据库中可以放多张表,我们给每张表命名,表与表之间能互相联系。联系就是说数据能够对应匹配,正式名称叫联接,对应的操作叫做Join,我们想象成Excel中的vlookup。

ohnu5jpraca.jpg

ohnu5jpraca.jpg

比方上面两张图,左图是学生信息表,右图是老师信息表。左图的主键是学生ID,右图的主键是老师ID。细心的读者很有可能发现右图还有一个学生ID,这里的学生ID是专门用来联接用户表的,它并不是主键。只不过两张表通过学生ID这个唯一信息来关联。
但两张表关联也并不是信息能一一对应的,也会存在空缺的那时候,比方:

cwb5ovzcict.jpg

cwb5ovzcict.jpg

那两表建立连接就会变成:

ytemzmqveos.jpg

ytemzmqveos.jpg

了解上面的概念,你就知道什么叫关系型数据库。简易说,它是由多张能互相联接的二维行列表格组成的数据库。在数据准备时,我们通常要建立表关联来分析。
关系型数据库是基于关系代数模型发展而来,常用的关系型数据库有SQL Server、MySQL、Oracle、DB2等,这个视企业采用为准,我们后续学习都以MySQL为主。
各关系型数据库(不感兴趣可跳过):
DB2: 关系型数据库, 适用于大型的分布式应用系统, 确实是非常非常好的数据库, 无论稳定性, 安全性, 恢复性等等都无可挑剔, 而且从小规模到大规模的应用都非常适合。但采用起来觉得非常繁琐, 安装的那时候规定颇多, 很多软件都很有可能和DB2产生冲突, 是因为一般DB2都是安装在小型机或是服务器上的, 所以在PC上安装很费事儿。新建一个库需要设置很多东西, 分配各种各样的存储空间。
Oracle: 是现在阶段市场占有率最大的数据库, 我在学习SSH的那时候用的就是说Oracle, 安装起来很繁琐, 而且居然程序文件有3G之多... 用起来非常方便, 对我这样的初学者, 有很简易的配置, 对规定很高的企业级应用, 也有很复杂的配置和管理方法, 有很强大的数据字典, 可以说是最实用的数据库了, 但查了一下, 价格不菲...
MS SQL: 当初用的是两百0和两百5版, 这两个版本差了很多。两百0的数据库做的很好, 程序很小, 操作简易, 功能较全, 算是各层面都很中庸的数据库吧, 是中型数据库, 我的毕业设计就是说用MS SQL 两百0做的。两百5中加入了很多功能, 复杂多了, 有大型数据库的风范了, 而且价格也变高了, 个人觉得除非用的是Window Server 系统或是针对Microsoft产品, 否则不如用Oracle好。
MySQL: MySQL是一个很好的关系型数据库, 免费, 而且功能很全, 程序又小, 安装简易, 如今很多网站都用MYSQL, 在字段约束上做的差了点儿, 其他的都很好, 和MS SQL 用着差不多。
Access: 典型的桌面数据库, 觉得做个单机系统, 比方记账, 记事儿什么的还成, 在局域网里跑个小系统都够呛, 数据源连接很简易, 是因为是Office的数据库, 所以Windows自带数据源。
更多关于数据库的知识,看一本《数据库系统概论》就够了。
二、尝试采用MySQL数据库
如果还没有接触过数据库或是说SQL,推荐我们下载并安装MySQL数据开展尝试,MySQL数据库的下载安装比较简易,安装完成就可以采用。
可以访问MySQL官网开展下载,网址如下(这里给出的是Windows版下载地址):
「链接」

o120yxc5mzu.jpg

o120yxc5mzu.jpg

下载MySQL时,需要开展免费注册,注册页面是英文的。下载该工具后,点击运行,这个程序就能够联网自动为你安装MySQL,并自动开展配置。在安装过程中,需要你设置密码,自己设置一个登陆密码,并记住,下次登陆MySQL时,需要这个密码。
解压之后没有my.ini文件(我的端口设置的3308),截图中是我增加的。

1fc2ao2ripc.jpg

1fc2ao2ripc.jpg

管理员命令行:
在MySQL安装目录的 bin 目录下执行命令:
mysqld --initialize --console
得到如下结果:

pzqwc2g3avw.jpg

pzqwc2g3avw.jpg

看到有个警告,查了一下mysql建议采用utf8mb4
修改my.ini文件

ubrwvu0svvj.jpg

ubrwvu0svvj.jpg

警告没有了,上面打印了默认密码:nj>uUJkpH4/I
然后,安装服务:
mysqld --install MySQL8.0
是因为这也是电脑上第二个mysql 所以服务名改成了 MySQL8.0

ydk5y5jn1my.jpg

ydk5y5jn1my.jpg

启动服务:
net start MySQL8.0

qrtfwc4oig3.jpg

qrtfwc4oig3.jpg

修改初始密码
登录mysql之后执行:
ALTER USER 'root'@'localhost' IDENTIFIED WITH mysql_native_password BY '123456';

v4jql4h01fr.jpg

v4jql4h01fr.jpg

将MySQL和Excel或是其它数据分析工具连接起来
默认安装的情况下,有一个插件允许MySQL数据库和Excel相连接,试想一下,我们在MySQL数据库中通过SQL语言开展大量数据的处理和计算,将计算结果存放在特定的数据表中,再通过Excel连接上MySQL数据库,将数据读取到Excel中,用Excel开展分析并绘制图表,免去了将数据从数据库导出再导入Excel的麻烦,是不是就可以提高效率了呢?
后面会分享一篇通过ODBC驱动程序连接一些报表\\BI工具来做分析的操作。
关于MySQL的学习推荐书籍《MySQL必知必会》。
关于学习计划
近期,我的公众号【数据分析不是个事儿】在策划《10周入门数据分析》系列文章,教课书式手把手教我们入门数据分析。
本文是系列中的第5篇,公中号上已更新到第11篇。
可以戳下“了解更多”前往关注。
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|小黑屋|手机版|Archiver|酷科技 ( 粤ICP备16006357号-6 )

GMT+8, 2023-2-7 19:38 , Processed in 0.038229 second(s), 32 queries .

Powered by Discuz! X3.4

© 2001-2017 Comsenz Inc.

快速回复 返回顶部 返回列表