4.2 大数据处理 知识点题库

下表为历年宁波市市区居民与农村居民收入状况。请回答以下问题。

_x0000_i1046

  1. (1) 表格中A1:E1是合并居中的,下图中能实现合并居中功能的按钮是第个。(填写序号)

    对象_x0020_13

    1

    2

    3

    4

    5

    6

    7

    8

    9

    10

    11

  2. (2) 要计算“平均收入”,应该怎么操作?请写出操作步骤。
  3. (3) 已知“收入比=市区人均收入÷农村人均收入×100%”,那么应该在E3单元格中输入公式
  4. (4) 为了直观地反映出宁波人民收入逐年提高的情况,以预测未来几年收入的的增减趋势,应该选择的图表类型是
  5. (5) 要制作下图的图表,选择的数据区域应该是:,进行此操作时必须按住键盘上的键。

    _x0000_i1048

以下为2016年亚冠比赛部分球队的技术统计表,请根据表格提供的信息回答下面小题。

  1. (1) 分析数据表,该表F3单元格的公式应该为,若要把小数点后位数设置为2位,应该在下图格式设置进行设置。

  2. (2) 一同学选中I2:I12并如下图提示继续完成对球队的攻次数从高到低排序,请问排序完成后“排名”列的顺序会不会发生改变(填  会/不会);若按射正率进行排序应该选择的区域是

  3. (3) 下图图表的数据源区域为,若不小心把I3的数据改变了,请问图表中对应的柱形图会不会改变(填:会/不会)。

小张收集了15个省份2017,2018上半年GDP数据,并使用Excel软件进行数据处理,如图a所示。

请回答下列问题:

  1. (1) 要使表格第2行内容能完整显示,在不改变字号和列宽的前提下,下列操作可行的是(单选,填字母:A .选择B2:D2单元格,文本对齐格式设置为“垂直居中”/B .选择B2:D2单元格,文本对齐格式设置为“跨列居中”C .选择B2:D2单元格,文本对齐格式中的文本控制设置为“自动换行”)。
  2. (2) 若对图a中的“2018上半年GDP同比增速”和“2018上半年GDP总量(亿元)”两列进行筛选操作,筛选条件如图b所示,则按此设置筛选出的省份是

  3. (3) 根据图a中数据制作的图表如图c所示,创建该图表的数据区域是A2:B3,

  4. (4) 在E3单元格中使用RANK函数获得各省2018上半年GDP同比增速排名。再利用自动填充功能获得E4:E17单元格中的数据。则E17中的内容是。(提示:RANK函数用于返回某个数字在一系列数字中相对于其他数字的排名。例如:=RANK(E3,E3:E17)表示E3在数据区域E3:E17中的降序排名。)
李明同学想比较一下前3次单元测试中自己的成绩是进步了还是退步了,他应使用( )图表进行成绩分析会比较直观。
A . 柱形图 B . 条形图 C . 线形图 D . 饼形图
小王收集了学校教师欢乐四项赛得分的相关数据,并使用Excel软件进行数据处理,如图a所示。

图a

请回答下列问题:

  1. (1) 小王要通过自动填充将“报名号”的值填充为如图a所示的序列“01,02,……,18”,则可先将该区域单元格格式设置为(单选,填字母:A .数值/B .货币/C .百分比/D .文本)。
  2. (2) 在L5单元格中使用SUMIF函数计算高三年级所有选手总分之和,则L5单元格中的公式是

    (提示:SUMIF函数用于对以域中满足条件的单元格求和。例如:=SUMIF(B3:B20,"高二",I3:I20)表示高二年级所有选手总分之和)

  3. (3) 根据图a中数据制作的图表如图b所示,创建图表的数据区域是

    图b

  4. (4) 市教育工会将举行“巾帼杯”欢乐四项赛,比赛项目为上述四项,计分规则不变。比赛规则:每校由2名女教师参加;每项每校由1名教师参赛;每名教师参赛项目不限;比赛成绩为4项得分的总和。以本次教师欢乐四项赛的结果为依据,从林雅璇、郦佳玲和董雯静中选择2名选手代表学校参加比赛。为使学校取得最高总分,你的选择是(单选,填字母:A .林雅璇与郦佳玲/B .林雅璇与董雯静/C .郦佳玲与董雯静)。
22018年2~12月的移动应用程序(APP)数量分类占比情况如图所示,分析并描述图中数据的特征和规律(写出两条)。

 ② 

小王运用excel软件处理浙江省2018、2019年浙江城乡居民人均收支情况,如图a所示,请回答下列问题:

图 a

  1. (1) 要计算各类居民的“同比±%”,在D4 单元格中输入公式,并复制到D5:D17,G4:G17,J4:J17 区域,D4 单元格中的公式为。(提示:同比=(2019 年-2018 年)/2018 年*100)。
  2. (2) 经过题(1)的操作,不小心把F列删除,G4单元格会出现 (填字母:A .8.3; B .#DIV/0! ;C .#REF! ;D .###)
  3. (3) 选中数据表中的数据创建了如图b所示图表,则创建图表的数据区域为

    图 b

  4. (4) 从数据表中我们可以发现浙江省2018、2019这两年生活消费支出增长速度最快的项目是
下列不是数据分析类型的是(     )
A . 有关趋势的分析 B . 有关比例的分析 C . 有关大小的分析 D . 有关关系的分析
以下关于数据可视化描述中,不恰当的是(   )。
A . 通过图形化手段清晰有效地传达与沟通信息 B . 选择合适的图表类型才有助于对信息的理解 C . 数据可视化有利于推动数据思维提升并发现业务逻辑 D . 尽量从视觉设计的角度制作数据可视化图表
学生处王老师收集到各班“我心向党、礼赞百年”活动文稿,尝试使用“在线词云图生成网站”生成如图所示词云图,将文本挖掘可视化。下列关于词云图的说法错误的是(    )

A . 词云图是目前常见的关键词数据可视化表达的一种方式 B . 词云图只能通过字体大小表示关键词的重要程度 C . 可以通过词云图快速获取文本数据中所蕴含的关键信息 D . 可以通过词云图直观呈现活动文稿中关键词出现频次
小王收集了部分理财产品和银行定期存款的利率数据,如图a所示。请回答下列问题:

  1. (1) D3:E10区域单元格格式设置如图b所示,计算年化收益率,可在E3单元格输入公式“=D *12”, 再通过自动填充完成区域E4:E10的计算,则E5单元格和E10单元格中显示的结果分别是(单选,填字母:A .18和0 /B .18.00 和 0.00 /C .18.00和#REF!/D .18.00和#VALUE!)

  2. (2) 对图a中的前5家银行按照月利率进行降序排序,应选择的数据区域是
  3. (3) 根据图a中的数据制作如图c所示的图表,下列说法正确的是           (多选)。

       

    A . 制作该图表的数据区域为C2:D2,C5:D9 B . 为了使图表中的数据对比更加明显,应对图表的坐标Y轴“最大值”和“主要刻度单位”做修改 C . 为了使图表柱形上方显示具体的数字,应设置数据标签选项 D . 对图a中区域B2:E10的“名称”和“月利率%”进行筛选,筛选方式分别如图d和图e所示,则图表中只显示1家银行的月利率数据
小张使用Excel软件对某地区2017年~2019年初中招生数据进行处理,如下图所示。

请回答下列问题:

  1. (1) 如上图表格所示,要计算每所学校2019年招生增长率,可先在单元格E3中输入公式,然后使用自动填充功能完成其他单元格的计算,则单元格E3中的公式为。(提示:2019年招生增长率=(2019年招生数-2018年招生数)/2018招生数×100)
  2. (2) 如上图表格所示,每一年的招生合计是在B15单元格中使用求和函数SUM计算所得,然后使用自动填充功能完成其他单元格的计算,则单元格D15中的公式为
  3. (3) 如上图表格所示,要计算2019年各校招生人数比例,可先在单元格F3中输入公式,然后使用自动填充功能完成其他单元格的计算,则单元格F10中的公式为。 (提示:2019年各校招生人数比例(%)=2019年招生数/2019年招生总人数×100)
  4. (4) 如上图表格所示,要将表格中数据按“2019年招生增长率(%)”降序排序,则应选择的数据区域为
  5. (5) 根据上图表格中数据制作的图表如下图所示,创建该图表的数据区域为

  6. (6) 分析上图中的数据,2019年招生数比2018年呈增长趋势的学校有个。
2021年3月15日晚会上某商家利用人脸识别监控设备在大众不知情的情况下收集进店顾客的人脸信息的新闻引发大众关注,据了解,国内上千家该品牌门店,都安装了摄像头,一旦有人走进店铺,面部信息就会被收集。只要顾客在一家门店出现一次,任何—家门店都将得到其光顾信息。下列说法正确的是(        )
A . “人脸识别”属于虚拟现实技术的应用 B . 商家利用摄像头收集进店顾客人脸信息的过程,属于数据的存储 C . 任何一家门店都能得到某顾客的光顾信息,体现了信息的时效性 D . 未经授权采集人脸信息有可能加剧个人隐私泄露风险
下列选项中,属于数据可视化表达的是(    )
A . 表格表达 B . 文字表达 C . 项目式表达 D . 流程图表达
小智在分析应用功能组成后,根据功能需求编写了如下网络应用Python代码:

from flask import Flask,render_template,request

app = _____________

@app.route("/")

def index():

#显示“主页”页面,代码略

@app.route("/introduce")

def introduce():

#显示“介绍”页面,代码略

@app.route("/exercise",methods=["GET","POST"])

def exercise():

#显示“练习”页面,代码略

@app.route("/top")

def toplist():

#显示“排行榜”页面,代码略

if __name__ == "__main__":

app.____________

  1. (1) 请在划线处补充代码。
  2. (2) 请用实线将下列访问的“在线加法练习系统”功能的URL与相应的路由及视图函数连接起来。(答案填写格式如:A-d 、B-a)

    A.//127.0.0.1:5000/top

    toplist()

    a.@app.route("/top")

    B.//127.0.0.1:5000/

    exercise()

    b.@app.route("/exercise",methods=["GET","POST"])

    C.//127.0.0.1:5000/exercise

    introduce()

    c.@app.route("/introduce")

    D.//127.0.0.1:5000/instance

    index()

    d.@app.route("/")

  3. (3) 在Flask Web应用框架中,可以通过网页模板来显示内存变量的值或对象等,以下在模板文件index.html中用于显示内存变量xxjs值的正确代码为             
    A . {{xxjs}} B . {{#xxjs#}} C . {{%xxjs%}} D . {%xxjs%}
某国的一家大型连锁超市通过利用信息系统对大量的销售数据进行了特定的分发现一个“奥秘”,于是这家超市就把尿布和啤酒这两种看起来没有关联的商品摆放在一起销售,结果销售量大幅增加。原来,超市经营者从数据分析中发现,婴儿尿布通常是男人们下班时购买的,而他们在购买尿布时又会顺便购买自己爱喝的啤酒。这个案例中的超市信息系统应用了大数据分析中的哪种技术?(  )
A . 聚类分析 B . 关联分析 C . 分类分析 D . 回归分析
小王收集了2020年双十一部分商品销售情况,并使用Excel软件进行数据分析,如图a所示。请回答下列问题:

  1. (1) C4单元格统计的是“服饰"类商品销售总金额。小王在G4单元格中输入公式后,对区域H4:I4进行了自动填充,则H4单元格中显示的结果是。(单选,填字母:A . # VALUE !/B . 5793. 56. 84/C . #DIV/0! /D . 0. 00)。

    (提示: SUMIF 函数用于对满足条件的单元格求和。例如“=SUMIF (B4:B33, G3, E4:E33)”,用于统计2020年11月类别为“服饰”的金额总和。)

  2. (2) 若要正确计算H4和I4单元格中的数据,可对G4单元格中的公式进行修改,并对区域H4:14进行自动填充,则G4单元格中的公式应改为:
  3. (3) 下列对数据处理和分析正确的是              (多选,填字母)。
    A . 选中A3:E18区域,以“人数”为主要关键字进行升序排序,不会影响图表的呈现效果。 B . 若要查看“医疗器械”中销售额最大的商品,可以按“类别”为医疗器械,“金额(万元)”为最大1项进行筛选。 C . 假如G3单元格中“服饰”字样被误删,则G4单元格中的显示结果变为#REF!。 D . 先以“类别”为医疗器械进行筛选,再以“金额(万元)”为关键字降序排序,与先以“金额(万元)”为关键字降序排序,再以“类别”为医疗器械进行筛选,两种操作后排在最前面的商品相同。
某店铺每周都要进行“店铺进销存统计分析”,如图1所示,请回答下列问题:

  1. (1) 为统计每天“销售额占本周销售总额百分比”情况,如图1所示,先计算出H4单元格中的值,再自动填充完成其它日期所占销售总额百分比的计算,则H4单元格的公式为:。(提示:销售额占本周销售总额百分比=销售额(元)/本周销售总额(元)×100)
  2. (2) 图1中表格已经执行过排序操作,排序方法:先选择为排序区域,再单击工具栏中“排序”按钮,并设置(填字段名)为主关键字降序排列。
  3. (3) 为了更直观表示相关数据差异,在经过排序后,该店铺员工为该表建立了柱形图表,如图2所示:

    分析该图表可知,该柱形图数据源范围是

  4. (4) 为了方便查询系统查询,该店铺员工根据图1的表格数据,利用Access软件创建了数据库文件,建立了“2015年6月第三周店铺进销存统计周数据”数据表,数据表内容如图3所示,他想修改第2条记录的“ID”值,却怎么都修改不了,原因是:

小明收集了不同的图书销量信息存储在“图书销量表.xlsx”中,如图所示。

序号

书店名称

图书名称

销量

单位

1

新华书店

三国演义

41

2

学仁书店

十万个为什么

32

3

学仁书店

红楼梦

36

4

联合书店

弟子规

21

用Python程序对数据做了整理与分析:

import pandas as pd

import matplotlib.pyplot as plt

plt.rcParams["font.sans-serif"]=["SimHei"]       #用于显示中文标签

data=pd.read_excel("图书销量表.xlsx")    

data=data.drop(2,axis=0)           

s=data.sort_values("销量",ascending=True)       

plt.bar(s.图书名称,s.销量,label="销量")       

plt.title("各图书销量比较",fontsize=26)          #设置图表标题

plt.legend()

plt.show()

上述代码运行后,输出的结果为

A . B . C . D .
小王要对这10篇作文随机抽取1篇进行分词处理,并进行频率统计,在统计频率时需要去除单个的文字,请回答下列各题。文章收集后存放目录如图a所示,生成的词云如图b所示。

   

import import import

pandas as pd

os,jieba,re,random,wordcloud

matplotlib.pyplot as plt

from PIL import Image

wzdir = "./2021 浙江高考满分作文/"

wz = os.listdir(wzdir) #获得文件夹中所有文件的名称列表

wzrd =    ①       

f=open(wzdir+wzrd[0],encoding="utf-8")

dd=f.read ()

f.close()

#使用正则表达式去除文章中的标点符号

ss = re.sub("[、,。:“”;?\n]","",dd)

wb = jieba.lcut(ss,cut_all=True)

word = {}

for i in wb:

  t =i.strip()

  if len(t)>1:

    if t in word:

      word[t]+=1

    else:

           ②    

      wc = wordcloud.WordCloud(font_path="msyh.ttc", width=800, height=600) wc.background_color="white"

      wc.fit_words (word)

      img = wc.to_array()

      plt.rcParams['font.sans-serif']=['SimHei'] plt.figure()

      plt.imshow(img)

      plt.axis(False)

      plt.title(wzrd[0].split(".")[0])

    ③  

#支持中文显示

  1. (1) 为实现上述功能①处代码为                            
    A . random.sample(wz,1) B . random.shuffle(wz) C . random.randint(1,10)
  2. (2) 请将②③处代码补充完整

最近更新