4.2 大数据处理 知识点题库

使用Excel软件,处理浙江省近40年来生产总值的相关数据(图a)。请回答下列问题:

图a

  1. (1) 参照15单元格公式计算16单元格的值,并用自动填充功能完成区域J6:K6的计算,则I6单元格中的公式是
  2. (2) 对改革开放最初五年(1979年-1983年)的数据以“生产总值增长率(%)”为关键字按降序进行排序,则排序的数据区域是
  3. (3) 需要筛选出“生产总值增长率(%)”超过25的数据,筛选条件设置如图b所示。发现筛选结果不满足需求,其原因是

    图b

  4. (4) 分析图表(图c),我省近40年生产总值增长最快的时段为(单选,填字母)。
    图c
某班主任收集了本班级学生线上学习情况的数据, 并用Excel软件进行数据处理,如第13题图a所示。请回答下列问题:

  1. (1) 通过H3单元格中的公式,对数据区域H4:H12进行自动填充,则H3单元格中的公式是

    (提示:COUNT IF函数用于计算某个区域中满足给定条件的单元格数目。例如:=COUNT IF(B2:B279“语文”)表示B2:B279区域中课程名称是“语文”的单元格数目)

  2. (2) 根据图a中数据制作的图表如图b所示,创建图表的数据区域是

  3. (3) 在区域A2:D280内找出“技术”课程中“认真度”最低的学生(若存在符合条件的多个记录,则全部选取)。下列方法可行的是     (多选,填字母)。
    A . 以“课程名称”为“技术”、“认真度”为“最小1项”进行筛选,然后选取筛选出的全部记录 B . 以“课程名称”为“技术”进行筛选,再以“认真度”为关键字升序排序,选取排在前面的记录 C . 以“课程名称”为主要关键字、“认真度”为次要关键字,均按升序排序,选取排在前面的记录 D . 以“认真度”为关键字升序排序,再以“课程名称”为“技术”进行筛选,选取排在前面的记录
阅读试题,请在相应位置写出问题的答案。

某银行国际业务部通过折线图比较业务处理效率情况,可掌握业务效率变化,及时发现业务延迟和低效率,提高服务水平。下面是汇入汇款,汇出汇款,电子转发,分报四种业务的折线图,请根据该折线图分析并回答以下问题。

  1. (1) 从折线图可以看出,汇入汇款,汇出汇款,电子转发,分报四种业务所耗时间变化波动最小的是
  2. (2) 02年第三季度,服务时间最短的业务是
  3. (3) 四种业务中,哪种业务所耗时间容易反弹,需要加强控制?
网上购物过程中,经常会看到“看了此商品的会员通常还看了…”、“买了此商品的会员通常还买了…”。这些信息既方便了顾客购物选择,又为商家赢得了更多的利润。这里采用的技术是(   )
A . 联机分析处理 B . 智能代理 C . 智能机器人 D . 数据挖掘
小张合并商品购买表和用户信息表得到新数据集,部分数据如图所示。

现要分析不同年龄、性别的用户购买商品种类、数量的情况。分析前,小张对数据进行了以下整理,下列操作恰当的是(    )

①删除“birthday"列数据

②删除“电话”列数据

③删除“购买日期”列数据

④修改“user_ id"birthday”列名称为中文名称

⑤修改单元格D6中的数据为M

⑥修改“birthday”列日期格式与G列一致

A . ①②③⑤ B . ②④⑤⑥ C . ①④⑤⑥ D . ③④⑤⑥
数据分析的方法不包括(     )。
A . 线性分析 B . 关联分析 C . 聚类分析 D . 数据分类
下列关于聚类分析的说法,错误的是(       )。
A . 可以从数据点集合中随机选择K个点作为初始的聚集中心 B . 对其他的每个数据点,以此判断其与K个中心点的距离,距离最近的表明它属于这项聚类 C . 聚类分析,必须先设定分类的标准,否则无法准确分类 D . 重新计算新的聚簇集合的平均值既中心点
下列关于词云说法错误的是(    )。
A . 词云是目前常用的关键词可视化形式 B . 用词云可视化文本数据可以帮助人们快速地了解文本的内容和特征信息 C . 词云通常使用字体的大小和颜色表示关键词的重要程度或出现频次 D . 在词云中,字越大表示该关键词使用频率就越低
在用Python编程对数据进行分析的时候,代码pandas.DataFrame.sum执行的操作是(   )
A . 返回所有列的和 B . 返回所有行的和 C . 返回所有数据中的最大值 D . 返回所有数据中的最小值
如图b所示,可以看出成绩稳步上升的班级是(    )

A . 高一(1)班 B . 高一(2)班 C . 高一(3)班 D . 不能确定
某大型购物网站收集了用户浏览网站的数据用于广告个性化实时推荐,下列处理方式中合理的是(         )
A . 应当使用统计分析软件进行数据分析 B . 应当选用针对流数据的实时计算 C . 应当选用针对图结构数据的图计算 D . 应当选用针对静态数据的批处理计算
在2021年7月23日到8月8日举行的“2020东京奥运会”上,共有206个国家、地区、独立代表团的11669名运动员参赛,争夺339枚金牌。奥运会闭幕后,小明从网上下载了金牌数前10名的国家,数据如图-1所示,然后根据各国金牌数绘制了柱形图,如图-2所示,请回答下面问题:

  1. (1) 在图-1中,表格标题“2020东京奥运会奖牌榜”所在的单元格是
  2. (2) 小明根据金牌数来计算各国名次,金牌数最多的为第1名,金牌数量相同名次也相同。小明采用“COUNTIF"函数在A3单元格计算美国队的名次,并自动填充到A4:A12单元格来计算其他国家的名次,则A3单元格应该输入(提示:“COUNTIF" 函数的功能是根据指定的条件来计数,例如=COUNTIF (F3:F12, ">"&F4)表示F3:F12范围内,统计比F4大的数的个数,结果是1。)
  3. (3) 根据图-1表格中的数据制作了图-2的图表,下列说法正确的是         (填字母)
    A . 绘制图-2图表时选择的数据区域是B3:C12 B . 将图-1表格中的数据以“奖牌总数”为关键字进行降序排列后,图-2的图表会发生变化 C . 若在图-1表格中“金牌”列前插入“参赛人数”列,图-2的图表会发生变化 D . 在图-2图表中的柱子上显示了金牌数据,这是通过“添加数据标签”实现的 E . 对图-1表格中。“国家/地区”列设置筛选条件为“包含国”,师选后,在图-2图表中看不到“日本”的情况(图表“隐藏和空单元格设置”默认
数据处理的一般过程是(      )。
A . 采集—整理—可视化表达—分析 B . 采集—整理—分析—可视化表达 C . 采集—分析—整理—可视化表达 D . 采集—可视化表达—分析—整理
下图为某患者血液化验单,针对该化验单的分析不正确的是(    )

A . 红色框内的信息表明患者血红蛋白测定数据低于参考值 B . 该医院近年来的患者血液化验结果就可以构成医疗大数据 C . 蓝色框内是一组孤立的数据,不结合检查项目无法确定其含义 D . 医生根据化验结果做出诊断,依靠的是专业基础知识和临床实践经验
想通过分析某同学各学科历次考试成绩的分数情况,预测他的下一次考试成绩,其基本步骤是

①数据整理 ②数据采集  ③ 撰写分析报告  ④ 数据分析与可视化

数据分析的方法主要有对比分析、平均分析。对比分析是指将两个或两个以上的数据进行比较,分析它们的差异,来反映总体在一定时间、地点条件下某一数量特征的一般水平。   

某投资者将一段时间内的证券操作记录保存在文件“table.xlsx”中,部分界面如图a所示。

图 a

图 b

该投资者为了总结投资经验,编写如下程序, 对数据进行分析。请在划线处填入合适代码。

import pandas as pd

import matplotlib.pyplot as plt

plt.rcParams['font.sans-serif'] = ['SimHei']    #使图形中的中文正常编码显示

df = pd.read_excel ("table.xlsx")

print( ) print( )

#筛选出所有盈利的证券操作记录。

#输出表格中所有操作的总盈亏。

#以下代码功能为找出盈利最大的 10 只证券, 并呈现如图 b 所示的图表。

g = df.groupby("证券名称",as_index = False)

df1 = g.盈亏.sum()

df1 = 

print(df1[:10])

plt.figure(figsize = (8,4))

plt.title('盈利前十的证券对比分析图')

plt. (df1[:10].证券名称,df1[:10].盈亏,label = "盈亏")

plt.xlabel('证券名称')

plt.ylabel("盈亏金额")

plt.legend()  #显示图例

plt.show ()

图为2017-2018年国内灯光强度增强区域示意图,其中,黑点为主要城市,红色表示该区域2018年度灯光强度较2017年实现增长,下列说法正确的是(        )

①图片、文字、数值都是数据,数据就是信息

②从图片中可以看到灯光强度增长区域大量集中在东部,在一定意义上也代表着东部经济比西部发展得更快

③这张示意图在计算机中是以二进制形式保存的

④灯光强度增强区域示意图的形成得益于大数据的采集和分析

A . ①②③④ B . ①②③ C . ①②④ D . ②③④
大数据处理环节,大致可按阶段划分为获取、储存、挖掘分析、最终应用与服务等步骤。在农业生产过程中,利用传感器监测光照、温度、二氧化碳、氧气等数据属于大数据处理的(     )环节。
A . 获取 B . 存储 C . 挖掘分析 D . 最终应用
思维导图、演示文稿、搜索引擎等工具,均属于数字化可视化表达工具。
最近更新