4.2 大数据处理 知识点题库

王老师想了解全班同学的成绩变化情况,较好的成绩分析方法是(   )
A . 将每位同学每次考试的成绩记录在纸张上然后进行分析 B . 将每位同学的每次考试成绩记录在Excel工作表中,然后利用图表进行分析 C . 每位同学自己统计分析自己的成绩,然后汇报给王老师 D . 将每次考试成绩张贴出来,进行直观比较
小王收集了某地农产品价格数据,用Excel对其进行分析,整理后的数据如图a所示。请回答下列问题:

  1. (1) 表中J列数据是通过公式计算得到的。小王首先在J5单元格中输入公式:,然后利用自动填充功能向下填充到J23单元格。
  2. (2) 小王想对蔬菜类的数据以“农产品品种”为主要关键字按升序进行排序,则他应该选择的数据区域是
  3. (3) 小王要对数据进行筛选,筛选条件如图b所示,则他共筛选出行数据。

  4. (4) 小王根据图a中数据制作了一个图表,如图c所示,则制作此图表的数据区域为

小王获取了2016-2017年支付宝付款数据,并使用excel软件进行数据处理,如图a所示。

图a

图b

请回答下列问题:

  1. (1) 区域C5:C13中的数据是从C4单元格利用自动填充功能得到的。则C4单元格输入的公式是
  2. (2) 要以“年增长率(%)”为主要关键字进行排序,则选择的数据区域是
  3. (3) 根据图a的数据,制作了图b的图表,创建该图表的数据区域是
  4. (4) 将区域 A3:F14的数据值复制到新的工作表A1:F12并进行筛选,筛选条件为E列最大的三项,则在第4行A列看到的是
数据特征探索的主要任务是(    )
A . 对数据进行预处理,发现和处理缺失值,异常数据、绘制直方图,观察数据分布的特征,求最大值、最小值、极差等描述性统计量。 B . 分析发现存在于大量数据之间的关联性和相关性,从而描述一个事物的共同规律和模式。 C . 是一种探索性的分析。不必事先给出一个分类标准,而是让其自动分类。 D . 是数据分析中最基本的方法。先基于样本数据构建分类器,然后进行预测。
采集某市某辆出租车2007年2月20日全天行驶轨迹的数据集,如图所示。该数据集特征包括:出租车ID、时间、经度、纬度、夹角角度、出租车的瞬时速度和出租车载客状态。

  1. (1) 图所示数据集文件名为,出租车ID、时间、经度、纬度、夹角角度、出租车的瞬时速度和出租车载客状态数据的间隔符为,经度、纬度的数据类型为
  2. (2) 绘制该数据集中出租车行驶轨迹的Python程序如下,请在方框中填写合适的代码,完善程序。

    import matplotib. pyplot as plt

    def track(file):     #绘制GPS坐标轨迹

         jd=[ ]      #经度

         wd=[ ]       #纬度

         for line in open(file):

             #切分行数据生成列表

             line_data=line. split(',')

             #取轨迹坐标

            

             jd. append(x)

             wd. append(y)

         plt. plot(jd, wd)

    filename='Taxi_ 105. txt'

    track(filename)

    plt. show( )

  3. (3) 运行程序,绘制的图形如图所示。说说你从图中发现了什么。

  4. (4) 尝试编写Python程序,从该数据集中挖掘其他你感兴趣的信息。
数据分析不但可以对数值型数据进行统计和描述,还可对文本、图像等数据进行分析。
分治策略是计算机求解问题的一个经典算法,它也是一种分解问题的思维方法。下列关于“分治策略”的描述正确的是(   )。
A . 分治策略就是把大问题转化为不同的小问题来解决 B . 分治策略就是把一个问题转化为多个问题同时解决 C . 分治策略解决问题时一般分为“分解”、“解决”和“合并”三个步骤 D . 分治策略解决问题时必须使用递归算法进行
学校高一年级的研究小组在调查同学们的上学方式,小组通过问卷收集了一些数据,张华负责将最终的结果做成一张饼图,那么张华所做的是数据处理的哪一步?(   )
A . 数据收集 B . 数据整理 C . 数据分析 D . 数据呈现
数据分析的过程不包括(     )。
A . 首先要根据分析的目标提出假设 B . 然后选择恰当的分析方法进行分析 C . 验证假设是否正确 D . 根据分析直接得出相应的结论
投针实验中拋掷的次数越多,结果偏离越大。
小王收集了2019和2020年杭州市各区县(市)GDP数据,并使用Excel软件进行数据处理,如图a所示。

图a

请回答下列问题:

  1. (1) 区域D3:D17的数据是通过公式计算得到的,在D3单元格中输入公式后,使用自动填充功能完成区域D4:D17的计算,则D3单元格中的公式是。(提示:同比增幅% =(2020年(亿元)-2019年(亿元))/ 2019年(亿元)*100)
  2. (2) 若对“2020年(亿元)”列进行筛选,筛选设置都如图b所示,则筛选出的区县(市)有个(填数字)。

    图b

    图c

  3. (3) 根据图a中的数据制作图表如图c所示,下列说法正确的有                  (多选,填字母)。
    A . 由图c可知2020年杭州市各区县(市)GDP最高的是余杭区 B . 对数据区域C3:C17设置单元格格式“2位小数”,图c所示的图表会随之改变 C . 对数据区域A2:E17按“2020年(亿元)”降序排序后,公式仍旧可以正确计算2020年各区县(市)GDP名次 D . 在图a所示工作表的“2020年(亿元)”列前插入一列“2019年排名”,图c所示图表会随之改变
导航软件提供了“未来出行”功能,用户可以设定未来出行时间,软件利用大数据分析,预估未来行程所需时长,为用户合理规划出行时间提供参考。这一功能凸显了大数据分析的哪一个核心作用?(  )
A . 了解事物的现状 B . 剖析事物的发展历程 C . 预测事物的未来走向 D . 数据价值化
平均分析就是运用的方法,来反映总体在一定时间、地点条件下某一数量特征的
数据可视化是指以图形、图像和动画等方式更加直观生动地呈现数据及数据分析结果,揭示数据之间的关系、趋势和规律等的表达方式。
“大事化小、小事化了”体现出的问题求解的思想是(      )。
A . 穷举法 B . 分治法 C . 归纳法 D . 递推法
小明将图1经过如下python程序段处理后,效果为图2所示,他发现处理后图像黑白颜色分布很不均衡,要想将图像处理成图3,下列做法正确的是 (     )

图 1

图 2

图 3

from PIL import Image

1 import numpy as np

2 import matplotlib.pyplot as plt

3  img=np.array(Image.open('dog.jpg').convert('L'))

4 row,cols=img.shape

5 for i in range(row):

6      for j in range(cols):

7 if img[i,j]>188:

8 img[i,j]=1           #1表示白色

9 else:

10             img[i,j]=0  #0表示黑色

11 plt.figure('dog')

12 plt.imshow(img,cmap='gray') 13 plt.axis('off')

14 plt.show()

A . 将第7行中的数字‘188’改成‘100’ B . 将第7行中的数字‘188’改成‘250’ C . 将第7行中的‘>’改成‘<’ D . 将第8行的数字‘1’改成‘0’,将第10行的数字‘0’改成‘1’
小明收集了我省2022年4月30日每个时间段,我省的各个监测站的PM2.5浓度的数据,存储在“数据.xlsx”中,如图1所示。

图1

  1. (1) 为了绘制某监测站24小时PM2.5的浓度变化趋势,小明需要对图1所示的表中数据进行整理,下列选项中说法不正确的是(    ) (单选)
    A . 通过检测发现E2单元格中的数据不正确,应进行修正 B . 应删除第10行数据 C . 第3行和第4行数据重复,应该删除其中一行数据 D . 删除“0时”和“24小时平均浓度”两列数据,图3绘制结果保持不变
  2. (2) 区域AA2:AA39的数据是通过公式计算出相应的平均值的,在AA2单元格中输入公式,再使用自动填充功能完成区域AA3:AA39的计算。
  3. (3) 接着,小明对图1中的数据进行整理后,转为csv文件,如图2所示。小明根据要求编写程序,绘制的‘临平镇’站点24小时变化趋势图如图3所示,程序运行结果如图4所示。实现的Python程序如下,请在划线处,填入适当的语句或语句表达式。

    图2

    图3

    图4

    import pandas as pd

    import matplotlib.pyplot as plt df=pd.read_csv("各站点 PM2.5 数据.csv")

    s1=df["日平均浓度"]     #将 DataFrame 中“日平均浓度”列的数据读到s1中

    #求浓度最低的站点

    minx=s1[0] n=len(s1) t=0

    for i in range(1,n):

        if s1[i]<minx:

            minx=s1[i]

            t = i

    print('浓度最低的站点是(填写监测站点名称):',,'浓度为:',minx) g=df.groupby('地区',as_index=False)

    s=g.日平均浓度.mean()

    s_sort=s.sort_values("日平均浓度",ascending=False)     #各地区按照日平均浓度进行降序排序

    print("求 PM2.5 平均浓度最高的三个区:\n",))

    #绘制的‘临平镇’监测站点24小时变化趋势图

    b=list(df.values[5][2:-1])      #将‘临平镇’每个时间段的数据存入列表b中

    x=[];y=[]

    for i in range(len(b)):

        x.append(i)

        y.append(b[i]) plt.plot()      

    plt.title("临平镇24小时PM2.5变化趋势图")

    plt.rcParams['font.sans-serif']=['SimHei']           #使中文字在视图中正常输出plt.rcParams['axes.unicode_minus']=False

    plt.show()

在数据处理中,除了可以对数值型数据进行分析外,还可以对文本、图像等数据进行分析。

学生处王老师收集到各班“我心向党、礼赞百年”活动文稿,尝试使用“在线词云图生成网站”生成如右所示词云图,将文本挖掘可视化。下列关于词云图的说法错误的是(    )

A . 词云图是目前常见的关键词数据可视化表达的一种方式 B . 词云图只能通过字体大小表示关键词的重要程度 C . 可以通过词云图快速获取文本数据中所蕴含的关键信息建党百年 D . 可以通过词云图直观呈现活动文稿中关键词出现频次
下面这段程序是绘制函数图象的,其中plot函数可以绘制线形图

1

2

3

4

5

6

7

8

9

import numpy as np

import matplotlip.pyplot as plt

x=np.linspace(0,10, 100)

y=np.sin(x)

plt.title("sin(x)")

plt.plot(x,y,color="r",linewindth="2")

plt.show( )

以下图形哪一个是该程序绘制出来的(    )

A . B . C . D .
最近更新