首页资讯热门酒文化企业行情市场产品品牌出口滚动

首页 > 热门 > 正文

【爬虫+数据清洗+可视化】Python分析"淄博烧烤"B站评论

2023-05-30 08:26:00 来源：哔哩哔哩

一、背景介绍

您好，我是 @马哥python说，一枚10年程序猿。

自从2023.3月以来，"淄博烧烤"现象持续占领热搜流量，体现了后疫情时代众多网友对人间烟火气的美好向往，本现象级事件存在一定的数据分析实践意义。

(资料图片)

我用Python爬取并分析了B站众多网友的评论，并得出一系列分析结论。

二、爬虫代码

2.1 展示爬取结果

首先，看下部分爬取数据：

爬取字段含：视频链接、评论页码、评论作者、评论时间、IP属地、点赞数、评论内容。

2.2 爬虫代码讲解

导入需要用到的库：

定义一个请求头：

请求头中的cookie是个很关键的参数，如果不设置cookie，会导致数据残缺或无法爬取到数据。

那么cookie如何获取呢？打开开发者模式，见下图：

由于评论时间是个十位数：

所以开发一个函数用于转换时间格式：

向B站发送请求：

接收到返回数据了，怎么解析数据呢？看一下json数据结构：

0-19个评论，都存放在replies下面，replies又在data下面，所以，这样解析数据：

这样，data_list里面就是存储的每条评论数据了。

接下来吗，就是解析出每条评论里的各个字段了。

我们以评论内容这个字段为例：

其他字段同理，不再赘述。

最后，把这些列表数据保存到DataFrame里面，再to_csv保存到csv文件，持久化存储完成：

注意，加上encoding='utf_8_sig'，否则可能会产生乱码问题！

下面，是主函数循环爬取部分代码：（支持多个视频的循环爬取）

三、可视化代码

为了方便看效果，以下代码采用jupyter notebook进行演示。

3.1 读取数据

用read_csv读取刚才爬取的B站评论数据：

查看前3行及数据形状：

3.2 数据清洗

处理空值及重复值：

3.3 可视化

3.3.1 IP属地分析-柱形图

结论：从柱形图来看，山东位居首位，说明淄博烧烤也受到本地人大力支持，其次是四川、广东等地讨论热度最高。

3.3.2 评论时间分析-折线图

结论：从折线图来看，4月26日左右达到讨论热度顶峰，其次是5月1号即五一劳动节假期第一天，大量网友的"进淄赶烤"也制造了新的讨论热度。

3.3.3、点赞数分布-箱线图

由于点赞数大部分为0或个位数情况，个别点赞数到达成千上万，箱线图展示效果不佳，因此，仅提取点赞数<10的数据绘制箱线图。

结论：从箱线图来看，去除超过10个点赞数评论数据之后，大部分评论集中在0-3个点赞之间，也就是只有少量评论引起网友的点赞共鸣和认可。

3.3.4 评论内容-情感分布饼图

针对中文评论数据，采用snownlp开发情感判定函数：

情感分布饼图，如下：

结论：从饼图来看，积极和消极分别占比不到一半，说明广大网友在认可淄博烧烤现象的同时，也有大量负面讨论存在，比如讨论烧烤的价格略高、住宿条件欠佳、环境污染等负面话题。

3.3.5 评论内容-词云图

由于评论内容中存在很多"啊"、"的"、"了"等无意义的干扰词，影响高频词的提取，因此，采用哈工大停用词表作为停用词词典，对干扰词进行屏蔽：

然后，绘制词云图：

结论：从词云图来看，"淄博"、"烧烤"、"山东"、"好吃"、"城市"、"好"、"物价"等正面词汇字体较大，体现出众多网友对以「淄博烧烤」为代表的后疫情时代人间烟火的美好向往。

四、技术总结

「淄博烧烤」案例完整开发流程：

1、requests爬虫

2、json解析

3、pandas保存csv

4、pandas数据清洗

5、snownlp情感分析

6、matplotlib可视化，含：

1）IP属地分析-柱形图Bar

2）评论时间分析-折线图Line

3）点赞数分布-箱线图Boxplot

4）评论内容-情感分布饼图Pie

5）评论内容-词云图WordCloud

五、演示视频

六、获取完整源码

爱学习的小伙伴，本次分析过程的完整python源码及结果数据，我已打包好，并上传至我的微信公众号"老男孩的平凡之路"，后台回复"淄博烧烤"即可获取。

我是@马哥python说，持续分享python干货！

标签：