导航:首页 > 研究方法 > 交叉统计分析方法哔哩哔哩

交叉统计分析方法哔哩哔哩

发布时间:2024-06-14 15:06:57

如何使用spss进行交叉列联表分析

1、首先我们打开之前导入的spps文件。

❷ bilibili(1)-爬取视频信息进行数据分析

感谢@雄哥和@逊哥的帮助才得以完成这篇文章,不然,还不知怎么应对IP限制。
项目地址: https://github.com/UranusLee/bilibili_spider

通过chrome可以看出来B站视频统计信息是通过js加载,打开开发者工具可以到stat?aid=31的json文件。

再分析json文件的加载方式,基本可以得到所需要的headers参数。

因为之前一直都在爬取豆瓣、知乎、拉勾这些有特殊headers的网站,所以,为了省事,还是全部headers都加上。

进行爬取的时候,发生了一点问题,通过不断测试,基本可以断定B站有IP访问限制,基本上是1分钟150次以下不会封IP,封闭IP一次为5分钟,所以考虑用代理IP,拿着买好的稳定的IP,刻不容缓的加入进来。

总共爬取下来710多W条数据,用了三四天的时间,期间网络断掉,或者IP地址停用,一直耽搁,之所以不准备继续下去是因为数据还准备做一个B站每年数据分析,所以选用了aid=11883351这条数据作为截止可以比较好的对应上每年7月初的一个数据对比分析

发现有播放数为-1的值,总共占数据总量的2%,故而删除。

可以看出基本上播放量,弹幕,评论回复,收藏,硬币,分享基本就是长尾数据,有大量的小数值的数据,但是整体的平均值受极值的影响较大。相比较而言view播放量更加有研究性。

1.播放量占比分析

总共分为<500,500-1000,1000-5000,5000-20000,>20000。
播放量整体还是大量的淹没视频,播放量小于500的达到了整体视频的48.8%,而播放量20000以上的只占到5.4%,按照“二八原则”,视频达到3338以上的播放量即达到B站视频实际效用的界限。

2.分年份分析B站视频增长速度

以每年7月份为周期分析

通过aid可以查到所有爬下的数据所属的时间,再按照概率分析大概的时间就可以得出每一年7月份的视频量。

整体的视频数量增长速度实际上是大致按照每年翻倍的速度来增长,整体增长曲线抛开10-11年,整体增长平和。

2010-2011年之间,必定是发生了事才会导致视频量突增,才会导致视频总量增长率超过800%。通过查询,基本确实如之前所假设一样,10年因为Ac fun(A站)确实发生了严重的几次弹幕冲突,A站关闭了弹幕系统,加上很多人打出“ACG滚出ac”的标语,大量的A站up主转移至B站,开始了B站的逆袭。

14年一年视频增长率唯一一次跌至94%,是因为14年动画版权问题,禁止了私自上传动画,视频量比预期下跌了大概8W左右。今年更加夸张的是2018年还没有到07月份,视频总量已经达到2200W左右。

3.参与率分析用户活跃度

弹幕成本是最低的,大概平均27.8人次观看,就会出现一次弹幕(包括非会员的观看次数,但是无法发弹幕,提高了弹幕成本),分享成本不仅仅是会员,非会员没有登陆也可以分享,这确实42.58人次的成本仅仅高于弹幕成本,说明B站整体视频风格更加多元化。121.58的投币成本受限于B站的投币系统,B币少,并且获得有难度,导致投币成本远高于其他几项。

4.投币分析

B站投币有“不牛不投,不服不投”的潜性规则,往往一个视频的投币量可以反应视频的质量和B站的流行趋势。
排名第一的是 【哔哩哔哩2017拜年祭】 ,94.1W投币
排名第二的是 【古筝】千本樱——你可见过如此凶残的练习曲 ,79.6W投币
排名第三的是 【哔哩哔哩2016拜年祭】 ,77.2W投币
然后是敖厂长的两连击
【敖厂长】让你耳朵怀孕的FC游戏 ,74.6W投币
【敖厂长】打脸!魂斗罗水下八关存在 ,73.0W投币

其实可以看出前三名中,两次拜年祭以及用户群体的自发投币,整个拜年祭已经成为B站文化的一部分,是每年最核心的一部分。当然也不缺乏敖厂长这种良心up主,每一次对于过往游戏的解疑和介绍,还有那无所不能的哥们,宅男但不失真心,牛逼但非常人亲。

文化的多元化才是整个B站撑起一片天的本质原因,我曾经在B站中过《极乐净土》的毒,看过外国人在中国成了网红,听过古筝弹奏魂斗罗、弹奏日本电音。这是一个大熔炉,每个人都可以找到自己喜欢的东西,我突然想起了广告模块的一个高分视频,弹幕量只有300,但是播放量有2000多万次,我不知道是B站运营人员清空了一部分的弹幕和评论,但是一个广告在B站,在这个无数个平时看都不看广告的年轻人,能够看上2000多万次,几乎人均一次。我才觉得我真正的知道。

----------------------------------------------------分割线-------------------------------------------
数据分析的部分有点意犹未尽,今天实在是困了,今天稍晚或者明天会继续对于B站各个模块继续进行深挖,包括弹幕的语义分析、通过弹幕揣摩剧情、哪种视频可以火、up主的影响力、视频质量建模等。

❸ 如何使用spss进行交叉列联表分析

SPSS提供了多种适用于不同类型数据的相关系数表达,这些相关性检验的零假设都是:行和列变量之间相互独立,不存在显着的相关关系。根据SPSS检验后得出的相伴概率(Concomitant Significance)判断是否存在相关关系。如果相伴概率小于显着性水平0.05,那么拒绝零假设,行列变量之间彼此相关;如果相伴概率大于显着性水平0.05,那么接受原假设,行列变量之间彼此独立。

在交叉列联表分析中,SPSS所提供的相关关系的检验方法主要有以下3种:

(1)卡方(χ2)统计检验:常用于检验行列变量之间是否相关。计算公式为:

在该对话框中,用户可以指定列联表的输出排列顺序。对话框中各选项的具体意义如下:

在行序(Row Order)栏中有如下两个选项:

升序(Ascending):系统默认,以升序显示各变量值;

降序(Descending):以降序显示各变量值。

用户在该对话框中进行选择后,单击【继续】(Continue)按钮,即可返回"交叉表"主对话框。

在"交叉表"对话框中单击【确定】(OK)按钮,可在输出窗口中得到数据概述、交叉列联表、卡方检验表、交叉分组下频率分布柱形图、相对危险性估计等图表。

阅读全文

与交叉统计分析方法哔哩哔哩相关的资料

热点内容
暖气闸门安装方法 浏览:820
企业招商技巧及方法 浏览:639
红薯在家种植方法 浏览:929
用什么方法对付领导给你穿小鞋 浏览:352
羊奶粉食用方法 浏览:928
圆椒坐果的正确方法 浏览:252
用什么方法可以查出妻子出轨 浏览:698
美的电压力锅使用方法指示灯在哪里 浏览:781
电动车霍尔线检测方法 浏览:771
人体详细锻炼方法 浏览:159
不绣钢管道连接方法 浏览:533
自己如何减肥方法 浏览:808
训练武磊的方法 浏览:833
新宝贝破零的技巧方法 浏览:48
xp的打印机在哪里设置方法 浏览:471
高一化学我原来的方法有什么错误 浏览:572
汉酱真假酒鉴别方法 浏览:99
亏电手机激活方法 浏览:418
补课班可以用哪些方法进行管理 浏览:348
listview类的常用方法 浏览:311