python多线程爬取加密后ts文件,解密后合成mp4视频_用python代码解密ts文件还原mp4视频-程序员宅基地

技术标签: 爬虫  python  Selenium爬虫  多线程  Requests库爬虫  

python多线程爬取加密后ts文件,解密后合成mp4视频

声明:仅供技术交流,请勿用于非法用途,如有其它非法用途造成损失,和本博客无关

前言

  • 续我前几天发布的上篇博客:python多线程爬取ts文件并合成mp4视频,说道爬视频有三种级别,上篇的例子属于中等级别,那么接下来的这篇是困难级别的。
  • 其实,这里再修正一下,爬视频应该不止是3种级别,还有很多更加困难的网站。
  • 所以,学无止境,尽管路途遥远,也要勇往直前~

废话不多说,下面直接开始吧,本次爬取的网站是点击跳转

一、分析页面

其实,这个网站跟我的上一篇博客的页面差不多,都属于同类型的网站,只不过是它的ts文件是加密的,如果直接运用上一篇的爬取逻辑,下载下来的ts文件合成mp4也是播放不了的,因为ts文件已经加过密了,需要解密才能播放。(跟上一篇的页面分析差不多,这里就不过多讲述了)

这个网站跟我的上一篇博客爬取的视频网站有三点不一样的地方:

  1. 用requests来请求播放页和js文件都会得不到网页的源代码,而是一个需要执行的JavaScript代码,因此,本文在拿到所有ts文件之前的操作均使用selenium来获取,比如获取播放页的网页源代码、获取js文件的响应内容。
    在这里插入图片描述
  2. js文件的响应内容里直接明文展示了所有剧集的m3u8文件的网址,而上一篇博客里的视频网站里的那个js文件是用base64来对m3u8文件网址进行编码加密的,因此,本文无需导入base64库来进行解密了。
    在这里插入图片描述
  3. ts文件是经过加密处理的,下载下来的ts需要对其解密才能播放,这正是本文的重点,随机打开一个播放页,看到在第二个m3u8文件中多出了一行说明:
    在这里插入图片描述
    可以看到METHOD=AES-128说明是用AES-128的加密方法,其秘钥的链接为后面URI,请求这个链接得到加密秘钥:
    在这里插入图片描述

二、视频解密

根据给出的秘钥即可以完成视频解密的操作,基本步骤是:将请求ts文件得到的响应内容进行解密之后,再做保存操作,下面以第一集视频解密为例,具体代码如下:

# 导入相关包或模块
import threading, queue
import time, os, subprocess
import requests, urllib, parsel
import random, re
from Crypto.Cipher import AES

# 下载ts文件
def download_ts(urlQueue,aes,headers): 
    while True:
        try: 
            #不阻塞的读取队列数据 
            temp = urlQueue.get_nowait()
            url=temp[0]
            n=temp[1]
        except Exception as e:
            break
        response=requests.get(url,stream=True,headers=headers)
        ts_path = "./ts/%04d.ts"%n  # 注意这里的ts文件命名规则
        with open(ts_path,"wb+") as file:
            for chunk in response.iter_content(chunk_size=1024):
                if chunk:
                    after=aes.decrypt(chunk)
                    file.write(after)
        print("%04d.ts OK..."%n)

if __name__ == '__main__':
    url='https://mahua-kb.com/20200330/2q4zN34n/2000kb/hls/index.m3u8' # 驱魔神医粤语版第一集
    headers={
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.25 Safari/537.36 Core/1.70.3741.400 QQBrowser/10.5.3863.400'}
    r=requests.get(url,headers=headers)
    urlQueue = queue.Queue()  # 存储ts文件的网址
    for i in r.text.split('\n'):
        if i.endswith('.ts'):
            urlQueue.put([urllib.parse.urljoin(url,i),urlQueue.qsize()])
        elif 'URI' in i:
            URI=urllib.parse.urljoin(url,re.findall('URI="(.*?)"',i)[0]) # 秘钥的网址
            key=requests.get(URI,headers=headers).text  # 得到秘钥
            aes=AES.new(key,AES.MODE_CBC,key)  # 通过秘钥新建解密器
    # 下面开始多线程下载
    startTime = time.time()
    threads = []
    # 可以适当调节线程数,进而控制抓取速度
    threadNum = 4
    for i in range(threadNum):
        t = threading.Thread(target=download_ts, args=(urlQueue,aes,headers,))
        threads.append(t)
    for t in threads:
        t.start()
    for t in threads:
        t.join()
    endTime = time.time()
    print ('Done, Time cost: %s ' %  (endTime - startTime))

    # 下面是执行cmd命令来合成mp4视频
    command=r'copy/b D:\python3.7\HEHE\爬虫\ts\*.ts D:\python3.7\HEHE\爬虫\mp4\驱魔神医-第一集.mp4'
    output=subprocess.getoutput(command)
    print('驱魔神医-第一集.mp4  OK...'

    # 下面是把这一集所有的ts文件给删除
    file_list = []
    for root, dirs, files in os.walk('D:/python3.7/HEHE/爬虫/ts'):
        for fn in files:
            p = str(root+'/'+fn)
            file_list.append(p)
    for i in file_list:
        os.remove(i)

ps:以上代码只是单独拿出了一集视频,来说明怎么将加密后ts进行解密并合成为mp4,完整的爬取整个电视剧的源代码可以关注我的微信公众号,回复:20200606,即可下载本篇文章的全部源代码
在这里插入图片描述


写在最后

因为我的上一篇博客说了我本人对爬视频难度的划分,并且上一篇的难度为中等难度,于是就想再找一篇困难级别的网站来分析,所以就找到了这个网站,不过我发现这个网站有的视频需要解密,而有的又不需要,这其中最关键的就是看第二个m3u8文件响应里是否说明了加密的方法以及其加密的秘钥,所以有的话就可以参考本篇文章所使用的逻辑方法,没有的话就可以参考我的上一篇博客。

版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。
本文链接:https://blog.csdn.net/sinat_39629323/article/details/106592256

智能推荐

hdu 1229 还是A+B(水)-程序员宅基地

文章浏览阅读122次。还是A+BTime Limit: 2000/1000 MS (Java/Others)Memory Limit: 65536/32768 K (Java/Others)Total Submission(s): 24568Accepted Submission(s): 11729Problem Description读入两个小于10000的正整数A和B,计算A+B。...

http客户端Feign——日志配置_feign 日志设置-程序员宅基地

文章浏览阅读419次。HEADERS:在BASIC的基础上,额外记录了请求和响应的头信息。FULL:记录所有请求和响应的明细,包括头信息、请求体、元数据。BASIC:仅记录请求的方法,URL以及响应状态码和执行时间。NONE:不记录任何日志信息,这是默认值。配置Feign日志有两种方式;方式二:java代码实现。注解中声明则代表某服务。方式一:配置文件方式。_feign 日志设置

[转载]将容器管理的持久性 Bean 用于面向服务的体系结构-程序员宅基地

文章浏览阅读155次。将容器管理的持久性 Bean 用于面向服务的体系结构本文将介绍如何使用 IBM WebSphere Process Server 对容器管理的持久性 (CMP) Bean的连接和持久性逻辑加以控制,使其可以存储在非关系数据库..._javax.ejb.objectnotfoundexception: no such entity!

基础java练习题(递归)_java 递归例题-程序员宅基地

文章浏览阅读1.5k次。基础java练习题一、递归实现跳台阶从第一级跳到第n级,有多少种跳法一次可跳一级,也可跳两级。还能跳三级import java.math.BigDecimal;import java.util.Scanner;public class Main{ public static void main(String[]args){ Scanner reader=new Scanner(System.in); while(reader.hasNext()){ _java 递归例题

面向对象程序设计(荣誉)实验一 String_对存储在string数组内的所有以字符‘a’开始并以字符‘e’结尾的单词做加密处理。-程序员宅基地

文章浏览阅读1.5k次,点赞6次,收藏6次。目录1.串应用- 计算一个串的最长的真前后缀题目描述输入输出样例输入样例输出题解2.字符串替换(string)题目描述输入输出样例输入样例输出题解3.可重叠子串 (Ver. I)题目描述输入输出样例输入样例输出题解4.字符串操作(string)题目描述输入输出样例输入样例输出题解1.串应用- 计算一个串的最长的真前后缀题目描述给定一个串,如ABCDAB,则ABCDAB的真前缀有:{ A, AB,ABC, ABCD, ABCDA }ABCDAB的真后缀有:{ B, AB,DAB, CDAB, BCDAB_对存储在string数组内的所有以字符‘a’开始并以字符‘e’结尾的单词做加密处理。

算法设计与问题求解/西安交通大学本科课程MOOC/C_算法设计与问题求解西安交通大学-程序员宅基地

文章浏览阅读68次。西安交通大学/算法设计与问题求解/树与二叉树/MOOC_算法设计与问题求解西安交通大学

随便推点

[Vue warn]: Computed property “totalPrice“ was assigned to but it has no setter._computed property "totalprice" was assigned to but-程序员宅基地

文章浏览阅读1.6k次。问题:在Vue项目中出现如下错误提示:[Vue warn]: Computed property "totalPrice" was assigned to but it has no setter. (found in <Anonymous>)代码:<input v-model="totalPrice"/>原因:v-model命令,因Vue 的双向数据绑定原理 , 会自动操作 totalPrice, 对其进行set 操作而 totalPrice 作为计..._computed property "totalprice" was assigned to but it has no setter.

basic1003-我要通过!13行搞定:也许是全网最奇葩解法_basic 1003 case 1-程序员宅基地

文章浏览阅读60次。十分暴力而简洁的解决方式:读取P和T的位置并自动生成唯一正确答案,将题给测点与之对比,不一样就给我爬!_basic 1003 case 1

服务器浏览war文件,详解将Web项目War包部署到Tomcat服务器基本步骤-程序员宅基地

文章浏览阅读422次。原标题:详解将Web项目War包部署到Tomcat服务器基本步骤详解将Web项目War包部署到Tomcat服务器基本步骤1 War包War包一般是在进行Web开发时,通常是一个网站Project下的所有源码的集合,里面包含前台HTML/CSS/JS的代码,也包含Java的代码。当开发人员在自己的开发机器上调试所有代码并通过后,为了交给测试人员测试和未来进行产品发布,都需要将开发人员的源码打包成Wa..._/opt/bosssoft/war/medical-web.war/web-inf/web.xml of module medical-web.war.

python组成三位无重复数字_python组合无重复三位数的实例-程序员宅基地

文章浏览阅读3k次,点赞3次,收藏13次。# -*- coding: utf-8 -*-# 简述:这里有四个数字,分别是:1、2、3、4#提问:能组成多少个互不相同且无重复数字的三位数?各是多少?def f(n):list=[]count=0for i in range(1,n+1):for j in range(1, n+1):for k in range(1, n+1):if i!=j and j!=k and i!=k:list.a..._python求从0到9任意组合成三位数数字不能重复并输出

ElementUl中的el-table怎样吧0和1改变为男和女_elementui table 性别-程序员宅基地

文章浏览阅读1k次,点赞3次,收藏2次。<el-table-column prop="studentSex" label="性别" :formatter="sex"></el-table-column>然后就在vue的methods中写方法就OK了methods: { sex(row,index){ if(row.studentSex == 1){ return '男'; }else{ return '女'; }..._elementui table 性别

java文件操作之移动文件到指定的目录_java中怎么将pro.txt移动到design_mode_code根目录下-程序员宅基地

文章浏览阅读1.1k次。java文件操作之移动文件到指定的目录_java中怎么将pro.txt移动到design_mode_code根目录下

推荐文章

热门文章

相关标签