翼度科技»论坛 编程开发 python 查看内容

Python:喜欢小姐姐?这不得来一波大采集?

9

主题

9

帖子

27

积分

新手上路

Rank: 1

积分
27
俗话说的好:技能学了~就要用在自己喜欢得东西上!!
这我不得听个话~我喜欢小姐姐,跳舞的小姐姐
这不得用python把小姐姐爬下来~嘿嘿嘿

采集网站

本期目标来自虎牙舞蹈区

开发环境


  • Python 3.8
  • Pycharm
模块
  1. requests
  2. re
复制代码
 
基本流程

数据来源分析

确定采集内容是什么? (目标网址, 网址里面数据)
通过开发者工具进行抓包分析, 分析我们想要数据 通过请求那个url地址可以获得
I. 通过分析可以知道 播放url地址是什么?
II. 通过播放地址, 去分析找寻, 数据包是在哪?
III. 通过两个数据包 请求参数对比, 可以知道 只要获取所有ID 就可以获取内容
(图片id MP4ID 音乐ID 还是什么ID 都可以去列表页面获取)
IV. 去分析 mp4ID可以从哪里获取 (一般情况都可以在列表页面获取)
我想要获取播放地址 >>> 要得到数据包 >>> 获取ID
代码实现步骤


  • 发送请求, 对于舞蹈列表页面发送请求
  • 获取数据, 服务器返回数据内容
  • 解析数据, 提取我们想要数据内容 ID
  • 发送请求, 把ID传入到 数据包里面 发送请求
  • 获取数据, 服务器返回数据内容
  • 解析数据, 提取我们想要数据内容 标题 以及播放地址
  • 保存数据, 把内容保存本地
  • 多页数据采集
代码展示

模块
  1. # 导入数据请求模块
  2. import requests   # 第三方模块 pip install requests 需要自行安装
  3. # 导入re正则表达式
  4. import re   # 内置模块 不需要安装
  5. # 导入格式化输出模块
  6. import pprint   # 内置模块 不需要安装
复制代码
 

  • 发送请求, 对于舞蹈视频列表页面发送请求
  1. for page in range(1, 11):
  2.     print(f'正在爬取第{page}页的数据内容')
  3.     url = f'https:// **** .com/g/all?set_id=51&order=hot&page={page}'
  4.     # 爬虫是模拟浏览器对于服务器发送请求, 然后获取服务器返回数据内容
  5.     # Python学习交流裙 708525271
  6.     # user-agent: 用户代理 表示浏览器基本身份信息  (一种简单反反爬手段)
  7.     headers = {
  8.         'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/99.0.4844.51 Safari/537.36'
  9.     }
  10.     # 通过requests模块里面get请求方式对于url地址发送请求, 并且携带上headers请求进行伪装, 最后用自定义变量response接收返回数据
  11.     response = requests.get(url=url, headers=headers)
  12.     # <Response [200]> 表示请求成功, 请求网址成功了  *** 200状态码表示请求成功, 但是不一定能够得到数据
复制代码
 

  • 获取数据, 服务器返回数据内容 response.text 获取响应文本数据
  1. print(response.text)
复制代码
 

  • 解析数据, 提取我们想要数据内容 视频ID
  1. # 解析方式: css re xpath
  2. # <li data-vid="676382675">  想要数据 可以(.*?) 从response.text 里面去找寻这样数据内容
  3. # .*?  是可以匹配任意字符(除了\n换行符以外)  如果你只是单纯提取数字 最好用 \d+ 匹配一个或者多个数字
  4. video_ids = re.findall('<li data-vid="(\d+)">', response.text)  # 返回列表数据
  5. for video_id in video_ids:  # 通过for循环遍历 提取列表里面元素 一个一个提取
  6.     # print(video_id)
复制代码
 

  • 发送请求, 把视频ID传入到视频数据包里面发送请求
  • 获取数据, 服务器返回数据内容
  1. # f 字符串格式化方法 {} 占位符
  2. video_info = f'https:// **** .com/moment/getMomentContent?videoId={video_id}&uid=&_=1647433310180'
  3. json_data = requests.get(url=video_info, headers=headers).json()
  4. # print(json_data)
  5. # pprint.pprint(json_data)
  6. # 根据冒号左边的内容, 提取冒号右边的内容
复制代码
 

  • 解析数据
  1. title = json_data['data']['moment']['title']
  2. video_url = json_data['data']['moment']['videoInfo']['definitions'][0]['url']
复制代码
 

  • 保存数据 >>> 发送请求 并且获取数据
  1. video_content = requests.get(url=video_url, headers=headers).content
  2. with open('video\\' + title + '.mp4', mode='wb') as f:
  3.     f.write(video_content)
  4. print(title, video_url)
复制代码
 





尾语
来源:https://www.cnblogs.com/hahaa/p/17253560.html
免责声明:由于采集信息均来自互联网,如果侵犯了您的权益,请联系我们【E-Mail:cb@itdo.tech】 我们会及时删除侵权内容,谢谢合作!

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

x

举报 回复 使用道具