App下載

Python爬蟲之批量下載音頻

猿友 2021-08-04 13:42:30 瀏覽數(shù) (4324)
反饋

很多小伙伴有聽故事或者聽廣播的習慣,但并不是什么時候都有網(wǎng)絡(luò),這時候把它們離線下來就可以隨時聽自己想聽的內(nèi)容了?;诖诵枨?,今天的python爬蟲實戰(zhàn)我們就來介紹一下python批量下載音頻怎么操作吧。

 文中代碼已經(jīng)過處理,不能直接運行?。?!

非法爬取別人網(wǎng)站資源是違法行為,學習爬蟲的時候在數(shù)據(jù)爬取方面也要適度?。。?/font>

一、解析網(wǎng)站

1.1 獲取音頻地址

在目標網(wǎng)站上,隨便點開一個音頻,打開“開發(fā)者工具”,再點擊播放按鈕,可以看到出現(xiàn)了多個請求:

頁面分析

經(jīng)過排查,發(fā)現(xiàn)可疑url:

網(wǎng)址

查看它的響應(yīng)信息,發(fā)現(xiàn)音頻地址就在里面:

請求分析

接下來,解析這個返回音頻地址的url:

https://www.****.com/revision/play/v1/audio?id=348451879&ptype=1

發(fā)現(xiàn)url中的id參數(shù)就決定了返回的音頻地址,而id參數(shù)是音頻的id號。

1.2 解析專欄網(wǎng)頁

我們已經(jīng)知道了獲取音頻url的網(wǎng)址,接下來要獲取一個專欄內(nèi)的音頻id和名稱,打開一個專欄,發(fā)現(xiàn):

頁面解析

所有的音頻存放在class為1F_的li標簽中,再來解析li標簽:

元素解析

在li標簽中的第一個a標簽存儲著我們所有需要的數(shù)據(jù),妙~??!

1.3 整理億下思路

思路:

1.獲取專欄內(nèi)的li標簽

2.獲取li標簽里的第一個a標簽

3.讀取a標簽的title和href屬性

4.將href解析成音頻id

5.將id帶入url請求音頻源地址

6.提取音頻源地址

7.請求音頻源地址

8.保存音頻(文件名為a的title屬性)

思路整理完了,開始編寫代碼。

二、編寫爬取代碼

代碼奉上——

import requests
from fake_useragent import UserAgent as ua
from bs4 import BeautifulSoup as bs

# 專欄地址
music_list_url = 'https://www.****.com/ertongjiaoyu/19702607/'
# 獲取音頻地址的url
get_link_url = "https://www.****.com/revision/play/v1/audio"

# UA偽裝
headers = {
    "User-Agent": ua().random
}

# 參數(shù)
params = {
    "id": None,    # id先設(shè)為None
    "ptype": "1",
}

# 獲取專欄HTML源碼
music_list_r = requests.get(music_list_url, headers=headers)
# 解析 獲取所有l(wèi)i標簽
soup = bs(music_list_r.text, "lxml")
li = soup.find_all("li", {"class": "lF_"})

# for循序遍歷處理
for i in li:
    a = i.find("a")   # 找到a標簽
    # 獲取href屬性
    # split("/")將字符串以"/"作為分隔符 從右往左數(shù)第一項是id號
    music_id = a.get("href").split("/")[-1]
    # 獲取title屬性 和“.m4a”拼接成文件名
    music_name = a.get("title") + ".m4a"

	# 修改請求參數(shù)id
    params['id'] = music_id

	# 獲得音頻源地址
    r = requests.get(get_link_url, headers=headers, params=params)
    link = r.json()['data']['src']

	# 獲取音頻文件并保存
    music_file = requests.get(link).content
    with open(music_name, "wb") as f:
        f.write(music_file)

print("下載完畢!")

運行代碼,等待億會(真的要等億會),可以看到當前目錄下已經(jīng)出現(xiàn)了音頻文件,如圖:

爬取結(jié)果

到此這篇Python爬蟲實戰(zhàn)之批量下載音頻的文章就介紹到這了,更多Python爬蟲實戰(zhàn)內(nèi)容請搜索W3Cschool以前的文章或繼續(xù)瀏覽下面的相關(guān)文章。

0 人點贊