scrapy 2.3 安裝指南
1. scrapy 2.3 安裝教程
2. scrapy 2.3 Windows環(huán)境搭建教程
3. scrapy 2.3 Ubuntu環(huán)境搭建教程
4. scrapy 2.3 macOS環(huán)境搭建教程
5. scrapy 2.3 PyPy環(huán)境搭建教程
6. scrapy 2.3 故障排除
scrapy 2.3 教程
1. scrapy 2.3 創(chuàng)建項(xiàng)目
2. scrapy 2.3 創(chuàng)建蜘蛛
3. scrapy 2.3 如何運(yùn)行我們的蜘蛛
4. scrapy 2.3 請(qǐng)求方法快捷方式
5. scrapy 2.3 提取數(shù)據(jù)
6. scrapy 2.3 在蜘蛛中提取數(shù)據(jù)
7. scrapy 2.3 存儲(chǔ)抓取的數(shù)據(jù)
8. scrapy 2.3 數(shù)據(jù)抓取實(shí)例
9. scrapy 2.3 蜘蛛?yún)?shù)
scrapy 2.3 命令行工具
1. scrapy 2.3 配置設(shè)置
2. scrapy 2.3 報(bào)廢項(xiàng)目的默認(rèn)結(jié)構(gòu)
3. scrapy 2.3 在項(xiàng)目之間共享根目錄
4. scrapy 2.3 工具
5. scrapy 2.3 可用工具命令
6. scrapy 2.3 自定義項(xiàng)目命令
scrapy 2.3 蜘蛛
1. scrapy 2.3 scrapy.Spider
2. scrapy 2.3 蜘蛛爬取參數(shù)
3. scrapy 2.3 類蜘蛛CrawlSpider
4. scrapy 2.3 XMLFeedSpider
5. scrapy 2.3 CSVFeedSpider
6. scrapy 2.3 SitemapSpider
scrapy 2.3 選擇器
1. scrapy 2.3 使用選擇器
2. scrapy 2.3 使用xpaths
3. scrapy 2.3 內(nèi)置選擇器引
  1. scrapy 2.3 SelectorList對(duì)象
4. scrapy 2.3 選擇器實(shí)例
  1. scrapy 2.3 HTML響應(yīng)的選擇器示例
  2. scrapy 2.3 XML響應(yīng)的選擇器示例
scrapy 2.3 項(xiàng)目
1. scrapy 2.3 項(xiàng)目類型
2. scrapy 2.3 使用項(xiàng)目對(duì)象
3. scrapy 2.3 支持所有項(xiàng)目類型
4. scrapy 2.3 與項(xiàng)目相關(guān)的其他類別
scrapy 2.3 項(xiàng)目加載器
1. scrapy 2.3 使用項(xiàng)目加載器填充項(xiàng)目
2. scrapy 2.3 使用dataclass項(xiàng)
3. scrapy 2.3 輸入和輸出處理器
4. scrapy 2.3 聲明項(xiàng)加載器
5. scrapy 2.3 聲明輸入和輸出處理器
6. scrapy 2.3 項(xiàng)目加載器上下文
7. scrapy 2.3 嵌套裝載機(jī)
8. scrapy 2.3 重復(fù)使用和擴(kuò)展項(xiàng)目加載器
scrapy 2.3 shell
1. scrapy 2.3 配置shell
2. scrapy 2.3 shell啟動(dòng)外殼
3. scrapy 2.3 shell使用外殼
  1. scrapy 2.3 shell可用快捷方式
  2. scrapy 2.3 Shell可用對(duì)象
4. scrapy 2.3 Shell會(huì)話示例
5. scrapy 2.3 從spiders調(diào)用shell來檢查響應(yīng)
scrapy 2.3 項(xiàng)目管道
1. scrapy 2.3 編寫自己的項(xiàng)目管道
2. scrapy 2.3 項(xiàng)目管道示例
3. scrapy 2.3 激活項(xiàng)目管道組件
scrapy 2.3 Feed導(dǎo)出
1. scrapy 2.3 序列化格式
2. scrapy 2.3 儲(chǔ)藏室
3. scrapy 2.3 存儲(chǔ)URI參數(shù)
4. scrapy 2.3 存儲(chǔ)后端
5. scrapy 2.3 Feed導(dǎo)出設(shè)置
scrapy 2.3 請(qǐng)求和響應(yīng)
1. 無標(biāo)題文章
2. scrapy 2.3 停止下載響應(yīng)
3. scrapy 2.3 請(qǐng)求子類
  1. scrapy 2.3 FormRequest對(duì)象
4. scrapy 2.3 響應(yīng)子類
scrapy 2.3 鏈接提取器
scrapy 2.3 設(shè)置
1. scrapy 2.3 填充設(shè)置
2. scrapy 2.3 導(dǎo)入路徑和類
3. scrapy 2.3 如何訪問設(shè)置
4. scrapy 2.3 內(nèi)置設(shè)置參考
scrapy 2.3 內(nèi)置異常引用
scrapy 2.3 登錄
1. scrapy 2.3 日志級(jí)別
2. scrapy 2.3 如何記錄消息
3. scrapy 2.3 從蜘蛛記錄
4. scrapy 2.3 日志記錄配置
scrapy 2.3 統(tǒng)計(jì)數(shù)據(jù)集合
1. scrapy 2.3 常用統(tǒng)計(jì)信息收集器使用
scrapy 2.3 發(fā)送電子郵件
1. scrapy 2.3 郵件設(shè)置
scrapy 2.3 遠(yuǎn)程登錄控制臺(tái)
1. scrapy 2.3 telnet控制臺(tái)中的可用變量
2. scrapy 2.3 telnet控制臺(tái)使用示例
3. scrapy 2.3 Telnet控制臺(tái)信號(hào)
4. scrapy 2.3 遠(yuǎn)程登錄設(shè)置
scrapy 2.3 常見問題
1. Scrapy與BeautifulSoup或LXML相比如何
2. BeautifulSoup能和Scrapy一起使用嗎？
3. Scrapy是否從Django“竊取”X？
4. Scrapy能與HTTP代理一起工作嗎？
5. Scrapy是以廣度優(yōu)先還是深度優(yōu)先的順序爬行？
6. 響應(yīng)狀態(tài)代碼999是什么意思？
7. 我可以從我的蜘蛛調(diào)用``pdb.set_trace（）``來調(diào)試它們嗎？
8. 如何將我的所有抓取項(xiàng)轉(zhuǎn)儲(chǔ)到j(luò)son/csv/xml文件中？
9. 我應(yīng)該使用蜘蛛?yún)?shù)或設(shè)置來配置我的蜘蛛嗎？
10. 如何在項(xiàng)目管道中將項(xiàng)目拆分為多個(gè)項(xiàng)目？
scrapy 2.3 調(diào)試spiders
1. scrapy 2.3 解析命令
2. scrapy 2.3 Scrapy Shell
3. scrapy 2.3 在瀏覽器中打開
4. scrapy 2.3 登錄
scrapy 2.3 蜘蛛合約
1. scrapy 2.3 正在檢測檢查運(yùn)行
scrapy 2.3 常用做法
1. scrapy 2.3 怎么從腳本中運(yùn)行
2. scrapy 2.3 在同一進(jìn)程中運(yùn)行多個(gè)spider
3. scrapy 2.3 分布式爬行
4. scrapy 2.3 避免被禁止
scrapy 2.3 寬爬行
1. scrapy 2.3 使用權(quán)利
2. scrapy 2.3 增加并發(fā)性
3. scrapy 2.3 增加Twisted IO線程池的最大大小
4. scrapy 2.3 設(shè)置您自己的DNS
5. scrapy 2.3 降低日志級(jí)別
6. scrapy 2.3 禁用Cookie
7. scrapy 2.3 禁用重試
8. scrapy 2.3 減少下載超時(shí)
9. scrapy 2.3 禁用重定向
10. scrapy 2.3 啟用“Ajax可爬行頁”的爬行
11. scrapy 2.3 按BFO順序爬行
12. scrapy 2.3 注意內(nèi)存泄漏
13. scrapy 2.3 安裝一個(gè)特殊的扭曲反應(yīng)器
scrapy 2.3 使用瀏覽器的開發(fā)人員工具進(jìn)行抓取
1. scrapy 2.3 檢查實(shí)時(shí)瀏覽器DOM時(shí)的注意事項(xiàng)
2. scrapy 2.3 查看網(wǎng)站
3. scrapy 2.3 網(wǎng)絡(luò)工具
scrapy 2.3 選擇動(dòng)態(tài)加載的內(nèi)容
1. scrapy 2.3 查找數(shù)據(jù)源
2. scrapy 2.3 檢查網(wǎng)頁的源代碼
3. scrapy 2.3 復(fù)制請(qǐng)求
4. scrapy 2.3 處理不同的響應(yīng)格式
5. scrapy 2.3 分析javascript代碼
6. scrapy 2.3 預(yù)渲染JavaScript
7. scrapy 2.3 使用無頭瀏覽器
scrapy 2.3 調(diào)試內(nèi)存泄漏
1. scrapy 2.3 內(nèi)存泄漏的常見原因
2. scrapy 2.3 使用調(diào)試內(nèi)存泄漏 trackref
3. scrapy 2.3 用muppy調(diào)試內(nèi)存泄漏
4. scrapy 2.3 無泄漏泄漏
scrapy 2.3 下載和處理文件和圖像
1. scrapy 2.3 使用文件管道
2. scrapy 2.3 使用圖像管道
3. scrapy 2.3 啟用媒體管道
4. scrapy 2.3 支持的存儲(chǔ)
5. scrapy 2.3 圖像處理實(shí)例
6. scrapy 2.3 下載處理其他功能
7. scrapy 2.3 擴(kuò)展媒體管道
8. scrapy 2.3 自定義圖像管道示例
scrapy 2.3 如何部署蜘蛛
scrapy 2.3 AutoThrottle擴(kuò)展
scrapy 2.3 標(biāo)桿管理
scrapy 2.3 暫停和恢復(fù)爬行
scrapy 2.3 協(xié)同程序
scrapy 2.3 asyncio

閱讀(2k) 書簽贊(0) 我要糾錯(cuò)

scrapy 2.3 SitemapSpider

2021-06-09 10:07 更新

classscrapy.spiders.SitemapSpider

SiteMapSpider允許您通過使用 Sitemaps .

它支持嵌套的站點(diǎn)地圖和從中發(fā)現(xiàn)站點(diǎn)地圖URL robots.txt .

sitemap_urls

指向要爬網(wǎng)其URL的網(wǎng)站地圖的URL列表。

您也可以指向 robots.txt 它將被解析為從中提取站點(diǎn)地圖URL。

sitemap_rules

元組列表 (regex, callback) 在哪里？

regex 是一個(gè)正則表達(dá)式，用于匹配從站點(diǎn)地圖中提取的URL。 regex 可以是str或已編譯的regex對(duì)象。
回調(diào)是用于處理與正則表達(dá)式匹配的URL的回調(diào)。 callback 可以是字符串（指示spider方法的名稱）或可調(diào)用的。

例如：：

sitemap_rules = [('/product/', 'parse_product')]

規(guī)則按順序應(yīng)用，只使用第一個(gè)匹配的規(guī)則。

如果省略此屬性，則在站點(diǎn)地圖中找到的所有URL都將使用 parse 回調(diào)。

sitemap_follow

應(yīng)遵循的站點(diǎn)地圖正則表達(dá)式列表。這只適用于使用 Sitemap index files 指向其他站點(diǎn) Mapfile 。

默認(rèn)情況下，將遵循所有站點(diǎn)地圖。

sitemap_alternate_links

指定是否為一個(gè) url 應(yīng)該遵循。這些是同一網(wǎng)站的鏈接，使用同一網(wǎng)站內(nèi)傳遞的另一種語言 url 塊。

例如：：

<url>
    <loc>http://example.com/</loc>
    <xhtml:link rel="alternate" hreflang="de"  rel="external nofollow" target="_blank" />
</url>

用 sitemap_alternate_links 設(shè)置，這將檢索兩個(gè)URL。用 sitemap_alternate_links 只有殘疾人 http://example.com/ 將被取回。

sitemap_alternate_links 殘疾人。

sitemap_filter(entries)

這是一個(gè)過濾器函數(shù)，可以重寫該函數(shù)以根據(jù)其屬性選擇站點(diǎn)地圖條目。

例如：：

<url>
    <loc>http://example.com/</loc>
    <lastmod>2005-01-01</lastmod>
</url>

我們可以定義一個(gè) sitemap_filter 要篩選的函數(shù) entries 日期：

from datetime import datetime
from scrapy.spiders import SitemapSpider

class FilteredSitemapSpider(SitemapSpider):
    name = 'filtered_sitemap_spider'
    allowed_domains = ['example.com']
    sitemap_urls = ['http://example.com/sitemap.xml']

    def sitemap_filter(self, entries):
        for entry in entries:
            date_time = datetime.strptime(entry['lastmod'], '%Y-%m-%d')
            if date_time.year >= 2005:
                yield entry

這只能找回 entries 2005年及以后年份修改。

條目是從站點(diǎn)地圖文檔中提取的dict對(duì)象。通常，鍵是標(biāo)記名，值是其中的文本。

重要的是要注意：

由于loc屬性是必需的，因此不帶此標(biāo)記的條目將被丟棄。
備用鏈接用鍵存儲(chǔ)在列表中 alternate （見 sitemap_alternate_links ）
名稱空間被刪除，因此名為 {{namespace}}tagname 成為唯一 tagname

如果省略此方法，則將處理站點(diǎn)地圖中找到的所有條目，同時(shí)觀察其他屬性及其設(shè)置。

SiteMapSpider示例

最簡單的示例：使用 parse 回叫：

from scrapy.spiders import SitemapSpider

class MySpider(SitemapSpider):
    sitemap_urls = ['http://www.example.com/sitemap.xml']

    def parse(self, response):
        pass # ... scrape item here ...

使用特定回調(diào)處理某些URL，使用其他回調(diào)處理其他URL:：

from scrapy.spiders import SitemapSpider

class MySpider(SitemapSpider):
    sitemap_urls = ['http://www.example.com/sitemap.xml']
    sitemap_rules = [
        ('/product/', 'parse_product'),
        ('/category/', 'parse_category'),
    ]

    def parse_product(self, response):
        pass # ... scrape product ...

    def parse_category(self, response):
        pass # ... scrape category ...

遵循中定義的站點(diǎn)地圖 robots.txt 文件，僅跟蹤其URL包含 /sitemap_shop ：：

from scrapy.spiders import SitemapSpider

class MySpider(SitemapSpider):
    sitemap_urls = ['http://www.example.com/robots.txt']
    sitemap_rules = [
        ('/shop/', 'parse_shop'),
    ]
    sitemap_follow = ['/sitemap_shops']

    def parse_shop(self, response):
        pass # ... scrape shop here ...

將SiteMapSpider與其他URL源合并：：

from scrapy.spiders import SitemapSpider

class MySpider(SitemapSpider):
    sitemap_urls = ['http://www.example.com/robots.txt']
    sitemap_rules = [
        ('/shop/', 'parse_shop'),
    ]

    other_urls = ['http://www.example.com/about']

    def start_requests(self):
        requests = list(super(MySpider, self).start_requests())
        requests += [scrapy.Request(x, self.parse_other) for x in self.other_urls]
        return requests

    def parse_shop(self, response):
        pass # ... scrape shop here ...

    def parse_other(self, response):
        pass # ... scrape other here ...

以上內(nèi)容是否對(duì)您有幫助：

← scrapy 2.3 CSVFeedSpider

scrapy 2.3 選擇器 →

寫筆記

我要補(bǔ)充

scrapy 2.3 SitemapSpider

SiteMapSpider示例

推薦文章

推薦教程

推薦課程