戰(zhàn):從華為應(yīng)用市場爬取海量應(yīng)用評論數(shù)據(jù))
1. 項(xiàng)目概述與核心價(jià)值最近在做一個(gè)關(guān)于移動(dòng)應(yīng)用用戶行為分析的項(xiàng)目需要大量真實(shí)的應(yīng)用評論數(shù)據(jù)作為支撐。市面上公開的數(shù)據(jù)集要么時(shí)效性差要么覆蓋的應(yīng)用不夠全面。于是我決定自己動(dòng)手目標(biāo)直指華為應(yīng)用市場爬取其平臺(tái)上所有應(yīng)用的評論數(shù)據(jù)。選擇華為應(yīng)用市場一是因?yàn)槠渥鳛閲鴥?nèi)主流的應(yīng)用分發(fā)平臺(tái)應(yīng)用數(shù)量龐大評論數(shù)據(jù)豐富且具有代表性二是因?yàn)槠鋀eb端頁面結(jié)構(gòu)相對規(guī)整適合作為爬蟲實(shí)戰(zhàn)的典型場景。這個(gè)項(xiàng)目聽起來簡單但實(shí)際操作起來從反爬策略應(yīng)對、數(shù)據(jù)清洗到大規(guī)模異步抓取每一步都藏著不少門道。今天我就把這次從零搭建Scrapy爬蟲完整爬取華為應(yīng)用市場評論數(shù)據(jù)的實(shí)戰(zhàn)經(jīng)驗(yàn)、踩過的坑以及優(yōu)化技巧毫無保留地分享出來。無論你是剛接觸Scrapy的新手想找一個(gè)有挑戰(zhàn)性的實(shí)戰(zhàn)項(xiàng)目練手還是已經(jīng)有一定經(jīng)驗(yàn)想了解如何應(yīng)對中等復(fù)雜度的商業(yè)網(wǎng)站爬取相信這篇內(nèi)容都能給你帶來直接的參考價(jià)值。整個(gè)項(xiàng)目的核心思路是首先我們需要獲取華為應(yīng)用市場所有應(yīng)用的唯一標(biāo)識(shí)如包名或ID然后針對每一個(gè)應(yīng)用模擬真實(shí)用戶訪問其評論頁面解析并提取結(jié)構(gòu)化的評論數(shù)據(jù)最后考慮到海量應(yīng)用和翻頁評論必須設(shè)計(jì)高效的異步抓取與存儲(chǔ)方案。在這個(gè)過程中我們將重點(diǎn)解決幾個(gè)關(guān)鍵問題如何高效地發(fā)現(xiàn)和遍歷所有應(yīng)用如何穩(wěn)定地獲取并解析評論頁面的動(dòng)態(tài)內(nèi)容如何設(shè)計(jì)爬蟲架構(gòu)以應(yīng)對可能的風(fēng)控和反爬機(jī)制下面我們就從環(huán)境準(zhǔn)備開始一步步拆解實(shí)現(xiàn)過程。2. 環(huán)境準(zhǔn)備與Scrapy項(xiàng)目初始化工欲善其事必先利其器。在開始編寫爬蟲代碼之前我們需要搭建一個(gè)穩(wěn)定、高效的開發(fā)環(huán)境。我個(gè)人的習(xí)慣是使用Python 3.8的版本這個(gè)版本在穩(wěn)定性和庫兼容性上取得了很好的平衡。2.1 基礎(chǔ)環(huán)境搭建首先使用虛擬環(huán)境隔離項(xiàng)目依賴是一個(gè)好習(xí)慣可以避免不同項(xiàng)目間的包版本沖突。我通常使用venv來創(chuàng)建。# 創(chuàng)建項(xiàng)目目錄并進(jìn)入 mkdir huawei_appmarket_crawler cd huawei_appmarket_crawler # 創(chuàng)建Python虛擬環(huán)境 python3 -m venv venv # 激活虛擬環(huán)境 # 在Windows上: venv\Scripts\activate # 在Mac/Linux上: source venv/bin/activate激活虛擬環(huán)境后安裝核心的Scrapy框架。Scrapy是一個(gè)為爬取網(wǎng)站數(shù)據(jù)、提取結(jié)構(gòu)性數(shù)據(jù)而編寫的強(qiáng)大異步框架。pip install scrapy除了Scrapy我們還需要幾個(gè)輔助庫來應(yīng)對更復(fù)雜的情況scrapy-user-agents: 用于隨機(jī)輪換User-Agent降低被識(shí)別為爬蟲的風(fēng)險(xiǎn)。fake-useragent: 方便地生成隨機(jī)的、真實(shí)的瀏覽器User-Agent字符串。pymongo(可選): 如果你打算將數(shù)據(jù)存儲(chǔ)到MongoDB這是一個(gè)高效的驅(qū)動(dòng)??紤]到評論數(shù)據(jù)可能是半結(jié)構(gòu)化的JSONMongoDB是個(gè)不錯(cuò)的選擇。當(dāng)然使用Scrapy自帶的JsonItemExporter導(dǎo)出到文件也同樣可行。pip install scrapy-user-agents fake-useragent pymongo2.2 Scrapy項(xiàng)目創(chuàng)建與結(jié)構(gòu)解析接下來我們使用Scrapy的命令行工具快速生成項(xiàng)目骨架。scrapy startproject huawei_appmarket cd huawei_appmarket執(zhí)行后你會(huì)看到生成的標(biāo)準(zhǔn)項(xiàng)目結(jié)構(gòu)。理解每個(gè)文件的作用對后續(xù)開發(fā)至關(guān)重要huawei_appmarket/ ├── scrapy.cfg # 項(xiàng)目部署配置文件 └── huawei_appmarket/ # 項(xiàng)目Python模塊 ├── __init__.py ├── items.py # 定義要爬取的數(shù)據(jù)結(jié)構(gòu)Item ├── middlewares.py # 自定義中間件如代理、User-Agent處理 ├── pipelines.py # 數(shù)據(jù)后處理管道清洗、驗(yàn)證、存儲(chǔ) ├── settings.py # 項(xiàng)目全局設(shè)置并發(fā)、延遲、中間件啟用等 └── spiders/ # 爬蟲文件存放目錄 └── __init__.py關(guān)鍵設(shè)置調(diào)整 (settings.py):在編寫爬蟲前我們先對settings.py進(jìn)行一些關(guān)鍵配置這能事半功倍。# huawei_appmarket/settings.py BOT_NAME huawei_appmarket # 遵守robots協(xié)議對于商業(yè)網(wǎng)站建議先設(shè)置為False以測試但正式運(yùn)行時(shí)應(yīng)評估風(fēng)險(xiǎn)。 ROBOTSTXT_OBEY False # 配置并發(fā)請求數(shù)。對于華為應(yīng)用市場這類網(wǎng)站不宜設(shè)置過高避免對服務(wù)器造成過大壓力或觸發(fā)風(fēng)控。 # 我實(shí)測下來CONCURRENT_REQUESTS 16 是一個(gè)比較穩(wěn)健的起點(diǎn)。 CONCURRENT_REQUESTS 16 # 下載延遲。添加隨機(jī)延遲可以模擬人類操作非常重要。 # 使用 RANDOMIZE_DOWNLOAD_DELAY True 并設(shè)置一個(gè)基礎(chǔ)延遲。 DOWNLOAD_DELAY 0.5 RANDOMIZE_DOWNLOAD_DELAY True # 啟用我們即將配置的User-Agent中間件 DOWNLOADER_MIDDLEWARES { scrapy.downloadermiddlewares.useragent.UserAgentMiddleware: None, # 禁用默認(rèn)的 scrapy_user_agents.middlewares.RandomUserAgentMiddleware: 400, # 啟用隨機(jī)的 } # 配置Item Pipeline用于處理爬取到的數(shù)據(jù)。 ITEM_PIPELINES { huawei_appmarket.pipelines.HuaweiAppmarketPipeline: 300, } # 日志級別開發(fā)調(diào)試時(shí)設(shè)為DEBUG生產(chǎn)環(huán)境可設(shè)為INFO或WARNING。 LOG_LEVEL DEBUG # 設(shè)置一個(gè)合理的請求超時(shí)時(shí)間 DOWNLOAD_TIMEOUT 30注意DOWNLOAD_DELAY和CONCURRENT_REQUESTS需要根據(jù)目標(biāo)網(wǎng)站的反爬強(qiáng)度和自身網(wǎng)絡(luò)狀況進(jìn)行動(dòng)態(tài)調(diào)整。一開始可以保守一些觀察請求成功率再逐步微調(diào)。3. 核心爬蟲邏輯設(shè)計(jì)與實(shí)現(xiàn)這是整個(gè)項(xiàng)目的核心。我們的爬蟲需要完成兩個(gè)主要任務(wù)1. 發(fā)現(xiàn)所有應(yīng)用2. 爬取每個(gè)應(yīng)用的評論。我將采用“廣度優(yōu)先”的策略先由一個(gè)“應(yīng)用列表爬蟲”收集所有應(yīng)用的鏈接再由“評論詳情爬蟲”去具體抓取。3.1 定義數(shù)據(jù)模型 (items.py)首先在items.py中定義我們想要爬取的數(shù)據(jù)結(jié)構(gòu)。清晰的Item定義能讓后續(xù)的數(shù)據(jù)處理和存儲(chǔ)更規(guī)范。# huawei_appmarket/items.py import scrapy class AppItem(scrapy.Item): # 應(yīng)用基本信息從列表頁或詳情頁獲取 app_id scrapy.Field() # 應(yīng)用唯一標(biāo)識(shí)通常是包名或數(shù)字ID app_name scrapy.Field() # 應(yīng)用名稱 app_category scrapy.Field() # 應(yīng)用分類 app_url scrapy.Field() # 應(yīng)用詳情頁URL # 可能還有其他字段如開發(fā)者、評分等根據(jù)需求擴(kuò)展 class CommentItem(scrapy.Item): # 評論數(shù)據(jù) app_id scrapy.Field() # 關(guān)聯(lián)的應(yīng)用ID comment_id scrapy.Field() # 評論唯一ID如果有 user_name scrapy.Field() # 用戶名可能匿名化 user_rating scrapy.Field() # 用戶評分如5星 comment_text scrapy.Field() # 評論正文 comment_time scrapy.Field() # 評論時(shí)間 thumbs_up scrapy.Field() # 點(diǎn)贊數(shù) # 可以添加設(shè)備型號、應(yīng)用版本等字段3.2 應(yīng)用列表爬蟲發(fā)現(xiàn)所有應(yīng)用華為應(yīng)用市場Web端通常有分類瀏覽、排行榜、搜索等入口。為了盡可能全地覆蓋應(yīng)用一個(gè)有效策略是從“全部分類”頁面出發(fā)遍歷每個(gè)分類下的應(yīng)用列表并處理分頁。我們在spiders/目錄下創(chuàng)建第一個(gè)爬蟲文件app_list_spider.py。# huawei_appmarket/spiders/app_list_spider.py import scrapy from urllib.parse import urljoin from huawei_appmarket.items import AppItem class AppListSpider(scrapy.Spider): name app_list allowed_domains [appgallery.huawei.com] # 華為應(yīng)用市場Web版域名 start_urls [https://appgallery.huawei.com/categoryList] # 假設(shè)的分類列表頁 def parse(self, response): 解析分類列表頁提取所有分類的鏈接。 # 使用瀏覽器的開發(fā)者工具F12分析頁面找到分類鏈接的CSS選擇器或XPath。 # 這里的選擇器是示例實(shí)際需要根據(jù)目標(biāo)網(wǎng)站HTML結(jié)構(gòu)調(diào)整。 category_links response.css(div.category-list a::attr(href)).getall() for cat_link in category_links: full_cat_url urljoin(response.url, cat_link) # 將分類頁的請求交給 parse_category 方法處理 yield scrapy.Request(full_cat_url, callbackself.parse_category) def parse_category(self, response): 解析單個(gè)分類頁面提取該分類下的應(yīng)用列表和分頁。 # 1. 提取當(dāng)前頁的應(yīng)用信息 app_elements response.css(div.app-item) # 示例選擇器 for app in app_elements: item AppItem() # 解析應(yīng)用名稱、ID、詳情頁鏈接等 item[app_name] app.css(h4.app-title::text).get() # 詳情頁鏈接可能需要拼接 detail_path app.css(a.app-link::attr(href)).get() item[app_url] urljoin(response.url, detail_path) # 從詳情頁URL或元素中提取app_id # 例如URL可能為 https://.../app/C10123456則app_id為C10123456 item[app_id] item[app_url].split(/)[-1] item[app_category] response.css(h1.category-title::text).get() # 這里可以先yield item也可以先只收集URL在評論爬蟲里再抓詳情。 # 我選擇先yield讓Pipeline先存儲(chǔ)基礎(chǔ)信息。 yield item # 2. 同時(shí)為這個(gè)應(yīng)用生成評論頁的初始請求交給評論爬蟲處理 # 評論頁URL通常有規(guī)律例如{app_url}/comment 或 {app_url}?tabreview # 需要實(shí)際分析。這里假設(shè)為 {app_url}?tabreviewpage1 comment_start_url f{item[app_url]}?tabreviewpage1 yield scrapy.Request(comment_start_url, callbackself.parse_comments, meta{app_id: item[app_id]}) # 3. 處理分頁查找“下一頁”按鈕 next_page response.css(a.next-page::attr(href)).get() if next_page: next_page_url urljoin(response.url, next_page) yield scrapy.Request(next_page_url, callbackself.parse_category) def parse_comments(self, response): 解析單個(gè)應(yīng)用的評論第一頁。 這個(gè)方法的邏輯也可以獨(dú)立成一個(gè)單獨(dú)的爬蟲。 這里為了流程連貫放在一起。實(shí)際大型項(xiàng)目建議拆分。 # 評論數(shù)據(jù)解析邏輯見下一節(jié)。 pass實(shí)操心得選擇器調(diào)試使用scrapy shell ‘url’命令在終端快速測試你的CSS選擇器或XPath是否正確這是提高開發(fā)效率的關(guān)鍵。分頁策略對于“加載更多”這種動(dòng)態(tài)分頁Ajax需要分析網(wǎng)絡(luò)請求找到真正的數(shù)據(jù)接口通常是返回JSON的API而不是解析頁面HTML。華為應(yīng)用市場的評論很可能采用這種方式。去重Scrapy默認(rèn)根據(jù)URL去重。確保應(yīng)用的詳情頁URL或評論分頁URL能唯一標(biāo)識(shí)該資源避免重復(fù)爬取。3.3 評論詳情爬蟲解析動(dòng)態(tài)內(nèi)容現(xiàn)代網(wǎng)站大量使用JavaScript動(dòng)態(tài)加載數(shù)據(jù)評論列表更是如此。直接請求網(wǎng)頁URL得到的HTML可能不包含評論數(shù)據(jù)。我們需要分析瀏覽器與服務(wù)器之間的真實(shí)數(shù)據(jù)交互。使用瀏覽器開發(fā)者工具分析網(wǎng)絡(luò)請求打開華為應(yīng)用市場某個(gè)應(yīng)用的評論頁面如https://appgallery.huawei.com/app/C10123456?tabreview。按F12打開開發(fā)者工具切換到Network網(wǎng)絡(luò)選項(xiàng)卡。刷新頁面并滾動(dòng)評論列表觸發(fā)加載更多。在請求列表中過濾XHR或Fetch類型的請求尋找返回評論數(shù)據(jù)的請求。通常其響應(yīng)體是JSON格式。模擬API請求 假設(shè)我們找到了一個(gè)類似https://web-drcn.hispace.dbankcloud.cn/uowap/index?methodinternal.getTabDetailuriapp|C10123456tabKeyreviewpage1的接口它返回了JSON格式的評論數(shù)據(jù)。那么parse_comments方法就需要重寫不再解析HTML而是直接請求這個(gè)API接口并處理JSON響應(yīng)。# 修改或重寫 parse_comments 方法 def parse_comments(self, response): app_id response.meta[app_id] # 如果當(dāng)前響應(yīng)是HTML頁面我們需要從中提取API的URL構(gòu)造參數(shù)。 # 但更常見的做法是直接在 parse_category 中構(gòu)造API請求。 # 更好的做法在 parse_category 中直接構(gòu)造API請求 # 在 parse_category 方法里找到應(yīng)用后 comment_api_template “https://web-drcn.hispace.dbankcloud.cn/uowap/index?methodinternal.getTabDetailuriapp|{app_id}tabKeyreviewpage{page}” first_comment_page_url comment_api_template.format(app_iditem[‘a(chǎn)pp_id’], page1) yield scrapy.Request(first_comment_page_url, callbackself.parse_comment_api, meta{‘a(chǎn)pp_id’: item[‘a(chǎn)pp_id’], ‘page’: 1}) def parse_comment_api(self, response): “””解析評論API返回的JSON數(shù)據(jù)。””” app_id response.meta[‘a(chǎn)pp_id’] current_page response.meta[‘page’] try: data response.json() # 解析JSON結(jié)構(gòu)提取評論列表 comment_list data.get(‘list’, []) # 具體字段名需要根據(jù)實(shí)際API響應(yīng)確定 if not comment_list: # 如果當(dāng)前頁沒有數(shù)據(jù)說明已爬完 self.logger.info(f‘App {app_id} comments finished at page {current_page}‘) return for comment in comment_list: item CommentItem() item[‘a(chǎn)pp_id’] app_id item[‘comment_id’] comment.get(‘commentId’) item[‘user_name’] comment.get(‘userName’, ‘匿名用戶’) item[‘user_rating’] comment.get(‘score’, 5) # 假設(shè)5分制 item[‘comment_text’] comment.get(‘content’, ‘’).strip() item[‘comment_time’] comment.get(‘publishTime’) # 可能是時(shí)間戳 item[‘thumbs_up’] comment.get(‘praiseCount’, 0) yield item # 請求下一頁 next_page current_page 1 next_page_url response.url.replace(f’page{current_page}‘, f’page{next_page}‘) # 或者根據(jù)API返回的totalPage等信息判斷是否還有下一頁 # if current_page data.get(‘totalPage’, 1): yield scrapy.Request(next_page_url, callbackself.parse_comment_api, meta{‘a(chǎn)pp_id’: app_id, ‘page’: next_page}) except json.JSONDecodeError as e: self.logger.error(f‘Failed to parse JSON for {response.url}: {e}‘)重要提示上述API URL、參數(shù)名method,uri,tabKey以及JSON結(jié)構(gòu)中的字段名list,commentId,score等均為示例并非華為應(yīng)用市場的真實(shí)接口。你必須使用瀏覽器開發(fā)者工具親自分析目標(biāo)網(wǎng)站的真實(shí)請求找到正確的接口地址和參數(shù)格式。這是爬蟲開發(fā)中最關(guān)鍵的一步。4. 應(yīng)對反爬策略與提升穩(wěn)定性商業(yè)網(wǎng)站通常沒有反爬機(jī)制。直接按上述步驟爬取很快可能會(huì)遇到請求失敗、返回空數(shù)據(jù)甚至IP被封的情況。4.1 中間件增強(qiáng)User-Agent與代理我們已經(jīng)配置了隨機(jī)User-Agent。對于IP封鎖可以考慮使用代理IP池。這里以使用中間件集成代理為例。在middlewares.py中自定義一個(gè)代理中間件# huawei_appmarket/middlewares.py import random class RandomProxyMiddleware: def __init__(self, proxy_list): self.proxy_list proxy_list classmethod def from_crawler(cls, crawler): # 從settings或外部文件讀取代理列表 proxy_list crawler.settings.get(PROXY_LIST, []) # 或者從文件讀取proxy_list [line.strip() for line in open(proxies.txt)] return cls(proxy_list) def process_request(self, request, spider): if self.proxy_list and not request.meta.get(proxy): proxy random.choice(self.proxy_list) request.meta[proxy] proxy spider.logger.debug(fUsing proxy: {proxy}) # 在 settings.py 中啟用這個(gè)中間件并配置代理列表 DOWNLOADER_MIDDLEWARES { scrapy.downloadermiddlewares.useragent.UserAgentMiddleware: None, scrapy_user_agents.middlewares.RandomUserAgentMiddleware: 400, huawei_appmarket.middlewares.RandomProxyMiddleware: 750, # 數(shù)字代表優(yōu)先級 } # PROXY_LIST [http://ip1:port, http://ip2:port, ...]4.2 請求頭與Cookie模擬有些API會(huì)校驗(yàn)Referer,Origin等請求頭。我們需要在請求中模擬瀏覽器。# 在生成Request時(shí)添加headers headers { ‘Accept’: ‘a(chǎn)pplication/json, text/javascript, */*; q0.01’, ‘Accept-Language’: ‘zh-CN,zh;q0.9,en;q0.8’, ‘Referer’: ‘https://appgallery.huawei.com/’, # 設(shè)置合適的來源頁 ‘X-Requested-With’: ‘XMLHttpRequest’, # 如果是Ajax請求 } yield scrapy.Request(url, callbackself.parse_comment_api, headersheaders, metameta)對于需要登錄后才能查看的評論雖然華為應(yīng)用市場評論通常公開可能需要處理Cookie。可以使用scrapy.Request的cookies參數(shù)或者使用start_requests方法先發(fā)起一個(gè)登錄請求獲取Cookie。4.3 錯(cuò)誤重試與速率控制Scrapy內(nèi)置了重試中間件和自動(dòng)限速擴(kuò)展AutoThrottle合理配置它們能極大提升爬蟲的健壯性。# settings.py # 啟用并配置重試 RETRY_ENABLED True RETRY_TIMES 3 # 重試次數(shù) RETRY_HTTP_CODES [500, 502, 503, 504, 408, 429] # 需要重試的HTTP狀態(tài)碼 # 啟用自動(dòng)限速擴(kuò)展它會(huì)根據(jù)服務(wù)器響應(yīng)和負(fù)載自動(dòng)調(diào)整請求延遲 AUTOTHROTTLE_ENABLED True AUTOTHROTTLE_START_DELAY 1.0 # 初始延遲 AUTOTHROTTLE_MAX_DELAY 60.0 # 最大延遲 AUTOTHROTTLE_TARGET_CONCURRENCY 4.0 # 目標(biāo)平均并發(fā)數(shù)5. 數(shù)據(jù)存儲(chǔ)與后處理管道爬取到的數(shù)據(jù)需要持久化存儲(chǔ)。Scrapy的Pipeline組件非常適合做這件事。5.1 實(shí)現(xiàn)數(shù)據(jù)存儲(chǔ)Pipeline我們以存儲(chǔ)到MongoDB和JSON文件為例實(shí)現(xiàn)一個(gè)Pipeline。# huawei_appmarket/pipelines.py import json import pymongo from itemadapter import ItemAdapter from scrapy.exceptions import DropItem class HuaweiAppmarketPipeline: def __init__(self, mongo_uri, mongo_db): self.mongo_uri mongo_uri self.mongo_db mongo_db classmethod def from_crawler(cls, crawler): # 從settings讀取MongoDB配置 return cls( mongo_uricrawler.settings.get(MONGO_URI, mongodb://localhost:27017), mongo_dbcrawler.settings.get(MONGO_DATABASE, huawei_appmarket) ) def open_spider(self, spider): # 爬蟲啟動(dòng)時(shí)連接數(shù)據(jù)庫 self.client pymongo.MongoClient(self.mongo_uri) self.db self.client[self.mongo_db] # 也可以同時(shí)打開一個(gè)JSON文件 self.json_file open(comments.json, a, encodingutf-8) def close_spider(self, spider): # 爬蟲關(guān)閉時(shí)斷開連接關(guān)閉文件 self.client.close() self.json_file.close() def process_item(self, item, spider): # 決定存儲(chǔ)到哪個(gè)集合/表 adapter ItemAdapter(item) if comment_text in adapter: # 判斷是否為CommentItem collection_name comments # 存儲(chǔ)到MongoDB self.db[collection_name].insert_one(dict(adapter)) # 同時(shí)寫入JSON文件一行一個(gè)JSON對象 line json.dumps(dict(adapter), ensure_asciiFalse) \n self.json_file.write(line) elif app_name in adapter: # 判斷是否為AppItem collection_name apps self.db[collection_name].update_one( {app_id: adapter[app_id]}, {$set: dict(adapter)}, upsertTrue # 如果不存在則插入 ) return item在settings.py中啟用這個(gè)Pipeline并配置MongoDB連接字符串。ITEM_PIPELINES { huawei_appmarket.pipelines.HuaweiAppmarketPipeline: 300, } MONGO_URI mongodb://localhost:27017 MONGO_DATABASE huawei_appmarket5.2 數(shù)據(jù)清洗與去重在Pipeline中我們還可以加入數(shù)據(jù)清洗邏輯比如去除空評論、過濾廣告、統(tǒng)一時(shí)間格式等。def process_item(self, item, spider): adapter ItemAdapter(item) # 清洗評論數(shù)據(jù) if comment_text in adapter: text adapter.get(comment_text, ) # 去除空白字符 text text.strip() # 過濾掉過短或無意義的評論如“.”“好” if len(text) 2: raise DropItem(f“Dropped short comment: {text}”) adapter[comment_text] text # 時(shí)間格式轉(zhuǎn)換假設(shè)原始是時(shí)間戳 raw_time adapter.get(comment_time) if raw_time and isinstance(raw_time, (int, float)): # 轉(zhuǎn)換為可讀的ISO格式字符串 import datetime adapter[comment_time] datetime.datetime.fromtimestamp(raw_time/1000).isoformat() # ... 后續(xù)存儲(chǔ)邏輯6. 運(yùn)行、監(jiān)控與問題排查6.1 運(yùn)行爬蟲可以使用Scrapy命令行運(yùn)行特定的爬蟲。# 運(yùn)行應(yīng)用列表爬蟲如果拆分了的話 scrapy crawl app_list -o apps.json # 或者運(yùn)行一個(gè)集成了所有邏輯的主爬蟲 scrapy crawl main_spider -s LOG_FILEspider.log為了長時(shí)間穩(wěn)定運(yùn)行并記錄日志建議使用nohup或screen等工具在后臺(tái)運(yùn)行。nohup scrapy crawl main_spider crawl.log 21 6.2 常見問題與排查技巧在爬取過程中你幾乎一定會(huì)遇到下面這些問題。這是我的實(shí)戰(zhàn)記錄問題現(xiàn)象可能原因排查與解決思路返回HTTP 403/429錯(cuò)誤IP或請求頻率被限制1. 檢查DOWNLOAD_DELAY和CONCURRENT_REQUESTS調(diào)大延遲降低并發(fā)。2. 檢查代理IP是否有效、是否被目標(biāo)網(wǎng)站封禁。3. 檢查請求頭特別是User-Agent是否模擬到位。API請求返回空數(shù)據(jù)或錯(cuò)誤JSON參數(shù)不正確或接口已更新1. 使用scrapy shell ‘a(chǎn)pi_url’直接測試請求查看原始響應(yīng)。2. 用瀏覽器開發(fā)者工具對比你的請求和瀏覽器請求的所有細(xì)節(jié)包括URL參數(shù)、Headers尤其是Cookie和某些特定Token。3. 檢查是否需要處理頁面上的動(dòng)態(tài)Token如csrf_token可能需要先請求一個(gè)頁面來獲取。爬取速度越來越慢最后停止觸發(fā)了更嚴(yán)格的風(fēng)控1. 啟用AUTOTHROTTLE擴(kuò)展讓它自動(dòng)調(diào)節(jié)速度。2. 模擬更真實(shí)的行為隨機(jī)化請求間隔加入鼠標(biāo)移動(dòng)、滾動(dòng)等行為的模擬可通過Selenium中間件實(shí)現(xiàn)但較重。3. 考慮使用更高質(zhì)量的住宅代理IP。MongoDB連接失敗數(shù)據(jù)庫服務(wù)未啟動(dòng)或配置錯(cuò)誤1. 確認(rèn)MongoDB服務(wù)正在運(yùn)行 (systemctl status mongod或sudo service mongod status)。2. 檢查MONGO_URI是否正確包括IP、端口、認(rèn)證信息如果有。內(nèi)存使用持續(xù)增長可能發(fā)生了內(nèi)存泄漏或Pipeline處理太慢1. 檢查Pipeline中是否有大量數(shù)據(jù)緩存未釋放。2. 適當(dāng)降低CONCURRENT_ITEMSsettings中設(shè)置減少同時(shí)處理的Item數(shù)量。3. 使用scrapy stats命令查看爬蟲運(yùn)行狀態(tài)關(guān)注item_scraped_count和memusage/startup。一個(gè)關(guān)鍵的調(diào)試技巧當(dāng)爬蟲行為不符合預(yù)期時(shí)不要盲目修改代碼。首先在parse方法中使用self.logger.debug(f‘Response URL: {response.url}, Status: {response.status}’)打印關(guān)鍵信息。其次將出問題的響應(yīng)體保存到本地文件方便仔細(xì)分析。def parse_comment_api(self, response): with open(‘debug_response.html’, ‘wb’) as f: f.write(response.body) # 然后暫停爬蟲用瀏覽器或文本編輯器打開這個(gè)文件分析。7. 項(xiàng)目優(yōu)化與擴(kuò)展思路當(dāng)基礎(chǔ)爬蟲能穩(wěn)定運(yùn)行后可以考慮以下優(yōu)化和擴(kuò)展讓項(xiàng)目更專業(yè)、更強(qiáng)大。分布式爬取使用scrapy-redis組件將爬蟲改造成分布式利用多臺(tái)機(jī)器同時(shí)爬取速度可成倍提升。這對于“所有應(yīng)用”這種海量目標(biāo)非常有效。增量爬取不是每次都全量爬取。在Pipeline中記錄每條評論的爬取時(shí)間。下次運(yùn)行時(shí)只請求和解析新出現(xiàn)的評論。這需要對API接口支持按時(shí)間篩選或者通過對比已存儲(chǔ)的最新評論ID來實(shí)現(xiàn)。數(shù)據(jù)豐富化除了評論還可以爬取應(yīng)用的描述、更新日志、下載量、所屬開發(fā)者等信息構(gòu)建更全面的應(yīng)用畫像。情感分析與主題挖掘?qū)ε廊〉降脑u論文本進(jìn)行自然語言處理NLP例如使用snownlp或jiebasklearn進(jìn)行情感分析正面/負(fù)面/中性或提取高頻關(guān)鍵詞了解用戶對應(yīng)用的關(guān)注點(diǎn)和不滿之處。構(gòu)建監(jiān)控告警系統(tǒng)編寫一個(gè)簡單的腳本定期運(yùn)行爬蟲的核心測試部分如訪問一個(gè)固定應(yīng)用的評論頁檢查是否能正常獲取數(shù)據(jù)。如果連續(xù)失敗則通過郵件、釘釘機(jī)器人等方式發(fā)送告警。這個(gè)項(xiàng)目從表面看是一個(gè)標(biāo)準(zhǔn)的Scrapy爬蟲應(yīng)用但深入其中你會(huì)涉及到HTTP協(xié)議、前端逆向、反爬對抗、數(shù)據(jù)清洗、異步編程、數(shù)據(jù)庫存儲(chǔ)乃至簡單的系統(tǒng)設(shè)計(jì)等多個(gè)方面的知識(shí)。每一個(gè)環(huán)節(jié)的深入都能帶來技術(shù)上的切實(shí)提升。我最初版本爬取10萬個(gè)評論花了近一天經(jīng)過代理池、分布式和請求參數(shù)優(yōu)化后時(shí)間縮短到了幾個(gè)小時(shí)。這個(gè)過程里最大的體會(huì)就是耐心分析網(wǎng)絡(luò)請求謹(jǐn)慎模擬瀏覽器行為尊重目標(biāo)網(wǎng)站的服務(wù)器壓力是爬蟲項(xiàng)目能夠長期穩(wěn)定運(yùn)行的不二法門。希望這份詳細(xì)的實(shí)戰(zhàn)記錄能幫你少走彎路順利拿到你需要的數(shù)據(jù)。如果在實(shí)際操作中遇到新的具體問題比如某個(gè)特定的API參數(shù)怎么構(gòu)造歡迎隨時(shí)交流討論。