详情

首页手游攻略 11、web爬虫讲解2怎么做-执行顺序和关键限制

11、web爬虫讲解2怎么做-执行顺序和关键限制

佚名 2026-09-03 19:58:00

爬虫讲解不能只看功能名称,更要看它在什么场景下能解决问题。把web、爬虫讲解、怎么做等信息拆开来看,判断会更直接。

先看原文给出的关键信息:xpath表达式 //x表示向下查找n层指定标签;如://p 表示查找所有p标签 /x表示向下查找一层指定的标签 /@x表示查找指定属性的值;能连缀如:@id @src [@属性名称="属性值"]表示查找指定属性等于指定值的标签。继续往下处理时,重点放在这些条件上:如查找class名称等于指定名称的标签 /text()获取标签文本类容 [x]通过索引获取集合里的指定一个元素 1、将xpath表达式过滤出来的结果完成正则匹配;用正则取最终内容收尾时.re('正则') xpath('//p[@class="showlist"]/li//img')[0].re('alt="(w )') 2、在选取器规则;必须继承scrapy.Item类 scrapy.Field()做法。收尾检查时,再把这些细节对上:必须继承scrapy.Spider name设定爬虫名称allowed_domains设定爬取域名start_urls设定爬取网址parse(response)爬虫回调;response里是获取到的html数据对象xpath()过滤器;参数是xpath表达式extract()获取html数据对象里的数据yield item接收了数据的容器对象。

相关资讯
点击查看更多
游戏推荐
推荐专题
热门阅读
推荐下载