数据采集——爬虫篇(二)：美食信息采集

2023-12-08 04:16:43

数据采集——爬虫篇(二)：美食信息采集

1.分析美食网页的url参数构成

美食，地址：北京，搜索关键词：火锅
url：
https://bj.*******.com/s/%E7%81%AB%E9%94%85/

url会有自动编码中文功能所以火锅=%E7%81%AB%E9%94%85

通过关键词城市的url构造，解析当前url中的bj=北京，/s/后面跟搜索关键词
这样我们就可以了解到当前url的构造。

2.分析页面数据来源（F12开发者工具）

开启F12开发者工具，并且刷新当前页面：
可以看到切换到第二页时候，我们的url没有变化，网站也没有自动进行刷新跳转操作（web中ajax技术就是在保证页面不刷新，url不变化情况下进行数据加载的技术）
在这里插入图片描述

此时我们需要在开发者工具中找到xhr里面对应当前数据的响应文件
在这里插入图片描述

分析到这里可以得知我们数据是以json格式交互
分析第二页的json文件请求地址与第三页json文件请求地址
第二页：https://apimobile.*******.com/group/v4/poi/pcsearch/1?uuid=xxx&userid=-1&limit=32&offset=32&cateId=-1&q=%E7%81%AB%E9%94%85
第三页：https://apimobile.*******.com/group/v4/poi/pcsearch/1?uuid=xxx&userid=-1&limit=32&offset=64&cateId=-1&q=%E7%81%AB%E9%94%85
对比发现offse参数每次翻页增加32
并且limit参数是一次请求的数据量，offse是数据请求的开始元素，q是搜索关键词poi/pcsearch/1？其中的1是北京城市的id编号。

3.构造请求抓取美食数据

接下来直接构造请求，循环访问每一页的数据，代码如下：

import requests
import redef start():for w in range(0, 1600, 32):#页码根据实际情况x32即可，我这里是设置50页为上限，为了避免设置页码过高或者数据过少情况，定义最大上限为1600-也就是50页，使用try-except来检测时候异常，异常跳过该页，一般作为无数据跳过该页处理try:# 注意uuid后面参数空余将uuid后xxx替换为自己的uuid参数url = 'https://apimobile.*******.com/group/v4/poi/pcsearch/1?uuid=xxx&userid=-1&limit=32&offset='+str(w)+'&cateId=-1&q=%E7%81%AB%E9%94%85'#headers的数据可以在F12开发者工具下面的requests_headers中查看，需要实现选择如下headers信息#必要情况  请求频繁 建议增加cookie参数在headers内headers = {'Accept': '*/*','Accept-Encoding': 'gzip, deflate, br','Accept-Language': 'zh-CN,zh;q=0.9','Connection': 'keep-alive','User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.25 Safari/537.36 Core/1.70.3741.400 QQBrowser/10.5.3863.400','Host': 'apimobile.*******.com','Origin': 'https://bj.*******.com','Referer': 'https://bj.*******.com/s/%E7%81%AB%E9%94%85/'}response = requests.get(url, headers=headers)#正则获取当前响应内容中的数据，因json方法无法针对店铺特有的title键值进行获取没所以采用正则titles = re.findall('","title":"(.*?)","address":"', response.text)addresses = re.findall(',"address":"(.*?)",', response.text)avgprices = re.findall(',"avgprice":(.*?),', response.text)avgscores = re.findall(',"avgscore":(.*?),',response.text)comments = re.findall(',"comments":(.*?),',response.text)#输出当前返回数据的长度  是否为32print(len(titles), len(addresses), len(avgprices), len(avgscores), len(comments))for o in range(len(titles)):#循环遍历每一个值  写入文件中title = titles[o]address = addresses[o]avgprice = avgprices[o]avgscore = avgscores[o]comment = comments[o]#写入本地文件file_data(title, address, avgprice, avgscore, comment)#文件写入方法
def file_data(title, address, avgprice, avgscore, comment):data = {'店铺名称': title,'店铺地址': address,'平均消费价格': avgprice,'店铺评分': avgscore,'评价人数': comment}with open('美食.txt', 'a', encoding='utf-8')as fb:fb.write(json.dumps(data, ensure_ascii=False) + '\n')#ensure_ascii=False必须加因为json.dumps方法不关闭转码会导致出现乱码情况
if __name__ == '__main__':start()

运行结果如下：
在这里插入图片描述
本地文件：
共写入1024条数据

总结：

根据搜索词变化，城市变化，可以改变url中指定的参数来实现，同时也要记得变更headers中的指定参数，方法简单，多加练习即可熟悉ajax类型的数据抓取。转载请注明出处！https://blog.csdn.net/dbldwang/article/details/106638364

本文来自互联网用户投稿，文章观点仅代表作者本人，不代表本站立场，不承担相关法律责任。如若转载，请注明出处。 如若内容造成侵权/违法违规/事实不符，请点击【内容举报】进行投诉反馈！

标签：技术

上一篇 > “广东味道”亮相北京美食市集展现粤式文化
下一篇 > php美食餐厅,基于php的周边美食api调用代码实例

Duilib中list控件支持ctrl和shif多行选中的实现

[ICML2015]Batch Normalization:Accelerating Deep Network Training by Reducing Internal Covariate Shif

win10系统微软输入法于eclipse ctrl+shif+f冲突间接处理办法

Codeforces Round #259 (Div. 2) B. Little Pony and Sort by Shif

读LDD3，内存映射与DMA--PAGE_SHIF…

VMware虚拟机安装XP【要先分区，再设置BOOT 启动CD，shif+上移】

更换iBus五笔的左与右Shif

sublime ctrl+shif+f 没用解决办法

idea 对 ctrl + z 的撤销是 ctrl + shif + z

计算机最早的设计师应用于,计算机应用基础选择题doc.doc

win10自带截图神器：Win+Shift+S

Python基础之文件目录操作

python简述目录_Python基础之文件目录操作(示例代码)

tp5 如何做数据采集

任务2-7(服务器字体+阿里巴巴矢量库)

html标签（1)：h1~h6,p,br,pre,hr

TI 电量计介绍与芯片选型指南

几款TI电源芯片简介

TI DSP芯片C2000系列读取FLASH数据

德州仪器(Ti)平台嵌入式开发基础

TI三相电机智能栅极驱动芯片特点分类

省选模拟（12.08） T3 圈圈圈圈圈圈圈圈

Hadoop生态圈技术栈（上）

大数据开发基础入门与项目实战（三）Hadoop核心及生态圈技术栈之6.Impala交互式查询

小猿圈之Linux下Mysql 操作命令

大数据Hadoop生态圈常用面试题

大数据开发基础入门与项目实战（三）Hadoop核心及生态圈技术栈之4.Hive DDL、DQL和数据操作

备战Noip2018模拟赛11（B组）T3 Monogatari 物语

【智能优化算法-圆圈搜索算法】基于圆圈搜索算法Circle Search Algorithm求解单目标优化问题附matlab代码

NYOJ 78 圈水池

递归问题跑道汽车绕圈问题 Python实现

Hadoop生态圈（三）：MapReduce

数据采集——爬虫篇(二)：美食信息采集