您好,欢迎访问一九零五行业门户网

Python怎么爬虫淘宝商品数据

这次的主要的目的是从淘宝的搜索页面获取商品的信息。其实分析页面找到信息很容易,页面信息的存放都是以静态的方式直接嵌套的页面上的,很容易找到。主要困难是将信息从html源码中剥离出来,数据和网页源码结合的很紧密,剥离数据有一定的难度。
然后将获取的信息写入excel表格保存起来,这次只爬取了前面10页的内容。
代码如下:
import requestsimport refrom xlwt import workbookimport xlrdimport timedef key_name( number ): #获取页面的内容并返回 name = '手机' url_1 = "https://s.taobao.com/search?ie=utf8&initiative_id=staobaoz_20170905&stats_click=search_radio_all%3a1&js=1&imgfile=&q=" url_2 = "&suggest=0_1&_input_charset=utf-8&wq=u&suggest_query=u&source=suggest&p4ppushleft=5%2c48&s=" url = ( url_1 + name + url_2 + str(number)) #print(url) res = requests.get( url ) return res.textdef find_date( text): #根据整个页面的信息,获取商品的数据所在的html源码并放回 reg = r',"data":{"spus":\[({.+?)\]}},"header":' reg = re.compile(reg) info = re.findall(reg, text) return info[0]def manipulation_data( info, n, sheet ): #解析获取的html源码,获取数据 date = eval(info) for d in date: t = " ".join([t['tag'] for t in d['tag_info']]) #print(d['title'] + '\t' + d['price'] + '\t' + d['importantkey'][0:len(d['importantkey'])-1] + '\t' + t) sheet.write(n,0,d['title']) sheet.write(n,1,d['price']) sheet.write(n,2,t) n = n + 1 return n def main(): book = workbook() sheet = book.add_sheet('淘宝手机数据') sheet.write(0,0,'品牌') sheet.write(0,1,'价格') sheet.write(0,2,'配置') book.save('淘宝手机数据.xls') #k用于生成链接,每个链接的最后面的数字相差48. #n用于记录表格的数据行数,便于写入数据 k = 0 n = 1 for i in range(10+1): text = key_name( k + i * 48 ) info = find_date(text) n = manipulation_data( info ,n, sheet ) book.save('淘宝手机数据.xls') print('下载第' + str(i) + '页完成')if __name__ == '__main__': main()
更多python相关技术文章,请访问python教程栏目进行学习!
以上就是python怎么爬虫淘宝商品数据的详细内容。
其它类似信息

推荐信息