python正则匹配抓取豆瓣电影链接和评论代码分享

代码如下:

import urllib.requestimport reimport time

def movie(movietag): tagurl=urllib.request.urlopen(url) tagurl_read = tagurl.read().decode(‘utf-8’) return tagurl_read

def subject(tagurl_read):

”’ 这里还存在问题: ①这只针对单独的一页进行排序,而没有对全部页面的电影进行排序 ②下次更新添加电影链接,考虑添加电影海报 ③需要追加列表 ④导入到本地txt或excel中 ⑤在匹配电影名字时是否可以同时匹配链接与名字、评分、评论组成数组 ⑥ ”’#正则表达式匹配电影的名字(链接)、评分与评论 nameurl = re.findall(r'(http://movie.douban.com/subject/[0-9.]+)\/”\s+title=”(.+)”‘,tagurl_read) scoreurl = re.findall(r'([0-9.]+)’,tagurl_read) evaluateurl = re.findall(r’\((\w+)人评价\)’,tagurl_read) movielists = list(zip(nameurl,scoreurl,evaluateurl)) newlist.extend(movielists) return newlist

#用quote处理特殊(中文)字符movie_type = urllib.request.quote(input(‘请输入电影类型(如剧情、喜剧、悬疑):’))page_end=int(input(‘请输入搜索结束时的页码:’))num_end=page_end*20num=0page_num=1newlist=[]while num

Posted in 未分类