python编程获取《续蜀山剑侠传》目录信息：目录名称和网址-eolink官网

python编程获取《续蜀山剑侠传》目录信息：目录名称和网址

一直很欣赏武侠小说宗师还珠楼主李寿民的扛鼎之作《蜀山剑侠传》，可惜由于种种原因，《蜀山剑侠传》并未写完。这着实令还珠迷们扼腕，也有不少人继写了《蜀山剑侠传》，但是良莠夹杂，其中有一位退休公务员写的《续蜀山剑侠传》相对来说是按照还珠楼主的思路续写的，并且在网上连载了，于是想把它从网上down下来保存为txt文件。顺便练习一下Python编程。

首先要获取目录信息，主要是目录名称和网址。通过分析连载网站的网页源代码，编写Python代码如下：

# -*- coding:UTF-8 -*-import urllib.request, sysimport redef openUrl(url): try: page = urllib.request.urlopen(url, data=None, timeout=5) except urllib.error.HTTPError as e: print(e.code) print(e.reason) return '' except urllib.error.URLError as e: print(e.reason) return '' else: html = page.read().decode('utf-8') return htmldef getList(html, tag): i = html.find(tag) if i == -1: print ('没有找到' + tag) return '' else: con = html[i+len(tag):] #print ("前30个字符：" + con[:30]) tag = 'ul' tag_pat = r'(?<=<'+ tag + '>).*?(?=)' tag_ex = re.compile(tag_pat, re.M|re.S) con = re.findall(tag_ex, con) #con = html.split('正文') #print (con[0]) return con[0]def printList(list, host): #获取text res = r'(.*?)' t = re.findall(res, list, re.S|re.M) #获取href res_url = r"(?<=href=\").+?(?=\")|(?<=href=\').+?(?=\')" h = re.findall(res_url, list, re.I|re.S|re.M) for i in range(len(t)): print (str(i+1) + '\t' + t[i] + '\t' + host + h[i])def main(): url = ' i = url.index('/', 7) host = url[0 : i] print ('打开' + url) html = openUrl(url) if len(html) > 0: tag = '正文' list = getList(html, tag) printList(list, host)main()

程序运行结果如下：

Python接口自动化之文件上传/下载接口怎么实现

326 2022-08-24

python编程获取《续蜀山剑侠传》目录信息：目录名称和网址

java中的接口是类吗

Spring中的aware接口详情

Python接口自动化之文件上传/下载接口怎么实现

推荐文章

接口调用是什么意思？几种常用接口调用方式

接口设计原则

8款在线 API 接口文档管理工具

api管理系统是什么？

什么是接口调试？接口调试的步骤有哪些？

api 接口管理系统有哪些？

接口测试有几种测试方法

API文档生成工具有哪些？

微服务和api网关区别

交换机配置步骤

最近发表

热评文章

在线接口文档管理工具推荐，支持在线测试，HTTP接口

开源的在线接口文档wiki工具Mindoc的介绍与使

如何优雅的进行接口设计？接口设计的六大原则是什么？

什么是API测试,api检测公司

遇到百度网址安全中心提醒您该页面可能存在钓鱼欺诈信息

软件接口设计怎么做？前后端分离软件接口设计思路

python编程获取《续蜀山剑侠传》目录信息：目录名称和网址

微信扫一扫：分享

推荐文章

最近发表

热评文章