还有就是注意网页的编码,这个网页的编码是GBK,但在实际运行过程中,我用GBK会出现网页解码错误:
UnicodeDecodeError: ‘gbk' codec can't decode bytes in position 2-3: illegal multibyte sequence
所以换用了gb18030,问题就解决了,因为一般修仙网络小说中,会出现各种王霸之气的文字,你们懂得,所以需要更加牛逼文字库,你们感受一下博大精深的字符编码。
源代码
我就知道,大家要这个,哈哈哈。
主函数
#主函数 if __name__ == '__main__': global numChapter global NOVERL NOVERL = '大主宰.txt' #NOVERL = '择天记.txt' NOVERL = '武动乾坤.txt' if(NOVERL == '大主宰.txt'): textStartURL = 'http://www.bxwx8.org/b/62/62724/11455540.html';#大主宰第一章的URL textStartURL = 'http://www.bxwx8.org/b/62/62724/28019405.html';#第一千两百三十七章 鬼大师 else: textStartURL = 'http://www.bxwx8.org/b/98/98289/17069215.html';#择天记第一章URL textStartURL = 'http://www.bxwx8.org/b/98/98289/28088874.html';#择天记第七十八章 合剑术 textStartURL = 'http://www.bxwx8.org/b/35/35282/5839471.html';#武动乾坤第一章 #textStartURL = 'http://www.bxwx8.org/b/35/35282/7620539.html';#武动乾坤 nextURL = textStartURL; isEnd = False f = open(NOVERL, 'w', encoding='utf-8') f.close() numChapter = 0; while(not isEnd): nextURL,isEnd = findNextTextURL(nextURL) print('end of capture!') print('获取到 ' + str(numChapter) + ' 章')
另外有需要云服务器可以了解下创新互联scvps.cn,海内外云服务器15元起步,三天无理由+7*72小时售后在线,公司持有idc许可证,提供“云服务器、裸金属服务器、高防服务器、香港服务器、美国服务器、虚拟主机、免备案服务器”等云主机租用服务以及企业上云的综合解决方案,具有“安全稳定、简单易用、服务可用性高、性价比高”等特点与优势,专为企业上云打造定制,能够满足用户丰富、多元化的应用场景需求。
网站栏目:Python下载网络小说实例代码-创新互联
转载来于:http://njwzjz.com/article/ccieos.html