python3爬取torrent种子链接实例

更新时间：2020年4月27日 21:20 点击：1430

本文环境是python3,采用的是urllib,BeautifulSoup搭建。

说下思路，这个项目分为管理器，url管理器，下载器，解析器，html文件生产器。各司其职，在管理器进行调度。最后将解析到的种子连接生产html文件显示。当然也可以保存在文件。最后效果如图。

首先在管理器SpiderMain()这个类的构造方法里初始化下载器，解析器，html生产器。代码如下。

def__init__(self):

  self.urls = url_manager.UrlManager()
  self.downloader = html_downloader.HtmlDownloader()
  self.parser = html_parser.HtmlParser()
  self.outputer = html_outputer.HtmlOutputer()

然后在主方法里写入主连接并开始下载解析和输出。

if __name__ == '__main__':
  url = "http://www.btany.com/search/桃谷绘里香-first-asc-1"
  # 解决中文搜索问题 对于：？=不进行转义
  root_url = quote(url,safe='/:?=')
  obj_spider = SpiderMain()
  obj_spider.parser(root_url)

用下载器进行下载，解析器解析下载好的网页，最后输出。管理器的框架逻辑就搭建完毕

def parser(self, root_url):  
  html = self.downloader.download(root_url)  
  datas = self.parser.parserTwo(html)  
  self.outputer.output_html3(datas)

downloader下载器代码如下：

def download(self, chaper_url):

  if chaper_url is None:
    return None
  headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}
  req = urllib.request.Request(url=chaper_url, headers=headers)
  response = urllib.request.urlopen(req)
  if response.getcode() != 200:
    return None

  return response.read()

headers是模仿浏览器的请求头。不然下载不到html文件。

解析器代码如下：

# 解析种子文件
def parserTwo(self,html):
  if html is None:
    return
  soup = BeautifulSoup(html,'html.parser',from_encoding='utf-8')
  res_datas = self._get_data(soup)
  return res_datas

# 将种子文件的标题，磁力链接和迅雷链接进行封装
def _get_data(self,soup):
  res_datas = []
  all_data = soup.findAll('a',href=re.compile(r"/detail"))
  all_data2 = soup.findAll('a', href=re.compile(r"magnet"))
  all_data3 = soup.findAll('a',href=re.compile(r"thunder"))
  for i in range(len(all_data)):
    res_data = {}
    res_data['title'] = all_data[i].get_text()
    res_data['cl'] = all_data2[i].get('href')
    res_data['xl'] = all_data3[i].get('href')
    res_datas.append(res_data)
  return res_datas

通过分析爬下来的html文件,种子链接在a标签下。然后提取magnet和thunder下的链接。

最后输出器输出html文件，代码如下：

def __init__(self):
  self.datas = []

def collect_data(self, data):
  if data is None:
    return
  self.datas.append(data)
#输出表单 
def output_html3(self,datas):
  fout = open('output.html', 'w', encoding="utf-8")

  fout.write("<html>")
  fout.write("<head><meta http-equiv=\"content-type\" content=\"text/html;charset=utf-8\"></head>")
  fout.write("<body>")
  fout.write("<table border = 1>")

  for data in datas:
    fout.write("<tr>")
    fout.write("<td>%s</td>" % data['title'])
    fout.write("<td>%s</td>" % data['cl'])
    fout.write("<td>%s</td>" % data['xl'])
    fout.write("</tr>")

  fout.write("</table>")
  fout.write("</body>")
  fout.write("</html>")
  fout.close()

项目就结束了。源代码已上传，链接https://github.com/Ahuanghaifeng/python3-torrent，觉得有用请在github上给个star，您的鼓励将是作者创作的动力。

以上这篇python3爬取torrent种子链接实例就是小编分享给大家的全部内容了，希望能给大家一个参考，也希望大家多多支持猪先飞。

[!--infotagslink--]

上一篇: Python3 实现爬取网站下所有URL方式

下一篇: win10安装tesserocr配置 Python使用tesserocr识别字母数字验证码

Python3 实现将bytes图片转jpg格式
这篇文章主要介绍了Python3 实现将bytes图片转jpg格式，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧...2021-03-08
Python3中小括号()、中括号[]、花括号{}的区别详解
这篇文章主要介绍了Python3中小括号()、中括号[]、花括号{}的区别详解,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧...2020-11-15
jQuery实现鼠标滑过链接控制图片的滑动展开与隐藏效果
本文实例讲述了jQuery实现鼠标滑过链接控制图片的滑动展开与隐藏效果。分享给大家供大家参考，具体如下：这里演示jQuery实现鼠标移动到链接上，滑动展开/隐藏图片效果，鼠标放在“上一页”“下一页”上，立即浮现出所对应的图...2015-10-30
Python3 常用数据标准化方法详解
这篇文章主要介绍了Python3 常用数据标准化方法详解，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧...2021-03-24
如何获取百度搜索结果页中解密之后的真实链接
大家用百度搜索的时候，可能会发现，结果链接用的还是百度的链接，点击之后才会跳转到另外一个页面，另外一个页面的真实链接如何获取到呢？？通过分析发现：可以看出，返回...2016-05-19
浅谈Python3中print函数的换行
这篇文章主要介绍了浅谈Python3中print函数的换行，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧...2020-08-05
解决python3安装pandas出错的问题
这篇文章主要介绍了解决python3安装pandas出错的问题，具有很好的参考价值，希望对大家有所帮助。如有错误或未考虑完全的地方，望不吝赐教...2021-05-20
ASP.NET中iframe框架点击左边页面链接右边显示链接页面内容
这篇文章主要介绍了ASP.NET中iframe框架点击左边页面链接,右边显示链接页面内容的实现代码，感兴趣的小伙伴们可以参考一下...2021-09-22
python3 sqlite3限制条件查询的操作
这篇文章主要介绍了python3 sqlite3限制条件查询的操作，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧...2021-04-07
python docx的超链接网址和链接文本操作
这篇文章主要介绍了python docx的超链接网址和链接文本操作，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧...2021-03-06
python3 循环读取excel文件并写入json操作
这篇文章主要介绍了python3 循环读取excel文件并写入json操作，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧...2020-07-14
Python 实现自动获取种子磁力链接方式
今天小编就为大家分享一篇Python 实现自动获取种子磁力链接方式，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧...2020-04-27
解决python3 中的np.load编码问题
这篇文章主要介绍了解决python3 中的np.load编码问题，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧...2021-03-27
python3 如何读取python2的npy文件
这篇文章主要介绍了python3 读取python2的npy文件操作，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧...2021-03-27
C++静态链接与动态链接详解
下面小编就为大家介绍C++静态链接与动态链接。小编觉得挺不错的，现在就分享给大家，也给大家做个参考。一起跟随小编过来看看吧...2021-10-11
浅谈CMake配置OpenCV 时静态链接与动态链接的选择
下面小编就为大家带来一篇浅谈CMake配置OpenCV 时静态链接与动态链接的选择。小编觉得挺不错的，现在就分享给大家，也给大家做个参考。一起跟随小编过来看看吧...2020-04-25
C++获取文件哈希值(hash)和获取torrent(bt种子)磁力链接哈希值
这二个代码一个是获取文件哈希值的，另外一个是获取torrent文件磁力链接的哈希值...2020-04-25
基于python3+OpenCV实现人脸和眼睛识别
这篇文章主要为大家详细介绍了基于python3+OpenCV实现人脸和眼睛识别，文中示例代码介绍的非常详细，具有一定的参考价值，感兴趣的小伙伴们可以参考一下...2021-09-06
dotnet core链接mongodb代码实例
这篇文章主要介绍了dotnet core链接mongodb代码实例,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下...2020-06-25
关于初始种子自动选取的区域生长实例（python+opencv)
今天小编就为大家分享一篇关于初始种子自动选取的区域生长实例（python+opencv)，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧...2020-04-27

python3爬取torrent种子链接实例

相关文章

阁下可能感兴趣的内容

推荐阅读