爬取时间:2019-10-21
爬取难度:★★★☆☆☆
请求链接:https://wh.58.com/chuzu/
爬取目标:58同城武汉出租房的所有信息
涉及知识:网站加密字体的攻克、请求库 requests、解析库 Beautiful Soup、数据库 MySQL 的操作
完整代码:https://github.com/TRHX/Python3-Spider-Practice/tree/master/58tongcheng
其他爬虫实战代码合集(持续更新):https://github.com/TRHX/Python3-Spider-Practice
爬虫实战专栏(持续更新):https://itrhx.blog.csdn.net/article/category/9351278


登陆时间:2019-10-21
实现难度:★★★☆☆☆
请求链接:https://kyfw.12306.cn/otn/resources/login.html
实现目标:模拟登陆中国铁路12306,攻克点触验证码
涉及知识:点触验证码的攻克、自动化测试工具 Selenium 的使用、对接在线打码平台
完整代码:https://github.com/TRHX/Python3-Spider-Practice/tree/master/12306-login
其他爬虫实战代码合集(持续更新):https://github.com/TRHX/Python3-Spider-Practice
爬虫实战专栏(持续更新):https://itrhx.blog.csdn.net/article/category/9351278


登陆时间:2019-10-21
实现难度:★★★☆☆☆
请求链接:https://passport.bilibili.com/login
实现目标:模拟登陆哔哩哔哩,攻克滑动验证码
涉及知识:滑动验证码的攻克、自动化测试工具 Selenium 的使用
完整代码:https://github.com/TRHX/Python3-Spider-Practice/tree/master/bilibili-login
其他爬虫实战代码合集(持续更新):https://github.com/TRHX/Python3-Spider-Practice
爬虫实战专栏(持续更新):https://itrhx.blog.csdn.net/article/category/9351278


爬取时间:2019-10-12
爬取难度:★★☆☆☆☆
请求链接:https://bbs.hupu.com/bxj
爬取目标:爬取虎扑论坛步行街的帖子,包含主题,作者,发布时间等,数据保存到 MongoDB 数据库
涉及知识:请求库 requests、解析库 Beautiful Soup、数据库 MongoDB 的操作
完整代码:https://github.com/TRHX/Python3-Spider-Practice/tree/master/hupu
其他爬虫实战代码合集(持续更新):https://github.com/TRHX/Python3-Spider-Practice
爬虫实战专栏(持续更新):https://itrhx.blog.csdn.net/article/category/9351278


爬取时间:2019-10-09
爬取难度:★★☆☆☆☆
请求链接:https://wuhan.anjuke.com/sale/
爬取目标:爬取武汉二手房每一条售房信息,包含地理位置、价格、面积等,保存为 CSV 文件
涉及知识:请求库 requests、解析库 Beautiful Soup、CSV 文件储存、列表操作、分页判断
完整代码:https://github.com/TRHX/Python3-Spider-Practice/tree/master/anjuke
其他爬虫实战代码合集(持续更新):https://github.com/TRHX/Python3-Spider-Practice
爬虫实战专栏(持续更新):https://itrhx.blog.csdn.net/article/category/9351278



Copyright 2018-2020 TRHX'S BLOG ICP 鄂ICP备19003281号-4MOE ICP 萌ICP备20202022号 正在载入... 百度统计

UV
PV
WordCount286.2k