rvest爬取链家网数据

2024-01-30 15:40
文章标签 数据 爬取 rvest 链家网

本文主要是介绍rvest爬取链家网数据,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

一、工具说明

  • 火狐浏览器
  • fireBug插件
  • R软件
  • revest包、stringr包

二、数据说明

想要获取链家网南京楼盘的信息,如:楼盘名称、地址、面积、是否在售、住宅性质、价格。最后在R里生成数据框
这里写图片描述


三、代码

Part1:加载包,rvest用于爬取数据、stringr处理字符串

# 加载包 ------------------------------------------
#加载rvest,没有则先安装后加载
tryCatch({library(rvest)
}, error = function(e) {print("No This Package")
},
finally = {install.packages("rvest")library(rvest)
})
library(stringr)

Part2:读取网页,求页数

想要获取该信息页数,如下图所示:
这里写图片描述
使用Firebug插件,很容易定位元素。
点击红框处图标,再点击黄框处10.自动定位元素位置,可以分析标签值等信息
这里写图片描述

# 读取网页,求页数 ----------------------------------------------------------------
url <- 'http://nj.fang.lianjia.com/loupan/'
web <- read_html(url)
#html_attr("page-data") 是从html_nodes('div.page-box')筛选出的标签中,查找page-data属性的值
page <-web %>% html_nodes('div.page-box') %>% html_attr("page-data")
page_num <- str_extract(page, '[0-9]+')#取出字符串里面的数字,+表示可以是多位的
page_num <- as.numeric(page_num)

Part3:循环读取每页上所需要的信息

# 循环读取每页上所需要的信息---------------------------
#所需列
name = area = price = type = address = status = NULL
for (i in 1:page_num) {#楼盘名称name <- c(name,web %>% html_nodes('div.info-panel') %>%html_nodes('a') %>% html_text())#地址address <- c(address,web %>% html_nodes('div.info-panel') %>%html_nodes('div.where') %>% html_nodes('span.region') %>%html_text())#面积area_ass <-web %>% html_nodes('div.info-panel') %>% html_nodes('div.area')  %>% html_nodes('span') %>%html_text()area = c(area, str_extract(area_ass, '[0-9]+~[0-9]+|[0-9]+'))#找到形如11~12或者数字的字符串price_ass <-web %>% html_nodes('div.info-panel') %>% html_nodes('div.average')  %>% html_nodes('span') %>%html_text()price = c(price, as.numeric(price_ass))#房屋性质type <- c(type,web %>% html_nodes('div.info-panel') %>%html_nodes('div.type') %>% html_nodes('span.live') %>% html_text())#是否在售status <- c(status,web %>% html_nodes('div.info-panel') %>%html_nodes('div.type') %>% html_nodes('span.onsold') %>% html_text())house_data <-data.frame(name = name,area = area,price = price,type = type,address = address,status = status,stringsAsFactors = F) 
}
# Ending############################ --------------------------------------

四、结果

这里写图片描述


五、Ref

[1] 链家网地址
[2] 快速定位元素:http://jingyan.baidu.com/article/19192ad81ab005e53e5707d6.html
[3] 《rvest + CSS Selector 网页数据抓取的最佳选择 》
[4] 语言爬虫初尝试-基于RVEST包学习
[5] 标签含义速查网站
[6] R语言学习:使用rvest包抓取网页数据

这篇关于rvest爬取链家网数据的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/660717

相关文章

SpringBoot集成EasyExcel实现百万级别的数据导入导出实践指南

《SpringBoot集成EasyExcel实现百万级别的数据导入导出实践指南》本文将基于开源项目springboot-easyexcel-batch进行解析与扩展,手把手教大家如何在SpringBo... 目录项目结构概览核心依赖百万级导出实战场景核心代码效果百万级导入实战场景监听器和Service(核心

使用Python开发一个Ditto剪贴板数据导出工具

《使用Python开发一个Ditto剪贴板数据导出工具》在日常工作中,我们经常需要处理大量的剪贴板数据,下面将介绍如何使用Python的wxPython库开发一个图形化工具,实现从Ditto数据库中读... 目录前言运行结果项目需求分析技术选型核心功能实现1. Ditto数据库结构分析2. 数据库自动定位3

pandas数据的合并concat()和merge()方式

《pandas数据的合并concat()和merge()方式》Pandas中concat沿轴合并数据框(行或列),merge基于键连接(内/外/左/右),concat用于纵向或横向拼接,merge用于... 目录concat() 轴向连接合并(1) join='outer',axis=0(2)join='o

批量导入txt数据到的redis过程

《批量导入txt数据到的redis过程》用户通过将Redis命令逐行写入txt文件,利用管道模式运行客户端,成功执行批量删除以Product*匹配的Key操作,提高了数据清理效率... 目录批量导入txt数据到Redisjs把redis命令按一条 一行写到txt中管道命令运行redis客户端成功了批量删除k

SpringBoot多环境配置数据读取方式

《SpringBoot多环境配置数据读取方式》SpringBoot通过环境隔离机制,支持properties/yaml/yml多格式配置,结合@Value、Environment和@Configura... 目录一、多环境配置的核心思路二、3种配置文件格式详解2.1 properties格式(传统格式)1.

解决pandas无法读取csv文件数据的问题

《解决pandas无法读取csv文件数据的问题》本文讲述作者用Pandas读取CSV文件时因参数设置不当导致数据错位,通过调整delimiter和on_bad_lines参数最终解决问题,并强调正确参... 目录一、前言二、问题复现1. 问题2. 通过 on_bad_lines=‘warn’ 跳过异常数据3

C#监听txt文档获取新数据方式

《C#监听txt文档获取新数据方式》文章介绍通过监听txt文件获取最新数据,并实现开机自启动、禁用窗口关闭按钮、阻止Ctrl+C中断及防止程序退出等功能,代码整合于主函数中,供参考学习... 目录前言一、监听txt文档增加数据二、其他功能1. 设置开机自启动2. 禁止控制台窗口关闭按钮3. 阻止Ctrl +

java如何实现高并发场景下三级缓存的数据一致性

《java如何实现高并发场景下三级缓存的数据一致性》这篇文章主要为大家详细介绍了java如何实现高并发场景下三级缓存的数据一致性,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 下面代码是一个使用Java和Redisson实现的三级缓存服务,主要功能包括:1.缓存结构:本地缓存:使

在MySQL中实现冷热数据分离的方法及使用场景底层原理解析

《在MySQL中实现冷热数据分离的方法及使用场景底层原理解析》MySQL冷热数据分离通过分表/分区策略、数据归档和索引优化,将频繁访问的热数据与冷数据分开存储,提升查询效率并降低存储成本,适用于高并发... 目录实现冷热数据分离1. 分表策略2. 使用分区表3. 数据归档与迁移在mysql中实现冷热数据分

C#解析JSON数据全攻略指南

《C#解析JSON数据全攻略指南》这篇文章主要为大家详细介绍了使用C#解析JSON数据全攻略指南,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录一、为什么jsON是C#开发必修课?二、四步搞定网络JSON数据1. 获取数据 - HttpClient最佳实践2. 动态解析 - 快速