常用图算法实现--Spar

2023-11-23 03:21
文章标签 算法 实现 常用 spar

本文主要是介绍常用图算法实现--Spar,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

使用Spark实现PageRank,强连通分量等图算法

PageRank

数据准备

边:

1 2
1 15
2 3
2 4
2 5
2 6
2 7
3 13
4 2
5 11
5 12
6 1
6 7
6 8
7 1
7 8
8 1
8 9
8 10
9 14
9 1
10 1
10 13
11 12
11 1
12 1
13 14
14 12
15 1

网页:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15

将这两个文件放入HDFS:

hdfs dfs -mkdir input/PageRank
hdfs dfs -put links.txt input/PageRank
hdfs dfs -put pages.txt input/PageRank

编写程序

import org.apache.spark.SparkConf;
import org.apache.spark.api.java.*;
import org.apache.spark.api.java.function.Function;
import org.apache.spark.api.java.function.PairFunction;
import scala.Tuple2;import static java.lang.Math.abs;public class PageRank {private static int MaxIteration = 100;private static final double DAMPENING_FACTOR = 0.85;private static final double EPSILON = 0.0001;public static void main(String[] args) {SparkConf conf = new SparkConf().setAppName("PageRank");JavaSparkContext sc = new JavaSparkContext(conf);sc.setLogLevel("WARN");String linksFile = "hdfs:///user/hadoop/input/PageRank/links.txt";String pagesFile = "hdfs:///user/hadoop/input/PageRank/pages.txt";String rankFile = "hdfs:///user/hadoop/output/Graph/SparkPageRank";/***  neighborRDD: (from, s)*  linksRDD: tuple (from, [to,1/m])*  pageRDD: vertex*  pageRankRDD: (point, 1/n)*/JavaPairRDD<Integer, Integer> neighborRDD = sc.textFile(linksFile).mapToPair(line -> new Tuple2<>(Integer.parseInt(line.split(" ")[0]), 1)).reduceByKey((x, y) -> x + y);JavaPairRDD<Integer, Tuple2<Integer, Integer>> linksRDD = sc.textFile(linksFile).mapToPair(line -> new Tuple2<>(Integer.parseInt(line.split(" ")[0]),Integer.parseInt(line.split(" ")[1]))).join(neighborRDD);JavaRDD<Integer> pagesRDD = sc.textFile(pagesFile).map(line -> Integer.parseInt(line));long pageCount = pagesRDD.count();JavaPairRDD<Integer, Double> pageRankRDD = pagesRDD.mapToPair(vertex -> new Tuple2<>(vertex, 1.0 / pageCount));int count = 0;while (count < MaxIteration) {JavaPairRDD<Integer, Double> NewPageRankRDD = linksRDD.join(pageRankRDD).mapToPair(new PairFunction<Tuple2<Integer, Tuple2<Tuple2<Integer, Integer>, Double>>, Integer, Double>() {@Overridepublic Tuple2<Integer, Double> call(Tuple2<Integer, Tuple2<Tuple2<Integer, Integer>, Double>> ans) throws Exception {
//                               // [ toNode, fraction * rank]return new Tuple2<>(ans._2._1._1, ans._2._2/ans._2._1._2);}}).reduceByKey((v1, v2) -> v1 + v2).mapValues(new Function<Double, Double>() {double dampening = DAMPENING_FACTOR;double randomJump = (1 - DAMPENING_FACTOR) / pageCount;@Overridepublic Double call(Double value) throws Exception {value = value * dampening + randomJump;return value;}});count++;JavaPairRDD<Integer, Tuple2<Double, Double>> compare = pageRankRDD.join(NewPageRankRDD).filter(each -> abs(each._2._1 - each._2._2) > EPSILON);if (compare.isEmpty() || count > MaxIteration)break;pageRankRDD = NewPageRankRDD;}pageRankRDD.saveAsTextFile(rankFile);}
}

思路:

  1. 全部使用Lambda表达式进行,首先需要找到所有的边的条数,初始化Rank值
  2. 然后使用Join进行合并,并计算下一轮Rank
  3. 使用DAMPENING_FACTOR进行随机跳转

运行

spark-submit  --class PageRank PageRank-1.0.jar
hdfs dfs -cat output/Graph/SparkPageRank/*

结果为:

54622233513

ConnectedComponents

数据准备

提供基本数据集,与PageRank一样,指定顶点和边

vertices.txt

准备一些顶点,例如1-16

edges.txt

准备一些连接边:

1 2
2 3
2 4
3 5
6 7
8 9
8 10
5 11
11 12
10 13
9 14
13 14
1 15
16 1

将这两个文件放入HDFS:

hdfs dfs -mkdir input/ConnectedComponents
hdfs dfs -put edges.txt input/ConnectedComponents
hdfs dfs -put vertices.txt input/ConnectedComponents

编写程序

import org.apache.spark.SparkConf;
import org.apache.spark.api.java.JavaPairRDD;
import org.apache.spark.api.java.JavaSparkContext;
import scala.Tuple2;import static java.lang.StrictMath.min;public class ConnectedComponents {public static int MaxIteration = 100;public static void main(String[] args) {SparkConf conf = new SparkConf().setAppName("ConnectedComponents");JavaSparkContext sc = new JavaSparkContext(conf);sc.setLogLevel("WARN");String edgesFile = "hdfs:///user/hadoop/input/ConnectedComponents/edges.txt";String verticesFile = "hdfs:///user/hadoop/input/ConnectedComponents/vertices.txt";String outFile = "hdfs:///user/hadoop/output/Graph/SparkConnectedComponents";/*** edgesRDD: [x,y]* componentsRDD: [x,x] init*/JavaPairRDD<Integer, Integer> edgesRDD = sc.textFile(edgesFile).mapToPair(line -> new Tuple2<>(Integer.parseInt(line.split(" ")[0]),Integer.parseInt(line.split(" ")[1])));JavaPairRDD<Integer, Integer> componentsRDD = sc.textFile(verticesFile).mapToPair(line -> new Tuple2<>(Integer.parseInt(line), Integer.parseInt(line)));int count = 0;while (count < MaxIteration) {JavaPairRDD<Integer, Integer> newcomponentsRDD = componentsRDD.join(edgesRDD).mapToPair(x -> new Tuple2<>(x._2._2, x._2._1)).reduceByKey((v1, v2) -> min(v1, v2));JavaPairRDD<Integer, Tuple2<Integer, Integer>> filterRDD = newcomponentsRDD.join(componentsRDD).filter(each -> each._2._1 < each._2._2);if (filterRDD.isEmpty())break;// update to componentsRDDcomponentsRDD = componentsRDD.leftOuterJoin(newcomponentsRDD).mapValues(v -> min(v._1, v._2.orElse(v._1)));count++;}componentsRDD.saveAsTextFile(outFile);}
}

思路:

  1. 首先需要将每个点映射成自己的强连通分支
  2. 每次迭代,更新与自己相连的点的强连通分支,取最小值
  3. 使用左连接更新原始的强连通分支

运行

spark-submit  --class ConnectedComponents ConnectedComponents-1.0.jar
hdfs dfs -cat output/Graph/SparkConnectedComponents/*

查看结果:

54622728559

SingleSourceShortestPaths

数据准备

首先我们需要准备边和点

边:

1 2 12.0
1 3 13.0
2 3 23.0
3 4 34.0
3 5 35.0
4 5 45.0
5 1 51.0

点:

1
2
3
4
5

将这两个文件放入HDFS:

hdfs dfs -mkdir input/SingleSourceShortestPaths
hdfs dfs -put edges.txt input/SingleSourceShortestPaths
hdfs dfs -put vertices.txt input/SingleSourceShortestPaths

编写程序

import org.apache.spark.SparkConf;
import org.apache.spark.api.java.JavaPairRDD;
import org.apache.spark.api.java.JavaSparkContext;
import scala.Tuple2;import javax.validation.constraints.Max;import static java.lang.StrictMath.min;public class SingleSourceShortestPaths {public static int sourceVerticeID = 1;public static int MaxIteration = 100;public static void main(String[] args) throws Exception {SparkConf conf = new SparkConf().setAppName("ConnectedComponents");JavaSparkContext sc = new JavaSparkContext(conf);sc.setLogLevel("WARN");String edgesFile = "hdfs:///user/hadoop/input/SingleSourceShortestPaths/edges.txt";String verticesFile = "hdfs:///user/hadoop/input/SingleSourceShortestPaths/vertices.txt";String outFile = "hdfs:///user/hadoop/output/Graph/SparkSingleSourceShortestPaths";/*** edgesRDD: [from, to, dis ]* verticesRDD: [vertice, dis]*/JavaPairRDD<Integer, Tuple2<Integer, Double>> edgesRDD = sc.textFile(edgesFile).mapToPair(line -> {int from = Integer.parseInt(line.split(" ")[0]);int to = Integer.parseInt(line.split(" ")[1]);double dis = Double.parseDouble(line.split(" ")[2]);return new Tuple2<>(from, new Tuple2<>(to, dis));});JavaPairRDD<Integer, Double> verticesRDD = sc.textFile(verticesFile).mapToPair(line -> {int vertice = Integer.parseInt(line);if (vertice == sourceVerticeID)return new Tuple2<>(vertice, 0.0);return new Tuple2<>(vertice, Double.POSITIVE_INFINITY);});int count = 0;while (count < MaxIteration) {// get new disJavaPairRDD<Integer, Double> newVerticesRDD = verticesRDD.join(edgesRDD).mapToPair(line -> {if (line._2._1 != Double.POSITIVE_INFINITY)return new Tuple2<>(line._2._2._1, line._2._1 + line._2._2._2);return new Tuple2<>(line._2._2._1, Double.POSITIVE_INFINITY);}).reduceByKey((v1, v2) -> min(v1, v2));JavaPairRDD<Integer, Tuple2<Double, Double>> filterRDD = newVerticesRDD.join(verticesRDD).filter(each -> each._2._1 < each._2._2);if (filterRDD.isEmpty())break;// update to verticesRDDverticesRDD = verticesRDD.leftOuterJoin(newVerticesRDD).mapValues(v -> min(v._1, v._2.orElse(v._1)));}verticesRDD.saveAsTextFile(outFile);}
}

思路:

  1. 首先需要初始化每个顶点的距离,将原始点设置为0,其余设置为无穷
  2. 每次迭代得到新的顶点距离,并使用reduceByKey最小化,比较是否更新
  3. 然后将更新得到的顶点距离加入原始RDD中

运行

spark-submit  --class SingleSourceShortestPaths SingleSourceShortestPaths-1.0.jar
hdfs dfs -cat output/Graph/SparkSingleSourceShortestPaths/*

查看结果:

54623040420

这篇关于常用图算法实现--Spar的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/414994

相关文章

分布式锁在Spring Boot应用中的实现过程

《分布式锁在SpringBoot应用中的实现过程》文章介绍在SpringBoot中通过自定义Lock注解、LockAspect切面和RedisLockUtils工具类实现分布式锁,确保多实例并发操作... 目录Lock注解LockASPect切面RedisLockUtils工具类总结在现代微服务架构中,分布

Java使用Thumbnailator库实现图片处理与压缩功能

《Java使用Thumbnailator库实现图片处理与压缩功能》Thumbnailator是高性能Java图像处理库,支持缩放、旋转、水印添加、裁剪及格式转换,提供易用API和性能优化,适合Web应... 目录1. 图片处理库Thumbnailator介绍2. 基本和指定大小图片缩放功能2.1 图片缩放的

Python使用Tenacity一行代码实现自动重试详解

《Python使用Tenacity一行代码实现自动重试详解》tenacity是一个专为Python设计的通用重试库,它的核心理念就是用简单、清晰的方式,为任何可能失败的操作添加重试能力,下面我们就来看... 目录一切始于一个简单的 API 调用Tenacity 入门:一行代码实现优雅重试精细控制:让重试按我

MySQL常用字符串函数示例和场景介绍

《MySQL常用字符串函数示例和场景介绍》MySQL提供了丰富的字符串函数帮助我们高效地对字符串进行处理、转换和分析,本文我将全面且深入地介绍MySQL常用的字符串函数,并结合具体示例和场景,帮你熟练... 目录一、字符串函数概述1.1 字符串函数的作用1.2 字符串函数分类二、字符串长度与统计函数2.1

Redis客户端连接机制的实现方案

《Redis客户端连接机制的实现方案》本文主要介绍了Redis客户端连接机制的实现方案,包括事件驱动模型、非阻塞I/O处理、连接池应用及配置优化,具有一定的参考价值,感兴趣的可以了解一下... 目录1. Redis连接模型概述2. 连接建立过程详解2.1 连php接初始化流程2.2 关键配置参数3. 最大连

Python实现网格交易策略的过程

《Python实现网格交易策略的过程》本文讲解Python网格交易策略,利用ccxt获取加密货币数据及backtrader回测,通过设定网格节点,低买高卖获利,适合震荡行情,下面跟我一起看看我们的第一... 网格交易是一种经典的量化交易策略,其核心思想是在价格上下预设多个“网格”,当价格触发特定网格时执行买

MySQL 内存使用率常用分析语句

《MySQL内存使用率常用分析语句》用户整理了MySQL内存占用过高的分析方法,涵盖操作系统层确认及数据库层bufferpool、内存模块差值、线程状态、performance_schema性能数据... 目录一、 OS层二、 DB层1. 全局情况2. 内存占js用详情最近连续遇到mysql内存占用过高导致

python设置环境变量路径实现过程

《python设置环境变量路径实现过程》本文介绍设置Python路径的多种方法:临时设置(Windows用`set`,Linux/macOS用`export`)、永久设置(系统属性或shell配置文件... 目录设置python路径的方法临时设置环境变量(适用于当前会话)永久设置环境变量(Windows系统

Python对接支付宝支付之使用AliPay实现的详细操作指南

《Python对接支付宝支付之使用AliPay实现的详细操作指南》支付宝没有提供PythonSDK,但是强大的github就有提供python-alipay-sdk,封装里很多复杂操作,使用这个我们就... 目录一、引言二、准备工作2.1 支付宝开放平台入驻与应用创建2.2 密钥生成与配置2.3 安装ali

Spring Security 单点登录与自动登录机制的实现原理

《SpringSecurity单点登录与自动登录机制的实现原理》本文探讨SpringSecurity实现单点登录(SSO)与自动登录机制,涵盖JWT跨系统认证、RememberMe持久化Token... 目录一、核心概念解析1.1 单点登录(SSO)1.2 自动登录(Remember Me)二、代码分析三、