###spark版### Spark Graphx 进行团伙的识别(community detection)

2024-05-07 14:58

本文主要是介绍###spark版### Spark Graphx 进行团伙的识别(community detection),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

最近在使用Spark Graphx,拿Graphx做了点实验。对大规模图常见的分析方法有连通图挖掘,团伙挖掘等。在金融科技领域,尤其风控领域,会有各种重要的关联网络,并且这种网络图十分庞大。 所以,Spark Graphx这种分布式计算框架十分适合这种场景。下面以设备间关联网络(节点数亿级别)为例,采用Graphx做一个设备团伙挖掘demo。团伙识别的算法采用的是Graphx自带的LabelPropagation算法。

下面的是Graphx示例代码(仅仅是demo):

其中输入文件格式:

A B weight

备注(A,B 代表设备id,String类型,weight:int,关联代表权重)

因为Graphx节点类型只支持Long,不支持String,所以,需要进行相应的转换,这里用到的广播变量进行idmap。

github链接: https://github.com/dylan-fan/spark_graphx_community_detection

[java] view plain copy
  1. package com.org.test  
  2.   
  3. import org.apache.spark.SparkConf  
  4. import org.apache.spark.SparkContext  
  5. import org.apache.spark.rdd.RDD  
  6. import org.apache.spark.graphx._  
  7. import scala.collection.mutable.Set  
  8.   
  9. object DeviceCom {  
  10.   def main(args: Array[String]) {  
  11.     if (args.length < 3) {  
  12.       println("usage: spark-submit com.org.test.DeviceCom <input> <output> <iternum>")  
  13.       System.exit(1)  
  14.     }  
  15.     val conf = new SparkConf()  
  16.     conf.setAppName("DeviceCom-" + System.getenv("USER"))  
  17.   
  18.     val sc = new SparkContext(conf)  
  19.   
  20.     val input = args(0)  
  21.   
  22.     val output = args(1)  
  23.   
  24.     val iternum = args(2).toInt  
  25.   
  26.     val vids = sc.textFile(input)  
  27.       .flatMap(line => line.split("\t").take(2))  
  28.       .distinct  
  29.       .zipWithUniqueId()  
  30.       .map(x => (x._1, x._2.toLong))  
  31.   
  32.     val vids_map = sc.broadcast(vids.collectAsMap())  
  33.   
  34.     val vids_rdd = vids.map {  
  35.       case (username, userid) =>  
  36.         (userid, username)  
  37.     }  
  38.   
  39.     val raw_edge = sc.textFile(input)  
  40.       .map(line => line.split("\t"))  
  41.     val col = raw_edge.collect()  
  42.   
  43.     val edges_rdd = sc.parallelize(col.map {  
  44.       case (x) =>  
  45.         (vids_map.value(x(0)), vids_map.value(x(1)))  
  46.     })  
  47.   
  48.     val g = Graph.fromEdgeTuples(edges_rdd, 1)  
  49.     val lp = lib.LabelPropagation.run(g, iternum).vertices  
  50.     val LpByUsername = vids_rdd.join(lp).map {  
  51.       case (id, (username, label)) =>  
  52.         (username, label)  
  53.     }  
  54.   
  55.     LpByUsername.map(x => x._1 + "\t" + x._2).saveAsTextFile(output)  
  56.   
  57.     sc.stop()  
  58.   }  
  59. }  


这里,只是采用Graphx做个demo(很简单啦),来测试Graphx在当前数据量级下的相关性能。实际设备团伙挖掘会更复杂,涉及到各种策略制定。

这篇关于###spark版### Spark Graphx 进行团伙的识别(community detection)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!


原文地址:
本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.chinasem.cn/article/967677

相关文章

一文解密Python进行监控进程的黑科技

《一文解密Python进行监控进程的黑科技》在计算机系统管理和应用性能优化中,监控进程的CPU、内存和IO使用率是非常重要的任务,下面我们就来讲讲如何Python写一个简单使用的监控进程的工具吧... 目录准备工作监控CPU使用率监控内存使用率监控IO使用率小工具代码整合在计算机系统管理和应用性能优化中,监

如何使用Lombok进行spring 注入

《如何使用Lombok进行spring注入》本文介绍如何用Lombok简化Spring注入,推荐优先使用setter注入,通过注解自动生成getter/setter及构造器,减少冗余代码,提升开发效... Lombok为了开发环境简化代码,好处不用多说。spring 注入方式为2种,构造器注入和setter

MySQL进行数据库审计的详细步骤和示例代码

《MySQL进行数据库审计的详细步骤和示例代码》数据库审计通过触发器、内置功能及第三方工具记录和监控数据库活动,确保安全、完整与合规,Java代码实现自动化日志记录,整合分析系统提升监控效率,本文给大... 目录一、数据库审计的基本概念二、使用触发器进行数据库审计1. 创建审计表2. 创建触发器三、Java

MySQL深分页进行性能优化的常见方法

《MySQL深分页进行性能优化的常见方法》在Web应用中,分页查询是数据库操作中的常见需求,然而,在面对大型数据集时,深分页(deeppagination)却成为了性能优化的一个挑战,在本文中,我们将... 目录引言:深分页,真的只是“翻页慢”那么简单吗?一、背景介绍二、深分页的性能问题三、业务场景分析四、

SpringBoot结合Docker进行容器化处理指南

《SpringBoot结合Docker进行容器化处理指南》在当今快速发展的软件工程领域,SpringBoot和Docker已经成为现代Java开发者的必备工具,本文将深入讲解如何将一个SpringBo... 目录前言一、为什么选择 Spring Bootjavascript + docker1. 快速部署与

linux解压缩 xxx.jar文件进行内部操作过程

《linux解压缩xxx.jar文件进行内部操作过程》:本文主要介绍linux解压缩xxx.jar文件进行内部操作,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录一、解压文件二、压缩文件总结一、解压文件1、把 xxx.jar 文件放在服务器上,并进入当前目录#

SpringBoot中如何使用Assert进行断言校验

《SpringBoot中如何使用Assert进行断言校验》Java提供了内置的assert机制,而Spring框架也提供了更强大的Assert工具类来帮助开发者进行参数校验和状态检查,下... 目录前言一、Java 原生assert简介1.1 使用方式1.2 示例代码1.3 优缺点分析二、Spring Fr

Golang如何对cron进行二次封装实现指定时间执行定时任务

《Golang如何对cron进行二次封装实现指定时间执行定时任务》:本文主要介绍Golang如何对cron进行二次封装实现指定时间执行定时任务问题,具有很好的参考价值,希望对大家有所帮助,如有错误... 目录背景cron库下载代码示例【1】结构体定义【2】定时任务开启【3】使用示例【4】控制台输出总结背景

使用Python进行GRPC和Dubbo协议的高级测试

《使用Python进行GRPC和Dubbo协议的高级测试》GRPC(GoogleRemoteProcedureCall)是一种高性能、开源的远程过程调用(RPC)框架,Dubbo是一种高性能的分布式服... 目录01 GRPC测试安装gRPC编写.proto文件实现服务02 Dubbo测试1. 安装Dubb

Python中图片与PDF识别文本(OCR)的全面指南

《Python中图片与PDF识别文本(OCR)的全面指南》在数据爆炸时代,80%的企业数据以非结构化形式存在,其中PDF和图像是最主要的载体,本文将深入探索Python中OCR技术如何将这些数字纸张转... 目录一、OCR技术核心原理二、python图像识别四大工具库1. Pytesseract - 经典O