基于共现发现人物关系的python实现

2023-11-06 05:20

本文主要是介绍基于共现发现人物关系的python实现,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

基于共现发现人物关系的python实现

参考链接:
提取《釜山行》人物关系,
用Python的networkx绘制精美网络图

1.共现关系

在文献计量学中,关键词的共词方法常用来确定该文献集所代表学科中各主题之间的关系。而在这里,我们需要通过分析一篇小说或剧本,来分析剧中各个角色之间的人物关系。两者有很相同的地方。

一般我们认为,在一篇文章中的同一段出现的两个人物之间,一定具有某种关联,因此我们的程序的大致流程也可以确定下来。我们可以先做分词,将每一段中的人物角色抽取出来,然后以段落为单位,统计两个角色同时出现的出现次数,并把结果存在一个二维矩阵之中。这个矩阵也可以作为关系图的矩阵,矩阵中的元素(统计的出现次数)就是边的权值。

举个例子,比如,现有三个段落的分词结果如下:a/b/c,b/a/f,a/d/c,那么就是ab共现2次,ac共现2次,以此类推。

同时,为了方便,我们把人物和人物关系也通过文件记录,我们要分析的人物关系则来自于人名的名义(小说)

2.jieba分词

jieba分词的原理和语法可以参考这篇文章《中文分词的基本原理以及jieba分词的用法》

虽然有jieba分词可以对文章进行分析,但是仍然不是很准。比如,人名名义中有一个角色叫“易学习”,“易”是副词,“学习”是动词,因此很难将这个人名分出来。不过好在结巴分词提供了自定义字典,我们就可以根据之前的分词结果,一点一点去修正自己的字典即可。当然,我建议在构建自定义字典的时候,最好先直接把人名的名义的角色表直接抄一份过来,词性全部标记成nr(人名)。

这样我们就可以通过先分词,然后筛选词性的方式,把名字筛选出来。筛选出之后,就记录到每一段的一个list中,用于后面的矩阵构成。

这个过程我们是以段落为单位进行的,因此可以设置一个全局字典来记录每一个角色的权重(即词频统计)。代码如下:

# 将剧本进行分词,并将表示人名的词提出,将其他停用词和标点省略
# 提出人名的同时,同name字典记录下来,作为矩阵的行和列
def cut_word(text):words=pseg.cut(text)L_name=[]for x in words :if x.flag!='nr' or len(x.word) < 2:continueif not Names.get(x.word):Names[x.word]=1else:Names[x.word]=Names[x.word]+1L_name.append(x.word)return L_name# 建立词频字典和每段中的人物列表
def namedict_built():global Nameswith open('e:/PY/relationship_find/test.txt','r') as f:for l in f.readlines():n=cut_word(l)if len(n)>=2: # 由于要计算关系,空list和单元素list没有用Lines.append(n)Names=dict(sorted(Names.items(),key = lambda x:x[1],reverse = True)[:36])# print(Line)

3.构建矩阵

虽然嘴上说着矩阵,但实际上在代码里使用二维字典完成的,因为这样访问起来比较快。统计也很简(bao)单(li),就是把我们在上面得出的每一段的人物list都遍历一遍。。.

由于,分词结果总是会有一些奇怪的词,所以,我们在构建矩阵的时候,直接以上面代码中的Names中的人物为基准,滤掉其他不在Names中的词,不然会有其他东西乱入。代码如下:

# 通过遍历Lines来构建贡献矩阵
def relation_built():for key in Names:relationships[key]={}for line in Lines:for name1 in line:if not Names.get(name1):continuefor name2 in line:if name1==name2 or (not Names.get(name2)):continueif not relationships[name1].get(name2):     relationships[name1][name2]= 1else:relationships[name1][name2] = relationships[name1][name2]+ 1# print(relationships)

networkx+matplotlib作图

有了前面的relationships矩阵,我们就可以根据矩阵来做带权边的网络图了。这个作图方法网上教程无数,具体就不记录了,代码大概是这样:

def Graph_show():mpl.rcParams['font.sans-serif'] = ['FangSong'] # 指定默认字体mpl.rcParams['axes.unicode_minus'] = False # 解决保存图像是负号'-'显示为方块的问题G=nx.Graph()# 在NetworkX中,节点可以是任何哈希对象,像一个文本字符串,一幅图像,一个XML对象,甚至是另一个图或任意定制的节点对象with open('e:/PY/relationship_find/edge.txt','r') as f:for i in f.readlines():line=str(i).split()if line == []:continueif int(line[2])<=50:continueG.add_weighted_edges_from([(line[0],line[1],int(line[2]))])nx.draw(G,pos=nx.shell_layout(G),node_size=1000,node_color = '#A0CBE2',edge_color='#A0CBE1',with_labels = True,font_size=12)plt.show()

做出来的图。。挺丑的说实话,不过好歹是个靠谱的图了
1371897-20180422145359348-586337675.png

转载于:https://www.cnblogs.com/August1s/p/8907251.html

这篇关于基于共现发现人物关系的python实现的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/354674

相关文章

MyBatis-Plus逻辑删除实现过程

《MyBatis-Plus逻辑删除实现过程》本文介绍了MyBatis-Plus如何实现逻辑删除功能,包括自动填充字段、配置与实现步骤、常见应用场景,并展示了如何使用remove方法进行逻辑删除,逻辑删... 目录1. 逻辑删除的必要性编程1.1 逻辑删除的定义1.2 逻辑删php除的优点1.3 适用场景2.

Python数据验证神器Pydantic库的使用和实践中的避坑指南

《Python数据验证神器Pydantic库的使用和实践中的避坑指南》Pydantic是一个用于数据验证和设置的库,可以显著简化API接口开发,文章通过一个实际案例,展示了Pydantic如何在生产环... 目录1️⃣ 崩溃时刻:当你的API接口又双叒崩了!2️⃣ 神兵天降:3行代码解决验证难题3️⃣ 深度

C#借助Spire.XLS for .NET实现在Excel中添加文档属性

《C#借助Spire.XLSfor.NET实现在Excel中添加文档属性》在日常的数据处理和项目管理中,Excel文档扮演着举足轻重的角色,本文将深入探讨如何在C#中借助强大的第三方库Spire.... 目录为什么需要程序化添加Excel文档属性使用Spire.XLS for .NET库实现文档属性管理Sp

Python+FFmpeg实现视频自动化处理的完整指南

《Python+FFmpeg实现视频自动化处理的完整指南》本文总结了一套在Python中使用subprocess.run调用FFmpeg进行视频自动化处理的解决方案,涵盖了跨平台硬件加速、中间素材处理... 目录一、 跨平台硬件加速:统一接口设计1. 核心映射逻辑2. python 实现代码二、 中间素材处

python中的flask_sqlalchemy的使用及示例详解

《python中的flask_sqlalchemy的使用及示例详解》文章主要介绍了在使用SQLAlchemy创建模型实例时,通过元类动态创建实例的方式,并说明了如何在实例化时执行__init__方法,... 目录@orm.reconstructorSQLAlchemy的回滚关联其他模型数据库基本操作将数据添

Java数组动态扩容的实现示例

《Java数组动态扩容的实现示例》本文主要介绍了Java数组动态扩容的实现示例,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧... 目录1 问题2 方法3 结语1 问题实现动态的给数组添加元素效果,实现对数组扩容,原始数组使用静态分配

Python实现快速扫描目标主机的开放端口和服务

《Python实现快速扫描目标主机的开放端口和服务》这篇文章主要为大家详细介绍了如何使用Python编写一个功能强大的端口扫描器脚本,实现快速扫描目标主机的开放端口和服务,感兴趣的小伙伴可以了解下... 目录功能介绍场景应用1. 网络安全审计2. 系统管理维护3. 网络故障排查4. 合规性检查报错处理1.

Python轻松实现Word到Markdown的转换

《Python轻松实现Word到Markdown的转换》在文档管理、内容发布等场景中,将Word转换为Markdown格式是常见需求,本文将介绍如何使用FreeSpire.DocforPython实现... 目录一、工具简介二、核心转换实现1. 基础单文件转换2. 批量转换Word文件三、工具特性分析优点局

Python中4大日志记录库比较的终极PK

《Python中4大日志记录库比较的终极PK》日志记录框架是一种工具,可帮助您标准化应用程序中的日志记录过程,:本文主要介绍Python中4大日志记录库比较的相关资料,文中通过代码介绍的非常详细,... 目录一、logging库1、优点2、缺点二、LogAid库三、Loguru库四、Structlogphp

Springboot3统一返回类设计全过程(从问题到实现)

《Springboot3统一返回类设计全过程(从问题到实现)》文章介绍了如何在SpringBoot3中设计一个统一返回类,以实现前后端接口返回格式的一致性,该类包含状态码、描述信息、业务数据和时间戳,... 目录Spring Boot 3 统一返回类设计:从问题到实现一、核心需求:统一返回类要解决什么问题?