AIOPS 自然语义处理之TF-IDF代码实现(Python)

2024-03-02 20:08

本文主要是介绍AIOPS 自然语义处理之TF-IDF代码实现(Python),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

关于理论讲TF-IDF可以查看上篇文章

要点讲解:

1、利用python第三方插件 jieba分词对输入的语句进行分析

2、利用python第三方插件 requests获取分词在中文文档中出现的文档数

3、利用python自带表中的Counter类对分词进行统计

4、测试语句:'查看一下亚马逊服务器硬盘'

代码见下:

# -*- coding: utf-8  -*-
import jieba
import math
import operator
import re
import requests
from collections import Counterclass SimilarityCalculator(object):def __init__(self):self.total_chinese_doc = 60000000000  # 假设所有的中文文档有60亿def cut_context(self, context):"""调用结巴分词进行切分:return:seg_list 包含分析的迭代器"""seg_list = jieba.cut(context, cut_all=False)return seg_listdef get_tf(self, context):"""计算每个词的词频term frequency 计算公式tf=count of word / total number of context:param context: 文本内容:return: 根据词频从高到底排列的OrderedDict字典, key为word, value为tf值"""word_tf_dict = {}# step 1: 针对语句进行分析, 此处利用结巴进行分析seg_list = self.cut_context(context)# step 2: 统计每隔分词的次数, 计算tffor word, count in Counter(seg_list).iteritems():word_tf_dict[word] = operator.div(float(count), len(context))return word_tf_dictdef get_idf(self, context):"""计算输入文本中每隔分词的逆文档频率 idf, 在此处假设中文总文档为D=65亿各个分词出现文档为:param context: 输入分文:return:"""word_idf_dict = {}seg_list = self.cut_context(context)for seg in seg_list:seg_doc_count = self.get_doc_count(seg)idf = math.log(operator.div(self.total_chinese_doc, operator.add(seg_doc_count, 1)), 10)print seg, seg_doc_count, idfword_idf_dict[seg] = idfreturn word_idf_dictdef get_df_idf_values(self, word_idf_dict, word_tf_dict):"""计算df_idf的值:param word_idf_dict: 逆文档频率数据:param word_tf_dict: 词频数据:return: df_idf的数据"""df_idf_value_dict = {}for word in word_idf_dict:df_idf_value_dict[word] = operator.mul(word_idf_dict.get(word), word_tf_dict.get(word))return df_idf_value_dictdef get_doc_count(self, word):"""通过百度上进行搜索,获取每个分词出现在的中文文档的个数:param word::return:"""doc_count = 0try:url = r'http://www.baidu.com/s?wd=' + wordres = requests.get(url)word_count_list = re.findall(ur'百度为您找到相关结果约(.*)个', res.text)if word_count_list:doc_count = re.sub(r'\D', '', word_count_list[0]).strip()except:doc_count = 0return int(doc_count)if __name__ == '__main__':similar_calculator = SimilarityCalculator()context = u'查看一下亚马逊服务器硬盘'word_idf_dict = similar_calculator.get_idf(context)word_tf_dict = similar_calculator.get_tf(context)idf_values = similar_calculator.get_df_idf_values(word_idf_dict, word_tf_dict)idf_values = sorted(idf_values.iteritems(), key=lambda x: x[1], reverse=True)for key, value in idf_values:print key, round(value, 2)

运行结果:

亚马逊 0.29
服务器 0.25
硬盘 0.25
一下 0.23
查看 0.23

具体过程数据:

分词出现的文档数IDFTFTF-IDF
查看1000000002.7774270.0830.23
一下939000002.8048210.0830.23
亚马逊188000003.5039270.0830.29
服务器630000002.9786370.0830.25
硬盘645000002.9684830.0830.25

这篇关于AIOPS 自然语义处理之TF-IDF代码实现(Python)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/767277

相关文章

golang版本升级如何实现

《golang版本升级如何实现》:本文主要介绍golang版本升级如何实现问题,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录golanwww.chinasem.cng版本升级linux上golang版本升级删除golang旧版本安装golang最新版本总结gola

SpringBoot中SM2公钥加密、私钥解密的实现示例详解

《SpringBoot中SM2公钥加密、私钥解密的实现示例详解》本文介绍了如何在SpringBoot项目中实现SM2公钥加密和私钥解密的功能,通过使用Hutool库和BouncyCastle依赖,简化... 目录一、前言1、加密信息(示例)2、加密结果(示例)二、实现代码1、yml文件配置2、创建SM2工具

Mysql实现范围分区表(新增、删除、重组、查看)

《Mysql实现范围分区表(新增、删除、重组、查看)》MySQL分区表的四种类型(范围、哈希、列表、键值),主要介绍了范围分区的创建、查询、添加、删除及重组织操作,具有一定的参考价值,感兴趣的可以了解... 目录一、mysql分区表分类二、范围分区(Range Partitioning1、新建分区表:2、分

MySQL 定时新增分区的实现示例

《MySQL定时新增分区的实现示例》本文主要介绍了通过存储过程和定时任务实现MySQL分区的自动创建,解决大数据量下手动维护的繁琐问题,具有一定的参考价值,感兴趣的可以了解一下... mysql创建好分区之后,有时候会需要自动创建分区。比如,一些表数据量非常大,有些数据是热点数据,按照日期分区MululbU

Spring Boot @RestControllerAdvice全局异常处理最佳实践

《SpringBoot@RestControllerAdvice全局异常处理最佳实践》本文详解SpringBoot中通过@RestControllerAdvice实现全局异常处理,强调代码复用、统... 目录前言一、为什么要使用全局异常处理?二、核心注解解析1. @RestControllerAdvice2

Python中你不知道的gzip高级用法分享

《Python中你不知道的gzip高级用法分享》在当今大数据时代,数据存储和传输成本已成为每个开发者必须考虑的问题,Python内置的gzip模块提供了一种简单高效的解决方案,下面小编就来和大家详细讲... 目录前言:为什么数据压缩如此重要1. gzip 模块基础介绍2. 基本压缩与解压缩操作2.1 压缩文

Python设置Cookie永不超时的详细指南

《Python设置Cookie永不超时的详细指南》Cookie是一种存储在用户浏览器中的小型数据片段,用于记录用户的登录状态、偏好设置等信息,下面小编就来和大家详细讲讲Python如何设置Cookie... 目录一、Cookie的作用与重要性二、Cookie过期的原因三、实现Cookie永不超时的方法(一)

MySQL中查找重复值的实现

《MySQL中查找重复值的实现》查找重复值是一项常见需求,比如在数据清理、数据分析、数据质量检查等场景下,我们常常需要找出表中某列或多列的重复值,具有一定的参考价值,感兴趣的可以了解一下... 目录技术背景实现步骤方法一:使用GROUP BY和HAVING子句方法二:仅返回重复值方法三:返回完整记录方法四:

Python内置函数之classmethod函数使用详解

《Python内置函数之classmethod函数使用详解》:本文主要介绍Python内置函数之classmethod函数使用方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地... 目录1. 类方法定义与基本语法2. 类方法 vs 实例方法 vs 静态方法3. 核心特性与用法(1编程客

IDEA中新建/切换Git分支的实现步骤

《IDEA中新建/切换Git分支的实现步骤》本文主要介绍了IDEA中新建/切换Git分支的实现步骤,通过菜单创建新分支并选择是否切换,创建后在Git详情或右键Checkout中切换分支,感兴趣的可以了... 前提:项目已被Git托管1、点击上方栏Git->NewBrancjsh...2、输入新的分支的