Python办公自动化 获取文本数据 支持多种类型文件

2024-08-30 04:28

本文主要是介绍Python办公自动化 获取文本数据 支持多种类型文件,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

学好办公自动化,走遍天下都不怕!!

        前面我们已经学习了,如何用python的下载安装以及入门基础知识,并且也知道如何使用python自动处理Excel文件数据、如何批量生成Word文件、如何对数据分析后生成洞察报告、如何用python实现自动发送包含附件的邮件等。

        今天我们主要学习python如何获取文本数据,比如获取word文件以及pdf文件的文本转换成txt类型的文件,为了方便使用,对代码进行封装,支持多种文件类型的工具。有问题请在评论区留言交流,谢谢。

目录

1. 安装下载以及导入

2.代码实现

3.运行结果

3.1 遇到一个问题

4.总结


1. 安装下载以及导入

需要的包文件都在下面了

# 导入需要的包和文件
import os,fnmatch
from win32com import client as wc
from win32com.client import Dispatch

2.代码实现

目前程序支持 doc | docx | pdf 文件类型。

1.根据文件的地址切分后得到文件的路径和文件名称

2.根据文件的后缀名生成新的txt后缀的文件名

3.设置新的保存路径 4.加载文本提取的处理程序 5.保存文件

#定义方法
#文件转换成txt文件,该方法两个参数:
#1.文件路径 需要转换的文件地址 2.保存路径 转换成txt文件之后保存的地址
def FilesToText(filePath,savePath=''):# 1.切分文件路径为文件目录和文件名dirs,filename = os.path.split(filePath)# print(dirs,'\n',filename)# return# 2.修改切分后文件的后缀typename= os.path.splitext(filename)[-1].lower() #获取文件后缀new_name = TranType(filename,typename)# print(typename,new_name)# 3.设置新的文件保存路径if savePath == '':savePath = dirselse:savePath = savePathnewtxtPath = os.path.join(savePath,new_name)# print('!!!!',newtxtPath)   # 4.加载文本提取的处理程序,word 转换 txtwordapp = wc.Dispatch('Word.Application')mytxt = wordapp.Documents.Open(filePath) print(filePath)  print(wordapp,'\n',mytxt)# 5.保存文本信息mytxt.SaveAs(newtxtPath,4) # 参数4代表抽取文本mytxt.Close()def TranType(filename,typename):new_name = ''if typename == '.pdf':if fnmatch.fnmatch(filename,'*.pdf'):new_name = filename[:-4]+'.txt'else:returnelif typename == '.doc' or '.docx':if fnmatch.fnmatch(filename,'*.doc'):new_name = filename[:-4]+'.txt'elif fnmatch.fnmatch(filename,'*.docx'):new_name = filename[:-5]+'.txt'            else:returnelse:print('转换失败 格式不正确无法转换')returnreturn new_nameif __name__=='__main__':filePath1 = os.path.abspath(r'../demo/file/年终总结模板.doc') filePath2 = os.path.abspath(r'../demo/file/2024年终总结模板.docx') filePath3 = os.path.abspath(r'2023项目汇报.pdf') FilesToText(filePath2)  

3.运行结果

现在我们运行项目,我们分别拿doc和docx文件、pdf文件做测试,看是否能转换成txt文件。

D:\CODE\VSCODE\python\demo> python wordtotxt.py

 

 可以看到docx和doc文件分别生成了对应的txt文件。

3.1 遇到一个问题

但是在执行pdf文件的时候出现了一个问题,Documents.Open()返回结果为none,代码以及报错截图如下图所示,经过查找filePath也是有数据的,wordapp也是有数据的,就是执行结果mytxt是none,但是执行的时候pdf文件是自动打开的,文件路径也没有问题。

 

如果小伙伴有遇到相同的问题以及解决方案,麻烦评论区留言分享一下,感谢。 

4.总结

本篇文章主要介绍了,后缀doc和docx结尾的word文件、pdf文件如何通过python转换成txt文件。

首先需要安装下载导入包、代码实现文件类型转换、最终实现文件类型的转换。

这篇关于Python办公自动化 获取文本数据 支持多种类型文件的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!


原文地址:
本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.chinasem.cn/article/1119788

相关文章

Python程序打包exe,单文件和多文件方式

《Python程序打包exe,单文件和多文件方式》:本文主要介绍Python程序打包exe,单文件和多文件方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录python 脚本打成exe文件安装Pyinstaller准备一个ico图标打包方式一(适用于文件较少的程

Macos创建python虚拟环境的详细步骤教学

《Macos创建python虚拟环境的详细步骤教学》在macOS上创建Python虚拟环境主要通过Python内置的venv模块实现,也可使用第三方工具如virtualenv,下面小编来和大家简单聊聊... 目录一、使用 python 内置 venv 模块(推荐)二、使用 virtualenv(兼容旧版 P

python如何生成指定文件大小

《python如何生成指定文件大小》:本文主要介绍python如何生成指定文件大小的实现方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录python生成指定文件大小方法一(速度最快)方法二(中等速度)方法三(生成可读文本文件–较慢)方法四(使用内存映射高效生成

基于Python开发一个有趣的工作时长计算器

《基于Python开发一个有趣的工作时长计算器》随着远程办公和弹性工作制的兴起,个人及团队对于工作时长的准确统计需求日益增长,本文将使用Python和PyQt5打造一个工作时长计算器,感兴趣的小伙伴可... 目录概述功能介绍界面展示php软件使用步骤说明代码详解1.窗口初始化与布局2.工作时长计算核心逻辑3

Python验证码识别方式(使用pytesseract库)

《Python验证码识别方式(使用pytesseract库)》:本文主要介绍Python验证码识别方式(使用pytesseract库),具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全... 目录1、安装Tesseract-OCR2、在python中使用3、本地图片识别4、结合playwrigh

C#代码实现解析WTGPS和BD数据

《C#代码实现解析WTGPS和BD数据》在现代的导航与定位应用中,准确解析GPS和北斗(BD)等卫星定位数据至关重要,本文将使用C#语言实现解析WTGPS和BD数据,需要的可以了解下... 目录一、代码结构概览1. 核心解析方法2. 位置信息解析3. 经纬度转换方法4. 日期和时间戳解析5. 辅助方法二、L

Python使用Code2flow将代码转化为流程图的操作教程

《Python使用Code2flow将代码转化为流程图的操作教程》Code2flow是一款开源工具,能够将代码自动转换为流程图,该工具对于代码审查、调试和理解大型代码库非常有用,在这篇博客中,我们将深... 目录引言1nVflRA、为什么选择 Code2flow?2、安装 Code2flow3、基本功能演示

基于Python+PyQt5打造一个跨平台Emoji表情管理神器

《基于Python+PyQt5打造一个跨平台Emoji表情管理神器》在当今数字化社交时代,Emoji已成为全球通用的视觉语言,本文主要为大家详细介绍了如何使用Python和PyQt5开发一个功能全面的... 目录概述功能特性1. 全量Emoji集合2. 智能搜索系统3. 高效交互设计4. 现代化UI展示效果

使用Python和Matplotlib实现可视化字体轮廓(从路径数据到矢量图形)

《使用Python和Matplotlib实现可视化字体轮廓(从路径数据到矢量图形)》字体设计和矢量图形处理是编程中一个有趣且实用的领域,通过Python的matplotlib库,我们可以轻松将字体轮廓... 目录背景知识字体轮廓的表示实现步骤1. 安装依赖库2. 准备数据3. 解析路径指令4. 绘制图形关键

详解如何使用Python从零开始构建文本统计模型

《详解如何使用Python从零开始构建文本统计模型》在自然语言处理领域,词汇表构建是文本预处理的关键环节,本文通过Python代码实践,演示如何从原始文本中提取多尺度特征,并通过动态调整机制构建更精确... 目录一、项目背景与核心思想二、核心代码解析1. 数据加载与预处理2. 多尺度字符统计3. 统计结果可