04-12 周五 基于VS Code + Python 实现单词的自动提取

2024-04-13 02:28

本文主要是介绍04-12 周五 基于VS Code + Python 实现单词的自动提取,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

04-12 周五 基于VS Code + Python 实现单词的自动提取
时间版本修改人描述
2024年4月12日21:30:56V0.1宋全恒新建文档
2024年4月12日22:29:26V1.0宋全恒完成撰写

简介

 在之前的文章中,我们 03-11 周一 zotero文献阅读时生词提取步骤这个文章中,我们详细的介绍了我们通过如下的流程将阅读文献时的生词摘录出来,专门进行专项日常生词积累。

[外链图片转存中…(img-F4e7x8Ek-1712933099672)]

 那么该如何进行呢?我们怎么才能将枯燥的切换转换为程序的执行呢?这便是这个文章要记录的内容管理。

前提

 要达到当前的要实现的效果,需要使用如下的工具:

  • VS Code
  • Python开发环境

 使用Python开发环境,是因为楼主最近两年一直使用这个语言来开发项目,所以相对熟悉一点。

本质就是将枯燥的手动查找替换输入正则匹配转换为程序执行

配置过程

如下的配置均在VSCode环境中进行,相当于只需要vscode,然后执行一个动作就完成替换即可。

配置任务

 这一步的本质是相当于配置一个执行文本处理的入口,我们可以使用快捷键Ctrl + Shift + P,

[外链图片转存中…(img-zmMyDhtR-1712933099675)]

 然后在task.json我们撰写如下的内容:

{"version": "2.0.0","tasks": [{"label": "word extractor","type": "shell","command": "python","args": ["D:\\400-工作\\420-资源\\423-script\\word_extractor.py", "${file}"],"problemMatcher": [],"group": {"kind": "build","isDefault": true}}]
}

 在上面,我们指定了command为python,所以需要实现在windows机器上安装Python3,然后关键是args,是要执行的过程,另外我们要指定这个参数,即处理的当前文件

我们将word_extrctor.py封装了单词提取的完整的流程,然后我们取名word extractor,这就是vscode的插件强大之处,很灵活的可以扩展。只要我们熟悉Python,熟悉正则表达式,我们基本上可以做各种各样的处理。

撰写脚本

 我们按照想要的流程处理当前文件。

注: "${file}"是必须要有的,标记待处理的文件路径

 下面我们看一下这个word_extractor.py的基本逻辑:

# -*- coding: utf-8 -*-import re
import os
import sys# print("文件路径: ", sys.argv[1])
# 确保文件路径正确
file_path = sys.argv[1]
# print(file_path.split("\\"))# paths = file_path.split("\\")
# file_path=os.path.join(paths[0], "/".join(paths[1:]))
# 读取文件内容
with open(file_path, 'r', encoding='utf-8') as file:content = file.read()# “implications” ([Zhu 等, 2023, p. 1](zotero://select/library/items/J3S5Q2PY)) ([pdf](zotero://open-pdf/library/items/FTR3LHEG?page=1&annotation=GWMLFT4K)) implications  处理成implications
new_content = re.sub( r'“(\w+)”.*\n', r'\1\n', content)lines = new_content.split("\n")# 匹配中文
pattern = r'[\u4e00-\u9fff]+'# 使用列表推导式和re.sub函数删除包含中文字符的行
new_lines = [re.sub(pattern, '', line) for line in lines if not re.search(pattern, line)]# 使用列表推导式移除空行,一个非空行定义为至少包含一个非空格字符
new_lines = [line for line in new_lines if line.strip()]# 将单词排序,并获取排序后的单词列表
new_lines.sort()
new_content="\n".join(new_lines)# 将新内容写回文件
with open(file_path, 'w', encoding='utf-8') as file:file.write(new_content)print(f"Replaced Markdown images with HTML in {file_path}")

 上述的代码逻辑基本上就是读取文件,逐行处理每一行内容。首先是处理单词的提取,然后使用正则表达式替换有中文的内容,然后进行了一次排序。

 这样就大功告成了,我们就将正则查找替换的命令固定成了一个函数了,这也就是程序开发的魅力所在,移除所有的枯燥,让世界美丽起来。

使用

 我们首先在zotero完成一篇文献的阅读,然后将标记为红色的生词全部提取出来。然后复制到txt文件中,然后,我们使用Ctrl + Shift + P,然后点击task: run,然后点击word extractor,即可以完成单词的提取。

然后我们登录不背单词,就可以完成自制词书的导入了。这个过程之前在文档中有记录,不再赘述。

总结

 最近状态还好吧,人还是要自律,最近自己对自己的手机使用屏幕时间限制,限制之后,再也不用担心因为手机放纵,看电子书,或者看短视频了,每天清净心不少。人真的是,不能收欲望的胁迫,然后为什么要不断地使用外在的刺激来获取快感呢,短视频是这样,电子书是这样,都是挺假的,只有生活才是真实的,所以大家还是要努力的认真的生活。

脚踏实地踏踏实实的去工作,去生活,去运动,去拥抱美好的生活!慢慢的,我发现自己的工作越来做好,人际关系越来越融洽,生活越来越充实,身体越来越健康!

这篇关于04-12 周五 基于VS Code + Python 实现单词的自动提取的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/898898

相关文章

Python并行处理实战之如何使用ProcessPoolExecutor加速计算

《Python并行处理实战之如何使用ProcessPoolExecutor加速计算》Python提供了多种并行处理的方式,其中concurrent.futures模块的ProcessPoolExecu... 目录简介完整代码示例代码解释1. 导入必要的模块2. 定义处理函数3. 主函数4. 生成数字列表5.

Python中help()和dir()函数的使用

《Python中help()和dir()函数的使用》我们经常需要查看某个对象(如模块、类、函数等)的属性和方法,Python提供了两个内置函数help()和dir(),它们可以帮助我们快速了解代... 目录1. 引言2. help() 函数2.1 作用2.2 使用方法2.3 示例(1) 查看内置函数的帮助(

Python虚拟环境与Conda使用指南分享

《Python虚拟环境与Conda使用指南分享》:本文主要介绍Python虚拟环境与Conda使用指南,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录一、python 虚拟环境概述1.1 什么是虚拟环境1.2 为什么需要虚拟环境二、Python 内置的虚拟环境工具

Python实例题之pygame开发打飞机游戏实例代码

《Python实例题之pygame开发打飞机游戏实例代码》对于python的学习者,能够写出一个飞机大战的程序代码,是不是感觉到非常的开心,:本文主要介绍Python实例题之pygame开发打飞机... 目录题目pygame-aircraft-game使用 Pygame 开发的打飞机游戏脚本代码解释初始化部

Python pip下载包及所有依赖到指定文件夹的步骤说明

《Pythonpip下载包及所有依赖到指定文件夹的步骤说明》为了方便开发和部署,我们常常需要将Python项目所依赖的第三方包导出到本地文件夹中,:本文主要介绍Pythonpip下载包及所有依... 目录步骤说明命令格式示例参数说明离线安装方法注意事项总结要使用pip下载包及其所有依赖到指定文件夹,请按照以

Python实现精准提取 PDF中的文本,表格与图片

《Python实现精准提取PDF中的文本,表格与图片》在实际的系统开发中,处理PDF文件不仅限于读取整页文本,还有提取文档中的表格数据,图片或特定区域的内容,下面我们来看看如何使用Python实... 目录安装 python 库提取 PDF 文本内容:获取整页文本与指定区域内容获取页面上的所有文本内容获取

基于Python实现一个Windows Tree命令工具

《基于Python实现一个WindowsTree命令工具》今天想要在Windows平台的CMD命令终端窗口中使用像Linux下的tree命令,打印一下目录结构层级树,然而还真有tree命令,但是发现... 目录引言实现代码使用说明可用选项示例用法功能特点添加到环境变量方法一:创建批处理文件并添加到PATH1

Python包管理工具核心指令uvx举例详细解析

《Python包管理工具核心指令uvx举例详细解析》:本文主要介绍Python包管理工具核心指令uvx的相关资料,uvx是uv工具链中用于临时运行Python命令行工具的高效执行器,依托Rust实... 目录一、uvx 的定位与核心功能二、uvx 的典型应用场景三、uvx 与传统工具对比四、uvx 的技术实

Java使用HttpClient实现图片下载与本地保存功能

《Java使用HttpClient实现图片下载与本地保存功能》在当今数字化时代,网络资源的获取与处理已成为软件开发中的常见需求,其中,图片作为网络上最常见的资源之一,其下载与保存功能在许多应用场景中都... 目录引言一、Apache HttpClient简介二、技术栈与环境准备三、实现图片下载与保存功能1.

Python中使用uv创建环境及原理举例详解

《Python中使用uv创建环境及原理举例详解》uv是Astral团队开发的高性能Python工具,整合包管理、虚拟环境、Python版本控制等功能,:本文主要介绍Python中使用uv创建环境及... 目录一、uv工具简介核心特点:二、安装uv1. 通过pip安装2. 通过脚本安装验证安装:配置镜像源(可