【爬虫】巧用 js2py (附带bug解决)

2023-11-05 06:18

本文主要是介绍【爬虫】巧用 js2py (附带bug解决),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

项目地址: https://github.com/PiotrDabkowski/Js2Py

项目介绍:(根据github)此项目完全用Python编写,支持Python2/3。可以在Python中执行JS代码,并获取JS对象值。

目前支持ES5,ES6仍在测试中。

一句话解释:一个纯Python的JS解释器。

推荐指数:四颗星  (博主用过其他的库如execjs, pyv8,多多少少都没有这个库的功能完备)

安装:pip3 install js2py

 

本文主要介绍js2py的EvalJs对象,因为它是功能最完备的。

1. 执行简单的JS代码

import js2py
js = """a =1 b =1function f(x){return x*x}"""
ctx = js2py.EvalJs()  # 初始化context对象
ctx.execute(js)  # 执行js
print(ctx.a)  # >>1   获取js变量
print(ctx.f(9))  # >>81  执行js函数

说明:EvalJs对象支持在同一个上下文中执行多次多段js代码,并能通过属性的方式获取js变量,非常好用。

2. Python与JS对象交互

import js2py
js = """function f(arg1, arg2){return arg1+arg2}end = f(a,b)"""
ctx = js2py.EvalJs(context={'a':1, 'b':2})  # 初始化context对象,通过字典形式传入python对象与js交互
ctx.execute(js)  # 执行js
print(ctx.end)  # 3

3. 在JS代码中引入外部JS库(需要安装nodejs环境)

import js2py
js = """var path = require('path')p=path.join('/foo/bar', 'file')"""
ctx = js2py.EvalJs(enable_require=True)  # 开启require功能
ctx.execute(js)  # 执行js
print(ctx.p)  # /foo/bar/file
js = """p = p+p"""
ctx.execute(js)  # 执行js
print(ctx.p)  # /foo/bar/file/foo/bar/file

关于require在js2py中使用有个bug,会在最后说明。

4. Python与JS混编

CryptoJS = js2py.require('crypto-js')
data = [{'id':1}, {'id':2}]
JSON = js2py.eval_js('JSON')ciphertext = CryptoJS.AES.encrypt(JSON.stringify(data), 'secret key 123')
bytes = CryptoJS.AES.decrypt(ciphertext.toString(), 'secret key 123')
decryptedData = JSON.parse(bytes.toString(CryptoJS.enc.Utf8)).to_list()print(decryptedData)  # [{'id':1}, {'id':2}]

5. 最后

在对js2py这个库的摸索使用中,发现了不少的问题(bug),发现作者最后一次处理issue是在2018年11月了,超过20个issue未处理,博主也把遇到的问题提了两个上去,不知道能不能收到回复。

博主修复的bug:在windows 10 上使用这个库执行带有require语句的JS代码时遇到的错误

Could not link required node_modules

解决:经过反复测试与检查,发现是subprocess库在windows上执行shell命令有bug。具体是这样,在Python包安装路径下的js2py/node_import.py的17行有以下代码:

assert subprocess.call('cd %s;npm install babel-core babel-cli babel-preset-es2015 babel-polyfill babelify browserify browserify-shim'% repr(DIRNAME),shell=True,cwd=DIRNAME) == 0, 'Could not link required node_modules'

这句代码时在windows上安装js依赖包,在cmd下执行时没有问题的,但是通过subprocess执行就有问题,问题在于subprocess不能正确执行带分号的命令,这就导致在执行require JS语句时一直报这个错,但我估计在linux环境是没有问题的。

修改

assert subprocess.call('npm install babel-core babel-cli babel-preset-es2015 babel-polyfill babelify browserify browserify-shim',shell=True,cwd=DIRNAME) == 0, 'Could not link required node_modules'

其实这里作者的cd命令是多余的,因为cwd参数已经指定了命令的执行路径,无需再cd进入路径。

除了这里,还要修改这个文件第79行,一样的问题。

最后友情提醒,如果你的环境不能科学上网,你最好修改一下npm的源:

 npm config set registry https://registry.npm.taobao.org

避免网络问题导致不必要的麻烦,因为执行的JS代码依赖外部库时,这个库会在后台执行npm install操作(仅一次)。

其他:

因为博主也是搞爬虫的,所有有时会用到这样的库,这次就做一下完整的记录,助己助人。

本博客欢迎留言 :) 

这篇关于【爬虫】巧用 js2py (附带bug解决)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/347975

相关文章

Springboot项目启动失败提示找不到dao类的解决

《Springboot项目启动失败提示找不到dao类的解决》SpringBoot启动失败,因ProductServiceImpl未正确注入ProductDao,原因:Dao未注册为Bean,解决:在启... 目录错误描述原因解决方法总结***************************APPLICA编

解决pandas无法读取csv文件数据的问题

《解决pandas无法读取csv文件数据的问题》本文讲述作者用Pandas读取CSV文件时因参数设置不当导致数据错位,通过调整delimiter和on_bad_lines参数最终解决问题,并强调正确参... 目录一、前言二、问题复现1. 问题2. 通过 on_bad_lines=‘warn’ 跳过异常数据3

解决RocketMQ的幂等性问题

《解决RocketMQ的幂等性问题》重复消费因调用链路长、消息发送超时或消费者故障导致,通过生产者消息查询、Redis缓存及消费者唯一主键可以确保幂等性,避免重复处理,本文主要介绍了解决RocketM... 目录造成重复消费的原因解决方法生产者端消费者端代码实现造成重复消费的原因当系统的调用链路比较长的时

深度解析Nginx日志分析与499状态码问题解决

《深度解析Nginx日志分析与499状态码问题解决》在Web服务器运维和性能优化过程中,Nginx日志是排查问题的重要依据,本文将围绕Nginx日志分析、499状态码的成因、排查方法及解决方案展开讨论... 目录前言1. Nginx日志基础1.1 Nginx日志存放位置1.2 Nginx日志格式2. 499

SpringBoot监控API请求耗时的6中解决解决方案

《SpringBoot监控API请求耗时的6中解决解决方案》本文介绍SpringBoot中记录API请求耗时的6种方案,包括手动埋点、AOP切面、拦截器、Filter、事件监听、Micrometer+... 目录1. 简介2.实战案例2.1 手动记录2.2 自定义AOP记录2.3 拦截器技术2.4 使用Fi

kkFileView启动报错:报错2003端口占用的问题及解决

《kkFileView启动报错:报错2003端口占用的问题及解决》kkFileView启动报错因office组件2003端口未关闭,解决:查杀占用端口的进程,终止Java进程,使用shutdown.s... 目录原因解决总结kkFileViewjavascript启动报错启动office组件失败,请检查of

SQL Server安装时候没有中文选项的解决方法

《SQLServer安装时候没有中文选项的解决方法》用户安装SQLServer时界面全英文,无中文选项,通过修改安装设置中的国家或地区为中文中国,重启安装程序后界面恢复中文,解决了问题,对SQLSe... 你是不是在安装SQL Server时候发现安装界面和别人不同,并且无论如何都没有中文选项?这个问题也

java内存泄漏排查过程及解决

《java内存泄漏排查过程及解决》公司某服务内存持续增长,疑似内存泄漏,未触发OOM,排查方法包括检查JVM配置、分析GC执行状态、导出堆内存快照并用IDEAProfiler工具定位大对象及代码... 目录内存泄漏内存问题排查1.查看JVM内存配置2.分析gc是否正常执行3.导出 dump 各种工具分析4.

Spring的RedisTemplate的json反序列泛型丢失问题解决

《Spring的RedisTemplate的json反序列泛型丢失问题解决》本文主要介绍了SpringRedisTemplate中使用JSON序列化时泛型信息丢失的问题及其提出三种解决方案,可以根据性... 目录背景解决方案方案一方案二方案三总结背景在使用RedisTemplate操作redis时我们针对

SpringBoot整合Dubbo+ZK注册失败的坑及解决

《SpringBoot整合Dubbo+ZK注册失败的坑及解决》使用Dubbo框架时,需在公共pom添加依赖,启动类加@EnableDubbo,实现类用@DubboService替代@Service,配... 目录1.先看下公共的pom(maven创建的pom工程)2.启动类上加@EnableDubbo3.实