ElasticSearch新增IK扩展词后,让历史数据生效方法

2023-10-08 05:28

本文主要是介绍ElasticSearch新增IK扩展词后,让历史数据生效方法,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

ElasticSearch新增IK扩展词后,让历史数据生效方法

一、前言

ES词库新增一个关键词、同义词、简繁体和停止词之后,发现只有新数据进入到索引才会生效,对于之前已经存储到索引的数据,还是按照之前的方式来做分词,这个问题应该如何解决呢?

我在网上发现有三种方式:

第一种就是将之前的索引的索引数据重新再刷一次,这种做法比较伤身体,不太推荐。

第二种方式就是采用reindex,这种方法一般用于解决索引结构调整比较大的问题,需要新建一个副本索引,把数据全部迁移到副本索引上,然后将原有索引删除,最后再将副本索引取一个别名,名字为原有索引的名称。

第三种方式就是采用update_by_query,这种方式可以不创建新索引,在已有索引基础上,将数据根据现有结构重新刷新一次,刷新之后,索引的历史数据就会采用词库新增词建立倒排索引了。

二、ES实现

2.1 参数简介

POST article/_update_by_query?conflicts=proceed&wait_for_completion=false&scroll_size=100
{"query": {"match_all": {}}
}

conflicts: 当更新遇到版本冲突是否继续执行,proceed为继续执行,abort为停止执行

wait_for_completion: 发送请求后之后等待返回结果,如果设置为false,ES将会开启一个后台任务,并且返回一个任务编号;如何设置为true,发送请求之后将会一直等待任务执行完毕才会返回结果,如果数据量比较大,不建议设置为true,因为容易出现请求超时502 Bad Request的情况。

scroll_size: 任务每次批量执行多少条数据,默认设置为1000条,如果一条数据执行时间比较长,可以考虑设置为100。

query: 此处的query你可以任意的发挥你的想象,这个就类似与数据库中的update table set column = value where field = condition中的where子句一样,可以过滤非必要更新数据并较少刷新时间。

2.2 获取任务执行详情

get _tasks/H9tGBF8FS-il0WyDNnhtSA:44192641

返回结果

{"completed": false,"task": {"node": "H9tGBF8FS-il0WyDNnhtSA","id": 44283452,"type": "transport","action": "indices:data/write/update/byquery","status": {"total": 94759,"updated": 33199,"created": 0,"deleted": 0,"batches": 333,"version_conflicts": 1,"noops": 0,"retries": {"bulk": 0,"search": 0},"throttled_millis": 0,"requests_per_second": -1,"throttled_until_millis": 0},"description": "update-by-query [article]","start_time_in_millis": 1696666800258,"running_time_in_nanos": 524996978138,"cancellable": true,"cancelled": false,"headers": {}}
}

2.3 获取ES任务列表

get _tasks?detailed=true&actions=*byquery&pretty

2.4 取消任务

POST _tasks/H9tGBF8FS-il0WyDNnhtSA:44161765/_cancel

2.5 进度条

如果你认为执行时间太长了,可以考虑做个进度条给在界面上展示,毕竟没有人会想点击刷新之后世界进入茫然无知的状况。下面是进度条的简短代码。

@Override
public BarVO getBar(String taskId) {if (taskId == null || !taskId.contains(":")){throw new RuntimeException("任务编号不合法");}// 1. 查询进度条GetTasksResponse tasksResponse = null;try {tasksResponse = elasticsearchClient.tasks().get(taskQueryBuilder -> taskQueryBuilder.taskId(taskId));} catch (IOException e) {throw new RuntimeException(e);}TaskStatus taskStatus = tasksResponse.task().status();BarVO barVO = new BarVO();barVO.setFail(taskStatus.versionConflicts());barVO.setSuccess(taskStatus.updated());barVO.setTotal(taskStatus.total());String percent = MathUtil.getPercent(barVO.getFail() + barVO.getSuccess(), barVO.getTotal());barVO.setRage(percent);barVO.setTaskId(taskId);return barVO;
}

请求结果展示

{"code": 200,"msg": "操作成功","result": {"timestamp": null,"total": 94759,"success": 79642,"fail": 5658,"rage": "90.02%","taskId": "H9tGBF8FS-il0WyDNnhtSA:44316655"}
}

这篇关于ElasticSearch新增IK扩展词后,让历史数据生效方法的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/162994

相关文章

Java 中的 @SneakyThrows 注解使用方法(简化异常处理的利与弊)

《Java中的@SneakyThrows注解使用方法(简化异常处理的利与弊)》为了简化异常处理,Lombok提供了一个强大的注解@SneakyThrows,本文将详细介绍@SneakyThro... 目录1. @SneakyThrows 简介 1.1 什么是 Lombok?2. @SneakyThrows

判断PyTorch是GPU版还是CPU版的方法小结

《判断PyTorch是GPU版还是CPU版的方法小结》PyTorch作为当前最流行的深度学习框架之一,支持在CPU和GPU(NVIDIACUDA)上运行,所以对于深度学习开发者来说,正确识别PyTor... 目录前言为什么需要区分GPU和CPU版本?性能差异硬件要求如何检查PyTorch版本?方法1:使用命

Qt实现网络数据解析的方法总结

《Qt实现网络数据解析的方法总结》在Qt中解析网络数据通常涉及接收原始字节流,并将其转换为有意义的应用层数据,这篇文章为大家介绍了详细步骤和示例,感兴趣的小伙伴可以了解下... 目录1. 网络数据接收2. 缓冲区管理(处理粘包/拆包)3. 常见数据格式解析3.1 jsON解析3.2 XML解析3.3 自定义

SpringMVC 通过ajax 前后端数据交互的实现方法

《SpringMVC通过ajax前后端数据交互的实现方法》:本文主要介绍SpringMVC通过ajax前后端数据交互的实现方法,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价... 在前端的开发过程中,经常在html页面通过AJAX进行前后端数据的交互,SpringMVC的controll

Java中的工具类命名方法

《Java中的工具类命名方法》:本文主要介绍Java中的工具类究竟如何命名,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友参考下吧... 目录Java中的工具类究竟如何命名?先来几个例子几种命名方式的比较到底如何命名 ?总结Java中的工具类究竟如何命名?先来几个例子JD

Spring Security自定义身份认证的实现方法

《SpringSecurity自定义身份认证的实现方法》:本文主要介绍SpringSecurity自定义身份认证的实现方法,下面对SpringSecurity的这三种自定义身份认证进行详细讲解,... 目录1.内存身份认证(1)创建配置类(2)验证内存身份认证2.JDBC身份认证(1)数据准备 (2)配置依

python获取网页表格的多种方法汇总

《python获取网页表格的多种方法汇总》我们在网页上看到很多的表格,如果要获取里面的数据或者转化成其他格式,就需要将表格获取下来并进行整理,在Python中,获取网页表格的方法有多种,下面就跟随小编... 目录1. 使用Pandas的read_html2. 使用BeautifulSoup和pandas3.

Spring 中的循环引用问题解决方法

《Spring中的循环引用问题解决方法》:本文主要介绍Spring中的循环引用问题解决方法,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友参考下吧... 目录什么是循环引用?循环依赖三级缓存解决循环依赖二级缓存三级缓存本章来聊聊Spring 中的循环引用问题该如何解决。这里聊

Java学习手册之Filter和Listener使用方法

《Java学习手册之Filter和Listener使用方法》:本文主要介绍Java学习手册之Filter和Listener使用方法的相关资料,Filter是一种拦截器,可以在请求到达Servl... 目录一、Filter(过滤器)1. Filter 的工作原理2. Filter 的配置与使用二、Listen

Pandas统计每行数据中的空值的方法示例

《Pandas统计每行数据中的空值的方法示例》处理缺失数据(NaN值)是一个非常常见的问题,本文主要介绍了Pandas统计每行数据中的空值的方法示例,具有一定的参考价值,感兴趣的可以了解一下... 目录什么是空值?为什么要统计空值?准备工作创建示例数据统计每行空值数量进一步分析www.chinasem.cn处