java 统计10000篇文章中不同单词出现的次数并以次序排序

2024-03-27 17:18

本文主要是介绍java 统计10000篇文章中不同单词出现的次数并以次序排序,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

统计10000篇文章中不同单词出现的次数并以次序排序

此次统计从两方面入手:一是单线程读取10000个文件;二是打开10000个线程,每个线程读取一个文件


单线程程序

import java.io.BufferedReader;
import java.io.File;
import java.io.FileReader;
import java.util.ArrayList;
import java.util.Collections;
import java.util.Comparator;
import java.util.HashMap;
import java.util.List;
import java.util.Map;
import java.util.TreeMap;public class CountLetters {
//	public static String FILE_NAME = "/home/taohao/temp/english.txt";public static String FILE_PATH = "/home/taohao/temp/test";private String[] readFromeFile(String[] fileNames){String lineString = new String();StringBuilder line = new StringBuilder();BufferedReader bufferedReader = null;for(String name : fileNames){try {name = FILE_PATH + "/" + name;File file = new File(name);bufferedReader = new BufferedReader(new FileReader(file));while((lineString=bufferedReader.readLine())!=null){line.append(lineString);}bufferedReader.close();} catch (Exception e) {// TODO: handle exceptionSystem.out.println(e);}}
//		System.out.println(line.toString());String[] letters = line.toString().split("\\W+");return letters;}private HashMap<String, Integer> countMap(String[] string){HashMap<String, Integer> hashMap = new HashMap<String, Integer>();Integer integer = new Integer(1);int newIntValue;Integer newInteger = null;Integer value = null;for(String item : string){if((value=hashMap.get(item))==null){hashMap.put(item, integer);}else {newIntValue = value.intValue() + 1;newInteger = new Integer(newIntValue);hashMap.put(item, newInteger);}}return hashMap;}// treemap 的key 不能重复,否则会被覆盖,因此此处的转换有问题
//	private TreeMap<Integer, String>hashMapToTreeMap(HashMap<String, Integer> hashMap){
//		TreeMap<Integer, String> treeMap = new TreeMap<Integer, String>(new Comparator<Integer>() {
//
//			@Override
//			public int compare(Integer o1, Integer o2) {
//				// TODO Auto-generated method stub
//				return ~o1.compareTo(o2)+1;
//			}
//		});
//		for(String letter : hashMap.keySet()){
//			treeMap.put(hashMap.get(letter), letter);
//		}
//		return treeMap;
//	}public static void main(String[] args){/** 单线程*/long start = System.currentTimeMillis();  //msCountLetters countLetters = new CountLetters();File file = new File(CountLetters.FILE_PATH);String[] fileNames = file.list();String[] letters = countLetters.readFromeFile(fileNames);System.out.println(letters.length);HashMap<String, Integer> hashMap = countLetters.countMap(letters);System.out.println(hashMap.size());SortByValues sortByValues = new SortByValues();List<Map.Entry<String, Integer>> mapItemList = new ArrayList<>(hashMap.entrySet());Collections.sort(mapItemList, sortByValues);System.out.println(mapItemList.size());System.out.println(mapItemList.toString());long end = System.currentTimeMillis();System.out.println("start-end=" + (end-start));}
}


多线程程序

import java.io.BufferedReader;
import java.io.File;
import java.io.FileReader;
import java.util.ArrayList;
import java.util.Collections;
import java.util.HashMap;
import java.util.List;
import java.util.Map;
import java.util.concurrent.ExecutorService;
import java.util.concurrent.Executors;public class CountLettersThreads {public static String FILE_PATH = "/home/taohao/temp/test";
//	private String[] fileLiStrings = null;public HashMap<String, Integer> hashMap = new HashMap<String, Integer>();class countThread implements Runnable{private String fileName = null;private String[] letterStrings = null;public countThread(String fileName) {// TODO Auto-generated constructor stubthis.fileName = FILE_PATH + "/" + fileName;}@Overridepublic void run() {// TODO Auto-generated method stubletterStrings = readFromeFile(fileName);synchronized (hashMap) {Integer integer = new Integer(1);int newIntValue;Integer newInteger = null;Integer value = null;for(String item : letterStrings){if((value=hashMap.get(item))==null){hashMap.put(item, integer);}else {newIntValue = value.intValue() + 1;newInteger = new Integer(newIntValue);hashMap.put(item, newInteger);}}}}public String[] readFromeFile(String fileName){String lineString = new String();StringBuilder line = new StringBuilder();File file = new File(fileName);BufferedReader bufferedReader = null;try {bufferedReader = new BufferedReader(new FileReader(file));while((lineString=bufferedReader.readLine())!=null){line.append(lineString);}bufferedReader.close();} catch (Exception e) {// TODO: handle exceptionSystem.out.println("readfile exception " + e);}System.out.println(line.toString());String[] letters = line.toString().split("\\W+");return letters;}}public static void main(String[] args) throws Exception{long start = System.currentTimeMillis();  // msFile file = new File(CountLettersThreads.FILE_PATH);CountLettersThreads countLettersThreads = new CountLettersThreads();String[] fileList = file.list();int fileCount = fileList.length;for(int i=0; i<fileCount; i++){CountLettersThreads.countThread runnaThread = countLettersThreads.new countThread(fileList[i]);Thread thread = new Thread(runnaThread);thread.start();thread.join();}HashMap<String, Integer> hashMap = countLettersThreads.hashMap;System.out.println(hashMap.size());SortByValues sortByValues = new SortByValues();List<Map.Entry<String, Integer>> mapItemList = new ArrayList<>(hashMap.entrySet());Collections.sort(mapItemList, sortByValues);System.out.println(mapItemList.toString());long end = System.currentTimeMillis();System.out.println("start-end=" + (end-start));}
}


另外用到的一个比较类

import java.awt.List;
import java.util.Comparator;
import java.util.HashMap;
import java.util.Map;
import java.util.Map.Entry;public class SortByValues implements Comparator<Map.Entry<String, Integer>>{@Overridepublic int compare(Entry<String, Integer> o1, Entry<String, Integer> o2) {// TODO Auto-generated method stubreturn ~o1.getValue().compareTo(o2.getValue()) + 1;}
}


得到的统计数据为:

单线程用时84537ms, 差不多是多线程的三倍多。

多线程用时31516ms

由上可知两者的差别只有三倍左右的差别,我觉得可能的原因是在最后排序都是统一排序的,

多线程只负责了读文件和区分不同的单词及单词出现的数量,并没有进行局部排序。

如果在每个线程里面进行了局部排序应该两者所用的时间还会继续拉大。


另外本程序中对hashmap的value进行排序,此时是将hashmap的entry作为list的元素,通过collection的sort()函数进行排序的。

collection的sort()函数怎样排序的,我还要进一步查阅资料学习。????







这篇关于java 统计10000篇文章中不同单词出现的次数并以次序排序的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/852857

相关文章

Java实现删除文件中的指定内容

《Java实现删除文件中的指定内容》在日常开发中,经常需要对文本文件进行批量处理,其中,删除文件中指定内容是最常见的需求之一,下面我们就来看看如何使用java实现删除文件中的指定内容吧... 目录1. 项目背景详细介绍2. 项目需求详细介绍2.1 功能需求2.2 非功能需求3. 相关技术详细介绍3.1 Ja

springboot项目中整合高德地图的实践

《springboot项目中整合高德地图的实践》:本文主要介绍springboot项目中整合高德地图的实践,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录一:高德开放平台的使用二:创建数据库(我是用的是mysql)三:Springboot所需的依赖(根据你的需求再

spring中的ImportSelector接口示例详解

《spring中的ImportSelector接口示例详解》Spring的ImportSelector接口用于动态选择配置类,实现条件化和模块化配置,关键方法selectImports根据注解信息返回... 目录一、核心作用二、关键方法三、扩展功能四、使用示例五、工作原理六、应用场景七、自定义实现Impor

SpringBoot3应用中集成和使用Spring Retry的实践记录

《SpringBoot3应用中集成和使用SpringRetry的实践记录》SpringRetry为SpringBoot3提供重试机制,支持注解和编程式两种方式,可配置重试策略与监听器,适用于临时性故... 目录1. 简介2. 环境准备3. 使用方式3.1 注解方式 基础使用自定义重试策略失败恢复机制注意事项

SpringBoot整合Flowable实现工作流的详细流程

《SpringBoot整合Flowable实现工作流的详细流程》Flowable是一个使用Java编写的轻量级业务流程引擎,Flowable流程引擎可用于部署BPMN2.0流程定义,创建这些流程定义的... 目录1、流程引擎介绍2、创建项目3、画流程图4、开发接口4.1 Java 类梳理4.2 查看流程图4

一文详解如何在idea中快速搭建一个Spring Boot项目

《一文详解如何在idea中快速搭建一个SpringBoot项目》IntelliJIDEA作为Java开发者的‌首选IDE‌,深度集成SpringBoot支持,可一键生成项目骨架、智能配置依赖,这篇文... 目录前言1、创建项目名称2、勾选需要的依赖3、在setting中检查maven4、编写数据源5、开启热

Java对异常的认识与异常的处理小结

《Java对异常的认识与异常的处理小结》Java程序在运行时可能出现的错误或非正常情况称为异常,下面给大家介绍Java对异常的认识与异常的处理,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参... 目录一、认识异常与异常类型。二、异常的处理三、总结 一、认识异常与异常类型。(1)简单定义-什么是

SpringBoot项目配置logback-spring.xml屏蔽特定路径的日志

《SpringBoot项目配置logback-spring.xml屏蔽特定路径的日志》在SpringBoot项目中,使用logback-spring.xml配置屏蔽特定路径的日志有两种常用方式,文中的... 目录方案一:基础配置(直接关闭目标路径日志)方案二:结合 Spring Profile 按环境屏蔽关

Java使用HttpClient实现图片下载与本地保存功能

《Java使用HttpClient实现图片下载与本地保存功能》在当今数字化时代,网络资源的获取与处理已成为软件开发中的常见需求,其中,图片作为网络上最常见的资源之一,其下载与保存功能在许多应用场景中都... 目录引言一、Apache HttpClient简介二、技术栈与环境准备三、实现图片下载与保存功能1.

SpringBoot排查和解决JSON解析错误(400 Bad Request)的方法

《SpringBoot排查和解决JSON解析错误(400BadRequest)的方法》在开发SpringBootRESTfulAPI时,客户端与服务端的数据交互通常使用JSON格式,然而,JSON... 目录问题背景1. 问题描述2. 错误分析解决方案1. 手动重新输入jsON2. 使用工具清理JSON3.