CCF-CSP 2024.03 - 相似度计算 Java满分解题

2024-05-31 12:04

本文主要是介绍CCF-CSP 2024.03 - 相似度计算 Java满分解题,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

import java.util.HashSet;
import java.util.Scanner;
import java.util.Set;public class text202403_02_Similarity {public static void main(String[] args) {Scanner scanner = new Scanner(System.in);// 读取两篇文章的单词个数int n = scanner.nextInt(); // 第一篇文章的单词个数int m = scanner.nextInt(); // 第二篇文章的单词个数scanner.nextLine(); // 消耗换行符// 创建两个Set集合,用于存储两篇文章的单词,自动去重Set<String> setA = new HashSet<>();Set<String> setB = new HashSet<>();// 读取第一篇文章的单词,转换为小写并添加到SetA中String lineA = scanner.nextLine();String[] wordsA = lineA.toLowerCase().split("\\s+");for (String word : wordsA) {setA.add(word);}// 读取第二篇文章的单词,转换为小写并添加到SetB中String lineB = scanner.nextLine();String[] wordsB = lineB.toLowerCase().split("\\s+");for (String word : wordsB) {setB.add(word);}// 计算交集Set<String> intersection = new HashSet<>(setA);intersection.retainAll(setB);// 计算并集Set<String> union = new HashSet<>(setA);union.addAll(setB);// 输出结果System.out.println(intersection.size()); // 输出交集的大小System.out.println(union.size()); // 输出并集的大小scanner.close();}
}

思路详解:

1. **读取输入**:
   - 首先,程序从标准输入读取两篇文章的单词个数,分别是`n`和`m`。在输入第二个整数后需要将换行符消耗掉。

2. **创建集合**:
   - 接着,程序创建两个`HashSet`集合,分别命名为`setA`和`setB`,用于存储两篇文章中的单词。

3. **处理第一篇文章的单词**:
   - 读取第一篇文章的所有单词,并将它们转换为小写形式以忽略大小写差异。
   - 将转换后的单词添加到`setA`集合中。由于`HashSet`的特性,会自动去除重复的单词,保证每个单词只被添加一次。

4. **处理第二篇文章的单词**:
   - 类似地,读取第二篇文章的所有单词,并将它们转换为小写形式。
   - 将转换后的单词添加到`setB`集合中。

5. **计算交集**:
   - 为了计算两篇文章共同出现的单词数量(交集),程序创建一个新的`HashSet`集合`intersection`,初始化为`setA`的一个副本。
   - 使用`retainAll()`方法,将`intersection`和`setB`进行比较,只保留同时存在于`setA`和`setB`中的元素。

6. **计算并集**:
   - 为了计算两篇文章中所有不同单词的数量(并集),程序创建一个新的`HashSet`集合`union`,初始化为`setA`的一个副本。
   - 使用`addAll()`方法,将`setB`中的元素添加到`union`中,这样`union`就包含了两篇文章中的所有不同单词。

7. **输出结果**:
   - 最后,程序输出交集`intersection`的大小,即共同出现的单词数量。
   - 接着输出并集`union`的大小,即两篇文章中所有不同单词的数量。

### 处理单词部分

1. **读取单词**:
   - 程序首先读取两篇文章的单词个数,分别是`n`和`m`。这是为了知道接下来需要读取多少个单词。

2. **转换为小写**:
   - 由于题目要求忽略英文字母的大小写区别,程序在读取单词后将它们转换为小写形式。这是通过调用`toLowerCase()`方法实现的。

3. **分割单词**:
   - 输入的单词是以空格分隔的字符串。程序使用`split("\\s+")`方法将字符串分割成单词数组。这里的正则表达式`"\\s+"`匹配一个或多个空白字符,确保即使单词之间有多个空格也能正确分割。

4. **存储单词**:
   - 单词被添加到`HashSet`集合中。`HashSet`是一个不允许重复元素的集合,所以即使文章中有重复的单词,它们也只会在集合中出现一次。

5. **去重**:
   - 由于使用了`HashSet`,程序自动处理了单词的去重工作。这意味着每篇文章的单词集合中不会有重复的单词。

### 计算交并集部分

1. **交集(AnB)**:
   - 交集是指同时出现在两篇文章中的单词集合。程序通过创建`setA`的一个副本`intersection`,然后使用`retainAll(setB)`方法来实现。`retainAll`方法会从`intersection`中移除那些不在`setB`中的元素,最终`intersection`中剩下的就是两篇文章共有的单词集合。

2. **并集(AUB)**:
   - 并集是指在两篇文章中出现过的所有不同单词的集合。程序通过创建`setA`的一个副本`union`,然后使用`addAll(setB)`方法将`setB`中的元素添加到`union`中来实现。`addAll`方法会将`setB`中的所有元素添加到`union`中,但不添加重复元素,因为`HashSet`不允许重复。

3. **输出大小**:
   - 最后,程序输出`intersection.size()`和`union.size()`。这两个值分别表示交集和并集的大小,即共同出现的单词数量和两篇文章中所有不同单词的数量。

### 为什么使用HashSet?

- **性能**:`HashSet`提供了高效的元素查找和插入操作,因为它是基于哈希表实现的。
- **去重**:`HashSet`自动处理重复元素,这意味着不需要额外的逻辑来检查一个元素是否已经存在于集合中。
- **集合操作**:`HashSet`提供了方便的集合操作,如`retainAll`和`addAll`,这些操作对于计算交集和并集非常有帮助。

这篇关于CCF-CSP 2024.03 - 相似度计算 Java满分解题的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1017869

相关文章

Java实现字节字符转bcd编码

《Java实现字节字符转bcd编码》BCD是一种将十进制数字编码为二进制的表示方式,常用于数字显示和存储,本文将介绍如何在Java中实现字节字符转BCD码的过程,需要的小伙伴可以了解下... 目录前言BCD码是什么Java实现字节转bcd编码方法补充总结前言BCD码(Binary-Coded Decima

SpringBoot全局域名替换的实现

《SpringBoot全局域名替换的实现》本文主要介绍了SpringBoot全局域名替换的实现,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一... 目录 项目结构⚙️ 配置文件application.yml️ 配置类AppProperties.Ja

Java使用Javassist动态生成HelloWorld类

《Java使用Javassist动态生成HelloWorld类》Javassist是一个非常强大的字节码操作和定义库,它允许开发者在运行时创建新的类或者修改现有的类,本文将简单介绍如何使用Javass... 目录1. Javassist简介2. 环境准备3. 动态生成HelloWorld类3.1 创建CtC

JavaScript中的高级调试方法全攻略指南

《JavaScript中的高级调试方法全攻略指南》什么是高级JavaScript调试技巧,它比console.log有何优势,如何使用断点调试定位问题,通过本文,我们将深入解答这些问题,带您从理论到实... 目录观点与案例结合观点1观点2观点3观点4观点5高级调试技巧详解实战案例断点调试:定位变量错误性能分

Java实现将HTML文件与字符串转换为图片

《Java实现将HTML文件与字符串转换为图片》在Java开发中,我们经常会遇到将HTML内容转换为图片的需求,本文小编就来和大家详细讲讲如何使用FreeSpire.DocforJava库来实现这一功... 目录前言核心实现:html 转图片完整代码场景 1:转换本地 HTML 文件为图片场景 2:转换 H

Java使用jar命令配置服务器端口的完整指南

《Java使用jar命令配置服务器端口的完整指南》本文将详细介绍如何使用java-jar命令启动应用,并重点讲解如何配置服务器端口,同时提供一个实用的Web工具来简化这一过程,希望对大家有所帮助... 目录1. Java Jar文件简介1.1 什么是Jar文件1.2 创建可执行Jar文件2. 使用java

SpringBoot实现不同接口指定上传文件大小的具体步骤

《SpringBoot实现不同接口指定上传文件大小的具体步骤》:本文主要介绍在SpringBoot中通过自定义注解、AOP拦截和配置文件实现不同接口上传文件大小限制的方法,强调需设置全局阈值远大于... 目录一  springboot实现不同接口指定文件大小1.1 思路说明1.2 工程启动说明二 具体实施2

Python实现精确小数计算的完全指南

《Python实现精确小数计算的完全指南》在金融计算、科学实验和工程领域,浮点数精度问题一直是开发者面临的重大挑战,本文将深入解析Python精确小数计算技术体系,感兴趣的小伙伴可以了解一下... 目录引言:小数精度问题的核心挑战一、浮点数精度问题分析1.1 浮点数精度陷阱1.2 浮点数误差来源二、基础解决

Java实现在Word文档中添加文本水印和图片水印的操作指南

《Java实现在Word文档中添加文本水印和图片水印的操作指南》在当今数字时代,文档的自动化处理与安全防护变得尤为重要,无论是为了保护版权、推广品牌,还是为了在文档中加入特定的标识,为Word文档添加... 目录引言Spire.Doc for Java:高效Word文档处理的利器代码实战:使用Java为Wo

SpringBoot日志级别与日志分组详解

《SpringBoot日志级别与日志分组详解》文章介绍了日志级别(ALL至OFF)及其作用,说明SpringBoot默认日志级别为INFO,可通过application.properties调整全局或... 目录日志级别1、级别内容2、调整日志级别调整默认日志级别调整指定类的日志级别项目开发过程中,利用日志