Java implementation of sample code analysis for reading repeated Chinese strings in articles-javaTutorial-php.cn

Home

Java

javaTutorial

Java implementation of sample code analysis for reading repeated Chinese strings in articles

黄舟

Mar 21, 2017 am 10:22 AM

本文主要介绍了Java实现读取文章中重复出现的中文字符串的方法。具有很好的参考价值。下面跟着小编一起来看下吧

在上个星期阿里巴巴一面的时候，最后面试官问我如何把一篇文章中重复出现的词或者句子找出来，当时太紧张，答的不是很好。今天有时间再来亲手实现一遍。其实说白了也就是字符串的处理，所以难度并不是很大。

以下是代码和运行效果：

实现方法：

import java.io.*;
import java.util.*;
/**
 * Created by chunmiao on 17-3-20.
 */
public class ReadArticle {
 //读取文件名称
 private String filename;
 //读取段落
 private ArrayList<String> result = new ArrayList<>();
 //最小字长（两个字以上进行匹配）
 private final int MINSIZE = 2;
 //重复词储存
 HashSet<String> set;
 public ReadArticle(String filename, HashSet<String> set) {
 this.filename = filename;
 this.set = set;
 }
 public void createData() throws IOException {
 String r;
 //读取文章内容
 BufferedReader in = new BufferedReader(new FileReader(new File(filename).getAbsoluteFile()));
 try {
  while ((r = in.readLine()) != null) {
  //消除不必要的标点符号
  r = r.replaceAll("\\s+ |“|\\[|‘|《|　*|", "").trim();
  //留下” ， 。 。” ”。 ”， ？ 》 -等作为划分句子的分割符标示
  Collections.addAll(result, r.split("，|(。”|”(。|，)|。)|(\\])|”|&#39;|？|:|》|-"));
  }
 }finally {
  in.close();
 }
 //对文章内容进行遍历找出重读出现的句子或者是词语
 for (int i = 0 ; i < result.size() - 1; i ++){
  for (int j = 0 ; j < result.size() - i - 1; j ++) {
  //将重复出现的词语保存到set集合里面
  set.addAll(getSameCharacter(result.get(i), result.get(j + i + 1)));
  }
 }
 }
 private ArrayList<String> getSameCharacter(String a1, String a2){
 String maxS;
 String minS;
 //短句遍历开始处
 int start = 0;
 //词的长度最短为两个字长
 int range =2;
 //设定短句和长句s,使得遍历更加快捷
 if (a1.length() <= a2.length()){
  maxS = a2;
  minS = a1;
 }else {
  maxS = a1;
  minS = a2;
 }
 String result = "";
 ArrayList<String> list = new ArrayList<String>();
 //防止substring时超出范围
 while (start + range <= minS.length()) {
  //如果句子或词在对象里面，则找出相应的句子或词保存在list里面
  if (maxS.indexOf(minS.substring(start, start + range)) != -1) {
  //获取最长句子,删除短句子
  list.remove(result);
  list.add(minS.substring(start, start + range));
  result = minS.substring(start, start + range);
  range++;
  continue;
  }
  range = MINSIZE;
  start++;
 }
 return list;
 }
}

测试代码：

import java.io.IOException;
import java.util.HashSet;
public class Main {
 public static void main(String[] args) throws IOException {
 String filename = "test.txt";
 HashSet<String> result = new HashSet<String>();
 ReadArticle read = new ReadArticle(filename,result);
 read.createData();
 System.out.println("这篇文章中的重复出现的词或句子有以下几个词或句子:\n");
 for (String s : result){
  System.out.println(s);
 }
 }
}

读取的文章内容：

Java implementation of sample code analysis for reading repeated Chinese strings in articles

正则匹配结果（去掉多余字符）：

Java implementation of sample code analysis for reading repeated Chinese strings in articles

字符串转换成ArrayList:

Java implementation of sample code analysis for reading repeated Chinese strings in articles

最终处理结果：

Java implementation of sample code analysis for reading repeated Chinese strings in articles

其实从上面的结果可以看出。单纯的操控字符串并不能判断它是否是一个完整的词和句，应该还要配合数据库字典来匹配上面的结果，从而找出真正的词和句

The above is the detailed content of Java implementation of sample code analysis for reading repeated Chinese strings in articles. For more information, please follow other related articles on the PHP Chinese website!

Statement

The content of this article is voluntarily contributed by netizens, and the copyright belongs to the original author. This site does not assume corresponding legal responsibility. If you find any content suspected of plagiarism or infringement, please contact admin@php.cn

带你搞懂Java结构化数据处理开源库SPLMay 24, 2022 pm 01:34 PM

本篇文章给大家带来了关于java的相关知识，其中主要介绍了关于结构化数据处理开源库SPL的相关问题，下面就一起来看一下java下理想的结构化数据处理类库，希望对大家有帮助。

Java集合框架之PriorityQueue优先级队列Jun 09, 2022 am 11:47 AM

本篇文章给大家带来了关于java的相关知识，其中主要介绍了关于PriorityQueue优先级队列的相关知识，Java集合框架中提供了PriorityQueue和PriorityBlockingQueue两种类型的优先级队列，PriorityQueue是线程不安全的，PriorityBlockingQueue是线程安全的，下面一起来看一下，希望对大家有帮助。

完全掌握Java锁（图文解析）Jun 14, 2022 am 11:47 AM

本篇文章给大家带来了关于java的相关知识，其中主要介绍了关于java锁的相关问题，包括了独占锁、悲观锁、乐观锁、共享锁等等内容，下面一起来看一下，希望对大家有帮助。

一起聊聊Java多线程之线程安全问题Apr 21, 2022 pm 06:17 PM

本篇文章给大家带来了关于java的相关知识，其中主要介绍了关于多线程的相关问题，包括了线程安装、线程加锁与线程不安全的原因、线程安全的标准类等等内容，希望对大家有帮助。

Java基础归纳之枚举May 26, 2022 am 11:50 AM

本篇文章给大家带来了关于java的相关知识，其中主要介绍了关于枚举的相关问题，包括了枚举的基本操作、集合类对枚举的支持等等内容，下面一起来看一下，希望对大家有帮助。

详细解析Java的this和super关键字Apr 30, 2022 am 09:00 AM

本篇文章给大家带来了关于Java的相关知识，其中主要介绍了关于关键字中this和super的相关问题，以及他们的一些区别，下面一起来看一下，希望对大家有帮助。

Java数据结构之AVL树详解Jun 01, 2022 am 11:39 AM

本篇文章给大家带来了关于java的相关知识，其中主要介绍了关于平衡二叉树（AVL树）的相关知识，AVL树本质上是带了平衡功能的二叉查找树，下面一起来看一下，希望对大家有帮助。

java中封装是什么May 16, 2019 pm 06:08 PM

封装是一种信息隐藏技术，是指一种将抽象性函式接口的实现细节部分包装、隐藏起来的方法；封装可以被认为是一个保护屏障，防止指定类的代码和数据被外部类定义的代码随机访问。封装可以通过关键字private，protected和public实现。

See all articles

Hot AI Tools

Undresser.AI Undress

AI-powered app for creating realistic nude photos

AI Clothes Remover

Online AI tool for removing clothes from photos.

Undress AI Tool

Undress images for free

Clothoff.io

AI clothes remover

AI Hentai Generator

Generate AI Hentai for free.

Hot Article

R.E.P.O. Energy Crystals Explained and What They Do (Yellow Crystal)

2 weeks agoBy尊渡假赌尊渡假赌尊渡假赌

How Long Does It Take To Beat Split Fiction?

1 months agoByDDD

R.E.P.O. Best Graphic Settings

2 weeks agoBy尊渡假赌尊渡假赌尊渡假赌

Assassin's Creed Shadows: Seashell Riddle Solution

1 weeks agoByDDD

R.E.P.O. How to Fix Audio if You Can't Hear Anyone

2 weeks agoBy尊渡假赌尊渡假赌尊渡假赌

Hot Tools

ZendStudio 13.5.1 Mac

Powerful PHP integrated development environment

MinGW - Minimalist GNU for Windows

This project is in the process of being migrated to osdn.net/projects/mingw, you can continue to follow us there. MinGW: A native Windows port of the GNU Compiler Collection (GCC), freely distributable import libraries and header files for building native Windows applications; includes extensions to the MSVC runtime to support C99 functionality. All MinGW software can run on 64-bit Windows platforms.