博客
关于我
Java 实现去除中文文本的停用词
阅读量:411 次
发布时间:2019-03-05

本文共 1850 字,大约阅读时间需要 6 分钟。

目录


1.  整体思路

第一步:先将中文文本进行分词,这里使用的HanLP-汉语言处理包进行中文文本分词。

第二步:使用停用词表,去除分好的词中的停用词。

2.  中文文本分词环境配置

使用的HanLP-汉语言处理包进行中文文本分词。

  • HanLP-汉语言处理包官网如下:
  • HanLP 的环境配置有两种方式:方式一、Maven;方式二、下载jar、data、hanlp.properties。

官方环境配置网址如下:

  • 环境配置好后,java使用HanLP进行中文分词文档如下:

3.  下载停用词表

停用词表可以去百度搜索,这是我搜到的一个:

我将它放在了百度云里面。

停用词.txt : 链接:  提取码:8uq1 

4.  去除停用词工具类

使用这个工具类的之前,请先完成中文文本分词环境配置,并测试一下。停用词 .txt 文件路径请修改为自己的本地路径

public class FormatUtil {    /**     * 去除停用词     * @param oldString:原中文文本     * @return 去除停用词之后的中文文本     * @throws IOException     */    public static String RemovalOfStopWords(String oldString) throws IOException {        String newString = oldString;        // 分词        List
termList = HanLP.segment(newString); System.out.println(termList); // 中文 停用词 .txt 文件路径 String filePath = "F:\\主文件夹\\知识图谱\\工具资源\\停用词.txt"; File file = new File(filePath); BufferedReader bufferedReader = new BufferedReader(new FileReader(file)); List
stopWords = new ArrayList<>(); String temp = null; while ((temp = bufferedReader.readLine()) != null) { //System.out.println("*" + temp+ "*"); stopWords.add(temp.trim()); } List
termStringList = new ArrayList<>(); for(Term term:termList) { termStringList.add(term.word); //System.out.println("*" + term.word + "*"); } termStringList.removeAll(stopWords); newString = ""; for (String string:termStringList) { newString += string; } return newString; }}

5.  工具类测试

5.1  测试代码

public class test {    public static void main(String args[]) {        try {            System.out.println(FormatUtil.RemovalOfStopWords("床前明月光,疑是地上霜。举头望明月,低头思故乡。"));        } catch (IOException e) {            e.printStackTrace();        }    }}

5.2  测试结果

END。

转载地址:http://epkzz.baihongyu.com/

你可能感兴趣的文章
Mysql中使用存储过程插入decimal和时间数据递增的模拟数据
查看>>
MySql中关于geometry类型的数据_空的时候如何插入处理_需用null_空字符串插入会报错_Cannot get geometry object from dat---MySql工作笔记003
查看>>
mysql中出现Incorrect DECIMAL value: '0' for column '' at row -1错误解决方案
查看>>
mysql中出现Unit mysql.service could not be found 的解决方法
查看>>
mysql中出现update-alternatives: 错误: 候选项路径 /etc/mysql/mysql.cnf 不存在 dpkg: 处理软件包 mysql-server-8.0的解决方法(全)
查看>>
Mysql中各类锁的机制图文详细解析(全)
查看>>
MySQL中地理位置数据扩展geometry的使用心得
查看>>
Mysql中存储引擎简介、修改、查询、选择
查看>>
Mysql中存储过程、存储函数、自定义函数、变量、流程控制语句、光标/游标、定义条件和处理程序的使用示例
查看>>
mysql中实现rownum,对结果进行排序
查看>>
mysql中对于数据库的基本操作
查看>>
Mysql中常用函数的使用示例
查看>>
MySql中怎样使用case-when实现判断查询结果返回
查看>>
Mysql中怎样使用update更新某列的数据减去指定值
查看>>
Mysql中怎样设置指定ip远程访问连接
查看>>
mysql中数据表的基本操作很难嘛,由这个实验来带你从头走一遍
查看>>
Mysql中文乱码问题完美解决方案
查看>>
mysql中的 +号 和 CONCAT(str1,str2,...)
查看>>
Mysql中的 IFNULL 函数的详解
查看>>
mysql中的collate关键字是什么意思?
查看>>