您好,欢迎来到[编程问答]网站首页   源码下载   电子书籍   软件下载   专题
当前位置:首页 >> 编程问答 >> 其他语言 >> Java 读取txt格式语料库并匹配指定字符串,如何可以快速完成?

Java 读取txt格式语料库并匹配指定字符串,如何可以快速完成?

来源:网络整理     时间:2016/6/8 0:29:45     关键词:java,字符串

关于网友提出的“Java 读取txt格式语料库并匹配指定字符串,如何可以快速完成?”问题疑问,本网通过在网上对“Java 读取txt格式语料库并匹配指定字符串,如何可以快速完成?”有关的相关答案进行了整理,供用户进行参考,详细问题解答如下:

问题:Java 读取txt格式语料库并匹配指定字符串,如何可以快速完成?
描述:

有一个9M多行的语料库,文件大小4G。现在需要匹配指定动词,符合句子条件的输出。
但是文件过大。每次读取一行。匹配下来要好久。请问有没有什么方法可以加快处理速度。

BufferedReader cpreader = new BufferedReader(new InputStreamReader(new FileInputStream(this.getCorpusPath())));
tring line = cpreader.readLine();
while(line != null)
            {
                ArrayList verbList = new ArrayList();
                matcher_line = Pattern.compile("(.*\\%\\&\\$cook\\%\\&\\$VB.*)").matcher(line);
                if(matcher_line.find())
                {
                    System.out.println(line);
                }

                line = cpreader.readLine();
            }

解决方案1:

Pattern.compile("(.*\\%\\&\\$cook\\%\\&\\$VB.*)")

这个在循环里边,每次都要编译正则,所以很慢,你把这个放到while外边看看

解决方案2:

nio+多线程

解决方案3:

你的程序是按行处理,单线程处理肯定慢,用多线程处理,每个线程处理一行,处理完后再请求处理下一行,读取行的话最好用缓存读取多行,然后再分配给多个线程处理,这样可以最大利用CPU。

解决方案4:

读文件的话应该是没有问题的,不过你可以尝试改为缓冲式读取,因为一行的大小 可能是不确定的,会对效率造成影响吧。。
匹配的话如果是单个单词的话,可以改用更好的匹配方法,正则的话就不晓得了


以上介绍了“Java 读取txt格式语料库并匹配指定字符串,如何可以快速完成?”的问题解答,希望对有需要的网友有所帮助。
本文网址链接:http://www.codes51.com/itwd/1588389.html

相关图片

相关文章