Java利用正则表达式提取数据的方法-eolink官网

Java利用正则表达式提取数据的方法

什么是正则表达式

正则表达式是一种可以用于模式匹配和替换的规范，一个正则表达式就是由普通的字符（例如字符a到z）以及特殊字符（元字符）组成的文字模式，它用以描述在查找文字主体时待匹配的一个或多个字符串。正则表达式作为一个模板，将某个字符模式与所搜索的字符串进行匹配。

java利用正则表达式提取数据

Java正则表达式的用途很广，之前要用到将一大 3M 的 txt 文本切分成多个小文本，用 C# 写的话很简洁，代码也就二十几行，今天用 Java 写了一下，果然，Java 很罗嗦。

切分文件的代码就不贴了，主要贴一下怎么使用正则表达式将大字符串进行分组：

比如，现在有一个 ehttp://ndlist.txt 文本文件，内容如下：

1300102,北京市

1300103,北京市

1300104,uZmhQTFfIP北京市

1300105,北京市

1300106,北京市

1300107,北京市

1300108,北京市

1300109,北京市

1300110,北京市

1300111,北京市

1300112,北京市

1300113,北京市

1300114,北京市

1300115,北京市

1300116,北京市

1300117,北京市

1300118,北京市

1300119,北京市

七位数字代表手机号码的前七位，后面的汉字表示号码归属地。现在我要将这些内容按照 130 131 132... 开头分别写到 130.txt 131.txt 132.txt.....这些文件中。

public static void main(String args[]) {

File file = null;

BufferedReader br = null;

StringBuffer buffer = null;

String childPath = "src/endlist.txt";

String data = "";

try {

file = new File(childPath);

buffer = new StringBuffer();

InputStreamReader isr = new InputStreamReader(new FileInputStream(file), "utf-8");

br = new BufferedReader(isr);

int s;

while ((s = br.read()) != -1) {

http:// buffer.append((char) s);

}

data = buffer.toString();

} catch (Exception e) {

e.printStackTrace();

}

Map> resultMap = new HashMap>();

for (int i = 0; i < 10; i++) {

resultMap.put("13" + i, new ArrayList

}

Pattern pattern = Pattern.compile("(\\d{3})(\\d{4},[\u4e00-\u9fa5]*\\n)");

Matcher matcher = pattern.matcher(data);

while (matcher.find()) {

resultMap.get(matcher.group(1)).add(matcher.group(2));

}

for (int i = 0; i < 10; i++) {

if (resultMap.get("13" + i).size() > 0) {

try {

File outFile = new File("src/13" + i + ".txt");

FileOutputStream outputStream = new FileOutputStream(outFile);

OutputStreamWriter writer = new OutputStreamWriter(outputStream, "utf-8");

ArrayList tempList = resultMap.get("13" + i);

for (int j = 0; j < tempList.size(); j++) {

writer.append(resultMap.get("13" + i).get(j));

}

writer.close();

outputStream.close();

} catch (Exception e) {

// TODO Auto-generated catch block

e.printStackTrace();

}

第24行使用正则表达式 "(\\d{3})(\\d{4},[\u4e00-\u9fa5]*\\n)" 每个()中的内容为一组，索引从 1 开始，0表示整个表达式。所以这个表达式分为两组，第一组表示3个数字，第二组表示 4个数字加多个汉字加一个换行符。提取时如26-28行所示。

总结

以上就是这篇文章的全部内容了，希望本文的内容对大家的学习或者工作能带来一定的帮助，如果有疑问大家可以留言交流。

}

Pattern pattern = Pattern.compile("(\\d{3})(\\d{4},[\u4e00-\u9fa5]*\\n)");

Matcher matcher = pattern.matcher(data);

while (matcher.find()) {

resultMap.get(matcher.group(1)).add(matcher.group(2));

}

for (int i = 0; i < 10; i++) {

if (resultMap.get("13" + i).size() > 0) {

try {

File outFile = new File("src/13" + i + ".txt");

FileOutputStream outputStream = new FileOutputStream(outFile);

OutputStreamWriter writer = new OutputStreamWriter(outputStream, "utf-8");

ArrayList tempList = resultMap.get("13" + i);

for (int j = 0; j < tempList.size(); j++) {

writer.append(resultMap.get("13" + i).get(j));

}

writer.close();

outputStream.close();

} catch (Exception e) {

// TODO Auto-generated catch block

e.printStackTrace();

}

总结

以上就是这篇文章的全部内容了，希望本文的内容对大家的学习或者工作能带来一定的帮助，如果有疑问大家可以留言交流。

Flask接口签名sign原理与实例代码浅析

578 2023-06-23

Java利用正则表达式提取数据的方法

Flask接口签名sign原理与实例代码浅析

vue项目接口域名动态的获取方法

zookeeper python接口实例详解

推荐文章

接口调用是什么意思？几种常用接口调用方式

接口设计原则

8款在线 API 接口文档管理工具

api管理系统是什么？

什么是接口调试？接口调试的步骤有哪些？

api 接口管理系统有哪些？

接口测试有几种测试方法

API文档生成工具有哪些？

微服务和api网关区别

交换机配置步骤

最近发表

热评文章

在线接口文档管理工具推荐，支持在线测试，HTTP接口

开源的在线接口文档wiki工具Mindoc的介绍与使

如何优雅的进行接口设计？接口设计的六大原则是什么？

什么是API测试,api检测公司

遇到百度网址安全中心提醒您该页面可能存在钓鱼欺诈信息

软件接口设计怎么做？前后端分离软件接口设计思路