python - 用于 CSV 拆分的正则表达式，包括多个双引号-6ren

python - 用于 CSV 拆分的正则表达式，包括多个双引号

转载作者：太空宇宙更新时间：2023-11-03 13:15:18

25

4

我有一个包含文本的 CSV 列数据。每行用双引号分隔 "

一行中的示例文本与此类似(注意:换行和每行前的空格是有意的)

"Lorem ipsum dolor sit amet, 
 consectetur adipisicing elit, sed do eiusmod
 tempor incididunt ut labore et dolore magna 
 aliqua. Ut ""enim ad"" minim veniam,
 quis nostrud exercitation ullamco laboris nisi 
 ut aliquip ex ea commodo
 consequat. Duis aute irure dolor in reprehenderit in voluptate velit esse
 cillum dolore eu fugiat ""nulla pariatu"""
"ex ea commodo
 consequat. Duis aute irure ""dolor in"" reprehenderit 
 in voluptate velit esse
 cillum dolore eu fugiat nulla pariatur. 
 Excepteur sint occaecat cupidatat non
 proident, sunt in culpa qui officia deserunt 
 mollit anim id est laborum."

上面代表 2 个后续行。

我想选择每个第一个双引号 "(开始一行)和每个最后一个双引号 "

之间包含的所有文本作为单独的组

如您所见，文本中有换行符，以及随后的转义双引号 ""，这是我需要选择的文本的一部分。

我想到了这样的东西

(?s)(?!")[^\s](.+?)(?=")

但是多个双引号打破了我想要的匹配

我是正则表达式的真正新手，所以我想我可能遗漏了一些非常基本的东西。不知道是否相关，但我使用的是 Sublime Text 3，所以我认为应该是 python。

我该怎么做才能达到我的需要？

最佳答案

您可以使用以下正则表达式:

"[^"]*(?:""[^"]*)*"

参见 demo

此正则表达式将匹配一个非引号或双引号内的 2 个后续双引号。

它是如何工作的？让我分享来自 debuggex.com 的图形:

使用正则表达式，我们匹配:

" - (1) - 文字引用
[^"]* - (2, 3) - 引号以外的 0 个或多个字符(是的，包括换行符，这是一个 negated character class )，如果没有，然后正则表达式搜索最终的文字引用 (6)
(?:""[^"]*)* - (4,5) - 0 个或多个序列:
- "" - (4) - 双双引号
- [^"]* - (5) - 0 个或多个引号以外的字符
" - (6) - 最后的文字引用。

这比 "(?:[^"]|"")*" 工作得更快(尽管产生相同的结果)，因为前者的处理是线性的，涉及的回溯要少得多。

关于python - 用于 CSV 拆分的正则表达式，包括多个双引号，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/32305144/

25

4

0

文章推荐： ssl - 如何在 Windows Server 2012 上安装密码套件

文章推荐： android - Firebase addValueEventListener 响应时间有点慢？

文章推荐： c# - Wpf Richtextbox 某个文本的位置

文章推荐： python - virtualenv 中的 pip ssl 错误

JavaScript 拆分
假设我有这个变量 var image = "image.jpg"; 我正在尝试拆分变量图像的内容并将 _thumbs 插入其中以获得类似 image_thumbs.jpg 的内容。我该如何解决这个问
excel - 拆分，转义某些拆分
我有一个包含多个问题和答案的单元格，其组织方式类似于 CSV。因此，为了将所有这些问题和答案分开，使用逗号作为分隔符的简单拆分应该很容易分开。不幸的是，有些值使用逗号作为小数分隔符。有没有办法避免这
d - 拆分/拆分的编译问题
这是简单的代码: import std.algorithm; import std.array; import std.file; void main(string[] args) { aut
java useDelimeter 拆分 -
我正在尝试解析一个看起来像的 txt 文件 A - 19 B - 2 C - 3 我正在使用扫描仪方法读取它并在“- ”中拆分，以便我的输出看起来像: A 19 B 2 C 3 但是它似乎没有正确拆分
qt - QString 拆分
我有这些网址字符串 file:///home/we/Pictures/neededWord/3193_n.jpg file:///home/smes/Pictures/neededWord/jds_2
没有最终修剪的 Groovy 拆分
我正在解析一个 CVS 文件，如下所示: "07555555555",25.70,18/11/2010,01/03/2011,N,133,0,36,,896,537,547,,Mr,John,Doe,
管道后的 PowerShell 拆分
我在脚本中使用以下行返回 $folder 处所有文件夹的所有路径地点。 dir -recurse $folder|?{$_.PSIsContainer}|select -ExpandProperty
Javascript 拆分、替换表现奇怪
我正在尝试将字符串格式化为word+word+word 例如 “超音乐节”变成“超+音乐+节日” 我尝试过使用以下代码 query.split(" ").join("+"); 或 query.repl
Perl系统+拆分+数组
我叫 luis，住在 arg。我有一个问题，无法解决。 **IN BASH** pwd /home/labs-perl ls file1.pl file2.pl **IN PERL** my $ls
java - 拆分 JsonArray
我想从包 javax.json 中拆分 JsonArray，但我找不到完成这项工作的便捷方法。我查看了文档，只能想到迭代 JsonArray 并使用 JsonArrayBuilder 手动添加项目。
Java 正则表达式/拆分
我希望在第一个 ':' 处拆分字符串，以防止字符串的第二部分包含 ':' 时出现问题。我一直在研究正则表达式，但仍然遇到一些问题，有人可以帮我吗？谢谢。最佳答案您可以使用overload of s
python - 拆分 RDD
我想拆分列表的列表 ((A,1,2,3),(B,4,5,6),(C,7,8,9))进入: (A,1) (A,2) (A,3) (B,4) (B,5) ... 我试过rdd.flatMapValues(
Javascript 数组 - 拆分
我有一个文本文件，其中每一行都有数据。它看起来像这样: number0;text0 number1;text1 number2;text2 ..等等所以我通过 xmlhttprequest 将该文本
C#数组题(拆分)
问题很简单——比如说，我得到了函数，它接收数组作为参数 void calc(double[] data) 如何将这些数据“拆分”成两个子数组并像这样传递给子函数 calc_sub(data(0, le
Java 拆分(字符串操作)
我想显示来自 EMAIL_TEXT 数据库列的数据，在定义的字符处拆分列。出于某种原因，我的结果只打印第一行到我拆分字符串的位置，跳过其余行。这是我希望在每个“|”之后拆分的数据。这里是要拆分的数据
JavaScript - 拆分，选择给定数字后的所有内容
我有一个动态数组，我想排除字符串的第一部分，但我不知道第一部分之后会有多少对象，我想将它们全部包含在一个新字符串中。 string = "text.'''hi''','''who''' '''are'
Javascript 拆分 URL
我想拆分 URL 的某些特定部分，这是我目前所做的。 var query = window.location.pathname.split( '/' ); query = window.locati
java - 拆分、丰富和组合
我有一条消息携带 XML(订单)，其中包含多个同质节点(比如产品列表)以及其他信息(比如地址、客户详细信息等)。我必须使用另一个外部服务提供的详细信息来丰富每个“产品”，并返回带有丰富“产品”的相同完
JavaScript 拆分，更改零件编号
我有一个动态生成的大字符串，我正在拆分它。 var myString="val1, val, val3, val4..... val400" 我对此字符串进行了简单的拆分， myString= myS
java - 拆分 - 如何在结果中获取尾随的空字符串
这个问题在这里已经有了答案: Java String split removed empty values (5 个答案) 关闭 7 年前。我正在尝试使用 split(";") 将字符串转换为数组

首页

博学

6Ren·AI

商城

python - 用于 CSV 拆分的正则表达式，包括多个双引号