gpt4 book ai didi

R strsplit 使用正则表达式

转载 作者:行者123 更新时间:2023-12-04 19:25:59 26 4
gpt4 key购买 nike

我想用 R 来拆分一些聊天消息,这里是一个例子:

example <- "[29.01.18, 23:33] Alice: Ist das hier ein Chatverlauf?\n[29.01.18, 23:45] Bob: Ja ist es!\n[29.01.18, 23:45] Bob: Der ist dazu da die funktionsweise des Parsers zu demonstrieren\n[29.01.18, 23:46] Alice: ‎PTT-20180129-WA0025.opus (Datei angehängt)\n[29.01.18, 23:46] Bob: Ah, er kann also auch erkennen ob Voicemails gesendet wurden!\n[29.01.18, 23:46] Bob: Das ist praktisch!\n[29.01.18, 23:47] Bob: Oder?\n[29.01.18, 23:47] Alice: ja |Emoji_Grinning_Face_With_Smiling_Eyes| \n[29.01.18, 23:47] Alice: und Emojis gehen auch!\n[29.01.18, 23:47] Bob: Was ist mit normalen Smilies?\n[29.01.18, 23:49] Alice: ‎Keine Ahnung, lass uns das doch mal ausprobieren\n[29.01.18, 23:50] Bob: Alles klar :) :D\n[29.01.18, 23:51] Alice: Scheint zu funktionieren!:P\n[29.01.18, 23:51] Bob: Meinst du, dass URLS auch erkannt werden?\n[29.01.18, 23:52] Bob: ‎Schick doch mal eine zum ausprobieren!\n[29.01.18, 23:53] Alice: https://github.com/JuKo007\n[29.01.18, 23:58] Alice: ‎Scheint zu funktionieren!\n[29.01.18, 23:59] Alice: Sehr schön!\n[30.01.18, 00:00] Alice: Damit sollten sich WhatsApp Verläufe besser quantifizieren lassen!\n[30.01.18, 00:02] Bob: ‎Alles klar, los gehts  |Emoji_Relieved_Face| \n"

基本上,我想在括号中的日期时间指示器前面拆分字符串,这是我迄今为止尝试过的:
  # Cutting the textblock into individual messages
chat <- strsplit(example,"(?=\\[\\d\\d.\\d\\d.\\d\\d, \\d\\d:\\d\\d\\])",perl=TRUE)
chat <- unlist(chat)

奇怪的是,在输出中,似乎拆分发生在第一个方括号之后,而不是前面:
 [1] "["                                                                                           
[2] "29.01.18, 23:33] Alice: Ist das hier ein Chatverlauf?\n"
[3] "["
[4] "29.01.18, 23:45] Bob: Ja ist es!\n"
[5] "["
[6] "29.01.18, 23:45] Bob: Der ist dazu da die funktionsweise des Parsers zu demonstrieren\n"
[7] "["
[8] "29.01.18, 23:46] Alice: ‎PTT-20180129-WA0025.opus (Datei angehängt)\n"
[9] "["
[10] "29.01.18, 23:46] Bob: Ah, er kann also auch erkennen ob Voicemails gesendet wurden!\n"
[11] "["
[12] "29.01.18, 23:46] Bob: Das ist praktisch!\n"
[13] "["
[14] "29.01.18, 23:47] Bob: Oder?\n"
[15] "["
[16] "29.01.18, 23:47] Alice: ja |Emoji_Grinning_Face_With_Smiling_Eyes| \n"
[17] "["
[18] "29.01.18, 23:47] Alice: und Emojis gehen auch!\n"
[19] "["
[20] "29.01.18, 23:47] Bob: Was ist mit normalen Smilies?\n"
[21] "["
[22] "29.01.18, 23:49] Alice: ‎Keine Ahnung, lass uns das doch mal ausprobieren\n"
[23] "["
[24] "29.01.18, 23:50] Bob: Alles klar :) :D\n"
[25] "["
[26] "29.01.18, 23:51] Alice: Scheint zu funktionieren!:P\n"
[27] "["
[28] "29.01.18, 23:51] Bob: Meinst du, dass URLS auch erkannt werden?\n"
[29] "["
[30] "29.01.18, 23:52] Bob: ‎Schick doch mal eine zum ausprobieren!\n"
[31] "["
[32] "29.01.18, 23:53] Alice: https://github.com/JuKo007\n"
[33] "["
[34] "29.01.18, 23:58] Alice: ‎Scheint zu funktionieren!\n"
[35] "["
[36] "29.01.18, 23:59] Alice: Sehr schön!\n"
[37] "["
[38] "30.01.18, 00:00] Alice: Damit sollten sich WhatsApp Verläufe besser quantifizieren lassen!\n"
[39] "["
[40] "30.01.18, 00:02] Bob: ‎Alles klar, los gehts |Emoji_Relieved_Face| \n"

当我尝试测试正则表达式模式时 online或者在 python 中使用它,它按预期工作,所以对我来说,这似乎是 strsplit 函数的一个特性?非常欢迎任何关于如何更改我的 R 代码以使其工作的建议!我知道将这个输出粘贴回一起以获得我想要的输出很容易,但我真的很想了解 strsplit 发生了什么并正确执行而不是将其重新修补在一起。我想要的是:
 [1] "[29.01.18, 23:33] Alice: Ist das hier ein Chatverlauf?\n"                                                                                                                           
[2] "[29.01.18, 23:45] Bob: Ja ist es!\n"
[3] "[29.01.18, 23:45] Bob: Der ist dazu da die funktionsweise des Parsers zu demonstrieren\n"
[4] "[29.01.18, 23:46] Alice: ‎PTT-20180129-WA0025.opus (Datei angehängt)\n"
[5] "[29.01.18, 23:46] Bob: Ah, er kann also auch erkennen ob Voicemails gesendet wurden!\n"
[6] "[29.01.18, 23:46] Bob: Das ist praktisch!\n"
[7] "[29.01.18, 23:47] Bob: Oder?\n"
[8] "[29.01.18, 23:47] Alice: ja |Emoji_Grinning_Face_With_Smiling_Eyes| \n"
[9] "[29.01.18, 23:47] Alice: und Emojis gehen auch!\n"
[10] "[29.01.18, 23:47] Bob: Was ist mit normalen Smilies?\n"
[11] "[29.01.18, 23:49] Alice: ‎Keine Ahnung, lass uns das doch mal ausprobieren\n"
[12] "[29.01.18, 23:50] Bob: Alles klar :) :D\n"
[13] "[29.01.18, 23:51] Alice: Scheint zu funktionieren!:P\n"
[14] "[29.01.18, 23:51] Bob: Meinst du, dass URLS auch erkannt werden?"
[15] "[29.01.18, 23:52] Bob: ‎Schick doch mal eine zum ausprobieren!\n"
[16] "[29.01.18, 23:53] Alice: https://github.com/JuKo007\n"
[17] "[29.01.18, 23:58] Alice: ‎Scheint zu funktionieren!\n"
[18] "[29.01.18, 23:59] Alice: Sehr schön!\n"
[19] "[30.01.18, 00:00] Alice: Damit sollten sich WhatsApp Verläufe besser quantifizieren lassen!\n"
[20] "[30.01.18, 00:02] Bob: ‎Alles klar, los gehts |Emoji_Relieved_Face| \n"

最佳答案

您可以添加负向预测 (?!^)断言不是字符串的开头。

您更新的行可能如下所示:

chat <- strsplit(example,"(?!^)(?=\\[\\d\\d.\\d\\d.\\d\\d, \\d\\d:\\d\\d\\])",perl=TRUE)

R demo

结果
 [1] "[29.01.18, 23:33] Alice: Ist das hier ein Chatverlauf?\n"                                     
[2] "[29.01.18, 23:45] Bob: Ja ist es!\n"
[3] "[29.01.18, 23:45] Bob: Der ist dazu da die funktionsweise des Parsers zu demonstrieren\n"
[4] "[29.01.18, 23:46] Alice: ‎PTT-20180129-WA0025.opus (Datei angehängt)\n"
[5] "[29.01.18, 23:46] Bob: Ah, er kann also auch erkennen ob Voicemails gesendet wurden!\n"
[6] "[29.01.18, 23:46] Bob: Das ist praktisch!\n"
[7] "[29.01.18, 23:47] Bob: Oder?\n"
[8] "[29.01.18, 23:47] Alice: ja |Emoji_Grinning_Face_With_Smiling_Eyes| \n"
[9] "[29.01.18, 23:47] Alice: und Emojis gehen auch!\n"
[10] "[29.01.18, 23:47] Bob: Was ist mit normalen Smilies?\n"
[11] "[29.01.18, 23:49] Alice: ‎Keine Ahnung, lass uns das doch mal ausprobieren\n"
[12] "[29.01.18, 23:50] Bob: Alles klar :) :D\n"
[13] "[29.01.18, 23:51] Alice: Scheint zu funktionieren!:P\n"
[14] "[29.01.18, 23:51] Bob: Meinst du, dass URLS auch erkannt werden?\n"
[15] "[29.01.18, 23:52] Bob: ‎Schick doch mal eine zum ausprobieren!\n"
[16] "[29.01.18, 23:53] Alice: https://github.com/JuKo007\n"
[17] "[29.01.18, 23:58] Alice: ‎Scheint zu funktionieren!\n"
[18] "[29.01.18, 23:59] Alice: Sehr schön!\n"
[19] "[30.01.18, 00:00] Alice: Damit sollten sich WhatsApp Verläufe besser quantifizieren lassen!\n"
[20] "[30.01.18, 00:02] Bob: ‎Alles klar, los gehts |Emoji_Relieved_Face| \n"

关于R strsplit 使用正则表达式,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/57010207/

26 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com