用于在 .CSV 逗号分隔文件中添加双引号的 Bash 脚本-6ren

用于在 .CSV 逗号分隔文件中添加双引号的 Bash 脚本

转载作者：行者123 更新时间：2023-12-02 00:03:53

我需要在 csv 文件中添加双引号。我的示例数据是这样的..

378478,COMPLETED,Tracfone,,,"2020/03/29 09:39:22",,2787,,356074101197544,89148000005748235454,75176540
378328,COMPLETED,"Total Wireless","Unlimited Talk, Text, & Data (First 25GB High Speed, then unlimited 2GB)",50,"2020/03/29 06:10:01",200890899011202395,0899,0279395,356058102052972,89148000005117597971,67756296

我已经尝试使用 awk 和 sed 在线获取一些代码，结果如下所示，错误 - **数字中的第一个数字正在被修剪，就像 ex .在“378478”中它只显示“78478”。

此外，它也在为现有的双引号添加双引号!** 似乎没有什么能完美地工作。请指导我!

"78478","COMPLETED","Tracfone","","",""2020/03/29 09:39:22"","","2787","","356074101197544","89148000005748235454","75176540"
"78328","COMPLETED",""Total Wireless"",""Unlimited Talk"," Text"," & Data (First 25GB High Speed"," then unlimited 2GB)"","50",""2020/03/29 06:10:01"","200890899011202395","0899","0279395","356058102052972","89148000005117597971","67756296"
"78329","COMPLETED",""Cricket Wireless"",""Unlimited Talk"," Text"," & 4G LTE Data w/ 15GB Hotspot"","60",""2020/03/29""

这是我使用的代码:

awk -F"'?,'?" -v OFS='","' '{$1=$1; gsub(/^.|$/,"\"")} 1' file # or
sed -E 's/([^,]*) , (.*)/"\1" , "\2"/' file

我的总代码如下。我的意图是首先将所有 .xlsx 转换为 .csv，然后将双引号添加到同一个 csv 并将其保存在同一个文件中。我知道 $file.csv 部分是错误的，因此我需要一些帮助

find "$Src_Dir" -type f -iname "*.xlsx" -print>path/temp

cat path/temp | while IFS="" read -r -d $'\0' file; 
do
    echo $file
    ssconvert "${file}" --export-type=Gnumeric_stf:stf_csv
    awk -F"'?,'?" -v OFS='","' '{$1=$1; gsub(/^.|$/,"\"")} 1' $file > $file.csv
done

最佳答案

如果您想处理最简单 CSV 文件以外的任何东西，您应该远离sed 和awk。有更好的工具可用。

例如，如果您在您最喜欢的发行版上sudo apt install csvtool(或等效程序)，您可以使用其逐行调用功能来处理输入文件中的每一行。有关示例，请参见以下脚本:

#!/bin/bash

function quotify {
  # Start empty line, process every field.

  line=""
  while [[ $# -ne 0 ]] ; do
      #    Append comma for all but first field, then quoted field.

      [[ -n "${line}" ]] && line="${line},"
      line="${line}\"$1\""

      shift
  done

  # Output the fully quoted line.

  echo "${line}"
}

# Needed to call functions. Also, ensure link: /bin/sh -> /bin/bash.
export -f quotify

# Pretty-print input and output.

echo "Input file:"
sed 's/^/   /' inputFile.csv

echo "Output file:"
csvtool call quotify inputFile.csv | sed 's/^/   /'

请注意为 CSV 文件中的每一行调用的 quotify 函数，参数设置为该行中的每个字段 (无引号，原始字段是否有引号)。

它基本上构造了行中所有字段的字符串，并用引号括起来，然后将其写入标准输出，如下面的脚本输出所示:

Input file:
   378478,COMPLETED,Tracfone,,,"2020/03/29 09:39:22",,2787,,356074101197544,89148000005748235454,75176540
   378328,COMPLETED,"Total Wireless","Unlimited Talk, Text, & Data (First 25GB High Speed, then unlimited 2GB)",50,"2020/03/29"
Output file:
   "378478","COMPLETED","Tracfone","","","2020/03/29 09:39:22","","2787","","356074101197544","89148000005748235454","75176540"
   "378328","COMPLETED","Total Wireless","Unlimited Talk, Text, & Data (First 25GB High Speed, then unlimited 2GB)","50","2020/03/29"

即使使用单独的工具可能是最简单的方法，但如果您绝对不能安装其他包，那么您将不得不在已有的包中编写一些代码。以下 bash 脚本是一个很好的起点，因为它不使用其他工具来实现其目标。

目前，它与一组非常具体的规则相关联，如下所示:

空白很重要。逗号之间的任何内容都被视为字段的一部分。这在检测带引号的字段时尤其重要，它必须将引号作为第一个字符，没有 abc, "d,e,f",ghi 东西，因为 “d,e,f” 不会被正确处理。
带引号的字段允许包含逗号，其中的 "" 序列将变成 "。
提供格式错误的 CSV 文件可能不是一个好主意:-)

但是，考虑到这一点，我们开始吧。我将提供每个部分的简短文本描述，但希望代码中的注释足以弄清楚发生了什么。

首先，一个用于查找某个字符串在另一个字符串中的位置的函数，对于计算字段边界很有用:

function findPos {
    haystack="$1"
    needle="$2"

    # Remove everything past the needle.

    prefix="${haystack%%${needle}*}"

    # If nothing was removed, it wasn't found, so supply massive number.
    # Otherwise, it was found at the length of the string with removed stuff.

    position=999999
    [[ ${#prefix} -ne ${#haystack} ]] && position=${#prefix}
    echo ${position}
}

然后我们可以在计算下一个字段长度的函数中使用它。这基本上只是为未引用的字段寻找下一个逗号，并通过从段构建字段来对引用的字段进行特殊处理(它必须处理引号和逗号内的引号):

function getNextFieldLen {
    line="$1"

    # Empty line means all work done.

    [[ -z "${line}" ]] && echo -1 && return

    # Handle unquoted first, this is easy.

    [[ "${line:0:1}" != '"' ]] && { echo $(findPos "${line}" ","); return; }

    # Now handle quoted. Loop over all segments where a segment is defined as
    # the text up to the next <"">, assuming it's before the next <",>.

    field=""
    nextQuoteComma=$(findPos "${line}" '",')
    nextDoubleQuote=$(findPos "${line}" '""')
    while [[ ${nextDoubleQuote} -lt ${nextQuoteComma} ]]; do
        # Append segment to the field and go back for next segment.

        field="${field}${line:0:${nextDoubleQuote}}\"\""
        line="${line:${nextDoubleQuote}}"
        line="${line:2}"

        nextQuoteComma=$(findPos "${line}" '",')
        nextDoubleQuote=$(findPos "${line}" '""')
    done

    # Add final segment (up to the comma) and output entire field.

    field="${field}${line:0:${nextQuoteComma}}\""
    echo "${#field}"
}

最后，还有一个顶级函数，它将引用通过标准输入输入的任何内容:

function quotifyStdIn {
    # Process file line by line.

    while read -r line; do
        # Start with empty output line and non-comma separator.

        outLine="" ; sep=""

        # Place terminator to make processing easier, start field loop.

        line="${line},"
        fieldLen=$(getNextFieldLen "${line}")
        while [[ ${fieldLen} -ge 0 ]]; do
            # Get field and quotify if needed, adjust line (remove field and comma).

            field="${line:0:${fieldLen}}"
            [[ "${field:0:1}" = '"' ]] || field="\"${field}\""

            line="${line:$((fieldLen+1))}"
            #line="${line:${fieldLen}}"
            #line="${line:1}"

            # Append to output line and prepare for next field.

            outLine="${outLine}${sep}${field}"; sep=","

            fieldLen=$(getNextFieldLen "${line}")
        done

        # Output built line.

        echo "${outLine}"
    done
}

并且，如果您想直接从文件中读取(虽然提供一个空文件名或 "-" 将使用标准输入，因此您可能只使用文件-一切都基于函数):

function quotifyFile {
    file="$1"

    # Empty file or "-" means standard input, otherwise take input from real file.

    [[ ${#file} -eq 0 ]] && { quotifyStdIn; return; }
    [[ "${file}" = "-" ]] && { quotifyStdIn; return; }

    quotifyStdIn < "${file}"
}

最后，因为每个不是“Hello, world”的程序都值得某种形式的测试工具，这就是您可以用来测试各种功能的工具:

(
    echo 'paxdiablo,was here'
    echo 'and,"then, strangely,",he,was,not'
    echo '50,"My name is ""Pax"", and yours is ""Bob""",42'
    echo '17,"""Love"" is grand",19'
) > harness.csv

echo "Before:"
sed "s/^/   /" harness.csv
echo "After:"
quotifyFile harness.csv | sed "s/^/   /"

rm -rf harness.csv

而且，由于除非您运行测试，否则测试工具几乎没有用，这里是第一次运行的结果:

Before:
   paxdiablo,was here
   and,"then, strangely,",he,was,not
   50,"My name is ""Pax"", and yours is ""Bob""",42
   17,"""Love"" is grand",19
After:
   "paxdiablo","was here"
   "and","then, strangely,","he","was","not"
   "50","My name is ""Pax"", and yours is ""Bob""","42"
   "17","""Love"" is grand","19"

希望这足以让您在无法安装软件包的情况下继续前进。当然，如果您无法在 bash 本身中安装其中一个软件包，那么您遇到了我无法帮助您解决的问题:-)

关于用于在 .CSV 逗号分隔文件中添加双引号的 Bash 脚本，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/61220101/

文章推荐： apache - SimpleSamlPHP 未解析自定义身份验证模块

文章推荐： django - 如何在 Django 中设置模板目录？

javascript - 多个选择的复选框下拉列表由 ; 分隔
我正在尝试从下拉列表中创建一个多选复选框，并通过 ; 连接所选结果。我的代码是这样的: var myobject = { ValueA : 'Text A', ValueB : 'T
javascript - 获取输入值并以 "|"分隔
我有输入，我需要获取值并用 “|” 符号分隔。我的输入: 输出我需要的: 00:00|00:00|00:00 我的代码是: (而且它不工作) var timesArray = $('table').
mysql - 数据库中的拆分数字由破折号 (-) 分隔
我正在尝试将超过 400 万行的列拆分为 4 个新列，问题是我不知道在哪里查看或我应该使用 Google 搜索哪个术语。 (是的，我已经在 Google 和 Stack 中搜索了一个类似的问题，但只在
javascript - 分隔 .CSV 文件中的数字
我有一个很大的 csv 文件，其中充满了用“|”分隔的数字字符，例如: 432452 | 543634 4122442 | 41256512 64523 | 12416 然后我读入数据如下: fs
C# 分隔 args 参数
我有一个程序可以计算多个数字的阶乘。这些数字在 cmd 中作为参数传递: factorial.exe 3 4 5 这将分别计算 3、4 和 5 的阶乘。该程序的早期版本有一个百分比显示堆栈的完整性。我
java - java中根据 "."分隔 double
这个问题已经有答案了: 奥 git _a (6 个回答) 已关闭 9 年前。我有一个双数“547.123456” 我只想使用这个 double 作为“547.1”，就像“.”后面只有 1 个数字我
C# 分隔 args 参数
我有一个程序可以计算多个数字的阶乘。这些数字在 cmd 中作为参数传递: factorial.exe 3 4 5 这将分别计算 3、4 和 5 的阶乘。该程序的早期版本有一个百分比显示堆栈的完整性。我
java - 分隔 arraylist 的元素
我有一个 ArrayList，其中包含一个 messageId、一个 -、一个用户名。示例:E123-sam 我想划分 List 的每个元素，使得 - 之前的部分进入一个 ArrayList ，而之
python - 分隔 Pandas 数据框中共享同一列的月份和年份
我目前有一个“日期”列作为 pandas 数据框的索引，其格式为: January February .... Year2 January February ... Year3 (它来自 pdf 表格
c - mdb工具sql查询表 namespace 分隔
我正在尝试对我的 .mdb 数据库进行 ODBC 查询。我正在使用 mdbtools 驱动程序。该代码是使用 Eclipse 用 C 语言编写的。唯一的问题是，当我写例如: "SELECT 'last
java - 分隔 "if else"语句
我需要知道如何将这两个if else 部分分开。 public static int NextBday(int Bdays, int days){ int daysleft = 0;
mysql - 如何使用计数一列并由每个 id 分隔
我想计算我的员工分开但合并在一起的出勤率 My target output 我的代码 SELECT count(employees_id) as numbers FROM attendance WH
php - 我想在一个单独的列中插入多封电子邮件，并用 # 分隔
关闭。这个问题需要details or clarity .它目前不接受答案。想改进这个问题吗？通过 editing this post 添加细节并澄清问题. 关闭 7 年前。 Improve t
java - 分隔 arraylist 中的每个项目
下面是我的代码的一小段摘录，它从 API 添加了一行。总共有很多行。每一行包含一行数据如 TY8tr,50,34,P,SB, 数据行在数据类型上是一致的。我如何通过 ,'s 拆分数组列表中
javascript - 获取选中的元素并用逗号分隔它们，最后一个元素用 "and"分隔
我想获取选中的元素并用逗号分隔它们，最后一个元素用“and”分隔它的显示输出为: 我想删除最后一个元素后面的逗号 (,) 并在它前面添加 'and'，例如 Sugar, Milk and Extra
javascript - 分隔 JSON 对象的值
我是 JSON 的新手，但在从已解析的 JSON 对象中提取数据时遇到问题: 我有一个 getstats.php 文件，它回显 mysql 查询的 json 编码结果。以下是 php 文件返回的示例:
C++ 字符串解析以 0 分隔
我有一个像这样的数字/字符串(我不确定如何将 int 与字符串相互转换) 000000122310200000223340000700012220000011411000000011011271043

python - 分隔

标签内的文本

我想尝试一些基本的网络抓取，但遇到了一个问题，因为我习惯了简单的 td-tags，在这种情况下，我有一个网页，其中包含以下预标记和其中的所有文本，这意味着刮掉它有点棘手。 11111111 1111

C# 分隔 TCP 消息
出于练习目的，我正在开发 TCP 客户端/服务器系统，我想在两者之间发送特定数据。我已经能够发送字节并让它们显示为字符串。此外，我还可以发送一个特定的字符串(“mb”)并在服务器端弹出一个 Mess
java - 分隔 Unicode 连字字符
在大量的 unicode 字符中，有一些实际上表示多个字符，例如两个 'f' 字符的 U+FB00 连字 ff。有什么方法可以轻松地将这样的字符转换为多个单个字符？最好是标准 Java API 中可用

行者123

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

用于在 .CSV 逗号分隔文件中添加双引号的 Bash 脚本