mysql - 我怎么能忽略分号；在 & 当我从 .csv 文件创建 Hive 表时-6ren

mysql - 我怎么能忽略分号；在 & 当我从 .csv 文件创建 Hive 表时

转载作者：可可西里更新时间：2023-11-01 14:58:35

25

4

接续这个问题How can I make a Hive table from a .csv file which has one column with fields delimiited by semicolon ;

我的 csv 文件中的一些标题/出版商有“&”；在它们中以及包含它们的行被误读，因为它们在 & 符号代码中的分号和每个字段的末尾被过早地分割。

如何修改这段代码:

CREATE TABLE books (ISBN STRING, Title STRING, Author STRING, Year STRING, Publisher STRING)
  ROW FORMAT DELIMITED FIELDS TERMINATED BY "\;";
LOAD DATA INPATH '/path/to/my/datafile' INTO TABLE books;

所以它不这样做？

我的 csv 文件中有问题的行示例是:

 0743403843;"Decipher";"Stel Pavlou";"2002";"Simon &amp; Schuster (Trade Division)"

出版商专栏未被正确阅读。

我知道我可以在手动删除 (&); 之前对 csv 进行 sanitizer 但可以告诉我如何在 Hive 或其他 Hadoop 工具中做到这一点吗？

最佳答案

你能试试这个吗？

hive> CREATE TABLE test_regex(
    >     isbn STRING,
    >     title STRING,
    >     author STRING,
    >     year STRING,
    >     publisher STRING) ROW FORMAT SERDE 'org.apache.hadoop.hive.contrib.serde2.RegexSerDe' 
    >     WITH SERDEPROPERTIES ("input.regex" = 
    >     "(.*)\;\"(.*)\"\;\"(.*)\"\;\"(.*)\"\;\"(.*)\"",
    >     "output.format.string" = "%1$s %2$s %3$s %4$s %5s")
    >     STORED AS TEXTFILE;
OK
Time taken: 4.139 seconds

hive> load data local inpath 'input.csv' overwrite into table test_regex;
OK
Time taken: 0.393 seconds


hive> select isbn,publisher from test_regex;
ISBN    Publisher
0002005018  HarperFlamingo Canada
0399135782  Putnam Pub Group
0743403843  Simon &amp; Schuster (Trade Division)
Time taken: 4.522 seconds

hive> select *from test_regex;
OK
ISBN    Title   Author  Year    Publisher
0002005018  Clara Callan    Richard Bruce Wright    2001    HarperFlamingo Canada
0399135782  The Kitchen God's Wife  Amy Tan 1991    Putnam Pub Group
0743403843  Decipher    Stel Pavlou 2002    Simon &amp; Schuster (Trade Division)
Time taken: 0.253 seconds

关于mysql - 我怎么能忽略分号；在 & 当我从 .csv 文件创建 Hive 表时，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/27627974/

25

4

0

文章推荐： javascript - Google Wonder Wheel API 或 js 小部件

文章推荐： hadoop - 如何从sqlserver导入数据到hdfs/hive/hbase

gitconfig 忽略 includeIf
我正在尝试设置我的 git 配置，以便我可以使用工作环境和个人环境。这是我的 ~.gitconfig 文件的内容(碰巧 work 和 private 在 github 上): [url "git@
excel - 当单元格包含特定文本时不要复制(忽略)
我有以下情况。我在 Sheet1 上有一个项目列表，我想将项目复制到 Sheet2 并排除特定项目。假设我在 Sheet1 上有以下项目列表: 我想将“梨”单元格留在 Sheet2 上。它应该完全
gcc 忽略 LC_ALL
我试图让 gcc 以不同的语言提供错误消息。但它仍然给我英文的错误信息。我的语言环境输出 varun@varun-desktop:$ 语言环境 LANG=en_IN LC_CTYPE="es_EC.
GCC 忽略 cdecl？
我在 Linux x86 上使用 gcc。我的程序将指向 C 函数的指针导出到 LLVM JIT 函数。调用约定是 cdecl。它在 Windows 上的 MingW 上运行良好。但是奇怪的事情发生
php - require_once 忽略
windows 上 php 的奇怪问题...我的应用程序加载了一个“核心”文件，该文件加载了一个设置文件、注册自动加载、进行初始化等。在核心文件的顶部我有 include_once("config.p
delphi - 在构建配置中设置调试器语言异常(忽略)
在工具|选项|调试器选项 |语言异常可以忽略特定的异常类型。是否可以为每个项目定义这个？例如在调试构建配置中(Delphi 2009 和/或 2010)？ /编辑:Reported in QC 最佳答
Safari 忽略 tabindex
我在一个文本框旁边有 2 个按钮，在这 2 个按钮后面还有另一个文本框。第一个文本框的 tabindex 为 1000，第一个按钮为 1001，第二个按钮为 1002。第二个文本框的 tabindex
忽略 Python 类型提示
我是 python 新手，正在尝试类型提示，但它们似乎只在某些情况下起作用。它们似乎在属性返回类型上按预期工作，但是当我尝试将整数分配给字符串值(即 self._my_string = 4)时，我没有
VBA:忽略 For-Each 循环中的条件
问题陈述我有一些国家和这些国家的州的依赖组合框。我使用 VBA 在第一个组合框中填充唯一值，然后在第二个组合框中动态填充唯一值。该代码似乎忽略了初始传递中的条件。例如，该代码适用于第一个国家/地区
Javascript 忽略 if 语句
我对 Javascript 有点陌生。我试图做到这一点，以便单击一个页面上的图像会将您带到一个新页面，并在该新页面上显示特定的 div，因此我使用 sessionStorage 来记住并使用 bool
javascript - 忽略@RenderBody()
我不确定我是否正确地处理了这个问题。我有一个 ASP.NET MVC Web 应用程序。有 4 个主要“页面”通过单击菜单选项，可以选择一个页面，并将该页面选项存储在本地存储中。现在，如果我刷新页
javascript - 忽略/不转换时区？
我的页面工作正常，并按预期显示日期和时间，直到我不得不添加 new Date() 以避免 momentjs deprecation warning 。现在我的约会比应有的时间晚了 5 个小时。我该如
忽略 $Id 行的合并工具
我需要合并一个 fork 项目。不幸的是，CVS $Id 行不同，因此我尝试的合并工具报告所有文件都不同(其中 95% 只有这一行不同) 是否有一个合并工具可以配置为忽略基于模式的行比较结果？ [编辑
忽略 Python 类型提示
我是 python 新手，正在尝试类型提示，但它们似乎只在某些情况下起作用。它们似乎在属性返回类型上按预期工作，但是当我尝试将整数分配给字符串值(即 self._my_string = 4)时，我没有
HttpsURLConnection 忽略 setSSLSocketFactory
我正在尝试根据 How do a send an HTTPS request through a proxy in Java? 使用代理访问 https 网页但是我遇到了一个奇怪的问题:HttpsU
CMake 忽略 library_output_name
我有一个简单的 CMakeLists.txt 文件: cmake_minimum_required(VERSION 2.8.9) project (sample) add_library(Shared
忽略 Const 限定符
这个问题在这里已经有了答案: typedef pointer const weirdness (6 个答案) 关闭 8 年前。我有一个结构体 type_s。然后我将指向 struct type_s
CryptEncrypt 忽略 HASH？
我正在尝试制作一个使用 AES 256 加密的应用程序。不幸的是我无法让它工作。也许我没有完全理解密码逻辑。所以它正在工作，但据我了解，哈希包含密码。但如果我更改密码，输出是相同的。因此，Crypt
java - 提取引号之间的子字符串，忽略\"
我的文件包含一些行，例如 "This is a string." = "This is a string's content." " Another \" example \"" = " New ex
Mysql - 忽略 where 子句中的状态
我尝试使用此查询来获取所选健身房的所有用户。我的问题是查询忽略了这部分:ual.user_id = weekUsers.user_id 查询似乎获取了与我选择的日期匹配的所有用户 ID，而不检查该用

首页

博学

6Ren·AI

商城

mysql - 我怎么能忽略分号；在 & 当我从 .csv 文件创建 Hive 表时