java - Parquet 文件可选字段不存在-6ren

java - Parquet 文件可选字段不存在

转载作者：可可西里更新时间：2023-11-01 15:51:21

25

4

我是使用 Parquet 文件的新手，我想开发一个 mapreduce 作业，它使用以下 shcema 读取许多输入的 Parquet 文件:

{
  optional int96 dropoff_datetime;
  optional float dropoff_latitude;
  optional float dropoff_longitude;
  optional int32 dropoff_taxizone_id;
  optional float ehail_fee;
  optional float extra;
  optional float fare_amount;
  optional float improvement_surcharge;
  optional float mta_tax;
  optional int32 passenger_count;
  optional binary payment_type (UTF8);
  optional int96 pickup_datetime;
  optional float pickup_latitude;
  optional float pickup_longitude;
  optional int32 pickup_taxizone_id;
  optional int32 rate_code_id;
  optional binary store_and_fwd_flag (UTF8);
  optional float tip_amount;
  optional float tolls_amount;
  optional float total_amount;
  optional float trip_distance;
  optional binary trip_type (UTF8);
  optional binary vendor_id (UTF8);
  required int64 trip_id;
}

我的工作目的是计算每天每小时的平均行程速度，因此我需要提取所有行程距离以及上下车时间来计算持续时间和速度，但是当字段 trip_distance 不存在:这是堆栈跟踪的一部分:

18/02/28 03:19:01 INFO mapreduce.Job:  map 2% reduce 0%
18/02/28 03:19:10 INFO mapreduce.Job: Task Id : attempt_1519722054260_0016_m_000011_2, Status : FAILED
Error: java.lang.RuntimeException: not found 20(trip_distance) element number 0 in group:
dropoff_datetime: Int96Value{Binary{12 constant bytes, [0, 0, 0, 0, 0, 0, 0, 0, -116, 61, 37, 0]}}
payment_type: ""
pickup_datetime: Int96Value{Binary{12 constant bytes, [0, 120, 66, 9, 78, 72, 0, 0, 3, 125, 37, 0]}}
pickup_latitude: 40.7565
pickup_longitude: -73.9781
pickup_taxizone_id: 161
store_and_fwd_flag: ""
trip_type: "uber"
vendor_id: ""
trip_id: 4776003633207

    at org.apache.parquet.example.data.simple.SimpleGroup.getValue(SimpleGroup.java:97)
    at org.apache.parquet.example.data.simple.SimpleGroup.getValueToString(SimpleGroup.java:119)
    at ParquetAssignmentSpeedAverageHours$ParquetMap.map(ParquetAssignmentSpeedAverageHours.java:48)
    at ParquetAssignmentSpeedAverageHours$ParquetMap.map(ParquetAssignmentSpeedAverageHours.java:37)
    at org.apache.hadoop.mapreduce.Mapper.run(Mapper.java:146)
    at org.apache.hadoop.mapred.MapTask.runNewMapper(MapTask.java:787)
    at org.apache.hadoop.mapred.MapTask.run(MapTask.java:341)
    at org.apache.hadoop.mapred.YarnChild$2.run(YarnChild.java:170)
    at java.security.AccessController.doPrivileged(Native Method)
    at javax.security.auth.Subject.doAs(Subject.java:422)
    at org.apache.hadoop.security.UserGroupInformation.doAs(UserGroupInformation.java:1866)
    at org.apache.hadoop.mapred.YarnChild.main(YarnChild.java:164)

这是我的映射器类:

public static class ParquetMap extends Mapper<Text, Group, IntWritable, DoubleWritable> {
    private DoubleWritable one = new DoubleWritable(1);
    private IntWritable time = new IntWritable();
    private DoubleWritable result = new DoubleWritable();
    @Override
    public void map(Text key, Group value, Context context) throws IOException, InterruptedException {
        double duration;
        double distance;
        double speed;
        Binary pickupTimestamp = value.getInt96("pickup_datetime", 0);
        Binary dropoffTimestamp = value.getInt96("dropoff_datetime", 0);
        if (value.getValueToString(20, 0) != null) { //the trip_distance field
            distance = value.getFloat("trip_distance", 0);
        } else {
            distance = 0;
        }
        try {
            if (!pickupTimestamp.equals(dropoffTimestamp)) {
                duration = ((double)(getTimestampMillis(dropoffTimestamp) - getTimestampMillis(pickupTimestamp))/3600000);
                speed = (float) (distance / duration);
                result.set((speed));
                Calendar cal = Calendar.getInstance();
                cal.setTimeInMillis(getTimestampMillis(pickupTimestamp));
                time.set(cal.get(Calendar.HOUR_OF_DAY));
                context.write(time, result);
            }
        } catch (Exception e) {
            e.printStackTrace();
        }
    }
}

有人可以帮忙吗？谢谢，

最佳答案

这是一个运行时异常java.lang.RuntimeException；这基本上表明代码有问题。

public String getValueToString(int fieldIndex, int index) 方法内部调用了 getValue(int fieldIndex, int index) 方法。getValue(...)的实现如下

 private Object getValue(int fieldIndex, int index) {
    List<Object> list;
    try {
      list = data[fieldIndex];
    } catch (IndexOutOfBoundsException e) {
      throw new RuntimeException("not found " + fieldIndex + "(" + schema.getFieldName(fieldIndex) + ") in group:\n" + this);
    }
    try {
      return list.get(index);
    } catch (IndexOutOfBoundsException e) {
      throw new RuntimeException("not found " + fieldIndex + "(" + schema.getFieldName(fieldIndex) + ") element number " + index + " in group:\n" + this);
    }
  }

在这里，如果 fieldIndex 或 index 不存在，它会抛出 IndexOutOfBoundsException，它被重新抛出为 RuntimeException.

我建议不要直接调用 getValueToString(...)，必须检查字段是否存在。

由于数据集中的所有字段都是可选的，因此使用固定的 fieldIndex 查找它并不可靠。在这种情况下，假设它存在并让它通过 try-catch block 失败以检测不存在，然后设置一个默认值:

try{
    distance = value.getFloat("trip_distance", 0);
}catch(RuntimeException e){
      distance = 0;
}

关于java - Parquet 文件可选字段不存在，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/49025524/

25

4

0

文章推荐： Hadoop hive : Generate Table Name and Attribute Name using Bash script

文章推荐： c++ - 在 C++ 中返回对象或指针

文章推荐： c++ - SIGFPE 访问 unordered_map 时

文章推荐： c++ - 图节点父列表中的 weak_ptr VS shared_ptr

mysql修改记录时update操作字段=字段+字符串
在有些场景下，我们需要对我们的varchar类型的字段做修改，而修改的结果为两个字段的拼接或者一个字段+字符串的拼接。如下所示，我们希望将xx_role表中的name修改为name+id。
MySQL SUM IF 字段 b = 字段 a
SELECT incMonth as Month, SUM( IF(item_type IN('typ1', 'typ2') AND incMonth = Month, 1, 0 ) )AS
java - 如果直接从内存读取 volatile 字段，那么从哪里读取非 volatile 字段？
我最近读到 volatile 字段是线程安全的，因为 When we use volatile keyword with a variable, all the threads read its va
python - 在数据库中已有数据之后添加的 UUID 字段。有没有办法为现有数据填充 UUID 字段？
我在一些模型中添加了一个 UUID 字段，然后使用 South 进行了迁移。我创建的任何新对象都正确填充了 UUID 字段。但是，我所有旧数据的 UUID 字段为空。有没有办法为现有数据填充 UUI
php - 左连接中的两个表都有 id 字段。尝试从第一个数据库中提取 id 字段，但获取第二个数据库
刚刚将我的网站从 mysql_ 更新为 mysqli，并破坏了之前正常运行的查询。我试图从旋转中提取 id，因为它每次都会增加 1，但我不断获取玩家 id，有人可以告诉我我做错了什么吗？我尝试了将
mysql - 如何使用 MySQL 将一个表中的一列(字段)复制到另一个表的空列(字段)，这两个表都是同一数据库的一部分？
我在 Mac OS X 上使用带有 Sequel Pro 的 MySQL。我想将一个表中的一个字段(即名为“GAME_DY”的列)复制到另一个名为“DAY_ID”的表的空字段中。两个表都是同一数据库的
java - 为序列化设置一个 transient 字段，但为 JPA 设置非 transient 字段
问题: 是否有可能有一个字段被 JPA 保留但被序列化跳过？可以实现相反的效果(JPA 跳过字段而序列化则不会)，如果使用此功能，那么相反的操作肯定会很有用。类似这样的事情: @Entity cl
php - 无重复(分组依据)字段 1 循环，字段 2 位于水平线
假设我有一个名为“dp”的表 Year | Month | Payment| Payer_ID | Payment_Recipient | 2008/2009 | July
c - 我在 IP header 中找不到 DSCP 字段，只有已弃用的 TOS 字段
我将尝试通过我的 Raspberry Pi 接入点保证一些 QoS。开始之前，我先动手:我阅读了有关 tcp、udp 和 ip header 的内容。在IP header description我看
dart - 什么时候应该在 dart 中使用 final 字段、工厂构造函数或带有 getter 的私有(private)字段？
如果你能弄清楚如何重命名这个问题，我愿意接受建议。在 Dart 语言中，可以编写一个带有 final 字段的类。这些是只能设置的字段构造函数前 body 跑。这可以在声明中(通常用于类中的静态常量)
javascript - jquery:使用两个带有两个字段(字段 1、字段 2 + 1 天)的日期选择器，例如 booking.com
你怎么样？我有两个带有两个字段的日期选择器我希望当用户选择 (From) 时，第二个字段 (TO) 将是 next day 。比如 booking.com 例如:当用户选择From 01-01-2
mysql - 将字段从 T1 字段 A 复制到 T2 字段 A where(if or when) T1 field B = T2 field B (mysql)
我想我已经看到了这个问题的一些答案，这些答案可能与我需要的相差不远，但我对 mysql 的了解还不够确定，所以我会根据我的具体情况提出问题。我有一个包含多个表的数据库，为此，如果“image”表上的
mySQL在单个查询中多次使用相同的表/字段
我在 mySQL 数据库中有 2 个表: customers ============ customer_id (1, 2 ) customer_name (john, mark) orders ==
数据库归档与基于时间段的表/字段
我正在开发一个员工目标 Web 应用程序。领导/经理在与团队成员讨论后为他们设定目标。这是一年/半年/季度，具体取决于组织遵循的评估周期。现在的问题是添加基于时间段的字段或存档上一季度/年度数据的
Sitecore 字段，用于从媒体库中选择多个文件并能够上传文件
我正在寻找允许内容编辑器从媒体库中选择多个文件的东西，这些文件将在渲染中列出。他们还需要能够上传文件和搜索。它必须在页面编辑器(版本 8 中称为体验编辑器)中工作。到目前为止我所考虑的: 一堆文件字
r - 创建 "other"字段
现在，我有以下由 original.df %.% group_by(Category) %.% tally() %.% arrange(desc(n)) 创建的 data.frame。 DF 5),
潘塔霍。将登录的错误消息放入字符串/字段
我想知道是否有一些步骤/解决方案可以处理错误消息并将它们放入 Pentaho 工具中的某个字符串或字段中？例如，如果连接到数据库时发生某些错误，则将该消息从登录到字符串/字段。最佳答案我们在作业的
iPhone如何制作 "To"字段，如短信应用程序
如何制作像短信应用程序一样的“收件人”字段？例如，右侧有一个“+”按钮，当添加某人时，名称将突出显示并可单击，如圆角矩形等。有没有内置的框架？最佳答案不，但请参阅 Three20 的 TTMess
delphi - 列出记录的元素\字段
是否可以获取记录的元素或字段的列表通过类型信息类似于类的已发布属性的列表吗？谢谢！最佳答案取决于您的delphi版本，如果您使用的是delphi 2010或更高版本，则可以使用“新rtti”
带有外键列表的 SQLite 字段
我正在构建一个 SQLite 数据库来保存我的房地产经纪人的列表。我已经能够使用外键来识别每个代理的列表，但我想在每个代理的记录中创建一个列表；从代理商和列表之间的一对一关系转变为一对多关系。看这里

首页

博学

6Ren·AI

商城

java - Parquet 文件可选字段不存在