java - Pig UDF java 索引不足-6ren

java - Pig UDF java 索引不足

转载作者：行者123 更新时间：2023-12-01 06:10:24

26

4

我的 UDF 在 pig 上遇到访问问题。我在收到的输出(Andi，19495)上进行了分组“Group BY”，pig 将其描述为C: {group: chararray, long}。现在我想将输出格式化为 (Andi 19495) 作为字符串。但我的 UDF 报告以下内容

"Caught error from UDF: pigUDF.Output, Out of bounds access [Index: 1, Size: 1]"

我不明白为什么会发生这种情况。

这是我的 java UDF:

package pigUDF;
import java.io.IOException;
import org.apache.pig.EvalFunc;
import org.apache.pig.data.BagFactory;
import org.apache.pig.data.DataType;
import org.apache.pig.data.Tuple;
import org.apache.pig.data.TupleFactory;
import org.apache.pig.impl.logicalLayer.schema.Schema;
import org.apache.pig.impl.logicalLayer.schema.Schema.FieldSchema;

public class Output extends EvalFunc<Tuple>{
   TupleFactory tupleFactory = TupleFactory.getInstance();
   BagFactory mBagFactory = BagFactory.getInstance();

   private static Tuple nullValue=TupleFactory.getInstance().newTuple(2);

   @Override
   public Tuple exec(Tuple input) throws IOException {

     if (input==null) return nullValue;

     Tuple t= tupleFactory.newTuple(1);

     String o = (String) input.get(0);
     int o1 = (Integer) input.get(1);


     String myString=o+" "+String.valueOf(o1);
     System.out.println(myString);

     t.set(0,myString);

     return t;        
   }

   @Override
   public Schema outputSchema(Schema input){

     Schema tupleSchema = new Schema();
     tupleSchema.add(new FieldSchema("group", DataType.CHARARRAY));        
     Schema s = new Schema (new FieldSchema(null, tupleSchema));
     return s;        
   }    
}

最佳答案

您可以使用 CONCAT 而不是编写 UDF并达到相同的结果。

将组与结果表达式“”和 SUM(A) 进行 CONCAT。此外，由于 CONCAT 需要相同类型的表达式，因此您必须将 int SUM(A) 值转换为 chararray。尝试改变

C = FOREACH A GENERATE group, SUM(A);

至

C = FOREACH A GENERATE CONCAT(group,CONCAT(' ',(chararray)SUM(A)));

关于java - Pig UDF java 索引不足，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/36072938/

26

4

0

文章推荐： python - 点亮大容量存储器的 LED

文章推荐： java - 如何在JAVA SE中使用依赖注入(inject)？

文章推荐： python - 使用 deferred.defer 任务发布到数据存储时出现问题

SQL 查询导致我 sleep 不足
所以我正在为考试复习，并在 SQL 河(或荒地)中撞到了一块大石头我制作了以下表格并插入了以下数据: create table Permissions ( fileName VARCHAR(
JQueryUI 对话框 maxWidth 不足
我有一个使用 maxWidth 定义的 jqueryui 对话框。 $("#myDialog").dialog({ autoOpen: false, width: 'a
c - 如何使用平方根优化c中的循环(完美、丰富、不足)
注意:我遗漏了不相关的代码所以我目前正在研究 CCC 1996 P1，这个问题的全部目的是能够计算一个整数输入是完美数、不足数还是充数。我上面列出的代码可以工作，但是我认为它太慢了。该代码会迭代每个
r - R 中的关联规则 RAM 不足
已关闭。此问题需要 debugging details 。目前不接受答案。编辑问题以包含 desired behavior, a specific problem or error, and the
python - Redis 使用的 RAM 不足
我正在使用 Go 和 Redis 开发 API。问题是RAM使用不足，我找不到问题的根源。 TL;DR 版本有数百/数千个哈希对象。每个 1 KB 的对象(键+值)占用大约 0.5 MB 的 RAM
kubernetes - 由于 CPU 不足，Pod 处于挂起状态
在我的 GCE Kubernetes 集群上，我无法再创建 pod。 Warning FailedScheduling pod (www.caveconditions.com-f1be467e3
kubernetes - Amazon EKS Fargate中的 pod 不足
当我尝试在EKS Fargate群集上安装指标服务器时，它抛出错误: 0/4 nodes are available: 4 Insufficient pods. 按照以下说明从此处安装指标服务器:ht
ios - 为什么 iOS 终止后台应用程序而不是以不同方式处理 RAM 不足？
遍布this document Apple 提到 iOS 在某些情况下会终止应用程序，最常见的原因似乎是释放一些 RAM。这会导致未实现状态恢复的应用程序出现问题——用户正在处理和暂时离开的一些内容可
audio - Google Cloud Speech:配额组 token 不足
尝试处理一个10分钟的音频文件时出现以下错误。我刚刚开始使用Google Cloud产品，所以我是唯一访问此资源的人。我怎么可能超出配额？配额设置为其默认值，我认为我没有任何限制。还有其他原因吗？我
r - 对R中事物类型的全面考察； 'mode' 和 'class' 和 'typeof' 不足
R 语言让我感到困惑。实体有模式和类，但即使这样也不足以完全描述实体。这个answer说 In R every 'object' has a mode and a class. 所以我做了这些实验:
kubernetes - Openshift:没有与以下所有谓词匹配的可用节点::cpu 不足 (173)、MatchNodeSelector (5)
我在 west-1 有一个 Openshift v3 项目。在其中，我有一个运行良好的应用程序，但在 GitHub 提交代码中非常下游的内容后，该应用程序停止工作。问题在于制作 pod: No nod
kubernetes - Openshift:没有与以下所有谓词匹配的可用节点::cpu 不足 (173)、MatchNodeSelector (5)
我在 west-1 有一个 Openshift v3 项目。在其中，我有一个运行良好的应用程序，但在 GitHub 提交代码中非常下游的内容后，该应用程序停止工作。问题在于制作 pod: No nod
wolfram-mathematica - 我可以使用 Stackoverflow API 检查哪些 SO 回答者 sleep 不足？
在 how-do-i-access-the-stackoverflow-api-from-mathematica我概述了如何使用 SO API 让 Mathematica 制作一些有趣的顶级回答者声誉
node.js - 小型 Node.js 应用程序 Pod 的 GKE CPU 不足
所以在 GKE 上，我有一个 Node.js app，每个 pod 使用大约:CPU(cores): 5m, MEMORY: 100Mi 但是我只能为每个 Node 部署 1 个 pod。我使用的是
javascript - 消费者的服务 'AnalyticsDefaultGroup' 的配额 'USER-100s' 和限制 'analyticsreporting.googleapis.com' 的 token 不足
我正在使用 async.eachOfSeries 超过 300 个数组并请求一些 GA api，它工作正常但有时我会收到错误.. UnhandledPromiseRejectionWarning:错误
amazon-s3 - 0/3 个节点可用 : 1 node(s) had taints that the pod didn't tolerate, 2 cpu 不足。 MR3 hive
我正在尝试在 AWS ec2 上托管的 kubernetes 集群上使用 mr3 设置配置单元。当我运行命令 run-hive.sh 时，Hive 服务器启动，并且 master-DAg 被初始化，但
google-cloud-pubsub - 消费者 'administrator' 的服务 'CLIENT_PROJECT-100s' 的配额 'pubsub.googleapis.com' 和限制 'project_number:#' 的 token 不足
创建订阅时有时会出现以下错误: Insufficient tokens for quota 'administrator' and limit 'CLIENT_PROJECT-100s' of ser

首页

博学

6Ren·AI

商城

java - Pig UDF java 索引不足