python - 在神经网络中准备训练和验证数据时出错-6ren

python - 在神经网络中准备训练和验证数据时出错

转载作者：行者123 更新时间：2023-12-04 03:55:24

25

4

我遇到的问题是，一旦我想根据数据拆分 (model.fit(...)) 训练模型，我就会收到错误

InvalidArgumentError: indices [0] = 261429 is not in [0, 235061)
[[node recommender_net_3 / embedding_15 / embedding_lookup (defined at <ipython-input-46-e2a6cff5eb06>: 29)]] [Op: __ inference_train_function_9058]

我正在使用 RetailRocket 数据集。你可以在这里找到它https://www.kaggle.com/retailrocket/ecommerce-dataset .

你可以在下面看到我的实现

import pandas as pd
import numpy as np
import tensorflow as tf
import matplotlib.pyplot as plt

from tensorflow import keras
from tensorflow.keras import layers
from pathlib import Path
from google.colab import drive

drive.mount('/content/drive')
import os
for dirname, _, filenames in os.walk('/content/drive/My Drive/Dataset'):
    for filename in filenames:
        print(os.path.join(dirname, filename))
path = '/content/drive/My Drive/Dataset/'

# items = pd.concat([pd.read_csv(path+'item_properties_part2.csv'),
#                    pd.read_csv(path+'item_properties_part1.csv')])
# items.shape

events = pd.read_csv(path+'events.csv')
events.shape

df_event = pd.read_csv(path+ "events.csv")
print("file events.csv")
df_event.head()
df_event['code'] = df_event['event'].map({"view":1, "addtocart":2, "addtocart":3})
df_event.head()


# Visitor
visitor_ids = df_event["visitorid"].unique().tolist()
visitor2visitor_encoded = {x: i for i, x in enumerate(visitor_ids)}
visitorencoded2visitor = {i: x for i, x in enumerate(visitor_ids)}

# Items 
items_ids = df_event["itemid"].unique().tolist()
item2item_encoded = {x: i for i, x in enumerate(items_ids)}
item_encoded2item = {i: x for i, x in enumerate(items_ids)}


df_event["visitor"] = df_event["visitorid"].map(visitor2visitor_encoded)
df_event["item"] = df_event["itemid"].map(item2item_encoded)

num_visitors = len(visitor2visitor_encoded)
num_items = len(item_encoded2item)

event = df_event["event"].value_counts()
#min_rating = min(df["rating"])
#max_rating = max(df["rating"])

print("Number of visitors: {}, Number of items: {}".format(num_visitors, num_items))
print("Number of views: {}, Number of addtocart: {}, Number of transactions: {}".format(event[0], event[1], event[2]))

    ## The Error
   x = df[["visitorid", "itemid"]].values
# Normalize the targets between 0 and 1. Makes it easy to train.
#y = (df[col] - df[col].mean())/df[col].std()
df['z_score'] = (df['code'] - df['code'].mean())/df['code'].std()
y = df['z_score'].values
    # Assuming training on 90% of the data and validating on 10%.
    train_indices = int(0.9 * df.shape[0])
    x_train, x_val, y_train, y_val = (
        x[:train_indices],
        x[train_indices:],
        y[:train_indices],
        y[train_indices:],
    )
    
    ## 

EMBEDDING_SIZE = 50


class RecommenderNet(keras.Model):
    def __init__(self, num_visitors, num_items, embedding_size, **kwargs):
        super(RecommenderNet, self).__init__(**kwargs)
        self.num_visitors = num_visitors
        self.num_items = num_items
        self.embedding_size = embedding_size
        self.visitor_embedding = layers.Embedding(
            num_visitors,
            embedding_size,
            embeddings_initializer="he_normal",
            embeddings_regularizer=keras.regularizers.l2(1e-6),
        )
        self.visitor_bias = layers.Embedding(num_visitors, 1)
        self.item_embedding = layers.Embedding(
            num_items,
            embedding_size,
            embeddings_initializer="he_normal",
            embeddings_regularizer=keras.regularizers.l2(1e-6),
        )
        self.item_bias = layers.Embedding(num_items, 1)

    def call(self, inputs):
        visitor_vector = self.visitor_embedding(inputs[:, 0])
        visitor_bias = self.visitor_bias(inputs[:, 0])
        item_vector = self.item_embedding(inputs[:, 1])
        item_bias = self.item_bias(inputs[:, 1])
        dot_visitor_item = tf.tensordot(visitor_vector, item_vector, 2)
        # Add all the components (including bias)
        x = dot_visitor_item + visitor_bias + item_bias
        # The sigmoid activation forces the rating to between 0 and 1
        return tf.nn.sigmoid(x)


model = RecommenderNet(num_visitors, num_items, EMBEDDING_SIZE)
model.compile(
    loss=tf.keras.losses.BinaryCrossentropy(), optimizer=keras.optimizers.Adam(lr=0.001)
)

## The InvalidArgumentError

history = model.fit(
    x=x_train,
    y=y_train,
    batch_size=64,
    epochs=5,
    verbose=1,
    validation_data=(x_val, y_val),)

可是我改的时候才发现

# old code
x_train, x_val, y_train, y_val = (
    x[:train_indices],
    x[train_indices:],
    y[:train_indices],
    y[train_indices:],
)

到

# new code
X_temp, X_test, y_temp, y_test = train_test_split(df_event[['visitorid', 'itemid']],
                                                  df_event['code'],
                                                  test_size=0.2,
                                                  random_state=1)

X_train, X_val, y_train, y_val = train_test_split(X_temp, y_temp, test_size=0.2, random_state=1)

X_train.shape, X_val.shape, X_test.shape

使用新代码，我没有遇到任何错误，而且实现也没有错误。有人可以告诉我如何正确编写“旧”代码以使其运行吗？两者之间有什么区别？提前致谢!

最佳答案

在https://github.com/tensorflow/tensorflow/issues/23698 ，据说错误可能是因为您具有第一个 Embedding 维度，即词汇量对于 NLP(或其他)任务问题而言太小；然而，之前的分词器/单词计数器检测到有更多独特的单词，因此出现以下错误。

InvalidArgumentError: indices [0] = 261429 is not in [0, 235061)

这意味着您有 261429 个不同的词/项目/元素，但嵌入维度集是 235061，因此省略 261429 - 235061 = 26368 单词/元素。

虽然我假设在你的第二个解决方案中有更少的单词并且你的代码有效，但一个可能的正确解决方案(尽管在下面硬编码)可能是增加 num_items 或 num_visitors到 261429(从错误行来看我会说它来自 num_items 但我不是 100% 确定)；请在两个 Embedding() 层上进行测试以检测引发错误的层:

    self.item_embedding = layers.Embedding(
        261429,
        embedding_size,
        embeddings_initializer="he_normal",
        embeddings_regularizer=keras.regularizers.l2(1e-6),
    )
    self.item_bias = layers.Embedding(261429, 1)

关于python - 在神经网络中准备训练和验证数据时出错，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/63987295/

25

4

0

文章推荐： Python-docx:更改一个表的行间距会在所有表中更改它

文章推荐：具有关联类型的快速协议(protocol)

javascript - npm test 出错，但 mocha test node.js 出错
我正在使用 node.js 和 mocha 单元测试，并且希望能够通过 npm 运行测试命令。当我在测试文件夹中运行 Mocha 测试时，测试运行成功。但是，当我运行 npm test 时，测试给出了
java - java方法replaceAll()出错
我的文本区域中有这些标签 ..... 我正在尝试使用 replaceAll() String 方法替换它们 text.replaceAll("", ""); text.replaceAll("", "
java - ZXing 出错
早上好，我是 ZXing 的新手，当我运行我的应用程序时出现以下错误: 异常Ljava/lang/NoClassDefFoundError；初始化 ICOM/google/zxing/client/a
C - free() 出错？
我正在制作一些哈希函数。它的源代码是... #include #include #include int m_hash(char *input, size_t in_length, char
swift - SKPhysicsContactDelegate 出错？
我正在尝试使用 Spritekit 在 Swift 中编写游戏。目的是带着他的角色迎面而来的矩形逃跑。现在我在 SKPhysicsContactDelegate (didBegin ()) 方法中犯了
java - actionPerformed 出错？
我正在尝试创建一个用于导入 CSV 文件的按钮，但出现此错误: actionPerformed(java.awt.event.ActionEvent) in cannot implement
java - NULLIF() 出错？
请看下面的代码 public List getNames() { List names = new ArrayList(); try { createConnection(); Sta
创建计划事件时 MySQL 出错
我正在尝试添加一个事件以在“dealsArchive”表中创建一个条目，然后从“deals”表中删除该条目。它需要在特定时间执行。这是我正在尝试使用的: DELIMITER $$ CREATE EV
尝试将存储过程结果插入表时 PHPmyadmin 出错
我试图将两个存储过程的表结果存储到 phpmyadmin 例程窗口中的单个表中，这给了我 mariadb 语法错误。单独调用存储过程给出了结果。存储过程代码 BEGIN CREATE TABLE t
android - videoview的onpreparedlistener()出错
我想在 videoview 中加载视频之前有一个进度条。但是我收到以下错误。我还添加了所有必要的导入。我在 ANDROID 中使用 AIDE 这是我的代码 public class MainActi
android - AsyncTask 出错
我已经使用了 AsyncTask，但我不明白为什么在我的设备 (OS 4.0) 上测试时仍然出现错误。我的 apk 构建于 2.3.3 中。我想我把代码弄错了，但我不知道我的错误在哪里。任何人都请帮助
MySQL注入(inject)出错
我在测试 friend 网站的安全性时，通过在 URL 末尾添加 ' 发现了 SQL 注入(inject)漏洞该网站是用zend框架构建的我遇到的问题是 MySQL -- 中的注释语法不起作用，因此页
java - getMap() 出错？
我正在尝试使用堆栈溢出答案之一的交互式信息窗口。链接如下: interactive infowindow 但是我在代码中使用 getMap() 时遇到错误。虽然我尝试使用 getMapAsync 但
java - addMouseListener 出错
当我编译以下代码时出现错误: The method addMouseListener(Player) is undefined for the type Player 代码: import java.
mysql - Async_Http_Response_Handler 出错
我是 Android 开发的初学者。我正在开发一个接收 MySql 数据然后将其保存在 SQLite 中的应用程序。我将 Json 用于同步状态，以便我可以将未同步数据的数量显示为要同步的待处理数据
Java - 转换文件名 - 出错？
(这里是Hello world级别的自动化测试人员) 我正在尝试下载一个文件并将其重命名以便于查找。我收到一个错误....这是代码 @Test public void allDownload(
c++ - while(cin) 出错
我只是在写另一个程序。并使用: while (cin) words.push_back(s); words是string的vector，s是string。我的 RAM 使用量在 4 或 5
javascript - AngularJS 出错
我是 AngularJS 的新手，我遇到了一个问题。我有一个带有提交按钮的页面，当我单击提交模式时必须打开并且来自 URL 的数据必须存在于模式中。现在，模式打开但它是空的并且没有从 URL 获取数据
c++ - 尝试将文件写入数组时运算符 << 出错
我正在尝试读取一个文件(它可以包含任意数量的随机数字，但不会超过 500 个)并将其放入一个数组中。稍后我将需要使用数组来做很多事情。但到目前为止，这一小段代码给了我 no match for o
c++ - benderrmq 出错
有些人在使用 make 命令进行编译时遇到了问题，所以我想我应该在这里尝试一下，我已经在以下操作系统的 ubuntu 32 位和挤压 64 位上尝试过我克隆了 git 项目 https://gith

首页

博学

6Ren·AI

商城

python - 在神经网络中准备训练和验证数据时出错