python - 我测量的多元线性回归模型的性能是否正确？-6ren

python - 我测量的多元线性回归模型的性能是否正确？

转载作者：行者123 更新时间：2023-11-28 18:14:51

25

4

这可能是一个有点愚蠢的问题(而且可能是微不足道的问题)，但我是机器学习的新手。这可能很容易从我提出的代码中推导出来，并且这不是问题表述不当的借口。如果您发现此问题表述不当，请通知我，以便我进行更新。

我训练了一个多元线性回归模型，我想看看它对给定数据集的表现如何。所以，我用谷歌搜索了一下，发现 a nice article向我解释如何从真实值中找出预测值的“错误”。它给我的几个选项是:

我应用了所有这些，它们给了我难以置信的高值(value)，所以我不知道这些是否正确或我应该如何解释它们。

输出接收到的文章:

10.0
150.0
12.2474487139

我的模型收到的输出:

7514.293659640891
83502864.03257468
9137.990152794797

作为快速引用，这些是我的真实/预测值

“TLDR”问题:我是否使用上述方法正确测量了我的错误，这些结果是否暗示我的模型表现得非常糟糕？ (这看起来不像，当我将预测值与真实值进行比较时)

Here你可以看看我正在使用的数据集。

我用来创建模型和预测值的代码(我试图删除不需要的代码)

# Importing the libraries
import numpy as np
import matplotlib.pyplot as plt
import pandas as pd
from sklearn.preprocessing import LabelEncoder, OneHotEncoder
from sklearn.linear_model import LinearRegression
from sklearn import metrics

dataset = pd.read_csv('50_Startups.csv')
X = dataset.iloc[:, :-1].values # Independent variables
y = dataset.iloc[:, 4].values # Dependent variable

# Encode categorical data into numerical values (1, 2, 3)
# For example; New york becomes 1 and Florida becomes 2
labelencoder_states = LabelEncoder()
# We just want to apply this to the state column, since this has categorical data
states_encoded = labelencoder_states.fit_transform(X[:, 3])
# Update the states with the new encoded data
X[:, 3] = states_encoded

# Now that we have the categories as numerical data, 
# we can split them into multiple dummy variables:
# Split the categories into columns (more optimal)
# Tell it too look at the state column
onehotencoder_states = OneHotEncoder(categorical_features = [3])
# Actually transforms them into columns
X = onehotencoder_states.fit_transform(X).toarray()

# Avoiding the Dummy Variable Trap
# Remove the first column from X
# Since; dummy variables -1
X = X[:, 1:]

# Splitting the dataset into the Training set and Test set
# In this case we are going to use 40 of the 50 records for training
# and ten of the 50 for testing, hence the 0.2 split ratio
from sklearn.cross_validation import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size = 0.2, random_state = 0)

# Create a regressor
regressor = LinearRegression()
# Fit the model to the training data
regressor.fit(X_train, y_train)

# Make predictions on the test set, using our model
y_pred = regressor.predict(X_test)

# Evaluating the model (Am I doing this correct?)

# How well did it do?
print(metrics.mean_absolute_error(y_test, y_pred))
print(metrics.mean_squared_error(y_test, y_pred))
print(np.sqrt(metrics.mean_squared_error(y_test, y_pred)))

最佳答案

让我们来回答:我认为您正在正确测量(至少使用代码)。但是:

谁告诉您这种关系是线性的？您正在尝试预测利润(对吗？)。我会说线性回归可能不会很好地工作。因此，您没有取得好成绩我并不感到惊讶。
要了解您的预测如何运作，请尝试绘制预测值与实际值的对比图，并检查您的点在一条线上的保持情况。

总而言之:您获得大值并不意味着您的代码是错误的。这种关系很可能不是线性的。

附带说明:使用分类变量可能是问题的根源。您是否尝试过在没有状态的情况下进行线性回归？你的结果是什么？哪个变量在你的回归中最重要？你应该检查一下。你的 R 平方是多少？

我希望这对翁贝托有所帮助

关于python - 我测量的多元线性回归模型的性能是否正确？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/48979658/

25

4

0

文章推荐： html - 无法使图像与 Foundation block 网格类的 div 底部对齐

文章推荐： javascript - 谷歌地图距离服务器端

文章推荐： python - 在 Django 中将 CSS 类添加到整个表单

opengl - 线性/非线性纹理映射扭曲的四边形
在我的 previous question ，已经确定，当纹理四边形时，面部被分解为三角形，纹理坐标以仿射方式插值。不幸的是，我不知道如何解决这个问题。 provided link很有用，但没有达到
Qt运动(线性)模糊
是否有简单的解决方案可以在 Qt 中为图像添加运动模糊？还没有找到任何关于模糊的好教程。我需要一些非常简单的东西，我可以理解，如果我可以改变模糊角度，那就太好了。最佳答案 Qt 没有运动模糊过滤器。
javascript - 线性+阈值统一尺度
我想构建一个有点复杂的轴，它可以处理线性数据到像素位置，直到某个值，在该值中所有内容都被归入一个类别，因此具有相同的数据到像素值。例如，考虑具有以下刻度线的 y 轴: 0%, 10%, 20%, 30
android - 线性、可滚动布局中的基线约束
我需要确保两个 View 元素彼此相邻且垂直高度相同。我会使用基线约束来做到这一点，但目前我正在使用线性、可滚动的布局( ScrollView 中的线性布局)，当我点击一个元素时，它不允许我从中获取基
regex - 如何在非贪婪的正则表达式中避免(线性)回溯？
考虑正则表达式 ".*?\s*$" 和一个不以空格结尾的字符串。示例 " a" .最后\s永远无法匹配 a这就是为什么匹配器迭代: \s\s\s\s\s - fails .\s\s\
approximation - 插值建议(线性，三次？)
Closed. This question needs to be more focused。它当前不接受答案。想要改善这个问题吗？更新问题，使它仅关注editing this post的一个问题。
assembly - 线性、物理、逻辑和虚拟内存地址有什么区别？
我正在尝试阅读英特尔软件开发人员手册以了解操作系统的工作原理，这四个寻址术语让我感到困惑。以上是我的理解，如有不对请指正。线性地址 : 对一个孤立的程序来说，似乎是一长串以地址0开头的内存。该程序的
javascript - 检查数字表达式(线性)是否有效？
有很多方法可以使用正则表达式并相应地使用匹配/测试匹配来检查字符串是否有效。我正在检查包含字母(a-b)、运算符(+、-、/、*)、仅特殊字符(如(')'、'(')和数字(0-9)的表达式是否有效我
r - 线性 SVM 和提取权重
我正在使用 iris 数据集在 R 中练习 SVM，我想从我的模型中获取特征权重/系数，但我想我可能误解了一些东西，因为我的输出给了我 32 个支持向量。假设我要分析四个变量，我会得到四个。我知道在使
r - 线性 SVM 和提取权重
我正在使用 iris 数据集在 R 中练习 SVM，我想从我的模型中获取特征权重/系数，但我想我可能误解了一些东西，因为我的输出给了我 32 个支持向量。假设我要分析四个变量，我会得到四个。我知道在使
java - 如何在android中滑动布局(线性/相对..)
如何向左或向右滑动线性布局。在该线性布局中，默认情况下我有一个不可见的删除按钮，还有一些其他小部件，它们都是可见状态，当向左滑动线性布局时，我需要使其可见的删除按钮，当向右滑动时，我需要隐藏该删除按钮
r - 线性 SVM 中的错误预测
我正在编写一个 R 脚本，运行时会给出因变量的预测值。我的所有变量都被分类(如图所示)并分配了一个编号，总类数为101。(每个类是歌曲名称)。所以我有一个训练数据集，其中包含 {(2,5,6,1)8
java - 线性 RGB 空间中的仿射变换
如果源栅格位于 linear RGB color space使用以下 Java 代码进行转换，应用过滤器时(最后一行)会引发 java.awt.image.ImagingOpException: Un
ios - UIVIew animateWithDuration 线性？
我想为我的多个 UIImageView 设置动画，使其从 A 点线性移动到 B 点。我正在使用 options:UIViewAnimationOptionCurveLinear - Apple 文档
css - 线性，右渐变到透明渐变，底部有额外渐变
我第一次无法使用 CSS3 创建好看的渐变效果。右侧应该有从黑色到透明的渐变透明渐变。底部是页脚，所以它需要在底部另外淡化为透明。如果可能的话，一个例子: 页面的背景是一张图片，所以不可能有非透明淡
c++ - 线性(超定)代数方程的解
我有一组线性代数方程，Ax=By。其中A是36x20的矩阵，x是20x1的 vector ，B是36x13，y是13x1。排名(A)=20。因为系统是超定的，所以最小二乘解是可能的，即； x = (
Python 将每月值插入每日值(线性): Pandas
我有一个带有年月数据列(yyyymm)的 Pandas 数据框。我计划将数据插入每日和每周值。下面是我的 df。 df: 201301 201302 201303
python - 线性 N 次等式问题的最小二乘法
假设我想找到2条任意高维直线的“交点”。这两条线实际上不会相交，但我仍然想找到最相交的点(即尽可能靠近所有线的点)。假设这些线有方向向量A、B和初始点C、D，我可以通过简单地设置一个线性最小二乘问题
java - 线性 "smoothed"函数使用查找表
如果我想编写一个函数(可能也是一个类)，它从不可变的查找表(调用构造函数时固定)返回线性“平滑”数据，如下所示: 例如func(5.0) == 0.5。存储查找表的最佳方式是什么？我正在考虑使用两
python - 线性 X 对数刻度
给定一条线 X像素长如: 0-------|---V---|-------|-------|-------max 如果0 <= V <= max , 线性刻度 V位置将是 X/max*V像素。如何计

首页

博学

6Ren·AI

商城

python - 我测量的多元线性回归模型的性能是否正确？