linear-regression - 为什么线性回归在使用 PYMC3 训练时这么差-6ren

linear-regression - 为什么线性回归在使用 PYMC3 训练时这么差

转载作者：行者123 更新时间：2023-12-04 07:48:05

24

4

我是 PYMC3 的新手。也许这是一个天真的问题，但我搜索了很多并没有找到关于这个问题的任何解释。基本上，我想在 PYMC3 中进行线性回归，但是训练速度非常慢，而且训练集上的模型性能也很差。下面是我的代码:

X_Tr = np.array([ 13.99802212,  13.8512075 ,  13.9531636 ,  13.97432944,
    13.89211468,  13.91357953,  13.95987483,  13.86476587,
    13.9501789 ,  13.92698143,  13.9653932 ,  14.06663115,
    13.91697969,  13.99629862,  14.01392784,  13.96495713,
    13.98697998,  13.97516973,  14.01048397,  14.05918188,
    14.08342002,  13.89350606,  13.81768849,  13.94942447,
    13.90465027,  13.93969029,  14.18771189,  14.08631113,
    14.03718829,  14.01836206,  14.06758363,  14.05243539,
    13.96287123,  13.93011351,  14.01616973,  14.01923812,
    13.97424024,  13.9587175 ,  13.85669845,  13.97778302,
    14.04192138,  13.93775494,  13.86693585,  13.79985956,
    13.82679677,  14.06474544,  13.90821822,  13.71648423,
    13.78899668,  13.76857337,  13.87201756,  13.86152949,
    13.80447525,  13.99609891,  14.0210165 ,  13.986906  ,
    13.97479211,  14.04562055,  14.03293095,  14.15178043,
    14.32413197,  14.2330354 ,  13.99247751,  13.92962912,
    13.95394525,  13.87888254,  13.82743111,  14.10724699,
    14.23638905,  14.15731881,  14.13239278,  14.13386722,
    13.91442452,  14.01056255,  14.19378649,  14.22233852,
    14.30405399,  14.25880108,  14.23985258,  14.21184303,
    14.4443183 ,  14.55710331,  14.42102092,  14.29047616,
    14.43712609,  14.58666212])
y_tr = np.array([ 13.704,  13.763,  13.654,  13.677,  13.66 ,  13.735,  13.845,
    13.747,  13.747,  13.606,  13.819,  13.867,  13.817,  13.68 ,
    13.823,  13.779,  13.814,  13.936,  13.956,  13.912,  13.982,
    13.979,  13.919,  13.944,  14.094,  13.983,  13.887,  13.902,
    13.899,  13.881,  13.784,  13.909,  13.99 ,  14.06 ,  13.834,
    13.778,  13.703,  13.965,  14.02 ,  13.992,  13.927,  14.009,
    13.988,  14.022,  13.754,  13.837,  13.91 ,  13.907,  13.867,
    14.014,  13.952,  13.796,  13.92 ,  14.051,  13.773,  13.837,
    13.745,  14.034,  13.923,  14.041,  14.077,  14.125,  13.989,
    14.174,  13.967,  13.952,  14.024,  14.171,  14.175,  14.091,
    14.267,  14.22 ,  14.071,  14.112,  14.174,  14.289,  14.146,
    14.356,  14.5  ,  14.265,  14.259,  14.406,  14.463,  14.473,
    14.413,  14.507])
sns.regplot(x=X_tr, y=y_tr.flatten());

这里我使用PYMC3来训练模型:

shA_X = shared(X_tr)
with pm.Model() as linear_model:    
    alpha = pm.Normal("alpha", mu=14,sd=100)
    betas = pm.Normal("betas", mu=0, sd=100, shape=1)
    sigma = pm.HalfCauchy('sigma', beta=10, testval=1.)
    mu = alpha + betas * shA_X
    forecast = pm.Normal("forecast", mu=mu, sd=sigma, observed=y_tr)
    step = pm.NUTS()
    trace=pm.sample(3000, tune=1000)

然后检查性能:

ppc_w = pm.sample_ppc(trace, 1000, linear_model,
                    progressbar=False)
plt.plot(ppc_w['forecast'].mean(axis=0),'r')
plt.plot(y_tr, color='k')`

为什么训练集上的预测这么差？感谢任何建议和想法。

最佳答案

这个模型做得很好——我认为困惑在于如何处理 PyMC3 对象(不过感谢您提供了易于使用的示例!)。通常，PyMC3 将用于量化模型中的不确定性。

例如，trace['betas'].mean() 约为 0.83(这取决于您的随机种子)，而最小二乘法估计，例如，sklearn 给出的值为 0.826。同样，trace['alpha'].mean() 给出 2.34，而“真实”值为 2.38。

您还可以使用轨迹为您的最佳拟合线绘制许多不同的合理绘图:

for draw in trace[::100]:
    pred = draw['betas'] * X_tr + draw['alpha']
    plt.plot(X_tr, pred, '--', alpha=0.2, color='grey')


plt.plot(X_tr, y_tr, 'o');

请注意，这些是从“最适合”数据的分布中提取的。您还使用了 sigma 来模拟噪声，您也可以绘制这个值:

for draw in trace[::100]:
    pred = draw['betas'] * X_tr + draw['alpha']

    plt.plot(X_tr, pred, '-', alpha=0.2, color='grey')
    plt.plot(X_tr, pred + draw['sigma'], '-', alpha=0.05, color='red')
    plt.plot(X_tr, pred - draw['sigma'], '-', alpha=0.05, color='red');


plt.plot(X_tr, y_tr, 'o');

使用 sample_ppc 从后验分布中提取观测值，因此 ppc_w['forecast'] 的每一行都是“下一次”生成数据的合理方式”。您可以这样使用该对象:

ppc_w = pm.sample_ppc(trace, 1000, linear_model,
                      progressbar=False)
for draw in ppc_w['forecast'][::5]:
    sns.regplot(X_tr, draw, scatter_kws={'alpha': 0.005, 'color': 'r'}, fit_reg=False)
sns.regplot(X_tr, y_tr, color='k', fit_reg=False);

关于linear-regression - 为什么线性回归在使用 PYMC3 训练时这么差，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/49592373/

24

4

0

文章推荐： ruby-on-rails - 覆盖 Rails to_param？

文章推荐： win-universal-app - 如何创建不需要开发者许可的 appxbundle

opengl - 线性/非线性纹理映射扭曲的四边形
在我的 previous question ，已经确定，当纹理四边形时，面部被分解为三角形，纹理坐标以仿射方式插值。不幸的是，我不知道如何解决这个问题。 provided link很有用，但没有达到
Qt运动(线性)模糊
是否有简单的解决方案可以在 Qt 中为图像添加运动模糊？还没有找到任何关于模糊的好教程。我需要一些非常简单的东西，我可以理解，如果我可以改变模糊角度，那就太好了。最佳答案 Qt 没有运动模糊过滤器。
javascript - 线性+阈值统一尺度
我想构建一个有点复杂的轴，它可以处理线性数据到像素位置，直到某个值，在该值中所有内容都被归入一个类别，因此具有相同的数据到像素值。例如，考虑具有以下刻度线的 y 轴: 0%, 10%, 20%, 30
android - 线性、可滚动布局中的基线约束
我需要确保两个 View 元素彼此相邻且垂直高度相同。我会使用基线约束来做到这一点，但目前我正在使用线性、可滚动的布局( ScrollView 中的线性布局)，当我点击一个元素时，它不允许我从中获取基
regex - 如何在非贪婪的正则表达式中避免(线性)回溯？
考虑正则表达式 ".*?\s*$" 和一个不以空格结尾的字符串。示例 " a" .最后\s永远无法匹配 a这就是为什么匹配器迭代: \s\s\s\s\s - fails .\s\s\
approximation - 插值建议(线性，三次？)
Closed. This question needs to be more focused。它当前不接受答案。想要改善这个问题吗？更新问题，使它仅关注editing this post的一个问题。
assembly - 线性、物理、逻辑和虚拟内存地址有什么区别？
我正在尝试阅读英特尔软件开发人员手册以了解操作系统的工作原理，这四个寻址术语让我感到困惑。以上是我的理解，如有不对请指正。线性地址 : 对一个孤立的程序来说，似乎是一长串以地址0开头的内存。该程序的
javascript - 检查数字表达式(线性)是否有效？
有很多方法可以使用正则表达式并相应地使用匹配/测试匹配来检查字符串是否有效。我正在检查包含字母(a-b)、运算符(+、-、/、*)、仅特殊字符(如(')'、'(')和数字(0-9)的表达式是否有效我
r - 线性 SVM 和提取权重
我正在使用 iris 数据集在 R 中练习 SVM，我想从我的模型中获取特征权重/系数，但我想我可能误解了一些东西，因为我的输出给了我 32 个支持向量。假设我要分析四个变量，我会得到四个。我知道在使
r - 线性 SVM 和提取权重
我正在使用 iris 数据集在 R 中练习 SVM，我想从我的模型中获取特征权重/系数，但我想我可能误解了一些东西，因为我的输出给了我 32 个支持向量。假设我要分析四个变量，我会得到四个。我知道在使
java - 如何在android中滑动布局(线性/相对..)
如何向左或向右滑动线性布局。在该线性布局中，默认情况下我有一个不可见的删除按钮，还有一些其他小部件，它们都是可见状态，当向左滑动线性布局时，我需要使其可见的删除按钮，当向右滑动时，我需要隐藏该删除按钮
r - 线性 SVM 中的错误预测
我正在编写一个 R 脚本，运行时会给出因变量的预测值。我的所有变量都被分类(如图所示)并分配了一个编号，总类数为101。(每个类是歌曲名称)。所以我有一个训练数据集，其中包含 {(2,5,6,1)8
java - 线性 RGB 空间中的仿射变换
如果源栅格位于 linear RGB color space使用以下 Java 代码进行转换，应用过滤器时(最后一行)会引发 java.awt.image.ImagingOpException: Un
ios - UIVIew animateWithDuration 线性？
我想为我的多个 UIImageView 设置动画，使其从 A 点线性移动到 B 点。我正在使用 options:UIViewAnimationOptionCurveLinear - Apple 文档
css - 线性，右渐变到透明渐变，底部有额外渐变
我第一次无法使用 CSS3 创建好看的渐变效果。右侧应该有从黑色到透明的渐变透明渐变。底部是页脚，所以它需要在底部另外淡化为透明。如果可能的话，一个例子: 页面的背景是一张图片，所以不可能有非透明淡
c++ - 线性(超定)代数方程的解
我有一组线性代数方程，Ax=By。其中A是36x20的矩阵，x是20x1的 vector ，B是36x13，y是13x1。排名(A)=20。因为系统是超定的，所以最小二乘解是可能的，即； x = (
Python 将每月值插入每日值(线性): Pandas
我有一个带有年月数据列(yyyymm)的 Pandas 数据框。我计划将数据插入每日和每周值。下面是我的 df。 df: 201301 201302 201303
python - 线性 N 次等式问题的最小二乘法
假设我想找到2条任意高维直线的“交点”。这两条线实际上不会相交，但我仍然想找到最相交的点(即尽可能靠近所有线的点)。假设这些线有方向向量A、B和初始点C、D，我可以通过简单地设置一个线性最小二乘问题
java - 线性 "smoothed"函数使用查找表
如果我想编写一个函数(可能也是一个类)，它从不可变的查找表(调用构造函数时固定)返回线性“平滑”数据，如下所示: 例如func(5.0) == 0.5。存储查找表的最佳方式是什么？我正在考虑使用两
python - 线性 X 对数刻度
给定一条线 X像素长如: 0-------|---V---|-------|-------|-------max 如果0 <= V <= max , 线性刻度 V位置将是 X/max*V像素。如何计

首页

博学

6Ren·AI

商城

linear-regression - 为什么线性回归在使用 PYMC3 训练时这么差