- mongodb - 在 MongoDB mapreduce 中,如何展平值对象?
- javascript - 对象传播与 Object.assign
- html - 输入类型 ="submit"Vs 按钮标签它们可以互换吗?
- sql - 使用 MongoDB 而不是 MS SQL Server 的优缺点
我正在寻找一种优雅而有效的方法来表示和存储由显式采样构建的任意概率分布。
该分布预计具有以下属性:
[-4000; 4000]
a
, b
, |a - b| < 40
通常的表示形式(直方图数组)是不可取的,主要是因为量化/分辨率和空间之间的权衡。我想一定有一种表示方法可以根据本地“复杂性”自适应地改变 bin 大小。
空间是值得关注的,因为更高级别的类似网格的数据结构将包含数千个单元格,每个单元格都包含至少一个这样的概率表示。磁盘或网络传输的简单序列化是可取的,但效率不是优先事项。
任何帮助将不胜感激。
最佳答案
有趣的问题。这是一个建议,根据您的数学倾向,实现起来可能相当困难。
请注意,我以空间换取速度,因为我的建议可能在计算上相当繁重(但这要针对真实数据进行测试)。
首先,使用函数式方法。概率分布是一种概率度量:
struct Distribution
{
virtual ~Distribution() {};
virtual double integrate(std::function<double(double)>) = 0;
};
这样,您就可以从生成的样本中抽象出来,因为您不想存储它们。说服自己使用“集成”方法几乎可以做任何事情。
当然,对于显式样本,您可以执行类似的操作
struct SampledDistribution
{
double integrate(std::function<double(double)> f)
{
double acc = 0;
for (double x: samples) acc += f(samples);
return acc / samples.size();
}
std::deque<double> samples;
};
现在,存储部分:
The usual representation -- a histogram array -- is undesirable mainly because of the trade-off between quantization/resolution and space. I imagine there must be a method of representation that adaptively varies the bin size depending on local "complexity".
传统的方法是wavelets .您可以通过调用 integrate
来生成系数,您可以对其进行序列化。如果它们产生的积分估计量的方差很高,你就把它们扔掉。
然后,为了反序列化,您生成一个 Distribution
对象,其 integrate
方法对小波执行集成。可以使用您最喜欢的正交方法进行积分。我在这里故意含糊其辞,因为实际实现取决于您选择的小波系列(平滑、紧凑支持、正交与否等)。无论如何,您都需要深入研究文献。
这里的要点是,您通常只需要很少的小波来表示具有少量特征(例如几个峰值,否则形状规则)的平滑函数,这与更“规则”的有限元不同(直方图是一种特殊的有限元元素表示)。小波表示使其自身适应被变换的特征,无论它们的位置或大小如何。此外,您还可以决定要保留多少个系数,从而控制压缩比。
此外,0.001 是一个相当高的数字:我怀疑您只需要几个系数
权衡在于您使用哪种小波类:非常平滑的分布可能会用平滑小波很好地表示,但紧凑支持的小波可能更容易集成,等等。实验。请注意,您在这里不需要“小波变换”包:只需要小波函数的显式表示和正交例程(尝试使用 Gauss-XXX 程序进行重建,或其他高阶程序)。
我更喜欢在傅里叶域中定义的小波(如 Lemarie 小波),因为它们在傅里叶空间中的值和导数为零是已知的,这允许您对分布施加约束:概率度量必须集成到一,你可能碰巧事先知道期望值或方差。
此外,您可能希望将变量更改为仅处理函数,例如。在 [0,1] 上。有大量关于区间小波的文献。
关于c++ - 寻求概率分布数据表示的建议,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/9789638/
我是一个相对较新的程序员; CS 学士学位,大学毕业大约 2 年,主要使用 C# 中的 .NET。我对 SQL 交互/脚本编写相当流利,并且对 ASP.NET 做了一些工作(主要是维护现有站点)。 我
我计划开发一个简单的解决方案,使我能够即时执行非常基本的视频流分析。我以前从未做过类似的事情,因此这是一个非常笼统和开放的问题。主要重点是检查流是否正常运行,例如 - 卡住帧、黑屏以及音频是否存在。同
我正在考虑重组一个大型 Maven 项目...... 我们当前结构的基本概述: build [MVN plugins, third party dependency management]:5.1
我需要有关附加查询的建议。该查询执行了一个多小时,并根据解释计划进行了全表扫描。我对查询调优还很陌生,希望得到一些建议。 首先,为什么我要进行全表扫描,即使我使用的所有列都在其上创建了索引。 其次,有
我正在做一个项目,我需要在 4 个模型之间创建三个多对多关系。这是它的过程: 常见问题类别可以有许多常见问题子类别,反之亦然。 常见问题组可以有许多常见问题的子类别,反之亦然。 常见问题可以有许多常见
对于代码大小比语音质量更重要的 PIC 和/或 ARM 嵌入式系统,是否有任何易于使用的免费或廉价的语音合成库?现在似乎 1 meg 的封装被认为是“紧凑的”,但很多微 Controller 都比它小
我们正在使用 Solr 建议器功能进行 businessName 查找。当用户输入查询以及匹配的名称时,我们希望 solr 发送来自个人资料的其他属性,如 id、地址、城市、州、国家等字段。 我尝试使
我正在构建一个用户界面。我的计划将包括 4 个主要部分: 1) 顶部菜单 - TMainMenu。一个窗口的顶部 2) 主菜单 - TTreeView。一个窗口的左边。 TreeView的每一项=对应
我的公司需要一个任务管理系统来处理从“为X购买一台计算机”到“将一个人转移到另一个国家”这样简单的场景。简单的场景是由一个人处理的单个任务,而更大的任务可以分解为在工作流程中委派给多个人的多个子任务。
MarkLogic 服务器的林大小与实际内存的建议比率是多少?例如,我目前有一个 190GB 的数据库,并且该数据库随着时间的推移而不断增长。由于数据库会不断增长,我最终需要对该数据库进行集群。因此,
去年我收到了一个礼物,它是一个索尼 CMT700Ni 音频站,支持 wifi。它还具有类似于广播的功能,称为“PartyStreaming”。我目前正在挖掘内部,探索它,所以也许我可以结束拥有自己的“
有没有我可以阅读的研究论文/书籍可以告诉我针对手头的问题哪种特征选择算法最有效。 我试图简单地将 Twitter 消息识别为 pos/neg(首先)。我从基于频率的特征选择开始(从 NLTK 书开始)
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。 要求我们推荐或查找工具、库或最喜欢的场外资源的问题对于 Stack Overflow 来说是偏离主题的,
我正在浏览 stackoverflow 以查找有关使用 jUnit 进行测试的常见建议,但仍然有几个问题。我知道,如果要测试的方法很复杂,最好的方法是将其分成小的单独部分并测试每个部分。但问题是 -
我有一个方法如下 public List> categorize(List customClass){ List> returnValue = new ArrayList<>();
我的问题是,当按照下面的程序合并时,在最佳实践场景中,“将分支折叠回主干”程序的最后一步是正确的方法吗? 我已经使用 svn 很多年了。在我的个人项目中,我总是毫不犹豫地在主干上愉快地进行修改,并且在
我读过 UINavigationController当您想从 n 个屏幕跳转到第一个屏幕时,这是最佳选择。这样做需要以下代码: NSMutableArray *array=[[NSMutableArr
我有一个文件输入类。它在构造函数中有一个字符串参数来加载提供的文件名。但是,如果文件不存在,它就会退出。如果文件不存在,我希望它输出一条消息 - 但不确定如何...... 这是类(class): pu
我希望创建一个“您访问过的国家/地区” map - 就像您可能在 Facebook、TravelAdvisor 和诸如此类的网站上看到的那样。 我尝试过不同的闪光灯套件,但它们并不像我希望的那样先进。
我需要一些关于如何处理我想用 Perl 编写的脚本的建议。基本上我有一个看起来像这样的文件: id: 1 Relationship: "" name: shelby pet: 1
我是一名优秀的程序员,十分优秀!