- c - 在位数组中找到第一个零
- linux - Unix 显示有关匹配两种模式之一的文件的信息
- 正则表达式替换多个文件
- linux - 隐藏来自 xtrace 的命令
我有一些大的(200 GB 是正常的)平面数据文件,我想将它们存储在某种数据库中,以便可以快速访问并以数据逻辑组织的直观方式进行访问。将其视为大量非常长的录音,其中每个录音的长度(样本)相同,并且可以被认为是一行。其中一个文件通常包含大约 100,000 个录音,每个录音的长度为 2,000,000 个样本。
将这些记录作为 BLOB 数据行存储在关系数据库中会很容易,但在很多情况下,我只想将整个数据集的某些列加载到内存中(例如,样本 1,000-2,000) .执行此操作最节省内存和时间的方法是什么?
请不要犹豫,询问您是否需要对我的数据的详细信息进行更多说明以便提出建议。
编辑:澄清数据维度...一个文件包括:100,000 行(记录)乘以 2,000,000 列(样本)。我研究过的大多数关系数据库都允许在一个表中最多有几百到几千行。再一次,我对面向对象的数据库了解不多,所以我想知道这样的事情是否对这里有帮助。当然,任何好的解决方案都是非常受欢迎的。谢谢。
编辑:澄清数据的用途...数据只能由我将编写的自定义桌面/分布式服务器应用程序访问。每个数据“集”(到目前为止我称之为 200 GB 的文件)都有元数据(收集日期、过滤器、采样率、所有者等)。还有与每个录音相关的元数据(我希望它是表格中的一行,这样我就可以为每个录音元数据添加列)。所有元数据都是一致的。 IE。如果一段特定的元数据存在于一个记录中,那么它也存在于该文件中的所有记录中。示例本身没有元数据。每个样本都是 8 位的 plain-ol' 二进制数据。
最佳答案
数据库存储可能不适合大文件。是的,这是可以做到的。是的,它可以工作。但是数据库备份呢?文件内容可能不会经常更改 - 添加后,它们将保持不变。
我的建议是将文件存储在磁盘上,但创建一个基于数据库的索引。当文件夹/目录/等中的文件超过 10k 时,大多数文件系统都会变得胡思乱想或变慢。您的应用程序可以生成文件名并将元数据存储在数据库中,然后按生成的名称在磁盘上进行组织。缺点是文件内容可能无法从名称中直接看出。但是,您可以轻松备份更改的文件,而无需专门的数据库备份插件和复杂的分区、增量备份方案。此外,在文件内查找操作变得更加简单(向前跳转、倒带等)。在文件系统中通常比在数据库中更好地支持这些操作。
关于sql - 数据库或其他存储和动态访问 HUGE 二进制对象的方法,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/8670276/
关闭。这个问题是opinion-based 。目前不接受答案。 想要改进这个问题吗?更新问题,以便 editing this post 可以用事实和引文来回答它。 . 已关闭 4 年前。 Improv
PowerShell Web Access 允许您通过 Web 浏览器运行 PowerShell cmdlet。它显示了一个基于 Web 的控制台窗口。 有没有办法运行 cmdlet 而无需在控制台窗
我尝试在无需用户登录的情况下访问 Sharepoint 文件。 我可以通过以下任一方式获取访问 token 方法一: var client = new RestClient("https://logi
我目前正在尝试通过 Chrome 扩展程序访问 Google 服务。我的理解是,对于 JS 应用程序,Google 首选的身份验证机制是 OAuth。我的应用目前已成功通过 OAuth 向服务进行身份
假设我有纯抽象类 IHandler 和派生自它的类: class IHandler { public: virtual int process_input(char input) = 0; };
我有一个带有 ThymeLeaf 和 Dojo 的 Spring 应用程序,这给我带来了问题。当我从我的 HTML 文件中引用 CSS 文件时,它们在 Firebug 中显示为中止。但是,当我通过在地
这个问题已经有答案了: JavaScript property access: dot notation vs. brackets? (17 个回答) 已关闭 6 年前。 为什么这不起作用? func
我想将所有流量重定向到 https,只有 robot.txt 应该可以通过 http 访问。 是否可以为 robot.txt 文件创建异常(exception)? 我的 .htaccess 文件: R
我遇到了 LinkedIn OAuth2: "Unable to verify access token" 中描述的相同问题;但是,那里描述的解决方案并不能解决我的问题。 我能够成功请求访问 toke
问题 我有一个暴露给 *:8080 的 Docker 服务容器. 我无法通过 localhost:8080 访问容器. Chrome /curl无限期挂断。 但是如果我使用任何其他本地IP,我就可以访
我正在使用 Google 的 Oauth 2.0 来获取用户的 access_token,但我不知道如何将它与 imaplib 一起使用来访问收件箱。 最佳答案 下面是带有 oauth 2.0 的 I
我正在做 docker 入门指南:https://docs.docker.com/get-started/part3/#recap-and-cheat-sheet-optional docker-co
我正在尝试使用静态 IP 在 AKS 上创建一个 Web 应用程序,自然找到了一个带有 Nginx ingress controller in Azure's documentation 的解决方案。
这是我在名为 foo.js 的文件中的代码。 console.log('module.exports:', module.exports) console.log('module.id:', modu
我试图理解访问键。我读过https://docs.aws.amazon.com/general/latest/gr/aws-sec-cred-types.html#access-keys-and-se
我正在使用 MGTwitterEngine"将 twitter 集成到我的应用程序中。它在 iOS 4.2 上运行良好。当我尝试从任何 iOS 5 设备访问 twitter 时,我遇到了身份验证 to
我试图理解访问键。我读过https://docs.aws.amazon.com/general/latest/gr/aws-sec-cred-types.html#access-keys-and-se
我正在使用以下 API 列出我的 Facebook 好友。 https://graph.facebook.com/me/friends?access_token= ??? 我想知道访问 token 过
401 Unauthorized - Show headers - { "error": { "errors": [ { "domain": "global", "reas
我已经将我的 django 应用程序部署到 heroku 并使用 Amazon s3 存储桶存储静态文件,我发现从 s3 存储桶到 heroku 获取数据没有问题。但是,当我测试查看内容存储位置时,除
我是一名优秀的程序员,十分优秀!