- android - RelativeLayout 背景可绘制重叠内容
- android - 如何链接 cpufeatures lib 以获取 native android 库?
- java - OnItemClickListener 不起作用,但 OnLongItemClickListener 在自定义 ListView 中起作用
- java - Android 文件转字符串
我在 mysql 中有一个 url 表,它只有两个字段 id 和 varchar(255) 作为 url。目前那里有超过 5000 万个 url,我的老板刚刚给我提供了关于我们当前项目扩展的线索,这将导致在该 url 表中添加更多的 url,预计到 2019 年中期的数量大约为 1.5 亿个明年。
目前数据库大小约为 6GB,所以我可以肯定地说,如果事情保持不变,那么它将超过 20GB,这并不好。所以,我正在考虑一些可以减少 url 存储磁盘空间的解决方案。
我也想说明一下,这个表不是一个繁忙的表,目前没有太多的查询,所以我只是想节省磁盘空间,更重要的是我想探索短文本的新想法压缩及其在mysql中的存储
但将来也可以大量访问该表,因此最好在时机成熟之前优化该表。
我花了很多功夫将 url 更改为数字形式并使用 BIGINT 进行存储,但由于它有 64 位的限制,所以效果不是很好。同样是 BIT 数据类型的问题,也施加了 64 位的限制。
我转换为数字形式的想法基本上是因为 8 字节 BIGINT 存储 19 个数字,所以如果每个数字指向所有可能字符的字符集中的一个字符,那么它可以在 8 个字节中存储 19 个字符,如果所有字符的范围是 1- 10 但在现实世界中有 52 个英文字符和 10 个数字加上一些符号,所以它大约有 100 个字符集。因此,在最坏的情况下,BIGINT 仍然可以指向 6 个字符,是的,它不是最终裁决,它仍然需要一些锻炼才能准确知道每个数字指向的是 10+ 数字还是 30+ 数字或 80+ 数字,但你有几乎明白我在想什么。
更重要的是,由于 url 是可变长度的,所以我也试图节省小 url 的磁盘空间,所以我不想提供固定长度的列类型。
我还研究了一些文本压缩算法,如 smaz 和 Huffman 压缩算法,但不太相信,因为它们使用某种字典单词,但我正在寻找一种干净的方法。
而且我不想使用二进制数据类型,因为它也像字节中的 varchars 一样占用太多空间。
最佳答案
另一个尝试的想法可能是识别常见字符串并用位图表示它们。例如,有两位表示协议(protocol)(http、https、ftp 或其他),另一位表示域名是否以“wwww”开头,两位表示域名是否以“.com”、“. org”、“.edu”或其他名称。您必须对您的数据进行一些分析,看看这些是否有意义,以及您是否可以识别任何其他常见字符串。
如果您有很多指向同一站点的 URL,您还可以考虑将您的表分成两个不同的表,一个包含域,另一个包含域相对路径(以及查询字符串和片段 ID,如果存在的话) ).您将有一个链接表,其中包含 URL 的 ID、域的 ID 和路径的 ID,并且您将用连接这三个表的 View 替换原始 URL 表。域表不必限于域,您可以包含尽可能多的常见 URL(例如,“http://stackoverflow.com/questions”)。这不会花费太多代码来实现,并且具有仍然可读的优点。您的数字编码可能会更有效,一旦您弄明白了,您将不得不分析您的数据以查看哪个更有意义。
关于mysql - url 文本压缩(不是缩短)并存储在 mysql 中,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/7391839/
我正在运行一个辅助角色,并检查 Azure 上托管的存储中是否存在数据。当我将连接字符串用于经典类型的存储时,我的代码可以正常工作,但是当我连接到 V2 Azure 存储时,它会抛出此异常。 “远程服
在我的应用程序的主页上,我正在进行 AJAX 调用以获取应用程序各个部分所需的大量数据。该调用如下所示: var url = "/Taxonomy/GetTaxonomyList/" $.getJSO
大家好,我正在尝试将我的商店导入我的 Vuex Route-Gard。 路由器/auth-guard.js import {store} from '../store' export default
我正在使用 C# 控制台应用程序 (.NET Core 3.1) 从 Azure Blob 存储读取大量图像文件并生成这些图像的缩略图。新图像将保存回 Azure,并将 Blob ID 存储在我们的数
我想将 Mlflow 设置为具有以下组件: 后端存储(本地):在本地使用 SQLite 数据库存储 Mlflow 实体(run_id、params、metrics...) 工件存储(远程):使用 Az
我正在使用 C# 控制台应用程序 (.NET Core 3.1) 从 Azure Blob 存储读取大量图像文件并生成这些图像的缩略图。新图像将保存回 Azure,并将 Blob ID 存储在我们的数
我想将 Mlflow 设置为具有以下组件: 后端存储(本地):在本地使用 SQLite 数据库存储 Mlflow 实体(run_id、params、metrics...) 工件存储(远程):使用 Az
我的 Windows 计算机上的本地文件夹中有一些图像。我想将所有图像上传到同一容器中的同一 blob。 我知道如何使用 Azure Storage SDKs 上传单个文件BlockBlobServi
我尝试发出 GET 请求来获取我的 Azure Blob 存储帐户的帐户详细信息,但每次都显示身份验证失败。谁能判断形成的 header 或签名字符串是否正确或是否存在其他问题? 代码如下: cons
这是用于编写 JSON 的 NeutralinoJS 存储 API。是否可以更新 JSON 文件(推送数据),而不仅仅是用新的 JS 对象覆盖数据。怎么做到的??? // Javascript
我有一个并行阶段设置,想知道是否可以在嵌套阶段之前运行脚本,所以像这样: stage('E2E-PR-CYPRESS') { when { allOf {
我想从命令行而不是从GUI列出VirtualBox VM的详细信息。我对存储细节特别感兴趣。 当我在GUI中单击VM时,可以看到包括存储部分在内的详细信息: 但是到目前为止,我还没有找到通过命令行执行
我有大约 3500 个防洪设施,我想将它们表示为一个网络来确定流动路径(本质上是一个有向图)。我目前正在使用 SqlServer 和 CTE 来递归检查所有节点及其上游组件,只要上游路径没有 fork
谁能告诉我 jquery data() 在哪里存储数据以及何时删除以及如何删除? 如果我用它来存储ajax调用结果,会有性能问题吗? 例如: $("body").data("test", { myDa
有人可以建议如何为 Firebase 存储中的文件设置备份。我能够备份数据库,但不确定如何为 firebase 存储中的文件(我有图像)设置定期备份。 最佳答案 如何进行 Firebase 存储的本地
我最近开始使用 firebase 存储和 firebase 功能。现在我一直在开发从功能到存储的文件上传。 我已经让它工作了(上传完成并且文件出现在存储部分),但是,图像永远保持这样(永远在右侧加载)
我想只允许用户将文件上传到他们自己的存储桶中,最大文件大小为 1MB,仍然允许他们删除文件。我添加了以下内容: match /myusers/{userId}/{allPaths=**} { al
使用生命周期管理策略将容器的内容从冷访问层移动到存档。我正在尝试以下策略,希望它能在一天后将该容器中的所有文件移动到存档层,但事实并非如此在职的。我设置了选择标准“一天未使用后”。 这是 json 代
对于连接到 Azure 存储端点,有 http 和 https 两个选项。 第一。 https 会带来开销,可能是 5%-10%,但我不支付同一个数据中心的费用。 第二。 http 更快,但 Auth
有人可以帮我理解这一点吗?我创建了Virtual Machine in Azure running Windows Server 2012 。我注意到 Azure 自动创建了一个存储帐户。当我进入该存
我是一名优秀的程序员,十分优秀!