- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我正在尝试将大量历史记录从 Perforce 转换到 Git,并且一个文件夹(现在是 git 分支)包含大量大型二进制文件。我的问题是我在运行 git gc --aggressive
时内存不足。
我的主要问题是重新打包存储库是否可能对大型二进制文件产生任何有意义的影响。再压缩 20% 会很棒。 0.2% 不值得我付出努力。如果没有,我会按照建议跳过它们 here .
对于背景,我成功地使用 git p4
创建了我满意的状态的存储库,但这在幕后使用了 git fast-import
所以我想要在正式发布之前优化存储库,并且确实使任何提交自动触发缓慢的 gc --auto
。目前裸机状态约为 35GB。
从概念上讲,有问题的二进制文件似乎是嵌入式设备中使用的供应商固件。我认为在 400-700MB 范围内大约有 25 个,在 20-50MB 范围内可能还有几百个。它们可能是磁盘镜像,但我不确定。随着时间的推移,出现了各种版本和文件类型,我经常看到 .zip
、tgz
和 .simg
文件。因此,我希望原始代码有明显的重叠,但我不确定此时实际文件看起来有多相似,因为我相信这些格式已经被压缩了,对吧?
这些二进制文件包含在一个(旧的)分支中,该分支很少会被过度使用(质疑版本控制是否有效,但超出范围)。当然,该分支的性能不需要很好。但我希望存储库的其余部分是合理的。
欢迎提供有关优化打包或内存管理的其他建议。我承认我并不真正理解在链接问题上讨论的各种 git 选项。我也不真正了解 --window
和 --depth
标志在 git repack
中的作用。但主要问题是二进制文件本身的重新打包是否在做任何有意义的事情。
最佳答案
My primary question here is whether repacking the repository is likely to have any meaningful effect on large binaries.
这取决于它们的内容。对于您特别概述的文件:
I see .zip, tgz, and .simg files frequently.
Zipfiles 和 tgz(gzipped tar archive)文件已经被压缩并且有可怕的(即高)Shannon entropy值——这对 Git 来说很糟糕——并且不会相互压缩。 .simg
文件可能是(我不得不在这里猜测)Singularity disk image files ;它们是否以及如何被压缩,我不知道,但我会假设它们是。 (一个简单的测试是将一个提供给压缩器,例如 gzip,看看它是否收缩。)
As such, I'd expect the raw code to have significant overlap, but I'm not sure how similar the actual files appear at this point, as I believe these formats have already been compressed, right?
没错。因此,矛盾的是,将它们未压缩存储在 Git 中最终会导致更大的压缩。 (但打包可能需要大量内存。)
If [this is probably futile], I'll have them skipped over as suggested here.
这将是我在这里的第一个冲动。 :-)
I admit I don't really understand the various git options being discussed on the linked question. Nor do I really understand what the
--window
and--depth
flags are doing ingit repack
.
各种限制令人困惑(而且很多)。同样重要的是要意识到它们不会在克隆时被复制,因为它们在 .git/config
中,这不是提交的文件,所以新的克隆不会拾取它们。 .gitattributes
文件被复制到克隆上,新克隆将继续避免打包不可打包的文件,因此这是更好的方法。
(如果您想深入了解细节,您会在 the Git technical documentation 中找到一些内容。这并没有准确讨论窗口大小,但它与 Git 使用多少内存来内存映射对象有关选择可能相互压缩良好的对象时的数据。有两个:一个用于一个包文件上的每个单独的 mmap,一个用于所有包文件上的总聚合 mmap。您的链接中未提及:core.deltaBaseCacheLimit
,这是用于保存 delta 基数的内存量——但要理解这一点,您需要理解 delta 压缩和 delta 链,1 并阅读相同的技术文档。请注意 Git将默认不尝试打包任何大小超过 core.bigFileThreshold
的文件对象。各种 pack.*
控件有点复杂:打包是多线程完成的尽可能利用所有 CPU,并且每个线程都可以使用大量内存。限制数量 o f threads 限制总内存使用:如果一个线程要使用 256 MB,则 8 个线程可能会使用 8*256 = 2048 MB 或 2 GB。位图主要是为了加快从繁忙的服务器中获取数据的速度。)
1它们并没有那么复杂:当一个对象说“获取对象 XYZ 并应用这些更改”,但对象 XYZ 本身说“获取对象 PreXYZ 并应用这些更改”时,就会出现增量链.对象 PreXYZ 也可以带另一个对象,依此类推。 delta base 是此列表底部的对象。
关于git - 重新打包存储库对大型二进制文件有用吗?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/50996930/
今天我在一个 Java 应用程序中看到了几种不同的加载文件的方法。 文件:/ 文件:// 文件:/// 这三个 URL 开头有什么区别?使用它们的首选方式是什么? 非常感谢 斯特凡 最佳答案 file
就目前而言,这个问题不适合我们的问答形式。我们希望答案得到事实、引用或专业知识的支持,但这个问题可能会引起辩论、争论、投票或扩展讨论。如果您觉得这个问题可以改进并可能重新打开,visit the he
我有一个 javascript 文件,并且在该方法中有一个“测试”方法,我喜欢调用 C# 函数。 c# 函数与 javascript 文件不在同一文件中。 它位于 .cs 文件中。那么我该如何管理 j
需要检查我使用的文件/目录的权限 //filePath = path of file/directory access denied by user ( in windows ) File fil
我在一个目录中有很多 java 文件,我想在我的 Intellij 项目中使用它。但是我不想每次开始一个新项目时都将 java 文件复制到我的项目中。 我知道我可以在 Visual Studio 和
已关闭。此问题不符合Stack Overflow guidelines 。目前不接受答案。 这个问题似乎不是关于 a specific programming problem, a software
我有 3 个组件的 Twig 文件: 文件 1: {# content-here #} 文件 2: {{ title-here }} {# content-here #}
我得到了 mod_ldap.c 和 mod_authnz_ldap.c 文件。我需要使用 Linux 命令的 mod_ldap.so 和 mod_authnz_ldap.so 文件。 最佳答案 从 c
我想使用PIE在我的项目中使用 IE7。 但是我不明白的是,我只能在网络服务器上使用 .htc 文件吗? 我可以在没有网络服务器的情况下通过浏览器加载的本地页面中使用它吗? 我在 PIE 的文档中看到
我在 CI 管道中考虑这一点,我应该首先构建和测试我的应用程序,结果应该是一个 docker 镜像。 我想知道使用构建环境在构建服务器上构建然后运行测试是否更常见。也许为此使用构建脚本。最后只需将 j
using namespace std; struct WebSites { string siteName; int rank; string getSiteName() {
我是 Linux 新手,目前正在尝试使用 ginkgo USB-CAN 接口(interface) 的 API 编程功能。为了使用 C++ 对 API 进行编程,他们提供了库文件,其中包含三个带有 .
我刚学C语言,在实现一个程序时遇到了问题将 test.txt 文件作为程序的输入。 test.txt 文件的内容是: 1 30 30 40 50 60 2 40 30 50 60 60 3 30 20
如何连接两个tcpdump文件,使一个流量在文件中出现一个接一个?具体来说,我想“乘以”一个 tcpdump 文件,这样所有的 session 将一个接一个地按顺序重复几次。 最佳答案 mergeca
我有一个名为 input.MP4 的文件,它已损坏。它来自闭路电视摄像机。我什么都试过了,ffmpeg , VLC 转换,没有运气。但是,我使用了 mediainfo和 exiftool并提取以下信息
我想做什么? 我想提取 ISO 文件并编辑其中的文件,然后将其重新打包回 ISO 文件。 (正如你已经读过的) 我为什么要这样做? 我想开始修改 PSP ISO,为此我必须使用游戏资源、 Assets
给定一个 gzip 文件 Z,如果我将其解压缩为 Z',有什么办法可以重新压缩它以恢复完全相同的 gzip 文件 Z?在粗略阅读了 DEFLATE 格式后,我猜不会,因为任何给定的文件都可能在 DEF
我必须从数据库向我的邮件 ID 发送一封带有附件的邮件。 EXEC msdb.dbo.sp_send_dbmail @profile_name = 'Adventure Works Admin
我有一个大的 M4B 文件和一个 CUE 文件。我想将其拆分为多个 M4B 文件,或将其拆分为多个 MP3 文件(以前首选)。 我想在命令行中执行此操作(OS X,但如果需要可以使用 Linux),而
快速提问。我有一个没有实现文件的类的项目。 然后在 AppDelegate 我有: #import "AppDelegate.h" #import "SomeClass.h" @interface A
我是一名优秀的程序员,十分优秀!