- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我在 S3 中有一些较大的文件 - 最多 40G
我想设置多个容器以使用 AWS Batch 处理每个文件 - 每个容器将获取较大文件的一小部分并对其进行分析,然后将一小部分结果返回到 S3。
由于大小,我不想为每个容器检索大文件的单独副本。
因为我使用的是 AWS Batch,底层服务器的数量和单个大小不一定是已知的(这取决于现货定价),因此将所有光栅预复制到所有服务器并不是一个好的选择。
在某些时候,容器将负责处理尚未在本地卷上的文件 block - 很容易将其复制,问题是,当 2 个或更多容器发现文件不存在,同时开始复制过来?
所以,我的问题是“什么是最好的模式来确保每个容器需要的文件在运行该特定容器的主机上的共享卷上可用,而不会产生竞争条件和容器相互依赖性?”
TIA西蒙
最佳答案
我会在提交作业时通过将文件 block 分配给批处理作业来构建它。例如,我会分配批处理作业 A 处理字节 0-1G,批处理作业 B 处理字节 1G-2G 等等。
您可以通过在提交作业时设置指示范围的环境变量来完成此操作。例如,对于您提交的第一份工作,您可以设置 RANGE_START=0
和 RANGE_END=999999999
。然后在容器内,您可以从 S3 获取该范围的字节并进行处理。例如,在 Python 中,您可以这样做:
import boto3
s3 = boto3.client("s3")
obj = s3.get_object(
Bucket="bucket",
Key="key",
Range="bytes 0-999999999"
)
content = obj["Body"].read()
关于docker - 我应该如何处理从 S3 获取大型共享文件以供容器并行批处理,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/46333042/
我正在使用以下dockerfile: FROM ubuntu:14.04 MAINTAINER xxx xxx # SSH RUN apt-get update && apt-get install
我运行了docker-compose build celery,(经过数小时的尝试,我的连接不良)成功了。 app Dockerfile的前80%是相同的,但不会重复使用缓存。从我可以浏览的内容来看,
我可以使用以下命令成功创建 Docker 注册表 v2 服务:docker service create 然后我使用 docker Push 将一些图像推送到该服务。 当我通过 curl localh
我正在尝试使用 gitlab 构建 CI,我从 docker 的 docker 镜像开始,我的前端存储库没有任何问题,但现在使用相同的 gitlab-ci 配置文件,我有此守护程序错误。 这是构建的输
用例: 我们在 Jenkins 中有几个“发布作业”build 和 push 应用程序的 Docker 镜像到 docker registry,更新各种文件中的项目版本,最后将发布标签推送到相应的 G
当我尝试构建我的 docker 文件时,docker 返回以下错误: [+] Building 0.0s (1/2)
docker-in-docker 的作者在此博客中建议不要将此图像用于 CI 目的: jpetazzo/Using Docker-in-Docker for your CI or testing en
我创建了一个 Dockerfile 来在 Docker 中运行 Docker: FROM ubuntu:16.04 RUN apt-get update && \ apt-get in
我尝试为 Docker 镜像定位一个特定标签。我怎样才能在命令行上做到这一点?我想避免下载所有图像,然后删除不需要的图像。 在 Ubuntu 官方版本中,https://registry.hub.do
我正在尝试在docker中运行docker。唯一的目的是实验性的,我绝不尝试实现任何功能,我只想检查docker从另一个docker运行时的性能。 我通过Mac上的boot2docker启动docke
docker-compose.yml version: "3" services: daggr: image: "docker.pvt.com/test/daggr:stable"
我有一个非常具体的开发环境用例。在一些代码中,我启动了一个容器来抓取页面并检索在容器中运行的服务(Gitlab)的 token 。 现在,我希望 Dockerize 运行它的代码。具体来说,类似: o
之前已经问过这个问题,但我不确定当时是否可以使用docker-compose文件完成docker堆栈部署。 由于最新版本支持使用compose将服务部署到堆栈,因此,我无法理解dab文件的值。 我检查
我在一次采访中被问到这个问题,但无法回答。也没有找到任何相关信息。 最佳答案 正如 Docker 文档中所述,Docker 注册表是: [...] a hosted service containin
有没有一种方法可以将具有给定扩展名的所有文件复制到Docker中的主机?就像是 docker cp container_name:path/to/file/in/docker/*.png path/o
我的日志驱动程序设置为journald。使用日志记录驱动程序时,daemon.json文件中的日志级别配置会影响日志吗?使用docker logs 时仅会影响容器日志? 例如,docker和journ
我最近开始使用Docker + Celery。我还共享了full sample codes for this example on github,以下是其中的一些代码段,以帮助解释我的观点。 就上下文
运行docker build .命令后,尝试提交构建的镜像,但收到以下错误 Step 12 : CMD activator run ---> Using cache ---> efc82ff1ca
我们有docker-compose.yml,其中包含Kafka,zookeeper和schema registry的配置 当我们启动docker compose时,出现以下错误 docker-comp
我是Docker的新手。是否可以在Docker Hub外部建立Docker基本镜像存储库?假设将它们存储在您的云中,而不是拥有DH帐户?谢谢。 最佳答案 您可以根据需要托管自己的注册表。可以在Depl
我是一名优秀的程序员,十分优秀!