c - `lseek` 如何帮助确定文件是否为空？-6ren

c - `lseek` 如何帮助确定文件是否为空？

转载作者：行者123 更新时间：2023-12-03 16:47:06

25

4

我在看 source code的 cat来自 GNU coreutils，特别是圆检测。他们正在比较设备和 inode 并且工作正常，但是有一个 额外的案例 如果输入为空，它们允许输出为输入。查看代码，这必须是lseek (input_desc, 0, SEEK_CUR) < stat_buf.st_size)部分。我阅读了联机帮助页和 discussion我从 git blame 找到的，但我还是不太明白为什么调用 lseek需要。
这是如何做的要点 cat检测，如果它会无限耗尽磁盘(请注意，为了简洁起见，还删除了一些错误检查，完整的源代码在上面链接):

struct stat stat_buf;
fstat(STDOUT_FILENO, &stat_buf);
out_dev = stat_buf.st_dev;
out_ino = stat_buf.st_ino;
out_isreg = S_ISREG (stat_buf.st_mode) != 0;

// ...
// for <infile> in inputs {
    input_desc = open (infile, file_open_mode); // or STDIN_FILENO
    fstat(input_desc, &stat_buf);
    /* Don't copy a nonempty regular file to itself, as that would
       merely exhaust the output device.  It's better to catch this
       error earlier rather than later.  */
    if (out_isreg 
        && stat_buf.st_dev == out_dev && stat_buf.st_ino == out_ino
        && lseek (input_desc, 0, SEEK_CUR) < stat_buf.st_size)         // <--- This is the important line
    {
      // ...
    }
// } (end of for)

我有两种可能的解释，但似乎都有些奇怪。

根据某些标准(posix)，文件可能是“空的”，尽管它仍然包含一些信息(用 st_size 计算)和 lseek或 open通过抵消某些默认值来尊重这一点。我不知道为什么会这样，因为空意味着空，对吧？

这种比较确实是两个条件的“巧妙”组合。这对我来说首先是有意义的，因为如果 input_desc将是 STDIN_FILENO并且不会有文件传送到 stdin , lseek会失败 ESPIPE (根据手册页)并返回 -1 .那么，整个语句就是 lseek(...) == -1 || stat_buf.st_size > 0 .但这不可能是真的，因为此检查仅在设备和 inode 相同的情况下才会发生，并且只有在 a) stdin 和 stdout 指向相同的 pty 时才会发生，然后 out_isreg将是 false或 b) stdin 和 stdout 指向同一个文件，但随后 lseek无法返回 -1 ，对？

我还编写了一个打印返回值和 errno 的小程序。对于重要的部分，但对我来说没有什么突出的:

#include <errno.h>
#include <fcntl.h>
#include <stdio.h>
#include <stdlib.h>
#include <sys/stat.h>
#include <unistd.h>

int main(int argc, char **argv) {
  struct stat out_stat;
  struct stat in_stat;

  if (fstat(STDOUT_FILENO, &out_stat) < 0)
    exit(1);

  printf("this is written to stdout / into the file\n");

  int fd;
  if (argc > 1)
    fd = open(argv[1], O_RDONLY);
  else
    fd = STDIN_FILENO;

  fstat(fd, &in_stat);
  int res = lseek(fd, 0, SEEK_CUR);
  fprintf(stderr,
          "errno after lseek = %d, EBADF = %d, EINVAL = %d, EOVERFLOW = %d, "
          "ESPIPE = %d\n",
          errno, EBADF, EINVAL, EOVERFLOW, ESPIPE);

  fprintf(stderr, "input:\n\tlseek(...) = %d\n\tst_size = %ld\n", res,
          in_stat.st_size);

  printf("outsize is %ld", out_stat.st_size);
}

$ touch empty
$ ./a.out < empty > empty
errno after lseek = 0, EBADF = 9, EINVAL = 22, EOVERFLOW = 75, ESPIPE = 29
input:
        lseek(...) = 0
        st_size = 0
$ echo x > empty
$ ./a.out < empty > empty
errno after lseek = 0, EBADF = 9, EINVAL = 22, EOVERFLOW = 75, ESPIPE = 29
input:
        lseek(...) = 0
        st_size = 0

所以我的研究没有触及我的最终问题: 怎么样lseek帮助确定此示例中的文件是否为空来自 cat源代码？

最佳答案

这是我对其进行逆向工程的尝试 - 我找不到任何可以解释原因的公开讨论 lseek()放在那里(GNU coreutils 中没有其他地方这样做)。
指导性问题是:条件何时lseek (input_desc, 0, SEEK_CUR) < stat_buf.st_size错误的？
测试用例:

#!/bin/bash
# (edited based on comments)

set -x

# arrange for cat to start off past the end of a non-empty file

echo abcdefghi > /tmp/so/catseek/input
# get the shell to open the input file for reading & writing as file descriptor 7
exec 7<>/tmp/so/catseek/input
# read the whole file via that descriptor (but leave it open)
dd <&7
# ask linux what the current file position of file descriptor 7 is
# should be everything dd read, namely 10 bytes, the size of the file
grep ^pos: /proc/self/fdinfo/7
# run cat, with pre and post content so that we know how to locate the interesting part
# "-" will cause cat to reuse its file descriptor 0 rather than creating a new file descriptor
# the redirections tell the shell to redirect file descriptors 1 and 0 to/from our open file descriptor 7
# which, as you'll remember, already has a file position of 10 bytes
strace -e lseek ./src/cat /tmp/so/catseek/pre - /tmp/so/catseek/post <&7 >&7
# now let's see what's in the file
cat /tmp/so/catseek/input

和:

$ cat /tmp/so/catseek/pre
pre
$ cat /tmp/so/catseek/post
post

cat与 lseek (input_desc, 0, SEEK_CUR) < stat_buf.st_size :

+ test.sh:8:echo abcdefghi
+ test.sh:10:exec
+ test.sh:12:dd
abcdefghi
0+1 records in
0+1 records out
10 bytes copied, 2.0641e-05 s, 484 kB/s
+ test.sh:15:grep '^pos:' /proc/self/fdinfo/7
pos:    10
+ test.sh:20:strace -e lseek ./src/cat /tmp/so/catseek/pre - /tmp/so/catseek/post
lseek(0, 0, SEEK_CUR)                   = 14
+++ exited with 0 +++
+ test.sh:22:cat /tmp/so/catseek/input
abcdefghi
pre
post

cat与 0 < stat_buf.st_size :

+ test.sh:8:echo abcdefghi
+ test.sh:10:exec
+ test.sh:12:dd
abcdefghi
0+1 records in
0+1 records out
10 bytes copied, 3.6415e-05 s, 275 kB/s
+ test.sh:15:grep '^pos:' /proc/self/fdinfo/7
pos:    10
+ test.sh:20:strace -e lseek ./src/cat /tmp/so/catseek/pre - /tmp/so/catseek/post
./src/cat: -: input file is output file
+++ exited with 1 +++
+ test.sh:22:cat /tmp/so/catseek/input
abcdefghi
pre
post

如您所见，当 cat开始时，文件位置可能已经在文件尾之后，只检查文件大小就会 cat跳过文件，还会触发失败，如 if里面的代码声明是:

error (0, 0, _("%s: input file is output file"), infile);
ok = false;
goto contin;

使用 lseek()允许 cat说“哦，文件是相同的，并且不是空的，但是我们的读取仍然会变成空的，因为这就是读取 EOF 之后的工作方式，所以我们可以允许这种情况”。

关于c - `lseek` 如何帮助确定文件是否为空？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/65674534/

25

4

0

文章推荐： python - 如何修复JupyterLab "Code Editor out of Sync"错误消息？

文章推荐： reactjs - Strapi安装过程依赖安装报错

文章推荐： ubuntu - 为什么 virtualbox 无法在 Ubuntu 20.04 上安装

java - Selenium Web 驱动程序无法单击前台对话框的“确定”按钮并找到后台对话框的“确定”按钮
我正在使用 Selenium Web 驱动程序 3.0，并且想要从打开的两个对话框(一个在后台，第二个在前台)的 Activity 对话框中单击“确定”按钮。如何从 html 下面的父 div 单击前
android - 在 flutter 中，我使用AlertDialog，它具有2个操作按钮“确定”和“取消”，单击“确定”时，我要转到新屏幕并结束当前屏幕？
actions: [ FlatButton( onPressed: () {
sqlite - 在 SQLite 中从接近重复的行(由 GROUP BY、HAVING、COUNT 确定)中选择 "first"(由 ORDER BY 确定)行
我有一个问题有点超出我的范围(我真的很高兴我是 Beta)涉及重复项(所以 GROUP BY, HAVING, COUNT)，通过将解决方案保留在 SQLite 附带的标准函数中而变得更加复杂。我正在
perl - 确定$ sth是否有行而不消耗它？
使用DBI是否可以确定SELECT语句的已执行语句句柄是否返回任何行而不从中获取行？ IE。就像是: use DBI; ... my $sth = $dbh->prepare("SELECT ..."
语义用户界面模式关闭-确定/取消回调
是否可以为“确定”和“关闭”按钮指定回调函数？如果是JQuery Modal，则可以在初始化时使用按钮字典指定回调函数。 Semantic-ui模态是否提供类似的功能？按下确定后，我该如何寻求其他逻
selenium - 阅读警报消息并单击“确定”
我想阅读警报中的消息。示例:如果警报显示“错误的电子邮件地址”。怎么读呢？意味着我想将该消息存储在字符串中。如何在“警报”中单击“确定”...？？如何使用 Selenium 来做到这一点？最佳
javascript - 确定 if 语句中是否选择了任何选项
我有一个删除按钮: 我试图首先查明是否已选择一个网站，如果已选择一个网站，我需要确定是否已选择一个或多个列表项，如果是，则继续删除这些项目。我的 if 语句不断返回“您必须首先选择您的列表”，即使它
.net - 确定.NET中对象图的内存使用率
部分出于好奇——我们想知道在我们的应用程序中发生了什么——部分是因为我们需要在我们的代码中找到一些潜在的问题，我喜欢在我们的网络应用程序运行时跟踪一些一般值。这尤其包括某些对象图的分配内存。我们的应
jquery - 甜蜜警报不会等到用户单击“确定”
我将 SweetAlert 与 Symfony 结合使用，我希望用户在完成删除操作之前进行确认。发生的情况是，当用户单击删除按钮时，SweetAlert 会弹出，然后立即消失，并且该项目被删除。在
c# - 确定.NET中随机生成的代码中是否包含任何淫秽词语的有效方法
我们有一个应用程序可以生成不包括字母 O 的随机基数 35 [0-9A-Z]。我正在寻找一种解决方案来查找包含任何淫秽英语单词的代码，而无需搜索包含 10,000 个条目的列表每个生成的代码。每秒生成
c - 确定、存储和打印给定范围内的所有整数
这是我做的: #include #include int betweenArray(int a, int b){ int *arr,i,range; range = b - a +
javascript - 在提示中单击“确定”
我知道如何创建警报和确认框，但我不知道如何做的是实际单击“确定”。我有一个弹出确认框的页面。我想使用 Java Script 插件单击“确定”。基本上，我希望我的代码单击页面上的链接，然后在出现提
javascript - 无法使用甜蜜警报单击“确定”
代码: swal('Your ORDER has been placed Successfully!!!'); window.location="index.php"; 甜蜜警报工
python - 确定 OR 正则表达式的哪个片段与字符串匹配
>>> import re >>> s = "These are the words in a sentence" >>> regex = re.compile('are|words') >>> [m
确定 2 个数组是否不相交的算法
使用确定的理想散列函数给出随机期望线性时间算法两个数组 A[1..n] 和 B[1..n] 是否不相交，即 A 的元素是否也是 B 的元素。谁能告诉我如何做到这一点，甚至如何开始考虑它？最佳答案
java - 确定 while 循环的迭代次数
我在计算机科学课上有这段代码: int input=15; while (input < n ) { input = input *3;} 这段代码有 log3(n/15) 次循环的上限。我们怎样才能
确定 TicTacToe 游戏状态的算法？
我有一个允许 2 位玩家玩 TicTacToe 的程序。在每个玩家移动之后，它应该在那个点显示棋盘并返回一个名为 Status 的枚举，显示玩家是否应该继续，如果玩家赢了，还是平局。但是，该算法要么返
确定 Y 轴标签和位置的算法？
给定一个 y 值数组，例如 [-3400, -1000, 500, 1200, 3790]，我如何确定“好的”Y 轴标签并将它们放置在网格上？ ^ ---(6,000)-|---
php - 确定 WHERE 语句的哪些部分失败
假设我有一个检查用户登录的 SQL 语句: SELECT * FROM users WHERE username='test@example.com', password='abc123', expi
indexing - 确定 Teradata 中表的主索引
teradata中有返回表中哪一列被定义为主索引的命令吗？我没有制作一些我正在处理的表，也没有尝试优化我对这些表的连接。谢谢! 最佳答案有dbc.IndicesV，其中IndexNumber=1表示

首页

博学

6Ren·AI

商城

c - `lseek` 如何帮助确定文件是否为空？