gpt4 book ai didi

go - 如何读取大型平面文件

转载 作者:IT老高 更新时间:2023-10-28 13:10:40 24 4
gpt4 key购买 nike

我有一个平面文件,其中包含 339276 行文本,大小为 62.1 MB。我正在尝试读取所有行,根据我拥有的某些条件解析它们,然后将它们插入数据库。

我最初尝试使用 bufio.Scan() 循环和 bufio.Text() 来获取线路,但缓冲区空间不足。我切换到使用 bufio.ReadLine/ReadString/ReadByte (我尝试了每个)并且每个都有相同的问题。我没有足够的缓冲空间。

我尝试使用 read 并设置缓冲区大小,但正如文档所说,它实际上是一个 const,可以变得更小,但永远不会大于 64*1024 字节。然后,我尝试使用 File.ReadAt 来设置起始位置,并在我引入每个部分时将其移动,但无济于事。我查看了以下示例和解释(不是详尽的列表):

Read text file into string array (and write) How to Read last lines from a big file with Go every 10 secs reading file line by line in go

如何将整个文件(逐行或一次全部)读入一个 slice 中,以便我可以对这些行执行操作?

这是我尝试过的一些代码:

                 file, err := os.Open(feedFolder + value)
handleError(err)
defer file.Close()
// fileInfo, _ := file.Stat()
var linesInFile []string

r := bufio.NewReader(file)
for {
path, err := r.ReadLine("\n") // 0x0A separator = newline

linesInFile = append(linesInFile, path)
if err == io.EOF {
fmt.Printf("End Of File: %s", err)
break
} else if err != nil {
handleError(err) // if you return error
}
}
fmt.Println("Last Line: ", linesInFile[len(linesInFile)-1])

这是我尝试过的其他东西:

var fileSize int64 = fileInfo.Size()
fmt.Printf("File Size: %d\t", fileSize)
var bufferSize int64 = 1024 * 60
bytes := make([]byte, bufferSize)
var fullFile []byte
var start int64 = 0
var interationCounter int64 = 1
var currentErr error = nil
for currentErr != io.EOF {
_, currentErr = file.ReadAt(bytes, st)
fullFile = append(fullFile, bytes...)
start = (bufferSize * interationCounter) + 1
interationCounter++
}
fmt.Printf("Err: %s\n", currentErr)
fmt.Printf("fullFile Size: %s\n", len(fullFile))
fmt.Printf("Start: %d", start)

var currentLine []string


for _, value := range fullFile {
if string(value) != "\n" {
currentLine = append(currentLine, string(value))
} else {
singleLine := strings.Join(currentLine, "")
linesInFile = append(linesInFile, singleLine)
currentLine = nil
}
}

我很茫然。要么我不完全了解缓冲区的工作原理,要么我不了解其他内容。谢谢阅读。

最佳答案

循环中的

bufio.Scan()bufio.Text() 非常适合我处理更大尺寸的文件,所以我想你已经超出了行数缓冲能力。那么

  • 检查你的行尾
  • 你使用哪个 Go 版本 path, err :=r.ReadLine("\n")//0x0A separator = newline?看起来 func (b *bufio.Reader) ReadLine() (line []byte, isPrefix bool, err error) 具有专门针对您的用例的返回值 isPrefix http://golang.org/pkg/bufio/#Reader.ReadLine

关于go - 如何读取大型平面文件,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/29313133/

24 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com