Go 用 bufio.Scanner 读大文件踩坑:默认 64KB 行上限、Buffer 扩容与按 Token 切分

Go 用 bufio.Scanner 读大文件踩坑:默认 64KB 行上限、Buffer 扩容与按 Token 切分
Go 用 bufio.Scanner 读大文件踩坑:默认 64KB 行上限、Buffer 扩容与按 Token 切分用 Go 逐行读文件,几乎所有人第一反应都是bufio.Scanner,写法也确实优雅:scanner:bufio.NewScanner(file)forscanner.Scan(){line:scanner.Text()// 处理每一行}小文件跑得好好的,直到某天你的程序读一个日志文件突然「读一半就停了」,还不报 panic。你以为文件读完了,其实是撞上了bufio.Scanner一个藏得很深的默认限制:单行超过 64KB 它就悄悄停下,而且默认吞掉错误。这篇我们把这个坑和相关的用法讲透。复现:一行超过 64KB 就断先造一个「有一行特别长」的文件:packagemainimport(bufiofmtosstrings)funcmain(){// 写一个包含超长行的文件:100000 个 a 再换行longLine:strings.Repeat(a,100000)os.WriteFile(big.txt,[]byte(longLine\n第二行\n第三行\n),0644)f,_:os.Open(big.txt)deferf.Close()scanner:bufio.NewScanner(f)count:0forscanner.Scan(){countfmt.Printf(第 %d 行,长度 %d\n,count,len(scanner.Text()))}fmt.Println(读到的行数:,count)fmt.Println(scanner.Err():,scanner.Err())}运行结果:读到的行数: 0 scanner.Err(): bufio.Scanner: token too long看到了吗?一行都没读到。第一行 10 万字节超过了默认上限,Scan()直接返回false,循环根本没进去。更阴险的是:如果你没检查scanner.Err(),程序会「安静地」结束,你还以为文件是空的。第一个铁律:循环后必须检查 scanner.Err()for scanner.Scan()退出有两种原因:正常读完(EOF),或者出错。Scan()返回false时不区分这两者,你必须靠scanner.Err()判断:forscanner.Scan(){process(scanner.Text())}// 千万别漏这句:Scan 返回 false 可能是出错而非读完iferr:scanner.Err();err!nil{log.Fatalf(扫描出错: %v,err)}漏了这个检查,token too long、磁盘读错误全都被你无声吞掉。这是用bufio.Scanner最常见的 bug 根源。第二步:用 Buffer() 抬高上限知道了是行太长,解决办法是用scanner.Buffer()显式给一个更大的缓冲区:scanner:bufio.NewScanner(f)// 参数一:初始 buffer(可给 nil 让它自己分配)// 参数二:单个 token 允许的最大字节数buf:make([]byte,0,64*1024)// 初始 64KBscanner.Buffer(buf,1024*1024)// 上限抬到 1MBforscanner.Scan(){fmt.Println(len(scanner.Bytes()))}iferr:scanner.Err();err!nil{log.Fatal(err)}Buffer(buf, max)的第二个参数是这个 token 最多能占多少字节。默认值是bufio.MaxScanTokenSize,正好是 64KB(65536)。把它抬到 1MB,10 万字节的行就能读了。注意:Buffer必须在第一次Scan()之前调用,否则会 panic(Buffer called after Scan)。第三步:行真的可能无限长?换 bufio.Reader如果你无法预知行有多长(比如处理别人生成的、可能有几百 MB 一行的畸形数据),盲目把上限设成 1GB 是危险的——一行就把内存吃光。这种场景应该放弃Scanner,改用bufio.Reader.ReadString,它按需增长、不设死上限:reader:bufio.NewReader(f)for{line,err:reader.ReadString(\n)// 读到换行符为止iflen(line)0{process(strings.TrimRight(line,\n))}iferr!nil{iferrio.EOF{break// 正常读完}log.Fatal(err)// 真出错了}}ReadString(\n)和Scan()的关键区别:Scan()有 token 上限,超了报错;ReadString没有,能读多长读多长(代价是内存)。ReadString返回的line包含分隔符\n,得自己TrimRight掉。EOF 时ReadString可能同时返回「最后一段没有换行的内容」和io.EOF,所以要先处理line再判断err,顺序反了会丢最后一行。进阶:不止按行切,自定义 SplitFuncbufio.Scanner真正强大的地方是Split():它不止能按行切,还能按单词、按自定义规则切。内置几个:scanner.Split(bufio.ScanWords)// 按空白切成单词scanner.Split(bufio.ScanRunes)// 按 UTF-8 字符切scanner.Split(bufio.ScanBytes)// 按字节切比如统计一个文本有多少个单词,一行搞定:scanner:bufio.NewScanner(f)scanner.Split(bufio.ScanWords)words:0forscanner.Scan(){words}fmt.Println(单词数:,words)你甚至能写自己的分隔逻辑,比如按分号;切分 SQL 语句。SplitFunc的签名是func(data []byte, atEOF bool) (advance int, token []byte, err error),data是当前缓冲区,你返回「消费多少字节 advance」和「切出来的 token」:// 按分号切分funcscanSemicolons(data[]byte,atEOFbool)(int,[]byte,error){ifi:bytes.IndexByte(data,;);i0{returni1,data[:i],nil// 消费到分号后,token 是分号前的内容}ifatEOFlen(data)0{returnlen(data),data,nil// 文件末尾没有分号的最后一段}return0,nil,nil// 数据不够,要求 Scanner 再读一些}// 用法scanner.Split(scanSemicolons)注意SplitFunc里也受Buffer上限约束:如果单个 token(比如一条超长 SQL)超过上限,同样会token too long。小结bufio.Scanner默认单行/单 token 上限是64KB,超了Scan()直接返回false,一行都读不到。循环后必须if err : scanner.Err(); err ! nil,否则token too long和读错误会被无声吞掉——这是最常见的坑。行会超 64KB 但有上界:用scanner.Buffer(buf, max)抬高上限,且必须在第一次Scan()前调用。行长度不可预知:放弃 Scanner,改用bufio.Reader.ReadString(\n),按需增长、无死上限,但要自己TrimRight分隔符、先处理内容再判 EOF。Scanner.Split()能按单词/字符/自定义规则切分,写SplitFunc处理非行分隔的场景。一句话记忆:用 bufio.Scanner 读文件,永远记得两件事——检查scanner.Err(),以及问自己「这一行会不会超过 64KB」。