当用python读取几十万行文本时

最新推荐文章于 2025-05-22 21:42:37 发布

accumulate_zhang

最新推荐文章于 2025-05-22 21:42:37 发布

阅读量4.6k

点赞数

CC 4.0 BY-SA版权

分类专栏： word2vec

本文链接：https://blog.youkuaiyun.com/accumulate_zhang/article/details/52705382

word2vec 专栏收录该内容

7 篇文章

订阅专栏

本文介绍了一种在Python中处理大型文件的方法，通过分批读取文件内容并筛选关键词对应的行，有效避免了内存溢出问题。此外还讨论了可能的优化方案如使用多线程。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

我在使用python读取几十万行的文件中的数据，并构造字典，列表等数据结构时，再访问字典，列表时，一般都会出现内存不够的问题，然后只能循环读取几百行或者一定数量的行数来循环操作。

keyword_list=[line.strip() for line in open("keywords.txt",'r')]
#f1=open("part_wiki_vec.txt",'r')
f1=open("wiki_vectors.txt")
f2=open("result.txt",'w')
i=0


content=f1.readlines()
while i<1150:
    for line in content[300*i:300*(i+1)]:
        line=line.strip().split(' ')
        if line[0] in keyword_list:
            wordvec=' '.join(line)
            print wordvec
            f2.write(wordvec)
        #print line
    i+=1

我是这样读取的？

应该还有很多好的方法，比如多线程等等。

做此记录只为了学习，O(∩_∩)O谢谢，不喜勿喷！

2016.9.29 @zixiaozhang