ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Python 多线程与多进程并发编程实战

Python 多线程与多进程并发编程实战 Python 并发编程绕不开 GIL很多人被它坑过。这篇讲清多线程、多进程怎么选、怎么写附爬虫和 CPU 密集型两个实战例子。一、多线程IO 密集型用 threadimportthreadingimporttimedefdownload(url):print(f开始下载:{url})time.sleep(2)# 模拟网络请求IO等待print(f下载完成:{url})# 串行 6 秒# 多线程并发 2 秒starttime.time()threads[]foriinrange(3):tthreading.Thread(targetdownload,args(furl-{i},))t.start()threads.append(t)fortinthreads:t.join()# 等所有线程结束print(f耗时:{time.time()-start:.1f}秒)# 输出: 耗时约 2.0 秒线程池版本更推荐fromconcurrent.futuresimportThreadPoolExecutor urls[furl-{i}foriinrange(10)]withThreadPoolExecutor(max_workers5)aspool:# 提交任务返回 Futurefutures[pool.submit(download,url)forurlinurls]forfinfutures:f.result()# 阻塞等结果异常会在这里抛出二、GIL 是什么必考GIL 全局解释器锁 Python 同一时刻只有一个线程在执行 Python 字节码 → 多线程无法利用多核 CPU 为什么有 GIL CPython 内存管理引用计数不是线程安全的 加 GIL 最简单牺牲并行换安全 影响 多线程对 IO 密集型有效线程等待IO时释放GIL 多线程对 CPU 密集型无效只在一个核上跑验证 GIL# CPU 密集型任务多线程反而更慢defcompute(n):returnsum(i*iforiinrange(n))# 串行 vs 多线程CPU 密集型下多线程没有优势# 因为 GIL 让线程轮流占用 CPU还有切换开销三、多进程CPU 密集型用 ProcessfrommultiprocessingimportProcess,cpu_countimportosdefheavy_task(n):CPU 密集型大量计算result0foriinrange(n):resulti*iprint(f进程{os.getpid()}计算完成:{result})returnresultif__name____main__:processes[]foriinrange(cpu_count()):# 进程数 CPU核数pProcess(targetheavy_task,args(5_000_000,))p.start()processes.append(p)forpinprocesses:p.join()每个进程有独立的解释器和 GIL → 真正利用多核。但注意进程间不共享内存传数据用队列。四、进程池 队列传数据frommultiprocessingimportPool,Queueimportmultiprocessingdefworker(item):returnitem*itemdefmain():# 进程池自动管理多个进程withPool(4)aspool:resultspool.map(worker,range(10))print(results)# [0, 1, 4, 9, ...]# 进程间通信用 Queueqmultiprocessing.Queue()q.put(数据)print(q.get())if__name____main__:main()五、异步 asyncio更高的 IO 并发IO 密集还能用协程单线程也能上万并发importasyncioasyncdeffetch(url):print(f请求:{url})awaitasyncio.sleep(1)# 模拟IO协程挂起不占线程returnf数据:{url}asyncdefmain():tasks[fetch(furl-{i})foriinrange(5)]resultsawaitasyncio.gather(*tasks)print(results)asyncio.run(main())# 5个请求 1 秒完成并发单线程六、怎么选核心结论任务类型方案原因IO 密集型爬虫/请求/读写多线程 / asyncio等待IO时让出CPUGIL不影响CPU 密集型计算/压缩/加密多进程 ProcessPool绕开GIL真正用多核简单高并发IOasyncio 协程单线程上万并发资源占用最小# 推荐concurrent.futures 统一接口fromconcurrent.futuresimportProcessPoolExecutor,ThreadPoolExecutor# IO 密集 → 线程池withThreadPoolExecutor(max_workers10)aspool:...# CPU 密集 → 进程池withProcessPoolExecutor(max_workers4)aspool:...真实爬虫场景最佳实践importrequestsfromconcurrent.futuresimportThreadPoolExecutordefcrawl(url):resprequests.get(url,timeout5)returnlen(resp.content)urls[https://example.com/str(i)foriinrange(100)]withThreadPoolExecutor(max_workers20)aspool:# 20个并发请求sizeslist(pool.map(crawl,urls))print(f总下载量:{sum(sizes)}字节)# 100个请求从串行100秒 → 并发约5秒总结Python 并发选择一句话IO 密集用线程CPU 密集用进程超高并发用协程。多线程 threading → IO 等待时切线程适合爬虫 多进程 multiprocessing → 绕开 GIL适合计算 协程 asyncio → 单线程高并发最轻量记住 GIL 的坑CPU 密集别用多线程再配合concurrent.futures统一接口并发代码就能写得又快又稳。 觉得有用的话点赞 关注【张老师技术栈】吧
返回列表