Python廖雪峰学习--进程与线程

Python多线程与多进程：原理、实践与进程间通信

最新推荐文章于 2023-11-01 11:48:12 发布

原创最新推荐文章于 2023-11-01 11:48:12 发布 · 231 阅读

0 ·

CC 4.0 BY-SA版权

文章标签：

#学习

Python学习笔记专栏收录该内容

5 篇文章

订阅专栏

本文详细介绍了如何在Python中使用os模块的fork实现多进程，以及multiprocessing模块提供的Process和Pool类进行多进程编程。同时涵盖了多线程的使用，如线程的创建、同步与通信，以及如何通过threading模块和Lock进行线程安全操作。

1.多线程

要让Python程序实现多进程，我们先了解操作系统的相关知识。Unix/Linux操作系统提供了一个fork()系统调用，它非常特殊。普通函数，调用一次，返回一次，但是fork()调用一次，返回两次，因为操作系统自动把当前进程(称为父进程)复制了一份(称为子进程)，然后，分别在父进程和子进程内返回。

父进程永远返回0，而父进程返回子进程的ID。这样做的理由是，一个父进程可以fork出很多子进程，所以，父进程要记下每个子进程的ID，而子进程只需要调用getppid()就可以拿到父进程的ID。Python的os模块封装了常见的系统调用，其中就包括fork，可以在Python程序中轻松创建子进程：

import os

print('Process (%s) start...' % os.getpid())

pid = os.fork()
if pid == 0:
    print('I am child process (%s) and my parent is %s.' % (os.getpid(), os.getppid()))
else:
    print('I (%s) just created a child process (%s).' % (os.getpid(), pid))

有了fork调用，一个进程在接到新任务时就可以复制出一个子进程来处理新任务，常见的Apache服务器就是由父进程监听端口，每当有新的http请求时，就fork出子进程来处理新的http请求。由于Windows没有fork调用，上面的代码在Windows上无法运行。而Mac系统是基于BSD(Unix的一种)内核，所以，在Mac下运行是没有问题的，推荐大家用Mac学Python.

multiprocessing

如果你打算编写多进程的服务程序，Unix/Linux无疑是正确的选择。由于Windows没有fork调用，难道在Windows上无法用Python编写多进程的程序？

multiprocessing模块就是跨平台的多进程模块。multiprocessing模块提供了一个Process类来代表一个进程对象，下面的例子演示启动了一个子进程并等待其结束：

from multiprocessing import Process
import os

def run_proc(name):
    print('Run child process %s (%s)...' %(name, os.getpid()))

if _name_ == '_name_':
    print('Parent process %s.' % os.getpid())
    p = Process(target = run_proc, args = ('test',))
    print('Child process will start.')
    p.start()
    p.join()
    print('Child process end.')

创建子进程时，只需要传入一个执行函数和参数的参数，创建一个Process实例，用start()方法启动，这样创建进程比fork()还要简单。

join()方法可以等待子进程结束后再继续往下进行，通常用于进程间的同步。

Pool:

如果要启动大量的子进程，可以用进程池的方式批量创建子进程：

from multiprocessing improt Pool
import os, time, random

def long_time_task(name):
    print('Run task %s (%s)...', % (name, os.getpid()))
    start = time.time()
    time.sleep(random.random() * 3)
    end = time.time()
    print('Task %s runs %0.2f seconds.' % (name, (end - start)))

if _name_ == '_main_':
    print('Parent process %s.' % os.getpid())
    p = Pool(4)
    for i in range(5):
        p.apply_async(long_time_task, args =(i,))
    print('Waiting for all subprocesses done ...')
    p.close()
    p.join()
    print('All subprocesses done')

对Pool对象调用join()方法会等待所有子进程执行完毕，调用join()之前必须先调用close()，调用close()之后就不能继续添加新的Process了。

子进程：

很多时候，子进程并不是自身，而是一个外部进程。我们创建了子进程后，还需要控制子进程的输入和输出。

subprocess模块可以让我们非常方便地启动一个子进程，然后控制其输入和输出。如果子进程还需要输入，则可以通过communicate()方法输入。

进程间通信：

Process之间肯定是需要通信的，操作系统提供了很多机制来实现进程间的通信。Python的multiprocessing模块包装了底层的机制，提供了Queue、Pipes等多种方式来交换数据。我们以Queue为例，在父进程中创建了两个子进程，一个往Queue里写数据，一个从Queue里读数据：

2.多线程

多任务可以由多进程完成，也可以由一个进程内的多线程完成。我们前面提到了进程是由若干线程组成的，一个进程至少有一个线程。由于线程是操作系统直接支持的执行单元，因此，高级语言通常都内置多线程的支持，Python也不例外，并且，Python的线程是真正的Posix Thread，而不是模拟出来的线程。

Python的标准库提供了两个模块：_thread和threading，_thread是低级模块，threading是高级模块，对_thread进行了封装。绝大多数情况下，我们只需要使用threading这个高级模块。启动一个线程就是把一个函数传入并创建Thread实例，然后调用start()开始执行：

import time, threading

def loop():
    print('thread %s is running ...' % threading.current_thread().name)
    n = 0
    while n < 5:
        n = n + 1
        print('thread %s >>> %s' % (threading.current_thread().name, n))
        time.sleep(1)
    print('thread %s ended.' % threading.current_thread().name)

print('thread %s is running...', %threading.current_thread().name)
t = threading.Thread(target = loop, name = 'LoopThread')
t.start()
t.join()
print('thread %s ended.' % threading.current_thread().name)

由于任何进程默认就会启动一个线程，我们把该线程称为主线程，主线程又可以启动新的线程，Python的threading模块有个current_thread()函数，它永远返回当前线程的实例。主线程实例的名字叫MainThread，子线程的名字在创建时指定，我们用LoopThread命名子线程。名字仅仅在打印时用来显示，完全没有其他意义，如果不起名字Python就自动给线程命名为：Thread-1等

Lock:

多线程和多进程最大的不同在于，多进程中，同一个变量，各自有一份拷贝存在于每个进程中，互不影响，而多线程中，所有变量都由所有线程共享，所以，任何一个变量都有可能被任何一个进程修改，因此，线程之间共享数据最大的危险在于多个线程同时该一个变量，把内容给改乱了。

通过threading.Lock()来实现锁。

lock = threading.Lock()
lock.acquire() //获取锁
lock.release() //释放锁

当多个线程同时执行lock.acquire()时，只有一个线程能成功地获取锁，然后继续执行代码，其他线程就继续等待直到获得锁为止。获得锁的线程用完之后一定要释放锁，否则那些苦苦等待锁的线程将永远等待下去，成为死线程

3.ThreadLocal