socket编程

一、客户端/服务器架构

1.硬件C/S架构(打印机)

2.软件C/S架构

  互联网中处处是C/S架构

  如网站是服务端,你的浏览器是客户端(B/S架构也是C/S架构的一种)

  腾讯作为服务端为你提供视频,你得下个腾讯视频客户端才能看它的视频

C/S架构与socket的关系:

我们学习socket就是为了完成C/S架构的开发

 

二 osi七层

引子:

须知一个完整的计算机系统是由硬件、操作系统、应用软件三者组成,具备了这三个条件,一台计算机系统就可以自己跟自己玩了(打个单机游戏,玩个扫雷啥的)

如果你要跟别人一起玩,那你就需要上网了,什么是互联网?

互联网的核心就是由一堆协议组成,协议就是标准,比如全世界人通信的标准是英语

如果把计算机比作人,互联网协议就是计算机界的英语。所有的计算机都学会了互联网协议,那所有的计算机都就可以按照统一的标准去收发信息从而完成通信了。

人们按照分工不同把互联网协议从逻辑上划分了层级,

详见网络通信原理:http://www.cnblogs.com/linhaifeng/articles/5937962.html

 

为何学习socket一定要先学习互联网协议:

1.首先:学会如何基于socket编程,来开发一款自己的C/S架构软件

2.其次:C/S架构的软件(软件属于应用层)是基于网络进行通信的

3.然后:网络的核心即一堆协议,协议即标准,你想开发一款基于网络通信的软件,就必须遵循这些标准。

4.最后:就让我们从这些标准开始研究,开启我们的socket编程之旅

                                                                   图1

三 socket层

 在图1中,我们没有看到Socket的影子,那么它到底在哪里呢?还是用图来说话,一目了然。

                                                                                   图2

 

四 socket是什么

Socket是应用层与TCP/IP协议族通信的中间软件抽象层,它是一组接口。在设计模式中,Socket其实就是一个门面模式,它把复杂的TCP/IP协议族隐藏在Socket接口后面,对用户来说,一组简单的接口就是全部,让Socket去组织数据,以符合指定的协议。

所以,我们无需深入理解tcp/udp协议,socket已经为我们封装好了,我们只需要遵循socket的规定去编程,写出的程序自然就是遵循tcp/udp标准的。

也有人将socket说成ip+port,ip是用来标识互联网中的一台主机的位置,而port是用来标识这台机器上的一个应用程序,ip地址是配置到网卡上的,而port是应用程序开启的,ip与port的绑定就标识了互联网中
独一无二的一个应用程序 而程序的pid是同一台机器上不同进程或者线程的标识

 

五 套接字发展史及分类

套接字起源于 20 世纪 70 年代加利福尼亚大学伯克利分校版本的 Unix,即人们所说的 BSD Unix。 因此,有时人们也把套接字称为“伯克利套接字”或“BSD 套接字”。一开始,套接字被设计用在同 一台主机上多个应用程序之间的通讯。这也被称进程间通讯,或 IPC。套接字有两种(或者称为有两个种族),分别是基于文件型的和基于网络型的。 

1. 基于文件类型的套接字家族

套接字家族的名字:AF_UNIX

unix一切皆文件,基于文件的套接字调用的就是底层的文件系统来取数据,两个套接字进程运行在同一机器,可以通过访问同一个文件系统间接完成通信

2. 基于网络类型的套接字家族

套接字家族的名字:AF_INET

(还有AF_INET6被用于ipv6,还有一些其他的地址家族,不过,他们要么是只用于某个平台,要么就是已经被废弃,或者是很少被使用,或者是根本没有实现,所有地址家族中,AF_INET是使用最广泛的一个,python支持很多种地址家族,但是由于我们只关心网络编程,所以大部分时候我么只使用AF_INET)

 

六 套接字工作流程

                                                              图3

 先从服务器端说起。服务器端先初始化Socket,然后与端口绑定(bind),对端口进行监听(listen),调用accept阻塞,等待客户端连接。在这时如果有个客户端初始化一个Socket,然后连接服务器(connect),如果连接成功,这时客户端与服务器端的连接就建立了。客户端发送数据请求,服务器端接收请求并处理请求,然后把回应数据发送给客户端,客户端读取数据,最后关闭连接,一次交互结束

socket模块用法

import socket
socket.socket(socket_family,socket_type,protocal=0)
#socket_family 可以是 AF_UNIX 或 AF_INET。socket_type 可以是 SOCK_STREAM 或 SOCK_DGRAM。protocol 一般不填,默认值为 0。

#获取tcp/ip套接字
tcpSock = socket.socket(socket.AF_INET, socket.SOCK_STREAM)

#获取udp/ip套接字
udpSock = socket.socket(socket.AF_INET, socket.SOCK_DGRAM)

#由于 socket 模块中有太多的属性。我们在这里破例使用了'from module import *'语句。使用 'from socket import *',我们就把 socket 模块里的所有属性都带到我们的命名空间里了,这样能大幅
减短我们的代码。
例如tcpSock = socket(AF_INET, SOCK_STREAM)

 

服务端套接字函数
s.bind() 绑定(主机,端口号)到套接字
s.listen() 开始TCP监听
s.accept() 被动接受TCP客户的连接,(阻塞式)等待连接的到来

客户端套接字函数
s.connect() 主动初始化TCP服务器连接
s.connect_ex() connect()函数的扩展版本,出错时返回出错码,而不是抛出异常

公共用途的套接字函数
s.recv() 接收TCP数据
s.send() 发送TCP数据(send在待发送数据量大于己端缓存区剩余空间时,数据丢失,不会发完)
s.sendall() 发送完整的TCP数据(本质就是循环调用send,sendall在待发送数据量大于己端缓存区剩余空间时,数据不丢失,循环调用send直到发完)
s.recvfrom() 接收UDP数据
s.sendto() 发送UDP数据
s.getpeername() 连接到当前套接字的远端的地址
s.getsockname() 当前套接字的地址
s.getsockopt() 返回指定套接字的参数
s.setsockopt() 设置指定套接字的参数
s.close() 关闭套接字

面向锁的套接字方法
s.setblocking() 设置套接字的阻塞与非阻塞模式
s.settimeout() 设置阻塞套接字操作的超时时间
s.gettimeout() 得到阻塞套接字操作的超时时间

面向文件的套接字的函数
s.fileno() 套接字的文件描述符
s.makefile() 创建一个与该套接字相关的文件

 

七 基于TCP的套接字

tcp是基于连接的,必须先启动服务端,然后再启动客户端去连接服务器。

1. tcp服务端

tcp_server = socket() #创建服务器套接字
tcp_server.bind()      #把地址绑定到套接字
tcp_server.listen()      #监听链接
inf_loop:      #服务器无限循环
    conn, addr  = tcp_server.accept() #接受客户端链接
    conn_loop:         #通讯循环
        conn.recv()/conn.send() #对话(接收与发送)
    conn.close()    #关闭客户端套接字
tcp_server.close()        #关闭服务器套接字(可选)

 

2. tcp客户端

tcp_client = socket()    # 创建客户套接字
tcp_client.connect()    # 尝试连接服务器
comm_loop:        # 通讯循环
     tcp_client.send()/tcp_client.recv()    # 对话(发送/接收)
tcp_client.close()            # 关闭客户套接字

 

 

3.  socket通信流程与打电话流程类似,我们就以打电话为例来实现一个简单的套接字通信

---------------------------服务端-------------------------------

import socket
ip_port=('127.0.0.1',9000)  #电话卡
BUFSIZE=1024                #收发消息的尺寸
s=socket.socket(socket.AF_INET,socket.SOCK_STREAM) #买手机
s.bind(ip_port) #手机插卡
s.listen(5)     #手机待机


conn,addr=s.accept()            #手机接电话
# print(conn)
# print(addr)
#print('接到来自%s的电话' %addr[0])

msg=conn.recv(BUFSIZE)             #听消息,听话
#print(msg,type(msg))

conn.send('詹姆斯fmvp'.encode('utf-8'))          #发消息,说话

conn.close()                    #挂电话

s.close()                       #手机关机


------------------------------客户端-------------------------------

import socket
ip_port=('127.0.0.1',9000)
BUFSIZE=1024
c=socket.socket(socket.AF_INET,socket.SOCK_STREAM)

c.connect_ex(ip_port)           #拨电话

c.send('湖人总冠军'.encode('utf-8'))         #发消息,说话(只能发送字节类型)

feedback=c.recv(BUFSIZE)                           #收消息,听话
print(feedback.decode('utf-8'))

c.close()                                       #挂电话

 

 

4.加上连接循环与通信循环

---------------------------服务端-------------------------------

import socket
ip_port=('127.0.0.1',9000)  #电话卡
BUFSIZE=1024                #收发消息的尺寸
s=socket.socket(socket.AF_INET,socket.SOCK_STREAM) #买手机
s.bind(ip_port) #手机插卡
s.listen(5)     #手机待机

while Ture:      #新增接收链接循环,可以不停的接电话
    conn, addr=s.accept()            #手机接电话
    # print(conn)
    # print(addr)
    #print('接到来自%s的电话' %addr[0])
    
    while Ture:       #新增通信循环,可以不断的通信,收发消息
        try:          #新增异常处理,当连接的客户端断开时,触发异常进入下一次连接循环
            msg=conn.recv(BUFSIZE)             #听消息,听话
            #print(msg,type(msg))

           conn.send('詹姆斯fmvp'.encode('utf-8'))          #发消息,说话
        expect Expection:
            break
        
        conn.close()                    #挂电话

s.close()                       #手机关机


------------------------------客户端-------------------------------

import socket
ip_port=('127.0.0.1',9000)
BUFSIZE=1024
c=socket.socket(socket.AF_INET,socket.SOCK_STREAM)

c.connect(ip_port)           #拨电话

while Ture:         #新增通信循环,客户端可以不断发收消息
    msg = input('>>:').strip()
    if not msg:    
        continue
    c.send(msg.encode('utf-8'))         #发消息,说话(只能发送字节类型)

    feedback=c.recv(BUFSIZE)                           #收消息,听话
    print(feedback.decode('utf-8'))

c.close()                                       #挂电话        

 

5. 问题

在重启服务端时可能会遇到

这个是由于服务端仍然存在四次挥手的time_wait状态在占用地址

解决方法:

#加入一条socket配置,重用ip和端口

phone=socket(AF_INET,SOCK_STREAM)
phone.setsockopt(SOL_SOCKET,SO_REUSEADDR,1) #就是它,在bind前加
phone.bind(('127.0.0.1',8080))

 

八 基于UDP的套接字

 udp是无连接的,先启动哪一端都不会报错

1. udp服务端

udp_server= socket()   #创建一个服务器的套接字
udp_server.bind()       #绑定服务器套接字
inf_loop:       #服务器无限循环
    msg = udp_server.recvfrom()/udp_server.sendto() # 对话(接收与发送)
udp_server.close()                         # 关闭服务器套接字

 

2. udp客户端

udp_client = socket()   # 创建客户套接字
comm_loop:      # 通讯循环
    udp_client.sendto()/udp_client.recvfrom()   # 对话(发送/接收)
udp_client.close()                      # 关闭客户套接字

 

 

3. udp套接字简单示例

---------------------------服务端-------------------------------

from socket import *
ip_port = ('127.0.0.1', 8080)
buffer_size = 1024

udp_server = socket(AF_INET, SOCK_DGRAM)  #数据报
udp_server.bind(ip_port)

while True:
    data, addr = udp_server.recvfrom(buffer_size)
    print(data)

    udp_server.sendto(data.upper(), addr)


---------------------------客户端----------------------------------

from socket import *
ip_port = ('127.0.0.1', 8080)
buffer_size = 1024

udp_client = socket(AF_INET, SOCK_DGRAM)  #数据报

while True:
    msg = input('>>:')
    udp_client.sendto(msg.encode('utf-8'), ip_port)

    data, addr = udp_client.recvfrom(buffer_size)
    print(data.decode('utf-8'))

 

 

4. 简单应用:时间服务器

----------------------------服务端-----------------------------

from socket import *
import time
ip_port = ('127.0.0.1', 8081)
buffer_size = 1024

udp_server = socket(AF_INET, SOCK_DGRAM)  #数据报
udp_server.bind(ip_port)

while True:
    data, addr = udp_server.recvfrom(buffer_size)
    print(data)

    back_time = time.strftime('%Y-%m-%d %X')
    udp_server.sendto(back_time.encode('utf-8'), addr)



------------------------------客户端---------------------------------

from socket import *
ip_port = ('127.0.0.1', 8081)
buffer_size = 1024

udp_client = socket(AF_INET, SOCK_DGRAM)  #数据报

while True:
    msg = input('>>:')
    udp_client.sendto(msg.encode('utf-8'), ip_port)

    data, addr = udp_client.recvfrom(buffer_size)
    print('NTP服务器的标准时间是', data.decode('utf-8'))

 

九 粘包现象

基于tcp先制作一个远程执行命令的程序(1:执行错误命令 2:执行dir 3:执行ifconfig)

注意:

res=subprocess.Popen(cmd.decode('utf-8'),
shell=True,
stderr=subprocess.PIPE,
stdout=subprocess.PIPE)

的结果的编码是以当前所在的系统为准的,如果是windows,那么res.stdout.read()读出的就是GBK编码的,在接收端需要用GBK解码

且只能从管道里读一次结果

注意:命令dir ; lllllll ; pwd 的结果是既有正确stdout结果,又有错误stderr结果

1. 基于tcp的socket,在运行时会发生粘包

-------------------------------服务端-----------------------------------

from socket import *
import subprocess
ip_port = ('127.0.0.1', 8082)
size = 1024
back_log = 5
s = socket(AF_INET, SOCK_STREAM)
s.bind(ip_port)
s.listen(back_log)

while True:
    conn, addr = s.accept()
    try:
        while True:
            msg = conn.recv(size)
            if not msg:
                break
            handle = subprocess.Popen(msg.decode('utf-8'),shell=True,
                                      stdout=subprocess.PIPE,
                                      stdin=subprocess.PIPE,
                                      stderr=subprocess.PIPE)
            err = handle.stderr.read()
            if err:
                back_handle = err
            else:
                back_handle = handle.stdout.read()
            if not back_handle:
                conn.send('执行成功'.encode('gbk'))
            conn.send(back_handle)
    except Exception:
        break


    conn.close()

s.close()


----------------------------------客户端-------------------------------------

from socket import *
ip_port = ('127.0.0.1', 8082)
size = 1024
c = socket(AF_INET, SOCK_STREAM)

c.connect(ip_port)

while True:
    data = input('>>:').strip()
    if not data:
        continue
    if data =='quit':
        break
    c.send(data.encode('utf-8'))
    msg = c.recv(size)

    print('命令的执行结果是', msg.decode('gbk'))

c.close()

 

 

2. 基于udp的远程执行命令的程序,在运行时不会粘包

-------------------------------服务端---------------------------------

from socket import *
import subprocess
ip_port = ('127.0.0.1', 8082)
size = 1024
s = socket(AF_INET, SOCK_DGRAM)
s.bind(ip_port)


while True:
    conn, addr = s.recvfrom(size)

    try:

        handle = subprocess.Popen(conn.decode('utf-8'), shell=True,
                                  stdout=subprocess.PIPE,
                                  stdin=subprocess.PIPE,
                                  stderr=subprocess.PIPE)
        err = handle.stderr.read()
        if err:
            back_handle = err
        else:
            back_handle = handle.stdout.read()
        if not back_handle:
            back_handle = '执行成功'.encode('gbk')
        s.sendto(back_handle, addr)

    except Exception:
        break


-------------------------------客户端--------------------------------------
from socket import *
ip_port = ('127.0.0.1', 8082)
size = 1024
c = socket(AF_INET, SOCK_DGRAM)


while True:
    data = input('>>:').strip()
    if not data:
        continue
    if data == 'quit':
        break
    c.sendto(data.encode('utf-8'), ip_port)
    msg, addr = c.recvfrom(size)

    print('命令的执行结果是', msg.decode('gbk'))

c.close()

 

十 什么是粘包

须知:只有TCP有粘包现象,UDP永远不会粘包

 

1. socket收发消息的原理:

发送端可以是一K一K地发送数据,而接收端的应用程序可以两K两K地提走数据,当然也有可能一次提走3K或6K数据,或者一次只提走几个字节的数据,也就是说,应用程序所看到的数据是一个整体,或说是一个流(stream),一条消息有多少字节对应用程序是不可见的,因此TCP协议是面向流的协议,这也是容易出现粘包问题的原因。而UDP是面向消息的协议,每个UDP段都是一条消息,应用程序必须以消息为单位提取数据,不能一次提取任意字节的数据,这一点和TCP是很不同的。怎样定义消息呢?可以认为对方一次性write/send的数据为一个消息,需要明白的是当对方send一条信息的时候,无论底层怎样分段分片,TCP协议层会把构成整条消息的数据段排序完成后才呈现在内核缓冲区。

例如基于tcp的套接字客户端往服务端上传文件,发送时文件内容是按照一段一段的字节流发送的,在接收方看了,根本不知道该文件的字节流从何处开始,在何处结束

所谓粘包问题主要还是因为接收方不知道消息之间的界限,不知道一次性提取多少字节的数据所造成的。

此外,发送方引起的粘包是由TCP协议本身造成的,TCP为提高传输效率,发送方往往要收集到足够多的数据后才发送一个TCP段。若连续几次需要send的数据都很少,通常TCP会根据优化算法把这些数据合成一个TCP段后一次发送出去,这样接收方就收到了粘包数据。

  1. TCP(transport control protocol,传输控制协议)是面向连接的,面向流的,提供高可靠性服务。收发两端(客户端和服务器端)都要有一一成对的socket,因此,发送端为了将多个发往接收端的包,更有效的发到对方,使用了优化方法(Nagle算法),将多次间隔较小且数据量小的数据,合并成一个大的数据块,然后进行封包。这样,接收端,就难于分辨出来了,必须提供科学的拆包机制。 即面向流的通信是无消息保护边界的。
  2. UDP(user datagram protocol,用户数据报协议)是无连接的,面向消息的,提供高效率服务。不会使用块的合并优化算法,, 由于UDP支持的是一对多的模式,所以接收端的skbuff(套接字缓冲区)采用了链式结构来记录每一个到达的UDP包,在每个UDP包中就有了消息头(消息来源地址,端口等信息),这样,对于接收端来说,就容易进行区分处理了。 即面向消息的通信是有消息保护边界的。
  3. tcp是基于数据流的,于是收发的消息不能为空,这就需要在客户端和服务端都添加空消息的处理机制,防止程序卡住,而udp是基于数据报的,即便是你输入的是空内容(直接回车),那也不是空消息,udp协议会帮你封装上消息头,实验略

udp的recvfrom是阻塞的,一个recvfrom(x)必须对唯一一个sendto(y),收完了x个字节的数据就算完成,若是y>x数据就丢失,这意味着udp根本不会粘包,但是会丢数据,不可靠

tcp的协议数据不会丢,没有收完包,下次接收,会继续上次继续接收,己端总是在收到ack时才会清除缓冲区内容。数据是可靠的,但是会粘包。

 

2. 粘包发生的情况

(1)发送端需要等缓冲区满才发送出去,造成粘包(发送数据时间间隔很短,数据了很小,会合到一起,产生粘包)

(2)接收方不及时接收缓冲区的包,造成多个包接收(客户端发送了一段数据,服务端只收了一小部分,服务端下次再收的时候还是从缓冲区拿上次遗留的数据,产生粘包) 

 

3.拆包的发生情况

当发送端缓冲区的长度大于网卡的MTU时,tcp会将这次发送的数据拆成几个数据包发送出去。

 

4.补充问题一:为何tcp是可靠传输,udp是不可靠传输

基于tcp的数据传输参考另一篇文章http://www.cnblogs.com/linhaifeng/articles/5937962.html,tcp在数据传输时,发送端先把数据发送到自己的缓存中,然后协议控制将缓存中的数据发往对端,对端返回一个ack=1,发送端则清理缓存中的数据,对端返回ack=0,则重新发送数据,所以tcp是可靠的而udp发送数据,对端是不会返回确认信息的,因此不可靠。

tcp的三次握手与四次挥手

5. 补充问题二:send(字节流)和recv(1024)及sendall

recv里指定的1024意思是从缓存里一次拿出1024个字节的数据

send的字节流是先放入己端缓存,然后由协议控制将缓存内容发往对端,如果待发送的字节流大小大于缓存剩余空间,那么数据丢失,用sendall就会循环调用send,数据不会丢失

 

十一 解决粘包的初级处理方法

问题的根源在于,接收端不知道发送端将要传送的字节流的长度,所以解决粘包的方法就是围绕如何让发送端在发送数据前,把自己将要发送的字节流总大小让接收端知晓,然后接收端来一个死循环接收完所有数据。

初级解决方法

-----------------------------------服务端--------------------------------------------

from socket import *
import subprocess
ip_port = ('127.0.0.1', 8080)
back_log = 5
buffer_size = 1024

tcp_server = socket(AF_INET, SOCK_STREAM)
tcp_server.bind(ip_port)
tcp_server.listen(back_log)

while True:
    conn, addr = tcp_server.accept()

    while True:
        try:
            cmd = conn.recv(buffer_size)
            if not cmd:
                break
            print('收到客户端的命令', cmd)

            # 执行命令,得到命令的运行结果是cmd_res
            res = subprocess.Popen(cmd.decode('utf-8'), shell=True,
                                   stderr=subprocess.PIPE,
                                   stdin=subprocess.PIPE,
                                   stdout=subprocess.PIPE)
            err = res.stderr.read()
            if err:
                cmd_res = err
            else:
                cmd_res = res.stdout.read()

            if not cmd_res:
                cmd_res = '执行成功'.encode('gbk')

            length = len(cmd_res)
            conn.send(str(length).encode('utf-8'))
            client_ready = conn.recv(buffer_size)
            if client_ready == b'ready':
                conn.send(cmd_res)

        except Exception:
            break

    conn.close()

tcp_server.close()



-------------------------------------客户端-------------------------------------------

from socket import *
ip_port = ('127.0.0.1', 8080)
back_log = 5
buffer_size = 1024

tcp_client = socket(AF_INET, SOCK_STREAM)
tcp_client.connect(ip_port)

while True:
    cmd = input('>>:').strip()
    if not cmd:
        continue
    if cmd == 'quit':
        break

    tcp_client.send(cmd.encode('utf-8'))
    #解决粘包
    length_recv = tcp_client.recv(buffer_size)
    tcp_client.send(b'ready')

    length = int(length_recv.decode('utf-8'))

    recv_size = 0
    recv_msg = b''
    while recv_size < length:
        recv_msg += tcp_client.recv(buffer_size)
        recv_size = len(recv_msg)

    print('命令的执行结果是', recv_msg.decode('gbk'))

tcp_client.close()

 此方法没有实用性的原因:程序的运行速度远快于网络传输速度,所以在发送一段字节前,先用send去发送该字节流长度,这种方式会放大网络延迟带来的性能损耗

 

 十二、解决粘包的高阶方法

为字节流加上自定义固定长度报头,报头中包含字节流长度,然后将字节流与报头一次性send到对端,对端在接收时,先从缓存中取出定长的报头,然后再取真实数据。

先来引入struct模块

该模块可以把一个类型,如数字,转成固定长度的bytes

>>> struct.pack('i',1111111111111)

 

 

 

posted @ 2019-05-08 15:09  sword23  阅读(126)  评论(0编辑  收藏  举报