一.以太网
图示如下:
两个不同局域网的主机传递数据并不是直接传递的,而是通过路由器 “一跳一跳” 地转发过去。跨网络传输的本质:是无数个局域网(子网)逐级转发、接力完成的结果。所以,要理解数据跨网络转发原理,就要先弄明白一个局域网内部的数据是如何转发的,而这套机制就是以太网协议。
在同一个局域网内的两台主机,是可以直接互相通信的。
举例:局域网通信就好比老师上课点名喊 “张三”。所有同学都能听到这句话,但大家一听发现喊的不是自己,就直接忽略;只有张三会认真回应老师这条消息。这样一来,老师和张三的交流,就相当于一对一的直接通信。
- “以太网” 并不是某种具体的网络,而是一种技术标准。它既涵盖了数据链路层的内容,也涉及物理层的规范,共同定义了同一局域网内设备之间如何传递数据帧。
- 例如以太网中的网线必须使用双绞线,传输速率有 10M,100M,1000M 等。
- 以太网是当前应用最广泛的局域网技术,和以太网并列的还有令牌环网,无线 LAN 等。
1.以太网帧格式
就是局域网两台主机之间通信必须要封装 MAC 帧。
如下图所示:
- 源地址和目的地址是指网卡的硬件地址(也叫 MAC 地址),长度是 48 位,是在网卡出厂时固化的。
- 帧协议类型字段有三种值,分别对应 IP 协议、ARP 协议和 RARP 协议。
- 帧末尾是 CRC 校验码。
用红色圈出来的部分就是报头部分。中间的则是数据部分,数据部分包含上层的报头加有效载荷(HTTP、TCP、IP 的封装)。
2.MAC 帧将报头与有效载荷进行分离和向上交付
问题如下:
如何将报头与有效载荷分离呢?
MAC 帧依靠定长的帧头完成分离。直接取出前面 14 字节帧头与末尾 4 字节 CRC 校验,剩下的部分就是有效载荷。
向上交付给哪个协议?
MAC 帧的帧头包含 2 字节的类型字段。在完成报头与有效载荷的分离之后,就可以根据这个类型字段,把有效载荷交付给对应的上层协议
3.认识 MAC 地址
局域网通信,每台主机都要有自己的唯一标识(虚拟机中的 MAC 地址不是真实的 MAC 地址,可能会冲突,也有些网卡支持用户配置 MAC 地址),每一台机器都要配一张网卡,每一个网卡都有一个序列号,这个序列号就是该网卡的 MAC 地址,用来识别数据链路层中相连的节点,在全球范围内具有唯一性(其实在局域网内保证唯一性就够了),长度为 48 位(6 个字节),一般用 16 进制数字加上冒号的形式来表示(例如:08:00:27:03:fb:19)。
细节:MAC 地址在网卡出厂时就确定了,不能修改。
4.局域网转发原理(基于协议)
那现在我们假设现在要 MAC 1发送数据给 MAC7,那么首先就需要封装一个 MAC 帧。
每台主机的数据链路层都会收到这个 MAC 帧,接着完成报头与有效载荷的分离,然后查看帧头里的目的 MAC 地址。如果目的 MAC 不是本机,就直接丢弃该数据帧,上层协议完全感知不到收到过这个帧;如果目的 MAC 是自己,就把分离出来的有效载荷向上交付给上层。
处理完成之后,MAC7 会向 MAC1 发送应答帧。
发送的过程同上。
得出结论:其实局域网所有的主机都能收到 MAC 帧,只不过如果目标 MAC 地址不等于自己的 MAC 地址,就直接在数据链路层丢弃掉。
由此在局域网中,网卡存在一种混杂模式:开启后网卡不会丢弃任何收到的数据帧,会把所有帧全部向上交付,这就是局域网抓包工具的底层原理。由此也能看出 HTTPS 对数据加密的必要性。
(1)数据碰撞
由于以太网内所有主机共享同一条通信信道,多台主机如果同时发送数据,报文之间就会产生碰撞。
举例:在教室里面老师想要和李四对话,但所有人都在同时交谈,导致李四听不到老师的声音。 解决方法:同一时刻只允许一台主机发送数据。
如何保证我在发送数据时,别人也想发送数据的场景?
两种方法:
- 令牌环:谁拿到令牌谁就可以发送消息,可以类比互斥锁。
- 以太网:如果检测到发生碰撞,就暂停发送数据,发送主机等待一段随机时间后再重新尝试发送。该机制称为碰撞检测与碰撞避免算法。
如果持续向局域网发送大量垃圾数据,并且不执行碰撞检测与碰撞避免,就会造成局域网内所有主机无法正常通信。
因此可以把局域网当成一个临界资源,依靠碰撞检测 + 碰撞避免机制,保证任意时刻最多只有一台主机发送消息。
局域网中的主机越多越好,还是越少越好呢?
答案是:越少越好。
局域网发送数据帧的时候,数据帧是越长越好,还是越短越好呢?
不能单纯越长或者越短。帧太长更容易引发碰撞;但如果帧过短,单次能够携带的数据量太少,所以不能太短。
(2)交换机
如果局域网过大,就会导致碰撞的概率增加,所以就出现了交换机
交换机具备碰撞检测能力,一旦某个端口检测到局部碰撞,就不会把这份受损数据转发出去。
举个例子,交换机左侧发生碰撞时,并不会干扰到 MAC3 向 MAC4 发送数据。
同样地,交换机对正常发送的数据也不会盲目转发。比如 MAC1 要发消息给 MAC5,就没必要让交换机右侧也收到这份数据,右侧发生碰撞的概率自然就降低了。
所以说,交换机的核心作用就是:把碰撞域隔离开来。
5.对比理解 MAC 地址和 IP 地址
- IP 地址标记的是数据传输全程的起点和终点。 MAC 地址标记的是路途里每一跳的起点和终点。
- IP 是最终要抵达的大目标,MAC 是一步步完成大目标的每个小目标。
所以数据在路由转发过程中,源 IP 地址和目的 IP 地址可以理解为固定不变的,而数据每经过一跳,它的源 MAC 地址和目的 MAC 地址都会发生变化。
6.认识 MTU
MTU 即最大传输单元,指的是底层数据帧单次最多可以承载的数据量,这个限制由数据链路层对应的物理层标准决定。以太网的 MTU 通常为 1500 字节,不同类型的网络,MTU 取值也各不相同。
如果一个数据包从以太网转发到拨号链路,且数据包长度超过了拨号链路的 MTU,就需要对这个数据包进行分片处理。
MAC 帧规定有效载荷的长度范围为 46~1500 字节。当 ARP 数据包长度不足 46 字节时,要在末尾补上填充位来补齐长度。
我们可以把 MTU 看作发快递时对包裹的大小限制,不同的数据链路层标准,对应的 MTU 也不一样。
(1)MTU 对 IP 协议的影响
受数据链路层 MTU 的限制,如果 IP 层一次要发送的字节数超过了 MTU,就必须进行分片。
具体做法是:
- 把较大的 IP 包拆成多个小包,并给每个小包打上标记。所有小包的 IP 协议头中,16 位标识(id)字段的值都相同,用来表明它们原本属于同一个包。
- 每个小包的 IP 协议头里还有一个 3 位标志字段:其中第 2 位固定为 0,表示允许分片;第 3 位用作结束标记,当前小包是最后一个就置为 1,否则置为 0。
- 这些小包到达对端后,会按顺序重新组装,拼回原来的完整数据包,再交给传输层。只要其中任意一个小包丢失,接收端的重组就会失败。需要注意的是,IP 层本身不负责重传数据
简单补充:数据在路由器转发过程中也可能被切分,因为不同网络的 MTU 大小不一样。为此,可以把 IP 协议头中的“不可分片”字段置为 1。这样一来,如果转发途中遇到 MTU 较小的网络,路由器就会直接丢弃该数据包,让发送端重新发送并重新选择路径,最终选出一条吞吐量更大的路径。
(2)MTU 对 UDP 协议的影响
UDP 携带的数据一旦超过 1472 字节(即 1500 − 20(IP 首部)− 8(UDP 首部)),就会在网络层被拆成多个 IP 数据报。
这些 IP 数据报中只要有任意一个丢失,接收端网络层的重组就会失败。换句话说,一旦 UDP 数据报在网络层发生分片,整个数据报丢失的概率就会大幅上升。
(3)MTU 对 TCP 协议的影响
TCP 作为传输控制协议,需要把有效载荷数据控制在一定阈值以内,这个阈值同样受制于 MTU。TCP 单个数据报的最大消息长度,称为 MSS(Max Segment Size,最大报文段长度)。
TCP 在建立连接的过程中,通信双方会进行 MSS 协商。最理想的情况是,MSS 的值恰好等于 IP 层不会被分片处理的最大长度,而这个长度依然受制于数据链路层的 MTU。
MAC 帧的有效载荷上限是 MTU,TCP 的有效载荷上限是 MSS。由于 TCP 和 IP 在常规情况下首部长度都是 20 字节,所以一般有 MSS = MTU − 20 − 20。MTU 通常为 1500 字节,因此 MSS 通常为 1460 字节。所以一般建议 TCP 把发送的数据控制在 1460 字节以内,这样就能降低数据被分片的可能性。
这也解释了为什么滑动窗口范围内会有多个报文段,却不能一次性全部发出去——因为单次发送的数据段大小是有上限的。
双方在发送 SYN 时,会在 TCP 头部写入自己能够支持的 MSS 值;双方得知对方的 MSS 值后,取其中较小的一个作为最终 MSS。
如何减少分片?
只要传输层控制好每次交给 IP 层的数据量,不让它太大,数据到了 IP 层自然就不需要分片。
如果 UDP 和 TCP 携带的数据过大、超过了 MTU,对 UDP 来说就是直接丢包,对 TCP 来说就是触发数据重传。由此可以看出,分片是不好的。
(4)MSS 和 MTU 的关系
(5)查看硬件地址和 MTU
继续使用 ifconfig 命令,即可查看 ip 地址,mac 地址和 MTU:
二.ARP 协议
注意:ARP 并不是一个单纯的数据链路层协议,而是一个介于数据链路层和网络层之间的协议。
1.ARP 协议的作用
当位于不同子网的两台主机 A 和 B 通信时,数据最终会先送到主机 B 所在局域网中的路由器 D。我们知道,D 和 B 属于同一个局域网,因此它们之间必须封装成 MAC 帧来通信。但此时报文中只包含 B 的 IP 地址,并不知道 B 的 MAC 地址。这就需要有一个过程,让路由器获取到主机 B 的 MAC 地址。
ARP 协议的作用,就是建立主机 IP 地址与 MAC 地址之间的映射关系——根据 IP 地址来获取目标主机的 MAC 地址。
在网络通信时,源主机的应用程序知道目的主机的 IP 地址和端口号,却不知道目的主机的硬件地址。数据包首先由网卡接收,再交给上层协议处理;如果收到的数据包中硬件地址与本机不符,就会直接被丢弃。因此在通信之前,必须先获得目的主机的硬件地址。
2.ARP 协议的工作流程
举例:现在在一个教室上课,老师第一次来,不认识每个学生,只知道每个人的学号。那么老师怎么知道每个人的姓名呢?——可以直接叫学号,然后得到这名同学的回应,也就建立了学号和姓名之间的映射关系。
当路由器收到数据、要发送给目标主机时,就会封装 ARP 报文并广播出去,寻找匹配的目标 IP。目标主机收到 ARP 请求后,会封装一个 ARP 应答,应答中包含自己的 MAC 地址。由此路由器就知道了目标主机的 MAC 地址,然后才会把数据包封装成 MAC 帧进行发送。
- 源主机发出 ARP 请求,询问“IP 地址是 192.168.0.1 的主机的硬件地址是多少”,并将这个请求广播到本地网段(以太网帧首部的硬件地址填 FF:FF:FF:FF:FF:FF,表示广播)。
- 目的主机接收到广播的 ARP 请求后,发现其中的 IP 地址与本机相符,就发送一个 ARP 应答数据包给源主机,将自己的硬件地址填写在应答包中。
- 每台主机都维护一个 ARP 缓存表,可以用 arp -a 命令查看。缓存表中的表项有过期时间(一般为 20 分钟),如果 20 分钟内没有再次使用某个表项,则该表项失效,下次还要发送 ARP 请求来获得目的主机的硬件地址。
(1)ARP 的请求过程
我们假设现在路由器 A 构建 ARP 请求发送给 B。
构建 ARP 请求:
- 硬件类型字段表示链路层的网络类型,取值为 1 时代表以太网。
- 协议类型字段表示要转换的地址类型,取值为 0x0800 时代表 IP 地址。
- 硬件地址长度字段:以太网地址为 6 字节,因为 MAC 地址是 48 位的。
- 协议地址长度字段:IP 地址为 4 字节,因为 IP 地址是 32 位的。
- op 字段取值为 1 时表示 ARP 请求,取值为 2 时表示 ARP 应答。
以太网地址和发送端 IP 地址,对应就是路由器 A 的 MAC 地址和 IP 地址。
目的以太网地址和目的 IP 地址,对应就是主机 B 的 MAC 地址和 IP 地址,因为不知道主机 B 的 MAC 地址,所以填全 F。
但是这个报文实际上是在 ARP 层封装的:
报文要先向下交付数据链路层进行封装才会发送到局域网。
因此现在需要添加以太网帧的报头:
- 目的 MAC 地址并不知道,所以填全 F。
- 源地址就填路由器 A 的 MAC 地址。
- 类型就填 0806,因为 MAC 帧当中的帧类型字段设置为 0806。
- 最后要加上 CRC 校验。
MAC 帧封装完毕后,路由器 A 就可以把封装好的 MAC 帧以广播的方式发送到局域网中。
假设现在 MAC2 主机收到了这个报文,解包后发现目标 MAC 是全 F,说明这是一个广播帧。当它识别到 MAC 帧中的帧类型字段为 0806 后,就知道这是一个 ARP 请求或应答的数据包,于是会把 MAC 帧的有效载荷向上交付给 ARP 层。
当 ARP 层收到数据包后,先比对 op 字段,判断这是请求还是应答。发现 op 为 1,说明是请求,然后提取目的 IP 字段,发现不是自己,就在 ARP 层直接丢弃该数据包。
(2)ARP 的应答过程
构建 ARP 响应:
- op 填 2,表示应答。
- 目标 MAC 就填路由器 A。
- 其他同理 ARP 请求。
我们为了发送到局域网,所以加下来封装 MAC 帧报头:
MAC 帧封装完成后,主机 B 就可以把封装好的 MAC 帧发送到局域网中。 局域网内所有主机都会收到这个 MAC 帧。主机核对 MAC 帧头部,如果目的 MAC 不是本机,就直接丢弃,不会把报文向上交付到 ARP 层。 当路由器 A 的 ARP 层收到该报文后,首先查看 op 字段,发现值为 2,判定这是 ARP 应答报文,随后提取发送方的以太网地址与 IP 地址,路由器 A 就缓存到主机 B 的 MAC 地址。
结论:
- 一台主机如果之前发起过 ARP 请求,就有可能收到对应的 ARP 应答。
- 局域网内任意主机,都有可能收到其他主机发出的 ARP 请求。
- 所以局域网内主机收到 ARP 报文时,报文类型有可能是 ARP 请求,也有可能是 ARP 应答。
总结:
ARP 层收到报文后,优先读取 op 字段:如果 op=1(请求),就构造 ARP 应答报文;如果 op=2(应答),就提取报文里的源 IP 和源 MAC,记录对方 IP 与 MAC 的映射关系。
是不是只会在目标主机所在的子网内执行 ARP?其他网段会不会产生 ARP?
不是。ARP 可以发生在传输路径上的各个子网。
3.ARP 数据报的格式
正因为 ARP 里面包含了 IP,因此ARP 协议协议属于 MAC 帧的上层协议。
所以 MAC 帧在封装的时候,不仅仅有 IP 报文,还有可能是 ARP 请求/应答。
注意到:源 MAC 地址和目的 MAC 地址在以太网首部与 ARP 请求中各出现了一次。对于链路层是以太网的情况来说,这种重复是多余的;但如果链路层是其它类型的网络,这两处地址就可能是必要的。
这里的前三个字段属于 MAC 帧的报头,因此真正的 ARP 请求其实只有后面的部分:
- 硬件类型字段表示链路层的网络类型,取值为 1 时代表以太网。
- 协议类型字段表示要转换的地址类型,取值为 0x0800 时代表 IP 地址。
- 硬件地址长度字段:以太网地址为 6 字节,因为 MAC 地址是 48 位的。
- 协议地址长度字段:IP 地址为 4 字节,因为 IP 地址是 32 位的。
- op 字段取值为 1 时表示 ARP 请求,取值为 2 时表示 ARP 应答。
后面这四个字段,就是用来完成 ARP 请求和响应的。如果其中某些字段暂时不清楚,比如目的 MAC 地址,就可以先填成全 F,表示该字段尚未被设置。
4.ARP 缓存表
局域网通信离不开 MAC 地址,所以需要用 ARP 协议通过 IP 得到 MAC 地址。ARP 看起来至少要进行一次请求和一次应答,难道每发送一次数据都要走一遍这个流程吗?
不是。ARP 请求成功之后,请求方会暂时把 IP 与 MAC 地址的映射关系保存下来。
每次发起 ARP 请求后,都会建立对应主机 IP 地址和 MAC 地址的映射关系。每台主机都维护着一个 ARP 缓存表,我们可以用命令
arp -a来查看。
注意:缓存表中的表项是有过期时间的,这个时间一般为 20 分钟。如果某个表项在 20 分钟内没有被再次使用,它就会失效;下次需要时,就必须重新发起 ARP 请求来获取目的主机的硬件地址。这主要是因为 IP 地址是会变化的。
5.RARP 协议
RARP(反向地址转换协议),是一种根据 MAC 地址获取 IP 地址的协议。
在同一局域网内,只要知道了 MAC 地址,就可以直接给主机发送消息。因此,我们完全可以直接发消息去询问对方的 IP 地址。
6.ARP 欺骗
假设现在有一个局域网,每个主机内部都有 ARP 缓存表如下:
但突然这个时候来了一个中间人,它封装大量假的 ARP 请求发送给 MAC1,里面写的是 IP4:MAC3,同理给路由器发送 IP1:MAC3。
这样 MAC3 就成为了中间人,这种操作就叫作ARP 欺骗。
ARP 欺骗 的完整过程梳理为以下四个阶段
1.初始状态(正常通信)
- MAC1 主机:ARP 缓存表记录 IP4 -> MAC4
- 路由器(MAC4):ARP 缓存表记录 IP1 -> MAC1、IP2 -> MAC2
- 攻击者(MAC3):局域网中的 “中间人”,准备实施欺骗
2.攻击者发送伪造 ARP 应答
攻击者(MAC3)主动向局域网内主机发送伪造的 ARP 应答包。由于 ARP 协议是无状态协议,主机收到 ARP 应答报文后,会直接更新自身 ARP 缓存(不需要先发送 ARP 请求)。
- 对 MAC1 主机:伪造应答声称 “IP4 对应的 MAC 是 MAC3”
- 对路由器:伪造应答声称 “IP1 对应的 MAC 是 MAC3”
3.ARP 缓存表被篡改
- MAC1 主机:缓存表被覆盖,IP4 -> MAC4 变成 IP4 -> MAC3
- 路由器:缓存表被覆盖,IP1 -> MAC1 变成 IP1 -> MAC3
- 结果:MAC1 和路由器之间的所有数据,都会先发给 MAC3
4.攻击者成为 “中间人”
- 攻击者(MAC3)收到数据后,可以窃听报文;
- 如果继续把报文转发给真正的目标,就能维持通信不中断。 MAC1 和路由器并不会感知到中间经过了攻击者,误以为双方仍在直接通信。
- 这种 “拦截并转发” 的攻击角色,就是中间人(MITM)。
5.结论
攻击者通过伪造 ARP 应答报文,篡改受害主机 / 路由器的 ARP 缓存表,把自己插入双方通信链路,这种攻击就叫做ARP 欺骗(ARP 缓存投毒)。