交换机这个品类有个很有意思的现象:它比路由器低调得多,但真正决定一个网络稳不稳、卡不卡的,往往是交换机。你在网上搜"交换机哪个品牌好",能翻出几千条答案,有人说华为稳,有人说 H3C 香,有人说 TP-LINK 便宜大碗,还有人一句"看预算"就把你打发了。这些回答都没错,但基本没用——因为选交换机从来不是选品牌,而是选"匹配"。我这几年从十几个人的小办公室一路折腾到几百个信息点的园区网,踩过的坑足够写一本小册子,这篇就把品牌格局、选型逻辑、配置实操和排查经验一次讲透。不管你手里只有一台千兆交换机要接三个摄像头,还是要给公司 5 个部门划 5 个子网,读完至少能少走半年弯路。
1. 交换机品牌选型的底层逻辑:先搞清你要解决什么问题
很多人一上来就问品牌,其实是把顺序搞反了。品牌是在需求明确之后的最后一层筛选,前面还有三层:链路规模、功能层级、运维能力。这三层想清楚,剩下的品牌范围会自动收窄到两三个,根本不需要纠结。
1.1 先分清二层、三层和"傻瓜"交换机的边界
交换机按功能大致分三档,这个边界比品牌重要得多。
傻瓜交换机(也叫非网管交换机)就是插上就能用,没有任何配置界面。它的内部逻辑非常简单:收到一个数据帧,查一下 MAC 地址表,从对应端口转发出去。端口不够就加一台,坏了就换一台,运维成本几乎为零。家用的千兆交换机,比如接几台电视、NAS、游戏机,用这一档完全够。
二层网管交换机支持 VLAN、链路聚合、端口镜像、STP/RSTP、端口安全这些功能。它不懂 IP 路由,只能在同一个广播域内转发,但通过 VLAN 可以把一个物理交换机切成多个逻辑隔离的网络。中小企业的主流选择就在这一档。
三层交换机额外具备路由能力,能在不同 VLAN 之间做线速转发。这里有个常见误区:很多人以为"不同网段通信必须上三层交换机",其实路由器也能干这活,只是路由器靠软件转发,吞吐量和时延撑不住内网大流量。三层交换机的价值在于用硬件 ASIC 做路由转发,做到线速。所以判断标准不是"要不要跨网段",而是"跨网段的流量有多大、要求多低时延"。
虚拟化环境里还有个概念容易被混淆:Hyper-V 虚拟交换机与物理网卡桥接。虚拟交换机是宿主机内核里的一层软件转发逻辑,把虚拟机的虚拟网卡和物理网卡"接"到一起。它跟物理交换机是配合关系,不是替代关系。物理交换机负责把流量送进服务器网卡,虚拟交换机负责把流量分发给各台虚拟机。理解这个分层,排查虚拟化环境网络问题时会清晰很多。
1.2 选品牌之前必须先算的三笔账
品牌讨论之前,有三个数字必须先算出来,这三个数字直接决定你能不能买某款机器。
第一笔:端口数量与扩展余量。数清楚现在需要多少个接入点,然后乘以 1.3。为什么是 1.3 而不是 1.2 或 1.5?因为办公场景通常有两波扩容:一波是新员工入职,一波是新增设备(打印机、门禁、摄像头、无线 AP)。1.3 基本能覆盖两年内的自然增长,同时不会让端口浪费太多。如果是 24 口交换机,实际规划接入 18~20 个点最舒适,剩下的留给上联和临时调试。
第二笔:背板带宽和包转发率。这两个参数是交换机性能的硬指标,也是最容易被忽略的。背板带宽的计算方式是非阻塞设计下所有端口速率之和乘以 2(全双工)。一台 24 口千兆交换机,理论最小背板带宽是 24 × 1Gbps × 2 = 48Gbps。如果标称值远低于这个数,说明它内部存在阻塞,多个端口同时满速转发时会丢包。
包转发率的算法是:千兆端口的线速转发能力约等于 1.488Mpps(百万包每秒),百兆端口约 0.1488Mpps。一台 24 口千兆 + 4 口万兆的交换机,整机包转发率应该是 24 × 1.488 + 4 × 14.88 ≈ 95.2Mpps。
| 参数 | 计算方式 | 24口千兆参考值 | 说明 |
|---|---|---|---|
| 背板带宽 | 端口速率之和 × 2 | ≥48Gbps | 低于此值存在内部阻塞 |
| 包转发率 | 千兆口数 × 1.488Mpps | ≥35.7Mpps | 达不到就是"假线速" |
| MAC 地址表 | 每端口至少 1K 条目 | ≥8K | 条目太少会频繁泛洪 |
| 缓存 | 每端口 ≥ 512KB | ≥12MB | 影响突发流量吸收能力 |
第三笔:运维能力的天花板。这句话很实在:你团队里有没有人能配 VLAN、能看 STP 拓扑、能处理链路聚合不通?如果没有,买一台三层核心交换机回去,很可能就是一台贵一点的傻瓜机。很多中小企业买华为核心交换机,最后只用了它的二层转发功能,配置全默认,这就是典型的资源错配。
1.3 交换机芯片:品牌差异的真正来源
聊品牌前必须聊芯片,因为交换机同质化的程度比想象中高。中低端交换机的核心转发芯片,主要来自博通(Broadcom)、美满(Marvell)、瑞昱(Realtek)和盛科(Centec)这几家。不同品牌之间,芯片方案的重合度非常高。
那品牌差异体现在哪?三点:固件质量、散热与电源设计、售后与文档。
固件质量决定功能的完整度和稳定性。同一颗芯片,固件写得好的品牌能做完整的 STP、完善的 ACL、细致的日志级别;固件写得差的品牌,功能菜单里有,实际用起来各种边界条件崩溃。
散热和电源设计决定设备能不能长时间稳定跑。我见过同规格的两台 24 口交换机,一台连续运行两年室温 35 度无异常,另一台夏天就风扇狂转、端口掉线。拆开一看,前者用的是工业级电解电容和更厚的散热片。
售后和文档在出问题时价值极高。华为、H3C、思科的文档体系非常完整,几乎每个功能都有配置示例和排错指引;小品牌往往只有一份快速安装指南,出了问题只能靠自己试。
2. 十个热门交换机品牌逐个拆解
下面这十个品牌,覆盖了从家用入门到园区核心的全场景。我不按排名讲,按使用场景分组来讲,这样你对照自己的需求更容易找到位置。
2.1 华为:企业网的默认选项
华为在交换机领域的地位不需要多解释。产品线从 S1700 系列这种入门网管机型,一路到 S5700、S6700、S12700 系列的核心设备,覆盖面非常完整。企业场景里出镜率最高的几个系列:
- S1700 系列:入门网管,适合小型办公,支持基础 VLAN 和端口管理
- S5700/S5730 系列:千兆接入层主力,S5730 支持更多万兆上行和更完整的 ACL
- S6700 系列:万兆接入或小型汇聚
- S12700 系列:园区核心,框式机箱,双主控双电源
华为的优势在于功能完整度和生态一致性。配套的 eNSP 模拟器可以离线搭拓扑、跑配置、做实验,这对学习成本是极大的降低。命令体系统一,"display"开头查状态、"system-view"进配置视图,风格清楚。
劣势也很明显:价格偏高,授权和功能包有时需要额外购买,而且机型命名规则对新手不友好。华为三层交换机 S5730 这类型号,后面跟的一串字母数字代表上行端口类型、电源类型、是否支持 PoE,买错型号是常事。我建议采购前把型号完整贴到官网规格查询里核对一遍端口形态。
2.2 新华三 H3C:性价比路线的稳健派
华三的定位和华为高度重叠,但价格通常更有优势。产品线同样完整,从 S5000 系列接入到 S7500、S10500 系列核心都有。H3C 的 S7506 这类框式设备在中大型园区里很常见。
H3C 的特点在于配置逻辑简洁,命令行风格和华为接近但不完全相同,比如查看接口状态是display interface brief,配置 VLAN 接口是三段式流程。文献和社区资料也足够多,遇到问题基本能搜到。
H3C 有个细节值得说:它的很多机型在出厂时的默认配置策略比较保守,端口默认全开、STP 默认开启,这对直接上生产环境是有利的。但如果你要做链路聚合或需要临时关闭 STP,记得先规划再动手,因为改动会触发短暂的收敛过程。
2.3 锐捷:教育行业的隐形冠军
锐捷在高校和职校的市场占有率非常高,宿舍网、机房、无线覆盖大量使用。它的接入交换机在端口密度和 PoE 供电上做得比较激进,很适合宿舍这种"一个房间多个信息点 + 需要给 AP 供电"的场景。
锐捷的常用命令和华为、H3C 都有些差别,比如 VLAN 配置和端口模式的切换语法自成一套。习惯华为体系的人第一次上手锐捷会有点别扭,但熟悉之后会发现它的命令层级设计挺直观的。锐捷交换机常用命令里,最常打交道的还是 VLAN 创建、端口划入、Trunk 放行这几组。
锐捷的云管理平台对多分支场景很友好,几百台设备批量上线和统一配置比较省事。
2.4 中兴:被低估的国产选择
中兴的交换机在运营商市场出货量很大,企业市场的存在感相对弱一些。产品线里 ZXR10 系列比较常见,比如 ZXR10 5252 这种型号,支持完整的 ACL、QoS、VLAN 功能。
中兴交换机有个特点:安全策略配置非常细致。比如密码策略可以设置有效期(像 90 天强制改密这种),ACL 规则支持基于端口、基于 MAC、基于 IP 的多维组合。对合规要求高的场景,这些功能很实用。
中兴的文档和社区资料相对少一些,遇到非常规问题需要多花点时间。但如果是标准的企业组网需求,它的功能完全够用,价格也有竞争力。
2.5 思科 Cisco:标准制定者,但要注意产品分级
思科是很多网络协议的事实标准制定者,STP、VLAN Trunk(802.1Q)、CDP 这些技术的规范都深受其影响。产品线分成商业级(Catalyst 1000/2960 系列)和企业级(Catalyst 9000 系列)。
思科的优势是功能最全、文档最权威、CCNA/CCNP 知识体系完整。学网络的人用思科设备做实验,学的知识通用性最强。
劣势是价格和授权。思科的部分机型需要单独购买软件授权才能解锁高级功能,采购成本容易失控。另外思科的入门机型在性价比上已经明显落后于国产品牌,除非有明确的技术生态需求,否则中小企业不太推荐首选。
2.6 TP-LINK:家用和小微办公的基本盘
TP-LINK 在消费级市场是绝对主力。它的千兆交换机和路由器价格亲民、渠道方便、即插即用。比如很多人家里用 TP-LINK 的全千兆路由器下面再接一台千兆交换机扩展端口,这是很典型的家用方案。
TP-LINK 的商用系列(TL-SG 系列)提供网管功能,支持 VLAN 和基础 QoS,价格比华为 H3C 低不少。缺点是高级功能相对简单,日志和排错信息的丰富度不如企业级产品,遇到复杂链路问题时能拿到手的诊断数据有限。
有个真实场景值得提醒:家用路由器接千兆交换机时,如果发现某个口只协商到 10M 或 100M,先别怀疑交换机。九成以上是网线问题——水晶头压制不良、线序不对、线材质量差,或者接头氧化。换个成品六类跳线一试,问题通常立刻消失。
2.7 水星 MERCURY:走量的极致性价比
水星是 TP-LINK 体系下的性价比品牌,主打低价位。产品线以傻瓜交换机和入门网管为主,非常适合"只需要把几台设备接到一起"的场景。
这类品牌的价值在于降低门槛。一个只有三四台电脑的工作室,花一百多块买台五口千兆交换机,需求就解决了,没必要为用不上的功能付钱。
但要清楚它的边界:没有完整的网管功能、没有高级日志、没有完善的售后技术支持。用于临时扩容或非关键链路没问题,用于承载核心业务就要慎重。
2.8 腾达 Tenda:家用与小型办公的另一选择
腾达的定位和水星类似,产品以家用交换机和小型网管交换机为主,外观设计偏消费化,安装简单。
它的网管系列提供基础的 VLAN 和端口管理功能,Web 界面比较友好,适合完全没有命令行基础的用户。缺点同样是高级功能有限,遇到需要抓包分析或者细致日志的场景会比较吃力。
对于预算有限的微型场景,腾达是一个可以考虑的备选,但如果网络规模会持续增长,建议一开始就选功能更完整的品牌,避免后期整体替换。
2.9 Ubiquiti:统一管理体验的代表
Ubiquiti(常被简称为 UBNT)的特点是软硬件一体化的管理体验。它的 UniFi 系列交换机配合控制器(软件或硬件),可以在一个界面里统一管理交换机、无线 AP、网关,拓扑可视化做得非常漂亮。
这对中小型场景很有吸引力:一个界面看到全网拓扑、哪个 AP 挂了多少终端、哪个端口跑了多少流量,一目了然。相比传统命令行,运维门槛低很多。
代价是生态锁定。一旦选择 UniFi 全套,最好保持统一,混用其他品牌会损失一部分管理体验。另外它的产品线对三层路由和复杂 ACL 的支持不如华为 H3C 深入,大型网络要慎用。
2.10 MikroTik:功能密度极高的小众选择
MikroTik 的设备以功能密度高著称,同样价位的设备,它能提供的路由、防火墙、队列管理、VLAN 功能往往比同价位产品多得多。它的 RouterOS 系统几乎是全能的。
适用场景很明确:懂网络、愿意折腾、需要精细化控制的人。比如需要做复杂的流量整形、多线路负载均衡、精细防火墙规则的小型 ISP 或技术型团队。
不适用场景同样明确:完全不想学命令行的人。RouterOS 的核心能力在命令行和 WinBox 工具里,纯 Web 界面能调的东西有限。
| 品牌 | 主战场 | 优势 | 注意事项 |
|---|---|---|---|
| 华为 | 企业园区 | 功能全、生态好、eNSP 可练手 | 价格高、型号命名复杂 |
| H3C | 中大型企业 | 性价比、文档全 | 配置语法与华为有差异 |
| 锐捷 | 教育/宿舍 | 端口密度高、云管理 | 命令体系自成一套 |
| 中兴 | 运营商/合规场景 | 安全策略细致 | 社区资料偏少 |
| 思科 | 技术标准 | 生态权威、知识通用 | 授权与价格偏高 |
| TP-LINK | 家用/小微 | 渠道方便、价格低 | 高级诊断能力有限 |
| 水星 | 极致性价比 | 便宜、即插即用 | 无完整网管能力 |
| 腾达 | 家用/小型办公 | Web 界面友好 | 高级功能少 |
| Ubiquiti | 中小场景 | 统一管理、可视化 | 生态相对封闭 |
| MikroTik | 技术型团队 | 功能密度高 | 学习曲线陡 |
3. 不同规模场景的落地选型与配置实操
品牌选完,真正的活才开始。这一节我把三个典型场景拆开讲,每个都给出可直接照抄的思路和配置骨架。
3.1 公司 5 个部门划 5 个子网:华为三层交换机配置实例
这是企业里最典型的需求。假设 A 部门 100 台主机、B 部门 50 台、C 部门 20 台,D 部门 30 台、E 部门 15 台,要各自独立成网段又能互相访问。
第一步:算网段。按主机数上取整到 2 的幂次:
- A 部门 100 台 → 需要 128 个地址 → /25(掩码 255.255.255.128)
- B 部门 50 台 → /26(255.255.255.192,62 个可用地址)
- C 部门 20 台 → /27(255.255.255.224,30 个可用地址)
- D 部门 30 台 → /27
- E 部门 15 台 → /27
如果嫌算得太细不好管,直接统一用 /24 更省心,每段 254 个可用地址,规划简单、扩展方便。我实际做项目更倾向统一 /24,除非有严格的地址规划要求。
第二步:划分 VLAN 并配置网关。下面是华为交换机的配置骨架,假设交换机是 S5700/S5730 这类三层机型:
system-view vlan batch 10 20 30 40 50 interface vlanif 10 ip address 192.168.10.1 255.255.255.0 interface vlanif 20 ip address 192.168.20.1 255.255.255.0 interface vlanif 30 ip address 192.168.30.1 255.255.255.0 interface vlanif 40 ip address 192.168.40.1 255.255.255.0 interface vlanif 50 ip address 192.168.50.1 255.255.255.0第三步:把物理端口划进对应 VLAN。假设 1 到 24 号口给 A 部门:
interface GigabitEthernet0/0/1 port link-type access port default vlan 10批量操作可以用端口组,省去重复劳动:
port-group group-member GigabitEthernet0/0/1 to GigabitEthernet0/0/24 port link-type access port default vlan 10第四步:上联口配 Trunk。如果还有下级接入交换机,上联口要放行所有业务 VLAN:
interface GigabitEthernet0/0/24 port link-type trunk port trunk allow-pass vlan 10 20 30 40 50这里有个常见疑问:Trunk、Access、Hybrid 到底怎么选?简单说,Access 用于接终端的口,只属于一个 VLAN;Trunk 用于交换机之间的口,能带标签通过多个 VLAN;Hybrid 更灵活,可以同时以带标签和不带标签的方式放行多个 VLAN,适合一个口既接终端又需要多 VLAN 的场景。企业组网里 90% 的情况用 Access + Trunk 就够,Hybrid 容易把自己绕晕。
第五步:做部门间访问控制。划了子网不等于隔离,默认三层交换机会把所有 VLAN 都路由通。如果需要限制某些部门互访,用 ACL:
acl number 3000 rule 5 deny ip source 192.168.20.0 0.0.0.255 destination 192.168.10.0 0.0.0.255 rule 10 permit ip interface vlanif 20 traffic-filter inbound acl 3000注意 ACL 的隐含规则:末尾如果没有显式的 permit,默认是拒绝所有。所以rule 10 permit ip这行别漏,否则 B 部门连网关都上不去。
3.2 链路聚合、端口绑定与 VLAN 划分的实操要点
链路聚合是把多条物理链路捆绑成一条逻辑链路,既增加带宽又提供冗余。华为上的配置:
interface Eth-Trunk 1 mode lacp-static port link-type trunk port trunk allow-pass vlan 10 20 interface GigabitEthernet0/0/23 eth-trunk 1 interface GigabitEthernet0/0/24 eth-trunk 1关键点:两端必须对称配置。一端静态 LACP,另一端也是静态 LACP;一端的成员口数量、速率、双工模式要一致。我遇到过聚合口起不来,最后查出是一端成员口里混了一个百兆口,速率不一致导致成员无法全部加入。
端口 IP + MAC 绑定是接入层防私接的常用手段。华三交换机的做法是先开启校验,再绑定条目:
interface GigabitEthernet1/0/1 ip verify source ip-address mac-address然后配置绑定表项,把允许的 IP 和 MAC 对应关系写进去。这样即使有人把电脑换个口插,或者把 IP 改掉,也过不了校验。实际部署时建议配合 DHCP Snooping,否则手工维护绑定表会很累。
MAC 地址绑定 IP和上面是同一个思路的不同维度。华为上可以先查 MAC 表再决定绑定哪个:
display mac-address | include Broad这个命令会过滤出包含 Broad 关键字的 MAC 条目,快速定位广播域里的 MAC。查完拿到 MAC 再去做绑定,效率比一条条翻表高得多。
3.3 单机交换机实验:用 eNSP 搭一个最小可用拓扑
如果你手上暂时没有设备,或者不想在生产环境上试错,eNSP 是最省事的方案。
实验目标:两台 PC 分属不同 VLAN,通过一台三层交换机互通,同时验证 Trunk 链路。
拓扑:两台接入交换机(S5700)通过 Trunk 互联,各自下挂一台 PC;其中一台作为三层设备配 VLAN 接口地址。
核心配置:
# 接入交换机 1 vlan batch 10 20 interface GigabitEthernet0/0/1 port link-type access port default vlan 10 interface GigabitEthernet0/0/2 port link-type trunk port trunk allow-pass vlan 10 20 # 接入交换机 2 vlan batch 10 20 interface GigabitEthernet0/0/1 port link-type access port default vlan 20 interface GigabitEthernet0/0/2 port link-type trunk port trunk allow-pass vlan 10 20 # 三层交换机 interface vlanif 10 ip address 192.168.10.1 255.255.255.0 interface vlanif 20 ip address 192.168.20.1 255.255.255.0PC 侧的网关填各自 VLAN 接口的地址,然后互 ping。通了说明三层转发正常。
远程登录配置是另一个必练项。华为上配置 Stelnet(SSH):
rsa local-key-pair create stelnet server enable user-interface vty 0 4 authentication-mode aaa protocol inbound ssh user-privilege level 15 aaa local-user admin password irreversible-cipher YourPassword local-user admin privilege level 15 local-user admin service-type ssh配完之后用 MobaXterm 或 SecureCRT 从 PC 发起 SSH 连接即可。如果第一次连接失败,先在交换机上display ssh server status看服务状态,再确认 VTY 的 inbound 协议是不是只放开了 SSH。
4. 运维监控与故障排查实录
设备上线只是开始,日常运维才是真正耗时间的地方。这一节讲监控方案和常见问题排查。
4.1 用 Prometheus 加 SNMP 监控交换机端口流量
交换机自带的管理界面能看实时流量,但看不了历史趋势,也没法做告警。要把交换机纳入监控体系,SNMP 是最通用的方式,配合 Prometheus 和 snmp_exporter 就能拿到端口流量、CPU、内存、温度这些指标。
第一步:交换机开启 SNMP。华为上的配置:
snmp-agent snmp-agent sys-info version v2c snmp-agent community read cipher YourCommunity snmp-agent target-host trap address udp-domain 10.0.0.100 params securityname YourCommunity v2c第二步:部署 snmp_exporter。关键是配置抓取模块,用 OID 采集接口流量。接口入流量和出流量的标准 OID 是:
| 指标 | OID | 说明 |
|---|---|---|
| 接口入字节数 | 1.3.6.1.2.1.2.2.1.10 | ifInOctets |
| 接口出字节数 | 1.3.6.1.2.1.2.2.1.16 | ifOutOctets |
| 接口速率 | 1.3.6.1.2.1.2.2.1.5 | ifSpeed |
| 接口状态 | 1.3.6.1.2.1.2.2.1.8 | ifOperStatus |
第三步:Prometheus 配置抓取任务。在 prometheus.yml 里加:
scrape_configs: - job_name: 'switch' metrics_path: /snmp params: module: [if_mib] target: [10.0.0.1] static_configs: - targets: ['10.0.0.1'] relabel_configs: - source_labels: [__address__] target_label: __param_target - source_labels: [__param_target] target_label: instance - target_label: __address__ replacement: 127.0.0.1:9116第四步:算实际带宽。ifInOctets 是累计字节数,要做速率计算。PromQL 里用 rate 函数:
rate(ifInOctets{instance="10.0.0.1", ifName="GigabitEthernet0/0/1"}[5m]) * 8乘以 8 是把字节转成比特。得到的结果单位是 bps,除以 1e9 就是 Gbps。
这里有个坑:交换机的接口名在不同品牌下格式差别很大,华为是 GigabitEthernet0/0/1,H3C 是 GigabitEthernet1/0/1,中兴又是另一套。做监控模板时要按品牌分别处理,别硬套一套规则。
如果还想做拓扑展示,可以把 Prometheus 作为数据源接到可视化工具上,把交换机端口作为节点,连线粗细映射流量大小,这样一眼就能看出哪条链路快跑满了。
4.2 常见报错与问题速查
下面这张表是我这几年遇到过的高频问题,按现象、原因、处理方式整理,方便你直接对照。
| 现象 | 常见原因 | 处理方式 |
|---|---|---|
| Console 口连不上 | 串口线驱动未装、COM 口号选错、波特率不匹配 | 设备管理器确认 COM 号;波特率一般 9600,8N1 |
| Telnet/SSH 登录失败 | VTY 未配认证、协议未放开、ACL 拦截 | 检查 user-interface vty 配置和 inbound 协议 |
| SSH 报错 shell request failed on channel 0 | 用户权限级别过低或服务类型未包含 ssh | 把 local-user 的 privilege level 提到 15,service-type 加上 ssh |
| MAC 表频繁变化 | 存在环路 | 检查 STP 状态,看是否有端口反复 up/down |
| 忘记 Console 密码 | 需要清空配置重启 | 按规范流程进入 BootROM 清除配置,注意会丢失现有配置 |
| 只想取消串口密码 | 不想清空全部配置 | 进入 user-interface console 0,把认证模式改为 none |
| 日志出现 adj resolve request 相关条目 | 路由下一跳无法解析 | 检查三层接口状态和静态路由配置 |
| 端口频繁触发 loopback | 单端口自环或下端接了环路设备 | 评估是否需要在全端口开启该检测,全开会有性能开销 |
| 部分端口只协商到 100M | 网线质量问题或水晶头压制不良 | 换成品六类跳线验证,再检查线序 |
| 链路聚合部分成员不生效 | 成员口速率或双工不一致 | 统一成员口配置,检查是否为同一型号端口 |
4.3 几个容易被忽略的细节
第一,STP 和 BPDU 的处理策略要想清楚。接入层端口如果开启了 BPDU 保护,当端口收到 BPDU 时会直接关闭,这是防止用户私接交换机的有效手段。但副作用是:如果下级接了需要跑 STP 的设备,端口会被误杀。所以要按端口类型区别对待,接终端的口开保护,接交换机的口不开。
第二,loopback-detection 不要无脑全开。它在单端口自环时能自动关闭端口,很有用。但在某些低端设备上,全端口开启会增加 CPU 负担,而且如果是临时插拔网线造成的误判,会导致端口被关闭。建议只在关键的终端接入端口开启。
第三,PFC 信任模式这类无损网络配置要谨慎。PFC 主要用于存储和 RDMA 场景,配置不当会导致流量被错误暂停甚至丢包。如果业务用不到,保持默认关闭即可,别看到"高级功能"就往上开。
第四,设备固件要定期关注。交换机固件更新通常修复的是稳定性问题,不是安全漏洞就是内存泄漏。企业环境建议建立固件版本台账,每年评估一次是否需要升级,升级前务必在测试环境验证。
第五,日志要送到统一的位置。交换机本地日志容量有限,重启就没了。配置日志服务器,把日志集中收集,出问题时才能追溯。至少要把 warning 及以上级别送出去,info 级别可选择性记录,避免日志爆炸。
第六,双路交换机设计要考虑收敛时间。核心层的双机冗余,如果是堆叠方案,切换时间可以做得很短;如果是独立设备加动态路由,收敛时间取决于路由协议配置。设计阶段就要明确"能容忍多长的中断时间",这个数字直接决定方案选型。
我个人在运维里最深的体会是:交换机这东西,买的时候比较的是参数和价格,用起来比较的其实是"出问题时你能不能快速定位"。一台配置界面完善、日志清晰、文档齐全的交换机,在故障时刻省下的时间,远超它贵出来的那点差价。所以如果预算允许,宁可少买几个端口,也要选一个能让你睡得着觉的品牌和型号。