交换机默认开了这个协议,居然能防网络瘫痪
干运维的大多都藏着点不愿外传的网络故障终极处理思路,真遇上全公司突然断网,再也不用平白无故背锅。
你肯定碰到过这种糟心时刻:
全公司几十上百台电脑瞬间集体卡成PPT,微信发不出去,网页刷半天转不出内容,连共享打印机都连不上。
网管蹲在机房折腾半小时摸不着头绪,老板在身后脸黑得不行,全部门的工作直接停摆。
这种情况十有八九,是撞上了网络运维圈里人人头疼的「广播风暴」。
说白了就是海量无效广播数据把整条网络的通道全堵死了,正常的数据包半点儿都挤不进去。
去看交换机的指示灯,全在疯狂乱闪甚至直接常亮,设备CPU直接跑满100%,几秒钟就能把所有带宽和设备资源耗光,整个网络当场瘫痪。
最坑的是,这玩意儿90%的情况都是日常配置留下的隐患:
很多公司为了防断网,特意在核心交换机和汇聚交换机之间接了两条备用冗余链路,结果忘了做链路聚合。
一个广播包发出去,两台交换机来回互相转发,这个包越攒越多像滚雪球一样,几秒钟就把几百兆的带宽全吃干抹净。
除此之外,电脑网卡坏了乱发数据包、网线磨破皮短路、有人搞ARP欺骗攻击,都能分分钟把整个网络搞崩。
以前碰到这种事,老运维的土办法就是挨个拔网线,拔到哪根网恢复了,才知道是哪块出问题,运气不好要折腾一两个小时。
其实根本不用这么费劲,现成的低成本防御手段早就有:
第一,把交换机自带的生成树协议开起来,它会自动把多余的冗余端口阻塞住,平时只走一条链路,主链路断了立刻切到备用链路,从根源上掐死环路。
第二,要是想让两条链路同时用、提升带宽,直接做链路聚合,把两条路合并成一条,带宽直接翻倍还不会出环路。
第三,多划几个VLAN虚拟局域网,把广播域拆碎,就算一个区域出了风暴,也不会把整个公司的网络全拖垮。
真要是故障已经爆发了,第一时间先把核心交换机重启清缓存,先快速断网止损,再挨个排查有没有人把网线两头插在同一个交换机上搞出环路,比瞎折腾快10倍都不止。
现在新的智能网络方案更是把这个问题从根上解决了:
上一套统一的网络控制器,所有交换机集中管控,不用你一台台跑过去配置,一键就能下发所有策略。
把传统的生成树协议换成以太环网自愈协议,就算哪个新来的实习生手贱把网线插出环路,网络20毫秒之内就能自己恢复,用户半点儿感知都没有,业务根本不会断。
再开启动态ARP检测,伪造的攻击包刚发出来就直接被丢弃,连对应的交换机端口也会直接封掉,半点儿风浪都掀不起来。
还能给不同业务设置优先级,办公OA、财务系统这类核心业务给最高权限,监控、下载这类流量设好带宽上限,再也不会出现有人下资源全公司跟着卡的情况。
说真的干运维这么多年,广播风暴绝对是排名前三的背锅重灾区,好多时候明明是之前的人配置留的坑,最后故障了全算在现任运维头上。
你们平时碰见过最离谱的广播风暴是啥原因搞出来的?我之前遇见过前台小姑娘把公司的网线两头插在同一个桌面交换机上,全公司断网俩小时,最后查出来的时候人都懵了。
