ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

中科曙光服务器培训实战:从RAID配置到BMC远程管理

中科曙光服务器培训实战:从RAID配置到BMC远程管理 简介中科曙光服务器培训教程汇总《服务器基础知识-v0.3》是一份面向服务器运维、技术支持及IT入门者的基础培训PPT由技术支持中心主讲旨在帮助零基础学员系统建立服务器知识框架。整份资源为单个pptx课件体积约42.47MB内容自成体系涵盖服务器形态与种类、服务器硬件部件介绍、服务器软件介绍三大模块并通过大量对比表格解析服务器与PC机、工作站、小型机的区别以及I/O性能、管理能力、可靠性、可扩展性等关键评价指标。课件还梳理了塔式、机架式、刀片式等主流服务器形态按CPU数量、指令集架构、应用功能与服务规模等多个维度介绍服务器分类思路并补充计算机基本概念与服务器性能“5高”评价标准知识点覆盖全面。目前已有600人学习下载适合需要快速入门硬件基础、参与企业内训或准备数据中心运维岗位的读者收藏学习。1. 中科曙光服务器培训为什么要系统过一遍v0.3课件背后的真实需求第一次接触中科曙光服务器培训教程很多人会把它当成一份“看过就忘”的PPT。但做过运维现场的人都知道“服务器基础知识”六个字的范围非常大从CPU、内存、硬盘背板这些硬件概念到RAID策略、BMC远程管理、操作系统安装这些动手环节每一块单拎出来都能写一本书。这份v0.3版本正是想把散落的点串成线。我在运维交接时见过这样的场景对方翻出一块移动硬盘里面躺着几年前的服务器培训课件版本号停在v0.3问我“这些够不够用”。翻了翻发现硬件架构讲得挺细但缺了磁盘阵列的实操步骤和远程管理卡配置方法典型的“课件不错但不闭环”。培训的价值不在“讲什么”而在“讲完怎么落地”。真正接手一台中科曙光服务器时RAID卡怎么进、BMC地址怎么配、固件版本的兼容问题这些细节才决定能否顺利交付。这份笔记适合刚入行的运维工程师、中小企业IT负责人以及想把课件迭代成实战手册的培训组织者。2. 服务器基础知识培训到底讲什么硬件架构、固件与远程管理的完整地图一份服务器培训课件如果只把CPU和内存参数罗列一遍基本等于没讲。有价值的部分是“硬件之间的关系”CPU通过什么总线访问内存硬盘通过什么控制器接入系统远程管理走哪条独立通道。把这张关系图记住后面所有配置操作才有依据。2.1 服务器里到底有几类硬件CPU、内存、硬盘之外的三个角色课件开篇通常会讲CPU、内存、硬盘的组成原理这部分对从业者来说大多是“已知信息”。我一般建议把注意力放在三类容易被带过的角色上。第一个是RAID卡磁盘阵列卡它决定你的数据如何分布在多块硬盘上。中科曙光服务器的入门级机架式机型板载RAID控制器多为LSI或Broadcom方案开机自检时按CtrlR或CtrlH可以进配置界面。课件里如果有RAID卡截图建议把截图里的菜单项和真机界面逐个对应一遍因为固件版本差异会让菜单名称对不上。第二个是网卡。服务器网卡往往有多个物理端口对应不同的PCIe通道。有些端口是光口需要配光模块和光纤跳线有些是电口用普通RJ45网线。课件里出现“万兆网卡”这类词时至少要知道物理端口上的指示灯状态对应哪个业务否则后面IP配错都不知道从哪里查。第三个是BMC管理芯片。它独立于主机的CPU和操作系统运行只要有电源就能访问。BMC自带IP地址通过浏览器或命令行登录后可以完成开关机、查看硬件健康状态、挂载ISO镜像等操作。中科曙光服务器的BMC默认IP地址通常在机器后背板的铭牌标签上有标注一般是192.168.x.x的固定地址。这三个角色在课件里可能各占一两页但到了现场决定你能不能“远程把服务器搞定”的就是它们。2.2 RAID磁盘阵列级别怎么选课件表格和实际生产环境的差异RAID是服务器基础培训绕不过去的主题因为它是数据安全的第一道防线。课件里通常把RAID 0、RAID 1、RAID 5、RAID 10的定义各列一张表但实际选型的逻辑比定义更直接取决于三个问题坏一块盘你能不能接受数据丢失、性能优先还是容量优先、预算内有多少块硬盘。RAID级别最少硬盘数冗余能力可用容量典型场景RAID 02无100%临时存储、性能测试RAID 12单盘故障50%系统盘、日志盘RAID 53单盘故障(n-1)/n文件共享、归档存储RAID 104每组单盘故障50%数据库、虚拟化存储我见过不少新人在课上学了RAID 5到了现场给四块盘的服务器配RAID 5结果可用容量只有三块盘随机写入性能也因校验计算上不去。而同样四块盘做RAID 10性能和冗余都兼顾。如果业务是跑数据库或虚拟化RAID 10通常是最稳的选择归档类场景才优先考虑RAID 5或RAID 6。RAID配置里还有一个常被忽略的参数缓存策略。写回Write Back模式下数据先写入RAID卡的高速缓存再延迟写入硬盘性能好但断电时有丢失风险直写Write Through模式性能稍差但更安全。生产环境建议开启写回前提是RAID卡带有电池或电容保护模块否则断电瞬间缓存里的数据全丢。另一个操作细节是创建阵列后一定要执行“初始化”。如果跳过新阵列会处于未初始化状态系统安装时可能识别不到完整容量甚至在某些固件版本下触发重建流程把刚建好的阵列状态搞成异常。正确的顺序是先确认硬盘上不需要保留数据再创建阵列再初始化最后装系统。2.3 BMC/IPMI远程管理默认IP、登录凭据与管理网段规划服务器和普通PC最本质的区别之一就是远程管理。服务器放在机房运维人员坐在办公室中间靠的是BMC。培训课件里对BMC往往只用一页带过但实际运维里它承担了超过一半的救场工作。中科曙光服务器的BMC管理页面核心功能大致如下表功能模块作用使用场景远程控制台相当于远程的显示器加键鼠看系统安装界面、做图形化配置电源控制开机、关机、重启、强制断电操作系统无响应时远程处理健康监控CPU温度、风扇转速、电源状态巡检时确认整机状态虚拟介质把ISO镜像挂载到服务器光驱位置免U盘安装操作系统配置BMC时第一件事是规划IP。BMC的IP最好独立划分一个管理网段比如10.10.10.0/24和业务网段完全分开。很多中小企业把BMC的IP随便设到业务网段里结果和某台业务机器冲突管理界面登录不上服务器出了故障只能跑机房。这属于典型的“课件没讲现场遭殃”说多了都是血泪经验。我一般在工单表里单独记一列“BMC地址”和业务IP分开管理。遇到设备下电再上电后BMC失联的情况先检查是不是有别的设备占用了这个IP。另外浏览器访问BMC页面建议用Chrome或Edge很多新固件已经取消了老的ActiveX插件方案页面打不开时先换浏览器别急着怀疑硬件。2.4 从单机到集群一台中科曙光服务器怎么撑起多个业务培训课件最后几页通常会展望集群但对大多数中小企业来说真实的起点是单机。你需要评估“一台服务器能承担多少角色”这里的关键是服务器虚拟化。常见做法是一台物理机安装虚拟化平台上面创建多台虚拟机分别承担文件服务器、业务数据库、应用服务等角色。结合服务器虚拟化技术一台16核64G的机器可以稳定跑4到6台轻量级虚拟机。资源规划我习惯按下面这个表来估算虚拟机角色CPU分配内存分配磁盘IO特征文件服务器2核4G顺序读写为主业务数据库4核8G随机读写较高应用服务2核4G混合型注意物理机的资源不是全部可分配的。虚拟化平台本身要占CPU和内存磁盘阵列写缓存也要吃内存BMC也要占一部分系统资源。我的习惯是把总内存打个八折再按上表分配这样出现突发流量时机器还有余量。集群的概念在这个阶段只需要理解到“多台物理机通过网络协同对外提供服务”即可。真正做集群要考虑共享存储、网络冗余、负载均衡策略复杂度会成倍上升。小企业从单机加虚拟化起步是最稳妥的路径。3. 把v0.3课件落到真机操作RAID初始化、Linux安装与时间同步的完整路径前面把硬件地图梳理完了接下来是真正的动手环节。我按一台新到的中科曙光服务器从拆箱到能跑业务的顺序把关键操作拆成四步。每一步都有对应的命令或界面操作照着做至少不会迷路。3.1 首次上电的第一件事进RAID卡配置界面把存储初始化做对新服务器第一次通电别急着装系统。先花十分钟把RAID配好后面能省一天的事。开机自检时留意屏幕提示一般在出现中科曙光Logo或RAID控制器信息时按CtrlRLSI方案或CtrlHBroadcom方案进入配置界面。界面里能看到当前连接的物理硬盘通常是Unconfigured Good状态。创建阵列的操作路径是在阵列卡主界面选择“Configuration Wizard”或“Create Virtual Drive”选择RAID级别根据硬盘数量和业务类型参照前文表格勾选参与阵列的物理硬盘设置条带大小Strip Size默认64KB即可数据库场景可以调到256KB设置缓存策略为Write Back初始化方式选Full Initialize确认后创建退出并重启初始化这一步很多人会跳过。快速初始化Fast Init虽然快但有些固件版本在快速初始化后仍会后台做一致性校验如果此时断电阵列状态可能变成Degraded。我所有的生产服务器都做全量初始化时间多花半小时换来的是后续重建时的安心。创建完阵列后按CtrlP可以查看虚拟驱动器状态正常应该是Optimal或Online。如果显示Foreign说明硬盘是之前从别的阵列上拔下来的需要先执行“Import Foreign Configuration”导入配置再继续后续操作。3.2 做一个Linux系统安装U盘分区方案、驱动与引导的关键设置RAID就绪后下一步是装系统。这里以服务器Linux环境为例装Ubuntu Server 22.04适合大多数线上业务。先在管理电脑上用UItraISO或dd命令把镜像写入U盘# 在Linux管理机上制作启动U盘/dev/sdb是U盘设备名务必确认无误 sudo fdisk -l # 列出所有磁盘找到U盘对应的设备名 sudo dd ifubuntu-22.04-server.iso of/dev/sdb bs4M statusprogress sync # 等缓冲区数据全部落盘后再拔出U盘dd命令的of参数指向U盘设备而不是分区写错会把管理机自己的硬盘数据清空。bs4M是每次写入4MB速度较快statusprogress能看到实时进度。这条命令在生产环境里“翻车”的案例很多核心原因就是把of写成了/dev/sdb1之类的分区名。U盘插入服务器后开机进入BMC远程控制台选择从U盘引导。Ubuntu Server安装器会问两个关键问题配置项推荐值说明分区方案使用整个磁盘LVM便于后续扩容逻辑卷软件选择OpenSSH server装完就能远程登录分区这一步我通常在LVM里单独划一个/boot分区1GB剩下的空间全部交给根分区。/boot独立出来的原因是某些RAID卡驱动在LVM之上加载会有顺序问题独立分区能减少引导失败的几率。这个经验是从一次PXE装系统失败后总结出来的。装完重启系统会提示移除安装介质。如果设置了BMC的虚拟介质挂载了ISO镜像记得在BMC界面把挂载卸载掉否则重启后可能又进入安装器。3.3 配置服务器时区与时间服务器让日志时间不再“穿越”系统装完第一件事不是装软件而是先看时间。新装好的Linux服务器默认时区可能是UTC和北京时间差8小时。这个问题在日志排查时特别折磨人应用报错的时间和你实际看到的时间对不上所有排查都会变慢。用下面两条命令先把时区改掉# 设置时区为东八区北京/上海时间 sudo timedatectl set-timezone Asia/Shanghai # 查看当前时间、时区和时间同步状态 timedatectl statustimedatectl是systemd自带的工具不需要额外安装。设置时区后配合时间服务器同步能让服务器始终和标准时间保持一致。接下来安装并配置chrony作为NTP客户端sudo apt install chrony -y sudo systemctl enable --now chrony sudo chronyc makestep # 立即同步一次跳过渐进调整过程chronyc makestep会立刻把系统时间跳到标准时间适合刚装完系统的场景。如果不执行这一步chrony会默认以缓慢调整的方式校准对于偏差超过几分钟的系统要等很久才能校准到位。生产环境里建议在/etc/chrony/chrony.conf中显式指定可靠的时间服务器# /etc/chrony/chrony.conf 关键配置行 server ntp.aliyun.com iburst server pool.ntp.org iburst local stratum 10iburst参数让chrony在启动后的前四次同步中快速拉齐时间适合刚开机的服务器。local stratum 10表示在无法联网时本机可以继续以低优先级时间源对外提供时间服务这样内网其他小机器可以从这台服务器同步时间形成一个内部的时间服务器节点。3.4 一台物理机当三台用小企业虚拟化架设的最简参数方案装好系统、调好时间后接着考虑怎么让一台物理机承载多个业务。对小企业来说单独为一套OA买一台服务器不现实虚拟机是默认方案。我常用的是KVM加Web管理面板的组合。安装KVM相关组件sudo apt install qemu-kvm libvirt-daemon-system virtinst -y sudo systemctl start libvirtd sudo systemctl enable libvirtd参数说明qemu-kvm是虚拟化引擎libvirt-daemon-system提供统一管理接口virtinst用来创建虚拟机。装完后用virsh list --all确认libvirtd正常运行。创建第一台虚拟机的命令如下sudo virt-install \ --name app-server \ --memory 4096 \ --vcpus 2 \ --disk path/var/lib/libvirt/images/app-server.qcow2,size50 \ --os-variant ubuntu22.04 \ --network bridgebr0 \ --cdrom /var/lib/libvirt/images/ubuntu-22.04-server.iso--memory 4096分配4G内存--vcpus 2分配2个虚拟CPU核--disk指定磁盘镜像路径和大小50GB--network bridgebr0把虚拟机的网卡桥接到物理网卡这样虚拟机对外呈现的IP和物理机在同一子网管理起来最方便。如果物理机内存只有64G按前文的规划4到6台这样规格的虚拟机是安全的。我一般会留8到16G内存给物理机操作系统和磁盘缓存剩下的才敢全部分配出去。4. 服务器运维最常见的五个坑现象、原因与解决办法这里把现场最容易踩的五个坑集中拿出来写。每一条都按“现象→原因→解决”的方式记录方便你对着排查。4.1 重启后系统找不到硬盘RAID配置没写回阵列卡现象RAID 10配置完成后系统装到一半或者重启一次直接提示“No boot device found”。进RAID配置界面一看阵列状态变成“Foreign”或“Missing”。原因创建阵列后没有执行初始化配置没有写回阵列卡的EEPROM。另外如果硬盘位置在关机后被物理调整过RAID卡也会识别不到原来的阵列。解决开机自检按CtrlR进入RAID卡界面先执行“Import Foreign Configuration”把外部配置导回来确认虚拟驱动器状态变成Optimal后再继续。这条“后悔药”只对配置存在但没导入了的情况有效如果是新阵列没初始化只能重建阵列并重新装系统。所以我的习惯是创建阵列后先重启一次确认阵列状态稳定了再开始装系统。4.2 服务器时间始终差8小时时区与时间服务器都没配现象新装好的Linux服务器date命令显示的时间和北京时间差8小时应用日志时间对不上定时任务到点不执行。原因安装系统时地区选项选择了UTC时区没有设置为Asia/Shanghai同时系统没有配置时间服务器硬件时钟漂移后无法自动校准。解决执行sudo timedatectl set-timezone Asia/Shanghai修正时区然后按3.3节的方法配置chrony并指向可靠的时间服务器。这里还有一个隐藏点如果是双系统比如服务器上同时装了Linux和Windows两套系统对硬件时钟的处理方式不同——Linux默认把硬件时钟当UTCWindows默认当本地时间。解决办法是在Linux下执行sudo timedatectl set-local-rtc 1让硬件时钟按本地时间解释。4.3 BMC管理页面登录不上去IP冲突或凭据过期现象浏览器打开BMC的IP地址要么一直转圈要么提示密码错误。重启BMC后有时能恢复但过一阵又失联。原因最常见的是BMC的IP和业务网段里的某台机器冲突其次是有同事改过BMC密码初始密码已经不适用。解决先用物理方式到服务器面前看看背面铭牌标注的默认IP和默认凭据通过BMC的物理复位按钮恢复出厂设置。然后把BMC的IP规划到独立管理网段比如10.10.10.0/24不要和业务网段混用。这个坑我踩过两次之后所有服务器的BMC地址都单独登记在资产管理表里统一管理。4.4 虚拟化平台安装后CPU跑不满BIOS里两个开关没开现象ESXi或KVM装好之后虚拟机启动报“虚拟化不可用”或者CPU只能识别物理核的一半。原因BIOS里Intel Virtualization TechnologyVT-x和VT-d两个选项默认关闭虚拟化底层指令集不可用。解决开机进BIOS找到“Processor Configuration”把“Intel Virtualization Technology”和“VT-d”都设为Enabled。需要注意不同中科曙光机型BIOS菜单位置有差异但关键词通常是“Virtualization”或“SVM Mode”。改完保存重启后在Linux里执行grep -E vmx|svm /proc/cpuinfo确认虚拟化标志位已经出现。4.5 课件里的命令在真机上报错固件版本带来的玄学差异现象按培训课件里的命令操作提示“invalid parameter”或“command not found”界面菜单位置也和截图完全不同。原因课件制作时的固件版本和实际设备不一致。RAID卡固件、BMC固件、BIOS版本各自独立迭代命令参数和界面名称都会变这不是机器坏了是版本差异。解决先通过BMC页面把BIOS版本、BMC版本、RAID卡固件版本都记录下来和课件封面的版本号对一下。命令执行前先查版本帮助比如ipmitool mc info可以查看BMC版本信息。更重要的是把每台设备的实际界面截图保存下来标注固件版本沉淀到自己的运维手册里。固件差异这种问题看着像“玄学”本质是版本管理没跟上。5. 从v0.3到v1.0验证培训效果并沉淀自己的运维手册5.1 验证清单按课件给自己做一次实操考核看完培训课件能不能上手用下面这份清单自测一遍验证项操作预期结果RAID配置进RAID卡界面查看阵列状态状态Optimal容量识别正确远程管理从办公电脑访问BMC页面能登录并看到整机健康信息时间同步执行timedatectl status时区为上海时间为标准时间虚拟化验证用virsh list --all查看虚拟机显示已创建的虚拟机列表固件版本记录查询BIOS/RAID/BMC版本并记录记录与设备型号对应清晰每一项都花不了几分钟但能把“学过”变成“会做”。我在带人时一般要求两周内独立完成一次“从裸机到虚拟机跑通应用”的全流程操作能走通基本说明培训过关了。5.2 把课件升级成运维手册三个必须收集的素材课件是别人的手册才是自己的。拿到v0.3或任何版本的培训课件我建议做三件事第一把课件里每个操作步骤和真机截图对应起来凡是和截图不一致的地方用新的截图替换并标注固件版本。第二把命令行的实际输出保存成文本文件和课件里的示例输出做diff差异大的命令要重点标注。第三把踩过的坑按“现象→原因→解决”格式追加到对应章节末尾形成自己的避坑索引。这套手册不需要一次写完整。每处理一次故障、每装一台新设备就往里补一条记录。半年后再回看它的价值远远超过原始培训课件。我现在接手任何一批新服务器都会先给每台设备建一条档案记录序列号、BMC地址、固件版本、RAID配置和业务角色后续所有变更都追加在这条档案里。希望帮到你。本文还有配套的精品资源点击获取
返回列表