zx94438011's recent timeline updates
zx94438011

zx94438011

服务器、存储、网络、GPU 的维保与备件
🏢  七小服 Seven Small Services / 数据中心硬件维保与备件
V2EX member #316009, joined on 2018-05-13 01:20:21 +08:00
七小服 Seven Small Services,做服务器、存储、网络和 GPU 设备的过保维保与备件。
在这里发硬件拆解和故障科普,也欢迎聊机房里的实际问题。
zx94438011's recent replies
@loading 对,18650 圆柱电芯一般自带泄压阀和过压断开( CID ),单颗相对可控。机房更担心的是成组以后:一颗出问题会不会传到旁边。所以电池包里还要靠 BMS 盯温度和电压,加上电芯之间的隔热和熔断。一块 66 节、一层 6 块、一个机房几百柜,数量上来以后,消防方案一般还是按锂电单独评估。
@ellipsecheung 对,大规模用的还没有。LightCounting 也是把线性方案的大规模部署放在 2027 到 2031 年,文里说的「绕开 DSP 」是方向,量还没起来。

@Autonomous DAC 确实省电又便宜,几米以内是首选。只是速率越高跑得越短,800G 下大约两三米,再远就得上两头带 DSP 的 AEC ,或者直接上光。
@v1 40G 一点不拖后腿。40G 是 4 路 10G 的 NRZ 信号,模块里用不着这种 DSP ,功耗也低得多,家里用正合适。DSP 是到了 PAM4 ( 200G 、400G 这一代)才成了光模块里的标配。

@willygeek007 传输这头其实已经在往这个方向走了。CPO 是把光引擎搬到交换芯片旁边;再往前一步,是用光直接把芯片和芯片连起来,Marvell 去年底宣布花 32.5 亿美元收购的 Celestial AI 做的就是这个。计算本身用光还早,眼下光电转换省不掉,只是转换的位置离芯片越来越近。
@zbinlin 两层都有。按 Meta 的说明和用户实测,每个用户先分到一台 Linux 虚拟机(有人在里面确认是 Cloud Hypervisor ),虚拟机里再用 systemd-nspawn 起一个容器跑代理的代码,容器里的 root 映射成非特权用户。所以 nspawn 是虚拟机里面那层隔离,不是用它来开虚拟机。2 vCPU 、约 7.7GiB 内存是虚拟机这一层看到的数,也是用户实测值,Meta 没有承诺每人都是这个配置。
@firemeteor 说得对,我上面说「不行」说重了。内存能超,ballooning 、KSM 、换出到盘都是办法。差别在超过头的后果:CPU 超多了是变慢,内存超多了、客户机又真的同时要用,就得换页或者触发 OOM 。这类助理的虚拟机大部分时间闲着,气球能收回不少,所以实际能超,只是比例要比 CPU 保守。我那条按不超售算的 8 亿 GB 是上限,不是实际要的量。
@zeni123 同意,CPU 可以超卖,内存不行。按每台 8GB 算,1 亿台不超售是 8 亿 GB ,折成 64GB 的内存条是 1,250 万条。CPU 九成时间在等模型回应,能挤;内存只要虚拟机开着就占着,能省的办法只有把闲置的休眠或换出到盘上。所以这类业务真铺开,先卡住的多半是内存,其次才是 CPU 。
@intoext 交换机是真能扛,除了风扇没什么活动部件,电源不出事就能一直跑。那批老机器现在还有不少在当接入层用,最后退役往往不是因为坏了,而是端口速率跟不上,或者固件不再更新了。
6 days ago
Replied to a topic by huhy › 服务器 › 服务器自己关机
BMC 运行时间没断,只能说明整机没掉过电,电源线和 PDU 这一路没问题,还不能排除硬件。可以分两步看:

1. 先看 BMC 里的系统事件日志( SEL ),不是告警页。找关机那个时间点记的是什么:OS 发起的软关机( ACPI S5 / soft-off )、电源键被按,还是 thermal trip 、电源保护、watchdog 超时。这几种的方向完全不同。

2. 再看系统里上一次启动的日志结尾:`journalctl --list-boots` 找到上一次,再 `journalctl -b -1 -e`,顺便 `last -x | grep -E 'shutdown|reboot'`。结尾如果有完整的停服务过程,就是有东西发了关机指令,去查 logind 有没有记到电源键事件、定时任务、UPS 或管控软件、麒麟自带的电源策略。日志如果是突然断的,没有关机过程,那就偏硬件,重点看过温和供电。

另外可以把 kdump 配上,再开着 BMC 的 SOL 串口日志,下次再关就能留下最后的输出。
@qazwsxkevin 同意,个人玩新卡省心:一张卡、有保修,功耗和噪音都好控制。V100 是被动散热的数据中心卡,放家里还得自己解决风道。老卡的优势主要在已经买了、已经上架的场合。
@cowcomic 32G 显存放到现在也不算小。你们是单卡跑还是多卡一起上?另外我印象里英伟达说过 580 是最后一个支持 Volta 的驱动分支,后面新版 CUDA 不一定带,这块有遇到问题吗?
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   4824 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 15ms · UTC 05:39 · PVG 13:39 · LAX 22:39 · JFK 01:39
♥ Do have faith in what you're doing.