简介这份HCS-Pre-Sales-Intelligent Computing智能计算售前题库面向备考华为智能计算售前认证的售前工程师、渠道技术人员及ICT从业者帮助系统梳理服务器、存储、安全、网络与计算五大领域的核心考点。题库以选择题与判断题为主覆盖TPM可信平台模块、Taishan服务器型号与iBMC管理接口、RAID与SSD分类、鲲鹏920处理器、GPU应用场景、网卡形态及企业标准QDKBA2096-2013等高频知识点并附有参考答案便于自测与查漏补缺。资源包共1个PDF文件约183KB轻量便携适合打印或移动端随时刷题。目前已有1169人学习下载可作为考前冲刺与知识点速查的实用参考。1. 从一道 H19-381 模拟题说起智能计算售前到底考什么上周帮一个准备转售前岗的兄弟复盘 H19-381 的错题他卡在一道「智算中心算力规划」的多选题上给定 32 台 GPU 服务器、单机 8 卡、集群网络收敛比 1:1问在训练和推理混合负载下如何分配存储带宽和参数面网络。他背了三天题库答案能默写但换个参数就懵。这不是他一个人的问题——HCS-Pre-Sales-Intelligent Computing智能计算售前认证的题库表面考的是记忆实际考的是你能不能把算力、网络、存储、能耗这几条线在客户场景里串起来。这篇笔记不打算给你一份「背了就能过」的答案列表而是把 H19-381 智能计算售前题库背后的知识域拆开告诉你每类题在考什么、参数怎么推、现场怎么讲。适合两类人一是正在刷 H19-381 题库、想搞懂「为什么选这个」的备考者二是刚转智能计算售前、需要一套可复用的算力方案推演方法的从业者。题库是死的客户场景是活的把题库当索引去补知识域比死记选项有用得多。2. 拆解 H19-381 题库的四大知识域与出题逻辑2.1 算力规划题从 GPU 卡数反推集群规模H19-381 题库里占比最高的一类题是给定模型参数量、训练数据量、目标训练周期反推需要多少张 GPU、多少台服务器。这类题的核心公式不复杂但坑在「有效算力」的折算上。常见做法是先用理论算力估算再乘一个经验利用率。以 FP16 训练为例单卡理论算力记作 P实际能跑到的有效算力通常是理论值的 30%45%取决于集群规模、并行策略和通信开销。题库里如果没给利用率默认按 40% 估这是行业里比较稳的中间值。# 训练算力需求估算给定模型和数据反推GPU卡数 # 参数说明 # N: 模型参数量单位十亿B # D: 训练token数单位十亿B # target_days: 目标训练天数 # gpu_peak_tflops: 单卡FP16峰值算力TFLOPS # utilization: 有效算力利用率默认0.4 def estimate_gpu_count(N, D, target_days, gpu_peak_tflops, utilization0.4): # 训练总计算量约 6 * N * D FLOPs前向反向 total_flops 6 * N * 1e9 * D * 1e9 # 单卡每天有效算力峰值 * 利用率 * 秒数 per_gpu_per_day gpu_peak_tflops * 1e12 * utilization * 86400 # 需要的卡数 总计算量 / (单卡日算力 * 天数) gpu_count total_flops / (per_gpu_per_day * target_days) return int(gpu_count) 1 # 向上取整 # 示例70B模型2T token30天训完单卡FP16峰值312 TFLOPS print(estimate_gpu_count(70, 2000, 30, 312))这段代码的逻辑是总计算量按 6ND 估这是训练 FLOPs 的经典近似单卡日有效算力用峰值乘利用率再乘一天的秒数。参数里最容易拍脑袋的是utilization小集群几十卡能到 0.45上千卡的大集群因为通信墙掉到 0.3 以下很常见。题库里如果出现「千卡集群」字样利用率要往下调。提示算出来的卡数还要向上取整到单机卡数的整数倍比如算出 250 张、单机 8 卡实际要按 256 张、32 台规划多出来的卡用于容错和负载均衡。2.2 网络选型题参数面、数据面、业务面怎么分智能计算售前题里网络部分最爱考的是「三张网」的划分参数面梯度同步、数据面存储读写、业务面管理调度。H19-381 题库里经常给一个集群规模问参数面该用 InfiniBand 还是 RoCE、收敛比设多少。选型逻辑其实就一条看通信量和延迟敏感度。参数面做 AllReduce对延迟和丢包极其敏感大规模训练优先 IB中小规模可以用 RoCEv2 但必须配无损网络PFCECN。数据面走存储流量带宽大但延迟容忍度高收敛比可以放到 3:1 甚至 5:1。业务面千兆都够。网络平面典型协议收敛比延迟要求题库常见考点参数面IB / RoCEv21:1 或 2:1微秒级无损网络配置、PFC 优先级数据面RoCE / TCP3:15:1毫秒级存储带宽与 GPU 配比业务面以太网无严格要求毫秒级管理口冗余收敛比这个参数题库里经常换个说法叫「超订比」。1:1 就是无收敛下行和上行带宽相等成本最高但训练效率最好。实际项目里参数面做到 1:1 的客户不多2:1 是性价比拐点再往上训练效率掉得厉害。2.3 存储配置题带宽和 IOPS 哪个先算存储题在 H19-381 里属于「看起来简单、算起来容易漏」的类型。题目通常给训练数据集大小、epoch 数、单 epoch 时间问需要多少存储带宽。很多人直接拿数据集大小除以时间漏了数据加载的并发和预取。正确做法是先算「每卡每秒需要喂多少数据」。假设单卡 batch size 为 B、单样本大小 S 字节、单步耗时 T 秒则单卡数据带宽需求 B × S / T。再乘卡数就是存储集群要提供的聚合带宽。IOPS 则要看小文件比例训练数据集如果是大量小文件IOPS 会成为瓶颈这时候要上并行文件系统或者做数据打包。# 用 fio 快速验证存储节点实际能跑出的带宽和IOPS # 顺序读带宽测试模拟大文件训练数据读取 fio --nameseq_read --ioenginelibaio --direct1 --bs1M \ --numjobs8 --rwread --size10G --runtime60 --group_reporting # 随机读IOPS测试模拟小文件加载 fio --namerand_read --ioenginelibaio --direct1 --bs4k \ --numjobs32 --rwrandread --size1G --runtime60 --group_reportingbs1M的顺序读测的是大文件吞吐bs4k的随机读测的是 IOPS。售前阶段如果客户已有存储这两个命令跑一遍比看厂商标称值靠谱。参数里numjobs模拟并发客户端数direct1绕过页缓存测的是真实落盘性能。2.4 能耗与制冷题PUE 和机柜功率密度这类题在题库里占比不高但容易丢分因为很多人只记 PUE 公式不会结合机柜功率密度算制冷方案。常见考法是给定单机柜功率和机房 PUE 目标问该用风冷还是液冷。判断线大致是单机柜功率 15kW 以下风冷能扛1530kW 要用冷板式液冷30kW 以上基本只能浸没式或强液冷。PUE 方面风冷机房做到 1.4 算不错液冷能压到 1.11.2。题库里如果出现「PUE 低于 1.2」的要求直接选液冷方案不用犹豫。3. 用 H19-381 题库做售前方案推演的实操路径3.1 把题目参数翻译成客户需求清单刷题和做方案最大的区别是题目给全了参数客户不会。所以拿到一道 H19-381 的算力规划题先别急着套公式把题目里的隐含条件列成一张需求清单。比如题目说「某客户要建一个支持 70B 模型训练的智算中心」你要拆出模型参数量 70B、训练数据量未知要问、目标训练周期未知要问、精度 FP16 还是 BF16、并行策略是 TP 还是 PP、集群规模上限、预算范围。这些信息题库不会全给但售前现场必须问全。我一般会做一张对照表左边是题库参数右边是客户现场要确认的问题。这样刷题就不是背答案而是练「问对问题」的能力。3.2 从题库选项反推方案边界H19-381 的选项设计有个规律错误选项往往对应「参数取极端值」的情况。比如一道网络收敛比的题正确选项是 2:1错误选项里一定有 1:1成本过高和 5:1训练效率崩。刷题时把错误选项为什么错想清楚就等于把方案的边界条件摸了一遍。具体做法每道错题旁边标注「这个选项在什么条件下反而正确」。比如 1:1 收敛比在「小规模、预算充足、追求极致训练效率」时就是对的。这样积累下来你手里就有了一套「什么场景选什么参数」的决策树比死记答案有用。3.3 用模拟题做 15 分钟方案速讲售前岗的核心能力是「15 分钟讲清一个方案」。拿 H19-381 题库里的一道综合题强迫自己在 15 分钟内输出一个完整方案框架算力规模、网络架构、存储配置、能耗估算、大致预算。方案速讲模板15分钟版 1. 需求复述2分钟客户要做什么模型、多大数据、多久训完 2. 算力规划4分钟卡数、服务器数、利用率假设 3. 网络架构3分钟三张网选型、收敛比、关键设备 4. 存储与能耗3分钟带宽需求、PUE目标、制冷方式 5. 风险与边界3分钟哪些参数敏感、哪些地方可能超预算这个模板练熟了题库里的综合题基本都能覆盖。关键是第 5 部分「风险与边界」这是区分背题者和真懂的人的分水岭。4. 智能计算售前刷题避坑5 个血泪教训4.1 现象算力估算结果和题库答案差一倍原因利用率取值不同。题库默认 0.4你用了 0.8 的理论值结果自然差一倍。 解决统一按 0.350.45 估题库没给就取 0.4。如果题目明确说「小规模集群」可以取 0.45说「千卡以上」取 0.35。4.2 现象网络题选了 RoCE 但答案要 IB原因没看清题目里的规模关键词。题库里出现「千卡」「大规模」「极致性能」时参数面默认选 IB。 解决记一条硬规则——参数面规模超过 500 卡优先 IB500 卡以下RoCEv2 配无损网络可以打。数据面和业务面永远选以太网。4.3 现象存储带宽算出来偏小被判错原因漏了数据预取和并发系数。实际训练时数据加载是流水线并行的存储带宽要按「聚合需求 × 1.5」预留。 解决算完基础带宽后乘 1.5 的安全系数题库里如果给了「数据加载效率 80%」之类的条件再除以这个效率。4.4 现象能耗题 PUE 算对了但制冷方案选错原因只看 PUE 没看机柜功率密度。PUE 1.2 可以用液冷实现但如果单机柜只有 8kW风冷也能做到 1.3题库可能考的是「性价比最优」而不是「PUE 最低」。 解决先算单机柜功率再对照风冷/液冷的分界线15kW最后看 PUE 目标。两个条件都满足才选液冷。4.5 现象综合题时间不够最后几道全靠蒙原因在前面的计算题上死磕一道题算了 10 分钟。 解决H19-381 的计算题单题超过 3 分钟就先标记跳过把概念题和选型题做完再回头算。售前考试考的是决策速度不是计算精度。5. 从题库到现场把 H19-381 变成售前话术的进阶技巧刷完 H19-381 题库的人容易陷入一个误区以为考试通过就等于能做售前。实际上题库训练的是「给定条件下的最优解」而售前现场面对的是「条件不全、需求模糊、预算卡死」的真实场景。把题库知识转化成现场话术才是这套认证真正值钱的地方。我的做法是给每个知识域准备一段「30 秒白话版」。比如算力规划白话版是「您要训 70B 的模型按 30 天训完算大概需要 256 张卡、32 台服务器这是按 40% 利用率估的实际跑起来如果通信优化得好能省个十来张卡。」这段话里没有公式但把关键参数和不确定性都带到了客户听得懂也留了后续调整的空间。再比如网络选型白话版是「参数面这张网500 卡以下我们用 RoCE 加无损配置性价比高上了千卡建议直接上 IB不然梯度同步的延迟会把训练效率吃掉一大截。」这句话把选型边界和理由都说了客户如果有预算压力自然会追问 RoCE 方案的具体配置这时候你再展开 PFC 和 ECN 的参数节奏就对了。还有一个进阶技巧用题库里的错误选项做「反向话术」。客户如果提出一个明显不合理的方案比如参数面用 5:1 收敛比你不要直接否定而是说「这个收敛比在数据面上没问题但参数面如果这么配AllReduce 的通信时间可能会超过计算时间训练效率会掉到 30% 以下。我们可以先按 2:1 设计如果预算实在紧再考虑把非关键流量分离出去。」这种说法既专业又留了余地比「你错了」管用得多。最后说个我自己的习惯每次刷完一套 H19-381 模拟题我会挑三道错题假装客户就在对面把正确选项背后的方案讲一遍录音回听。讲得磕巴的地方就是知识域没打通的地方。这个习惯坚持了两个月现场讲方案的流畅度明显不一样。题库是磨刀石但刀要拿到现场去砍柴才知道快不快。希望帮到你。本文还有配套的精品资源点击获取