[H3 CI] compare frozen hardware runs and retain serving evidence / 保留跨硬件服务证据 - #2916
[H3 CI] compare frozen hardware runs and retain serving evidence / 保留跨硬件服务证据#2916edwingao28 wants to merge 29 commits into
Conversation
|
Thanks for the contribution! Please reach out to respective companies' CODEOWNER to fill in the latest PR_REVIEW_CHECKLIST.md before pinging core maintainer on Slack for review. In order for the signoff PR check bot to trigger, you must follow the PR_REVIEW_CHECKLIST.md template correctly, including the phrase For PR verification, add the PR authors are responsible for ensuring that after merging, all GitHub Action jobs fully pass. A lot of the time, failures are just flakes and simply re-running the failed jobs will fix it. See GitHub's docs on re-running failed jobs 感谢你的贡献!请联系相应公司的 CODEOWNER 填写最新的 PR_REVIEW_CHECKLIST.md,然后再在 Slack 上联系核心维护者进行审阅。为了触发 signoff PR 检查机器人,你必须正确遵循 PR_REVIEW_CHECKLIST.md 模板,包括保留英文语句 如需进行 PR 验证,请为此 PR 添加 PR 作者有责任确保合并后所有 GitHub Action 任务完全通过。 很多时候失败只是偶发抖动(flake),重新运行失败的任务即可解决。参见 GitHub 关于重新运行失败任务的文档 |
接入已准备的 H100、H200 与 B200 站点,扩展每档请求数并单独记录全部分配 GPU。AMD 运行时和跨硬件实测尚待完成。
a7facf5 to
7019bb2
Compare
新增不分配 GPU 的站点预检,通过现有 CI 留存主机公钥与执行来源;各硬件独立排队,预检产物不作为性能验收依据。
预检补充当前调度账户与共享运行时缓存候选,便于在申请 GPU 前确认已有环境;不将目录或命令存在视为硬件验收。
只读站点预检仅使用登录节点 runner,无需预留 GPU 节点名额;真实硬件执行继续通过原有优先级和 Slurm 准入。
允许站点配置选择并发档位子集,用新执行补齐缺失结果,避免重复已完成测量。保留默认 C1/C2/C4、逐请求证据和全部分配 GPU 计数。
通过实际 UID 查询调度账号,避免继承的 USER 或 LOGNAME 指向其他用户,并记录账号名称与主目录。
在不分配 GPU 的站点预检中记录默认账号与当前使用的调度账号,保留缺失状态。
通过已验证的 H200 来源清单准备 AMD 持久化模型缓存,优先复用已有权重并逐文件校验大小与 SHA256。该独立 CPU 任务不分配 GPU,也不声明运行时兼容。
将两种 CPU 准备操作合并为一个选择参数,保持 GitHub 手动工作流的 25 项输入上限,并保留独立的预检与模型准备路径。
记录候选共享目录的挂载、权限、可写状态与剩余空间,避免在无权限的 AMD 根目录重复准备模型。仅查询元数据,不改权限或分配 GPU。
CI 已确认共享根目录不可写,而 /it-share/data 可写且有足够空间。仅调整任务专属持久化路径,不修改已有目录权限。
通过现有调度队列、任务回执和资源清理流程检查 AMD 节点的设备身份、遥测格式及缓存镜像。最多分配八张 GPU 十五分钟,不运行视频生成,不导入镜像,并保留失败和清理证据。
AMD 只读节点检查使用独立并发组,使模型下载期间可以核对实际设备和缓存格式。保留原有 GPU 排队、任务所有权回执及有限资源预算。
中文:保留 AMD 分配核验失败时的调度字段与具体原因,并允许无 GPU 的站点检查读取本任务已有分配记录。
中文:调度器已移除任务记录时,读取 sacct 留存的资源与退出信息。
中文:AMD 的 AllocTRES 未记录 GPU 数量;只读节点检查保留 CPU、内存与时限核验,并在查询设备前验证完整的八卡步骤绑定。
通过有时限的任务专属分配检查 ROCm 缓存环境、进程身份和 HIP 设备映射;复用权重与运行环境,不执行视频生成或自动升级依赖。
分别读取可访问的进程身份字段,并在同一次环境准备中保存容器内 AMD SMI 输出和字节级显存信息。
通过 HIP 与 AMD SMI 的 PCI 地址绑定设备,保留进程身份和功率来源,并按完整 Slurm 分配核算 GPU。新增 AMD 配置校验,真实生成仍需通过缓存运行环境与 smoke 验收。
复用已校验的模型清单和统一的二十个输入,通过无 GPU 的准备步骤封存 AMD 启动脚本、运行时身份和首档并发配置。保留依赖缺失及生成能力尚未验证的状态。
仅在性能变更记录末尾追加 AMD 并发首档准备流程,注明统一负载、完整分配计费以及真实生成尚待验证。
中文:在 CPU CI 中复用已有 C1 产物,校验来源与文件哈希,发布完整视频和音频配对指标及可播放报告。保留未校准阈值结论,不新增 GPU 请求。
记录 H3 请求从服务端接收到媒体就绪的时间,保留单请求执行批量、副本、时钟、补丁和原始事件的来源。历史结果继续显示缺失值;仅在显式启用并校验固定运行时补丁后采集。
仅发布配对报告及其真实视频,保留原始 CI、manifest 和校验清单引用,避免重复打包三档原始运行媒体。54 项针对性 CPU 测试通过。
在不分配 GPU 或改写 rootfs 的情况下保留 AMD 运行时提取失败的文件与 Enroot 源码证据。
复用中断提取后保留的 AMD rootfs,通过 CPU CI 完成 Enroot 权限整理与导入检查,失败时保留证据且不标记就绪。
对保留的 rootfs 先验证实际进入和依赖导入;仅在具体路径失败时修复权限,避免重复扫描全部文件。
复用已提取的 AMD 运行时并缩短设备检查预算;保留严格核验的系统监控上下文、隔离计时源码工作树和原始基线,在实际 GPU 绑定与音视频预热通过后才允许测量。
在同一个受限的 MI355X 分配中复用运行环境,完成一次预热和二十次固定请求;独立限制启动时间,保留失败证据并封存释放凭据。
Description
Run the same frozen H3 serving workload on prepared H100/H200/B200 sites, record participating GPUs separately from allocated capacity, and retain latency, completion failures, validated media, and board power/energy with their measurement windows. The existing H200 defaults and manual CI authorization remain intact. This PR is stacked on #2894 and remains draft.
dba9686a1with no native runner, executed GPU steps, or allocation yet. Its budget begins after allocation: 120 minutes, a 15-minute readiness deadline, and 10 minutes reserved beyond the serving supervisor. It must pass compute-node entry and one full video/audio warmup before exactly 20 scheduled requests; failures must not be topped up. The workload is structurally checked against the formal H200 source before allocation. AMD records its TP1/Ulysses4/AITER configuration separately from NVIDIA TP2/Ulysses2.Validation: the integrated local CPU suite passed 631 tests, with two Linux-only skips; actionlint and diff checks passed. The final single-lease change passed 80 focused local tests and current-head Linux CI passed 646 tests. Real AMD execution remains pending. The unchanged AgentX signal-lifecycle check failed once (210/211 passed); its second CPU attempt passed 211/211. The original failure is retained; no AgentX code was changed. The matching frontend #1100 is merged and deployed with participating-GPU efficiency, separate allocation accounting, measured watts, energy/valid clip, and recorded enforced-cap ratios. The fidelity/timing viewer #1101 is merged at
9c4d9cdeand deployed. Final-head frontend CI passed 5,998 unit tests, 430 component tests and 1,906 integration executions across eight Chrome/Firefox shards. Both compact artifacts passed production EN/ZH desktop/mobile playback, audio, paired selection, report/raw downloads and original-source links. Collapsed reports now defer media loading; paired-page initial distinct MP4 requests fell from 40 to 2 in the controlled real-media check. Existing approved media storage is reused. Backend merge requirements remain unchanged.Related Issue
Builds on #2894; no issue automatically closed.
Type of Change
Checklist
perf-changelog.yamland have not edited historical entriesOWNER/MEMBER/COLLABORATOR) has commented/reuse-sweep-runon this PR. Do this only once there is a final full sweep that is all green with evals passing, since after this comment the sweep label will no longer automatically kick off new sweeps. Remove and re-add the label to force one.中文说明
本 PR 基于 #2894,保持草稿。H100/H200/B200 复用同一冻结工作负载,九个正式 C1/C2/C4 测量点均完成 20/20 条计划请求,并保留参与 GPU、分配容量、延迟、失败记录、完整音视频和功率/能耗窗口。当前结果不代表持续服务容量或硬件优胜。原始启动日志显示三个 NVIDIA 配置的 DiT 参数均为 BF16,但不能推定所有内核和激活的精度;H100/H200 选择 FlashAttention,B200 选择 dynamic cuDNN SDPA,需按硬件与软件配置共同解读。
仅复用原始视频完成两组各 20 对逐帧/逐音频采样检查,校验 CI 身份与产物哈希。两组示例阈值均为 2 通过、18 未通过;阈值未校准,不能据此宣称画质回归或发布合格。便携报告保留全部配对视频和精确来源,避免重复打包完整运行目录。
新增可选服务端阶段计时,保留运行时补丁和旁路日志身份;历史字段维持不可用,真实 GPU 计时与插桩开销仍待验证。AMD 复用已提取 rootfs 和模型缓存,保留提取、CPU 修复超时及登录节点 namespace 拒绝证据;尚无通过验收的 MI355X 视频。当前唯一一轮 MI355X CI 仍等待原有 runner 调度,尚无 GPU 分配或已执行 GPU 步骤。分配后总时限为 120 分钟、启动截止 15 分钟、服务监督程序外预留 10 分钟。必须先通过计算节点检查与完整音视频预热,再执行恰好 20 个计划请求,不能补跑到 20 个成功。分配前核对正式 H200 工作负载内容,单独记录 AMD TP1/Ulysses4/AITER 与 NVIDIA TP2/Ulysses2 的拓扑和运行时差异。
当前整合版本本地 631 项 CPU 测试通过、两项 Linux 专属跳过,工作流语法通过;最终单次分配变更的 80 项本地测试及当前提交 Linux CI 的 646 项测试通过。AMD 实测待完成。未改动的 AgentX 信号清理测试首次出现一次失败(210/211 通过),保留原日志后仅复查该 CPU 任务,第二次 211/211 通过,未修改 AgentX 代码。前端 #1100 已合并部署参与卡效率、分配成本口径、功率、每条有效视频能耗和记录的实际功率上限占比。#1101 已以
9c4d9cde合并并部署配对 fidelity、可选服务端计时和报告按需加载;最终 CI 通过 5,998 项单元测试、430 项组件测试和八组 Chrome/Firefox 共 1,906 次集成测试。两份真实产物的线上中英文、桌面/移动端播放、音频、配对选择、报告和原始下载均通过;复用已批准的媒体存储。后端合并授权和验收门槛不变。