FL2VA 生产 API 并发压测

viggle_new_5090 · 8×RTX 5090 · 生产服务 :9100 · 2026-08-18 20:48 起 4 波提交

📼 想看产物本身 → 结果视频(常驻池 58 条,可翻页)

1 · 成败按池划分

86 单全部走官方 HTTP 接口提交,由调度器自行落卡。常驻池 = GPU 0–5(权重常驻显存), 流式池 = GPU 6–7(group offload 权重换页,用于 768p 15s / 1080p 这类装不下的规格)。

逐卡

2 · 失败归因

26 次失败全部落在流式池,且只有两种。两种都不是容量问题——峰值显存都没打满。

3 · 队列与吞吐

每 30s 采一次 GET /queue。四波提交把队列顶到峰值后由 8 卡消化。

排队中 queued 运行中 running

4 · 八卡显存时间线

同一时间轴,每卡一格(nvidia-smi 口径,含非 PyTorch 占用)。 灰色虚线为 31.4 GiB 卡上限。常驻池贴着 25–30 GiB 跑,流式池明显低——那是换页的代价与收益。

5 · 各规格耗时

仅统计成功单的 worker 端耗时(不含排队)。同规格的散布来自并发相互挤占, 不是配置差异。

6 · 复测

7 · 全部 86 单