案例说明

案例属性:模拟正式项目,用于展示方案设计、实施和验收方法;不是虚构客户宣传稿。文中的压测数据与故障过程为按该配置构造的模拟工程数据,真实采购前必须用目标硬件和业务请求重新测试。

一、项目场景与目标

  • 单位:8人短视频制作团队,包括编导、设计、剪辑和运营
  • 任务:32B文案模型、Flux图片生成、语音转写、数字人口型与视频超分
  • 目标:素材不上传外网;白天支持交互创作,夜间批量渲染;普通任务等待不超过10分钟
  • 限制:设备放在办公室,要求噪声可接受;总预算15万元;只有普通220V插座

二、最终硬件与软件清单

  • GPU:RTX PRO 6000 96GB专业卡,单卡避免消费级双卡的槽位与互联问题
  • 平台:Xeon W或Threadripper PRO工作站,256GB ECC内存
  • 存储:2TB系统盘、8TB模型与项目NVMe、24TB NAS归档;10GbE连接
  • 电源:1600W高效率电源;机箱为显卡提供直接进风与独立支撑
  • 软件:Ubuntu工作站、ComfyUI、推理服务、Whisper、任务队列与团队Web入口

三、部署架构

  • 交互任务与批量任务进入不同队列;工作日9:00—20:00优先交互任务
  • 文案模型常驻约30GB显存,图片与视频任务按需加载;批量视频不与图片生成并行
  • 模型目录只读共享,个人工作流和输出按项目隔离
  • NAS保存源素材与成品,本地NVMe只保存当前项目和可重建缓存
  • 浏览器端显示排队位置、预计时长、GPU显存和任务失败原因

四、模拟实测数据

测试说明:以下结果只在本案例给定的模型、输入输出长度、并发、环境与版本下成立,不能脱离条件比较。

  • 32B INT4文案模型常驻:8K上下文单用户生成约38 tokens/s,4并发聚合约74 tokens/s
  • 1024×1024图片生成:单张平均18秒;连续20张平均19.6秒,GPU温度最高76℃
  • 4K视频超分测试片段:每分钟素材处理约21分钟,安排在夜间队列
  • 白天模拟8人提交53个任务:中位等待2.8分钟,P95等待11.4分钟
  • 同时运行文案模型与两路图片任务时峰值显存88GB,无OOM但交互延迟明显上升
  • 工作日模拟平均功耗460W、每天运行12小时,按0.8元/kWh估算月电费约132元

五、首次测试发现的问题

  • 初版允许所有工作流同时启动,两个视频任务会挤占显存并导致文案服务重启
  • 模型和输出都放NAS,首次加载慢且大量小文件拖慢ComfyUI
  • 设计师保存重复模型副本,一个月占用超过3TB
  • 工作站紧贴墙面摆放,持续图片任务后进风温度升高

六、整改措施与变化

  • 给视频任务设置独占GPU标志,并限制白天只运行一个低优先级视频任务
  • 模型同步到本地NVMe并以版本清单管理,冷加载时间从数分钟降到几十秒级
  • 模型仓库只读并按文件校验去重,个人目录只保存工作流与结果
  • 工作站后方保留50厘米回风空间,重新测得持续负载无明显降频

七、最终结论

一台96GB工作站可以覆盖8人团队的大部分本地AI创作,但视频类任务仍是长时间独占负载。方案价值在于数据本地、统一模型和低沟通成本,不应把它当作8人可同时满负荷使用的服务器。数据为模拟团队工作日测试。

八、真实项目复现时必须补充的证据

  • 服务器型号、主板、CPU、GPU、内存、磁盘、网卡、电源与固件清单
  • 操作系统、内核、驱动、CUDA或ROCm、框架、容器摘要与模型文件校验
  • 完整启动参数、测试请求集、输入输出token分布、并发和测试持续时间
  • 压测原始CSV或JSON、监控导出、错误日志、功耗与温度时间线
  • 整改前后使用同一口径重复测试的结果,以及仍未解决的问题

相关主题

AI工作站、RTX PRO 6000、内容生产、96GB显存

来源、翻译与版权说明

来源:网昱方案研究。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。

原文语言
ZH
原文更新时间
未提供
许可证
未登记