中科曙光在官方消息中讨论人工智能基础设施与安全议题。原消息发布于9月22日,讨论VARA2026大会上的系统安全议题。以下结合该议题梳理企业算力平台的安全与可靠性要求。

原文对应2026年网络安全漏洞分析与风险评估大会VARA,讨论智能体和推理负载增加后系统级安全的变化。曙光将RAS、故障隔离、断点恢复与跨中心调度放进同一框架,强调生产、调度与应用之间的可信边界。可靠性、数据安全和服务权限是相互关联但不同的指标,应分别设计测试,不用一个“安全算力”名称覆盖全部要求。

冗余电源解决不了所有故障

电源冗余针对供电设备异常,无法替代应用进程恢复、模型文件校验和数据备份。驱动故障、磁盘写满、错误配置和管理员误操作仍可能中断业务。交付时应分别列出设备、系统、模型服务和业务数据的恢复方法。

访问控制也需要分层。普通用户只访问业务API,开发人员使用受限环境,运维权限另行审核。模型服务、监控接口与管理面不应直接暴露到公网;日志中应避免保存账号密钥和完整敏感提示词。

容器不是完整安全边界

GPU容器依赖宿主驱动和设备权限。运行未知镜像或给容器过高权限,可能影响整台服务器。建议使用审核后的镜像、固定版本与摘要,限制挂载目录,并将外部试验任务和生产任务隔离。

恢复演练比“备份成功”提示更有意义。选择一份备份,在隔离环境中恢复并验证模型、数据库和业务请求,记录恢复时间与丢失范围。只有能够重建服务的资料才算有效交付;保存了文件但没有环境清单,往往无法在故障后快速使用。

来源、翻译与版权说明

来源:中科曙光官方新闻。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。

原文语言
ZH
原文更新时间
2026-09-22
许可证
摘要引用与独立评论