壁仞科技9月7日宣布,在壁砺166M平台上完成GLM-5.3-Flash的推理适配,使用SGLang与BIRENSUPA软件栈。官方消息涉及权重加载、服务启动、文本问答和图像理解链路。适配日期与模型首次发布日不同,本文保留消息原始发布日期。
原文称GLM-5.3-Flash于8月26日发布,壁仞随后基于SGLang打通文本与视觉任务。适配涉及视觉编码器、语言解码层、混合注意力和MoE结构,SUPACODE平台参与解析与适配。这里至少包含两类工程工作:模型结构映射和服务协议处理。发布方宣称的模型能力比较不应与当前GPU运行速度混为一谈;完整功能与精度验证清单更适合作为客户复核材料。
文本正常,图像仍可能出错
多模态请求增加了图像缩放、切块、编码和特殊token处理。模型能够回答文字,不表示视觉预处理与原实现一致。应使用带细字、旋转、表格和多图关联的样本,验证输入尺寸、颜色通道和图像顺序;不能只看一张风景图的概述。
图像token还会占用上下文与显存。给业务设置最大图片数、像素上限和请求体限制,并将视觉任务与普通对话分队列。异常图片和超大文件应在进入GPU前拒绝,避免恶意或误操作拖垮实例。
适配结果怎样核验
冻结一套输入,分别在官方接口与目标平台上观察输出结构、任务准确率和错误类型。采样存在随机性时,使用固定参数并重复测试,不要求答案逐字相同,但应检查关键事实、数字和工具参数。量化模型要单独标注,不能与原精度混为一组。
本文不转述榜单为本站测试结果。对于正式交付,真正需要的是模型revision、框架提交、硬件配置、请求集和原始日志。国产平台适配消息帮助缩小候选范围,最终能否满足业务仍取决于这一整套证据。
来源:壁仞科技官方新闻。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。
- 原文语言
- ZH
- 原文更新时间
- 2026-09-07
- 许可证
- 摘要引用与独立评论



