GLM 团队披露递归自我改进方向首个工程化实践,由 GLM-5.3 驱动的 Infra Agent 完成 GLM-5.3-Flash 推理基础设施的设计、调试与优化,实现模型对自身运行系统的反向改进,系国内大模型厂商首个公开跑进生产环境的 RSI 案例。该 Agent 在超 10 万张国产芯片集群上搭建生产级推理服务,两周内将端到端吞吐提至初始基线 3 倍,硬件利用效率与单 Token 成本达主流 NVIDIA GPU 水平,支持 1M 上下文窗口与多模态请求。GLM-5.3-Flash 以匿名模型 Ox-Alpha 上线相关平台,6 天 Token 调用量超 62 万亿。此次实践中 Agent 可围绕推理系统完成完整工程闭环,GLM 团队称系统尚未达完全自主设计训练下一代模型阶段,但已呈现 RSI 早期形态。