以GLM-5为例,探究九章智算云强化学习系统如何落地“训推一致”
过去几年,大模型竞争的主线很清晰:更大的模型、更多的数据和更强的GPU集群。但随着预训练边际收益递减,模型能力Scaling正从单纯的预训练堆叠向后训练强化学习(RL)转变,数学推理、代码生成、复杂决策、长时序Agent等高阶能力,越来越依赖后训练强化学习(RL)激发。RL通过生成、执行、反馈和奖励,让模型持续学习推理、规划与自我纠错的能力。由此,大模型发展从“一次性训练”进入“持续训练”,模型能力Scaling也从预训练延伸至生成、反馈和迭代全过程。SemiAnalysis指出,当RL成为模型能力持续Scaling的关键,竞争的就不只是算法,还有支撑模型持续生成、训练和更新的AI基础设施系统。问题也随之变成:当模型越依赖RL获得能力,谁来支撑这种能力持续低成本地生产。从“模型+算力”到算法与AI基础设施共同Scaling智谱近期的模型迭代,为观察后训练RL提供了一个窗口。智谱公告指出,G
agent 大模型 智谱