导语
Z.ai CEO、清华大学教授唐杰近日在X平台发文,对当前AI领域普遍存在的“参数规模至上”论调提出系统性反思。他认为,随着模型能力进入新的发展阶段,单纯讨论参数量已失去实际意义。唐杰以最新发布的GLM-5.3为案例,阐述了他所提出的“扩展五要素”,强调模型进步的驱动力已从参数规模转向数据质量、推理计算、后训练方法以及部署条件,特别是通过构建可合成、可验证的长周期强化学习环境,模型能在复杂实际任务中实现端到端的自主工作,这标志着AI发展进入了“后训练扩展定律”主导的新阶段。
Z.ai CEO唐杰指出,AI模型发展进入新阶段,单纯追求参数规模已过时。他提出扩展的五个关键维度,并以GLM-5.3为例,展示通过长期环境强化学习实现性能飞跃。模型能力提升的核心正从参数量转向数据质量、推理计算和后训练配方,特别是合成环境与奖励信号的规模化。
Z.ai CEO、清华大学教授唐杰近日在X平台发文,对当前AI领域普遍存在的“参数规模至上”论调提出系统性反思。他认为,随着模型能力进入新的发展阶段,单纯讨论参数量已失去实际意义。唐杰以最新发布的GLM-5.3为案例,阐述了他所提出的“扩展五要素”,强调模型进步的驱动力已从参数规模转向数据质量、推理计算、后训练方法以及部署条件,特别是通过构建可合成、可验证的长周期强化学习环境,模型能在复杂实际任务中实现端到端的自主工作,这标志着AI发展进入了“后训练扩展定律”主导的新阶段。
展开「深读」看每一段讨论的问题与论据。
讨论的问题:为什么当前对模型规模的讨论需要超越单纯的参数数量?
论据 / 案例:GLM-5.3仅基于与GLM-5.2相同的基础架构,通过约一个月的额外强化学习训练获得显著性能提升。
讨论的问题:如何系统性地构建和扩展用于强化学习训练的任务环境?
论据 / 案例:环境合成流水线与验证器合成流水线实现端到端自动化,二元奖励信号足够可靠以直接用于训练。
讨论的问题:除了参数数量,还有哪些维度是模型扩展的关键?
论据 / 案例:高级技能是需要长因果链的推理问题,而非检索/记忆问题。
讨论的问题:开源模型和压缩技术近期有哪些重要进展?
论据 / 案例:Ornith-1.5在Terminal-Bench 2.1上得分86.1,在SWE-Bench Verified上得分86。
讨论的问题:智能体框架如何成为AI应用的新竞争焦点?
论据 / 案例:TrueForge在14项任务的企业基准测试上,匹配Claude Managed Agents在Opus 4.8上的表现,同时减少约30%的token使用;路由到GLM-5.2可将成本降低约75%。
讨论的问题:强化学习训练基础设施有哪些关键改进?
论据 / 案例:中期训练正被更明确地视为优化层面,需优化数据混合、持续时间、阶段排序、序列长度和可训练性。
讨论的问题:在生产部署中,哪些基础设施细节至关重要?
论据 / 案例:任务感知服务可将延迟降低29-40%,状态卸载可将内存需求减少4.6倍,工具结果缓存可移除35.2%的冗余搜索调用。
讨论的问题:Google、OpenAI和Anthropic在产品化方面有哪些最新举措?
论据 / 案例:Gemini 3.7 Flash在80个表格/文档密集型定量任务上的平均成本为$0.54。