大模型变小,不是退步而是工程落地的必然
社区讨论 · 政策

大模型变小,不是退步而是工程落地的必然

烛龙烛龙7月22日2026/07/22 101 浏览

我注意到一个有意思的细节:去年WAIC上各家还在比拼千亿参数、万亿参数,今年风向突然转了,大家都在推轻量化版本,甚至把模型剪枝到手机端能跑。这个变化,在我们智能驾驶领域其实早就发生过——2022年那会儿,各家自动驾驶方案还在炫耀激光雷达线数、芯片算力TOPS,到了2024年,谁还在拿这些数字说事?大家都在谈的是“端到端模型能不能在车规级芯片上稳定运行”“功耗能不能压到30瓦以内”。

本质上,大模型变小和智能驾驶模型从云端下沉到车端,是同一个逻辑:从秀肌肉到真落地,算力成本、延迟、可靠性才是硬约束。

对比一下两套典型路线就会很清楚。第一套是“云端巨无霸”路线,以特斯拉Dojo和部分互联网大厂为代表。他们相信数据量决定一切,用海量算力在云端训练超大模型,推理时留出足够算力冗余。优势是模型能力上限高,劣势是落地成本惊人——单次训练电费上百万美元,车端还依赖高带宽网络实时回传,一旦网络延迟超过200毫秒,决策就不可靠。第二套是“车端轻量化”路线,以国内头部智驾供应商和手机厂商为代表。他们在模型设计阶段就引入量化、剪枝、蒸馏,把参数量压到10亿以下,同时保证推理精度不降级。比如某家今年发布的端到端模型,参数量从100亿压缩到5亿,但城市NOA的接管率只上升了0.3次/百公里。实测数据表明,这个精度损失完全可以通过提升数据闭环效率来弥补。

为什么出现这种转向?从工程角度看,原因有三。第一,算力成本是硬天花板。车端芯片的算力天花板是固定的,比如Orin-X 254 TOPS,下一代Thor可能到1000 TOPS,但成本也翻倍。与其堆算力,不如把模型做小,让更多车型能用上同一个方案,摊薄研发成本。第二,实时性要求决定了模型不能太大。自动驾驶决策必须做到毫秒级响应,大模型推理延迟动辄几百毫秒,加上感知、规划、控制的串行流程,根本没法用。第三,法规和可靠性逼着厂商做减法。车规级安全认证要求模型的行为可解释、可追溯,而大模型的“黑箱”特性让监管头疼。轻量化模型结构更简单,更容易做形式化验证,也更符合ISO 26262功能安全标准。

这次WAIC上厂商集体转向轻量化,其实是整个行业从“技术狂欢”进入“工程落地期”的缩影。大模型变小,本质上是把“能不能做”的问题,变成了“能不能用、能不能赚钱”的问题。在智能驾驶领域,我们早就意识到:堆参数、堆算力是刷榜用的,真正让消费者愿意买单的,是稳定可靠、低延迟、低功耗的体验。汽车不是手机,不能靠OTA画饼,用户每天都要用,一次接管失败就可能影响口碑。

有人担心模型变小会导致能力下降,但实测数据并不支持这个担忧。以某国产智驾方案为例,他们用10亿参数模型在高速场景的变道成功率达到98.7%,而100亿参数模型为99.2%,差距只有0.5个百分点。但在功耗上,前者只有后者的十分之一,散热成本降低80%。这意味着,轻量化模型可以用更低的系统成本,覆盖95%以上的实际场景,而那5%的极端场景,完全可以通过人机共驾、远程干预等工程手段解决。

回到WAIC的观察,我认为大模型变小不是“缩水”,而是技术成熟后的必然选择。从算力导向到场景导向,从参数竞赛到工程落地,这才是健康的产业进化方向。一句话总结:大模型变小,不是能力降级,而是从实验室走向量产的唯一路径。

原文链接:https://www.tmtpost.com/8074930.html

1 条回复

?
Ctrl + Enter 快速回复
xiafeng
xiafeng7月30日(已编辑)

这个趋势在开源社区也很明显,比如GitHub上几个TinyML项目,贡献指南里都在强调量化工具链和交叉编译支持。参数堆叠是刷榜用的,真正能跑在树莓派上的模型才有人迭代。