社区讨论 · 政策

具身ICL热起来,先别把上下文当万能

烛龙烛龙9月6日2026/09/06 92 浏览

上周三,我在朋友公司的测试台边上,看一台机械臂整理一批形状各异的充电枪头。它没有提前做太复杂的夹具,旁边摆了几张参考照片和一段任务说明,现场换了一个新摆法,让模型先看几个例子再动手。朋友说,现在具身创业圈把这类做法叫 ICL,In-Context Learning。我听完没什么兴奋,先想到自己这阵子用 Robotaxi 和 FSD。

2020 年 GPT-3 靠看几个示例就会新任务,震动了 NLP。六年过去,同样的叙事被搬到机器人上。量子位这篇说的创业玩家,是 2026 年 4 月成立的可可矩阵。创始人高宇翔提到,今年 1 月讨论创业时,团队已经决定押注 ICL。这个时间点很有意思。团队先把上下文当成新的 scaling 方向,硬件本体还在卷。

从落地角度看,这其实是从「训练一个更大的模型」转向「组织一段更有效的现场记忆」。语言模型里的上下文,是 prompt、示例、历史对话。具身模型的上下文,要复杂得多。视觉、力矩、触觉、本体状态、任务目标、环境约束、上一次失败记录,全都可能进 context。它比把几张图片塞进去、再写一句「照做」复杂得多。

我最近用 WorkBuddy 做流程整理,有个很直观的体会。多源输入一次性丢给模型,输出经常不稳。拆开,单步处理,再合并,结果会可靠很多。具身 ICL 也绕不开这个工程问题。机器人动作错了,代价比文字错了高。文字可以重新生成,机械臂可能撞上去,夹爪可能夹坏东西,人也可能受伤。这几天我也在试通用大模型做任务拆解,它给步骤很利索,但一到物理约束就开始飘。比如让它规划一个装配动作,它能写出先拿什么、后放什么,却不一定知道力矩、公差、夹取顺序在真实台上会卡在哪。

自动驾驶这边,我这三周试 Robotaxi、FSD、Waymo、小马智行,体感越来越像。拉开差距的,往往是长尾场景有没有被记住,规则有没有被约束,兜底有没有记录、回放和归因。城市 NOA 也一样。硬件越来越容易买到,激光雷达、800V、电池包、传感器,参数表好看,不等于体验稳定。实测数据表明,同一套传感器方案,在不同软件版本和不同运营边界下,用户感知能差出一个代际。

具身智能现在也在经历同样的阶段。资本开始看硬件、工程体系和数据记录、回放、归因能力。评测也在变冷。之前那篇具身智能“高考”里提到,人类拿 100 分,最强模型只有 12.8。这个结论不太好看,但它把 demo 驱动的氛围压了压。机器人完成几个漂亮动作,不等于能反复部署。

上下文如果只用来炫技,价值有限。一个机器人现场看几个例子会新任务,确实容易传播。可一旦进入工厂、实验室、物流仓、家庭,问题就会变麻烦。示例是谁提供的,上下文有没有版本,模型当时读了哪些状态,出错后能不能回放,责任怎么归。我平时关注智驾法规,看到这类现场学习能力,第一反应是追溯链够不够。自动驾驶事故复盘要看数据记录、模型版本、感知结果、决策路径、远程接管。具身 ICL 如果也想进真实生产环境,迟早也要面对同样的问题。

不要只构建一个更大的大脑,还要把经验采集、回放、归因这些环节建起来。

这句话我比较认同。Ropedia 的刘子纬讲具身 Scaling Law,重点在人类经验,这个判断比单纯堆模型更贴近现实。经验体系要落到采集、清洗、对齐、回放、评测、失败归因一整套工具上,数据量只是入口。ICL 如果只是运行时检索,缺少记录、回放和归因,最后会变成高级 prompt。

所以我对具身 ICL 的态度,不反对,但别神化。它有可能成为具身智能的重要工程路径,因为机器人天然需要利用现场上下文。可它不会替代训练、仿真、真机数据和工程约束。更可能的位置,是把这些东西串起来,让机器人在有限场景里少重训、快适配。

垂直场景会先受益。固定工位、标准料箱、实验室样本处理、仓储补货,这些任务边界清楚,上下文可定义,失败也能回收。家庭场景最热闹,但最难。每个家庭不一样,物品不一样,人的习惯不一样,安全要求还高。所谓通用机器人,短期更像垂直经验复利,一个大脑通吃所有现场还早。

从落地角度看,上下文的价值在于变成可审计的任务状态。 如果一段 context 只能让模型在视频里更聪明,不能记录、不能回放,出了事也说不清,那它离工程化还差一层。具身 ICL 这条赛道能不能跑出来,关键也在这里。

往后看,我判断未来一两年,具身创业公司的分水岭会落在稳定的上下文工程能力上,采得准、理得清、评得稳,出事能查。等到 2027 年前后,能拿到订单的玩家,大概率是把 ICL 做成可部署、可运维、可合规的任务记忆系统的公司。光把 ICL 讲成通用大脑不够。

1 条回复

?
Ctrl + Enter 快速回复
知微
知微9月6日

真机延迟一大,上下文里的视觉反馈根本对不上步,这坑我踩过。