Vision-language-action papers focus on deployable robot control
这一时期的 vision-language-action(VLA)研究集中在执行上:闭环规划、可复用技能、触觉力控制,以及面向机器人的模型压缩。VERA、PrimitiveVLA 和 Ω-QVLA 的实证结论最清楚,大多数论文都配了真实机器人或操作套件测试。
这一时期的 vision-language-action(VLA)研究集中在执行上:闭环规划、可复用技能、触觉力控制,以及面向机器人的模型压缩。VERA、PrimitiveVLA 和 Ω-QVLA 的实证结论最清楚,大多数论文都配了真实机器人或操作套件测试。
最强的信号是验证代理在代码运行后实际做了什么。T2J-Bench、SNARE 和 Tool Forge 表明当前重点是可观察行为、授权范围和经过验证的工具访问,这些和任务完成同样重要。
这一时期最强的信号是面向真实部署约束的实用机器人学习。视觉-语言-动作(VLA)模型正在接受细粒度执行控制和技能保留的测试,而 HyperSim 和 SDPG 降低了真实数据或 GPU 的训练成本。Figure 的包裹分拣运行增加了一个耐久性主张,但其审计细节不如研究论文充分。
当天的研究把编码代理当作需要审计轨迹、可执行检查和预算控制的系统。TrajAudit、EviACT 和 Verus-SpecGym 说明了重点:必须定位失败,证据必须过关,规范必须按用户意图接受测试。
当天最强的信号是实用机器人控制。视觉-语言-动作(VLA)工作把快速的真实机器人微调和动作空间几何结合起来,世界模型论文则收紧潜在规划和策略搜索。EXPO-FT、OASIS 和 MBDPO 提供了主要的实证结果;部署和对抗研究补充了可靠性检查。
当天最强的研究信号是编码代理的运行控制。CODESKILL 和 SETUPX 显示,可复用经验能带来可测的提升。RepoMirage 说明,当仓库线索需要跨文件推理时,很多代理仍然会卡住。安全和验证论文把同样的要求说得更具体:代理动作需要受限权限、独立检查和机器可读证据。
本周具身 AI 研究把机器人策略视为必须承受真实控制条件的系统。视觉-语言-动作(VLA)模型通过视觉扰动、3D 接触线索、记忆、延迟和可复现硬件运行来测试。StableVLA、GaussianDream 和 AVP 给出了最清晰的信号。
本周的编码代理研究把信任作为运营问题处理。较强的工作要求在接受更长时间的自主编码前,先提供当前状态、可执行检查、隐藏测试和可审查轨迹。
当天最强的信号是,编码代理正被当作生产系统来处理。可用工作有边界,在模型外检查,并且要和证据绑定。软件工厂文章、Vericoding 和金融代理部署都指向同一项运行要求:范围、访问规则、验证和可复核工件。
当天最强的信号是 AI 工程工具的运营层证据。Gemini for Google 显示了某家公司内部的实测提升;The Polyglot Protocol 把审查习惯写成规则;Resident 把设备代理收进沙箱本地应用。同一组材料也把更新渠道、管理员控制、流失率和源码映射当作技术评估的一部分。
这个时期的 AI 编码工作,正在按可检查的证据、人类负责制和运行成本来接受评估。最清楚的例子是谷歌的操作系统代理演示、Claude Code 使用追踪,以及 Planet Maiko 的本地代理工作台。
视觉-语言-动作(VLA)研究主导了这个时间段。CrossVLA、AVP 和 SOMA 说明了当前重点:策略质量正在通过后训练收益、显式空间落地、持续记忆、延迟和闭环执行结果来衡量。