编码代理研究正在测量用户负担、运行时成本和工具风险
当天最强的工作把编码代理视为需要会话级评测的长时间运行系统。SWE-Together、SWE-INTERACT 和 MirrorCode 让用户反馈、完整程序行为和计算预算进入评分。
当天最强的工作把编码代理视为需要会话级评测的长时间运行系统。SWE-Together、SWE-INTERACT 和 MirrorCode 让用户反馈、完整程序行为和计算预算进入评分。
本周机器人视觉-语言-动作(VLA)研究聚焦于可在执行期间检查的策略。FORCE、ICWM 和 LIBERO-Safety 提供了主要信号:机器人论文正在把进展绑定到在线 rollout、配置标定和不安全成功指标上。
本周的研究把大型语言模型(LLM)智能体视为生产软件。最有力的工作把任务成功与上下文恢复、产物交付、成本核算、权限边界和凭据安全联系起来。DeepDiscovery、EnterpriseClawBench 和 Rel(AI)Build 提供了最清晰的证据。
今天的语料把代理视为运营工具,它们需要更安全的凭据、更清晰的工作界面和更严格的监督。DevFortress 提供了最强的风险证据;Iris 和 Notion 展示了产品模式:把小而有边界的工作分配给代理,同时让审查和权限保持可见。
当天的小型语料把 AI 采用视为工程控制问题。peek-cli 为编码代理增加了只读浏览器视觉能力。另一篇 AI 预测认为,大语言模型(LLM)的使用必须经受推理成本、用户支付意愿和可维护软件输出的考验。
当天语料规模小,内容偏实用。Workbench 关注在不丢失状态的情况下运行多个编码智能体。Ratchets 关注低成本规则检查,用来阻止智能体添加不想要的模式。
机器人视觉-语言-动作(VLA)研究正聚焦于真实操作证据:开放 rollout、部署检查和安全指标。ABC 让行为克隆更容易复现。E-TTS 加入推理时候选打分。ForesightSafety-VLA 在完整轨迹中评估不安全成功。
这一时期将大型语言模型(LLM)代理视为可运行的软件。Rel(AI)Build 像管理供应链工件一样管理代理配置,CodeAnchor 为仓库导航加入静态结构,AgentX 将代理工作连接到在线推荐系统实验。
这一天的机器人研究把视觉-语言-动作(VLA)模型视为已部署的控制系统,需要在硬件约束下完成校准、微调和执行。ICWM、FORCE 和 ACNet 给出了最清晰的证据:设置探测、在线奖励和延迟条件化都能在不重建完整策略的情况下改进控制。
这一时期把编码 agent 视为带有状态、测试、故障恢复和可追踪控制的软件系统。i cat-agent 提供了最强的正向结果;ToolBench-X 和 CodeChat-Eval 暴露了 agent 在工具故障和后续编辑下的脆弱行为。
这一时期的机器人论文集中讨论如何让视觉-语言-动作(VLA)策略在部署后可用。InSight 通过机器人 rollout 增加新的操作原语。Reflective VLA 记录动作后果。G3VLA 将相机校准注入视觉 token。共同重点是在新技能、新相机和不完美数据下获得可测量的行为。
这一时期的重点是编码代理问责:测量真实使用情况、控制工具成本,并在代码运行后检查安全性。最有力的证据来自 1.8 亿仓库普查、贝叶斯控制和 BigBag;产品项目补充了治理需求,但评估较少。